> ## Documentation Index
> Fetch the complete documentation index at: https://kawax.biz/llms.txt
> Use this file to discover all available pages before exploring further.

# AI 智能体从写「正确」代码转向写「Laravel 风格」代码 —— Boost Benchmarks 的下一步

> 基于 Laravel 官方博客《AI agents pass tests. Can they write idiomatic Laravel?》，介绍 Boost Benchmarks 如何从「测试通过」转向衡量「每 token 的正确性」与「Laravel 风格」。

## 概述

2026 年 7 月 24 日，Laravel 官方博客发布了 [AI agents pass tests. Can they write idiomatic Laravel?](https://laravel.com/blog/idiomatic-laravel-ai-coding-agents)。文章介绍了 [Laravel Boost](https://laravel.com/docs/13.x/boost) 的评估基础设施 **Boost Benchmarks** 将大幅调整 AI 编码智能体的评估方针。

<Info>
  Boost Benchmarks 是一个评估套件，通过 [Pest](https://pestphp.com/) 测试和架构测试验证 AI 编码智能体是否能正确实现 Laravel 应用程序。
</Info>

## 至今的背景：17 个 eval 已达到"几乎全对"

在此前的文章 [which AI model is best for Laravel](https://laravel.com/blog/which-ai-model-is-best-for-laravel) 发布时，主要模型使用 Boost 通过了 17 个 eval（评估任务）中的 16 个，正确率为 99.4%。即便如此，仍未能突破最难的那一项任务。

据本次文章介绍，GPT-5.6、Claude Fable 5 / Mythos 5、Gemini 3.x 系列等最新的前沿模型，现在几乎能 100% 通过相同的 17 个任务。对"AI 智能体能写正确的 Laravel 代码吗？"这一提问，已经给出了明确的"能"的答案。

这不仅限于 Boost，而是整个编码基准测试领域正在发生的现象。

* **SWE-bench Verified**：主要模型已达到接近人类专家的水平并趋于并列，实际上已饱和
* **HumanEval**：早已无法区分模型之间的差异

## 仅"通过测试"仍不够的原因

文章还指出，测试通过并不能完全证明"代码好"。

* OpenAI 在收到指出许多问题设定存在缺陷的审核结果后，[已停止报告 SWE-bench Verified 成绩](https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/)
* [Cursor 的调查](https://cursor.com/blog/reward-hacking-coding-benchmarks)显示，存在模型从 `.git` 历史等中找出答案而看起来"解出"的案例，而在隐藏历史后分数会急剧下降

Boost Benchmarks 由于设计上每次都从全新的 Laravel 应用开始，且不会在 `.git` 中植入答案，因此对这些问题相对具有较强抵抗力。但"通过 Pest 测试套件"并不能直接证明"该模型写的是 Laravel 风格的代码"。这种"能跑"与"融入代码库"之间的差距，正是下一个焦点所在。

## 新的评估维度：每 token 的正确性以及"Laravel 风格"

文章提出的今后方针有以下两点。

<Steps>
  <Step title="每 token 的正确性（correct code per token）">
    如果所有模型都能达到正解，那接下来重要的是"花费多少成本"抵达。同样的结果，不同模型消耗的 token 数可能相差一到两个数量级。Boost 已经在记录每次执行的 token 数和成本，但今后会将其从注脚提升为主要指标。
  </Step>

  <Step title="Laravel 风格（idiomatic Laravel）">
    即便通过了测试，写原生 SQL 查询、不使用 `Route::resource()`、用手写校验代替[表单请求](https://laravel.com/docs/13.x/validation)、省略 `$fillable` 的代码都不能称作"好的 Laravel"。通过 LLM-as-judge 方式的评分，现已到达无需模范答案就能判定"是否符合 Laravel 风格"的阶段。
  </Step>
</Steps>

判定基准所参照的，是 Boost [best-practices skill](https://github.com/laravel/boost/blob/main/.ai/laravel/skill/laravel-best-practices/SKILL.md) 中总结的 19 项具体规约。作为示例，列举如下几项。

* 使用 `Cache::remember()` 而非自实现的缓存处理
* 使用表单请求而非行内验证
* 预加载使用 `with()`
* 路由定义使用 `Route::resource()`

第一条规则是"Consistency First（一致性优先）"，要求在跳到看似更好的模式之前，先与现有同级文件的风格保持一致。

## Boost Benchmarks 后续预计新增的度量项

文章末尾列举了正在考虑加入的度量维度。

* **将 token / 成本作为主要指标**，与每个 eval 及每个模型的正确率并列报告
* **在 Pest 测试和架构测试之外新增"Laravel 风格"的评分**
* **将上下文的轻量化列为 Boost 自身的工程主要目标**（删除冗余的指南、优化工具输出、只索引必要的信息）

现有的 17 个 eval 将作为回归测试保留，同时在其之上构建新的层次。

## 小结

"AI 智能体能否写出正确的 Laravel 代码"已经有了定论，接下来的问题转向"多高效地"、"多 Laravel 风格地"编写。若你尚未尝试 Boost，可以从[官方文档](https://laravel.com/docs/13.x/boost)安装。关于 Boost 的具体接入方式，也请参阅 [Laravel Boost](/zh-CN/boost) 页面。

<Card title="阅读原文" icon="link" href="https://laravel.com/blog/idiomatic-laravel-ai-coding-agents">
  AI agents pass tests. Can they write idiomatic Laravel?（laravel.com）
</Card>


## Related topics

- [Laravel 新代码分析生态 — surveyor / ranger / roster](/zh-CN/blog/laravel-ecosystem-analysis.md)
- [laravel/agent-skills — Laravel 官方 AI 智能体技能集](/zh-CN/blog/agent-skills-introduction.md)
- [Laravel Agent Detector — AI 智能体检测包](/zh-CN/blog/agent-detector-introduction.md)
- [Laravel PAO — 面向 AI 智能体的输出优化工具](/zh-CN/blog/pao-introduction.md)
- [Laravel AI 智能体支持 MCP 服务器](/zh-CN/blog/ai-sdk-mcp-client.md)
