概述
2026 年 7 月 24 日,Laravel 官方博客发布了 AI agents pass tests. Can they write idiomatic Laravel?。文章介绍了 Laravel Boost 的评估基础设施 Boost Benchmarks 将大幅调整 AI 编码智能体的评估方针。Boost Benchmarks 是一个评估套件,通过 Pest 测试和架构测试验证 AI 编码智能体是否能正确实现 Laravel 应用程序。
至今的背景:17 个 eval 已达到”几乎全对”
在此前的文章 which AI model is best for Laravel 发布时,主要模型使用 Boost 通过了 17 个 eval(评估任务)中的 16 个,正确率为 99.4%。即便如此,仍未能突破最难的那一项任务。 据本次文章介绍,GPT-5.6、Claude Fable 5 / Mythos 5、Gemini 3.x 系列等最新的前沿模型,现在几乎能 100% 通过相同的 17 个任务。对”AI 智能体能写正确的 Laravel 代码吗?“这一提问,已经给出了明确的”能”的答案。 这不仅限于 Boost,而是整个编码基准测试领域正在发生的现象。- SWE-bench Verified:主要模型已达到接近人类专家的水平并趋于并列,实际上已饱和
- HumanEval:早已无法区分模型之间的差异
仅”通过测试”仍不够的原因
文章还指出,测试通过并不能完全证明”代码好”。- OpenAI 在收到指出许多问题设定存在缺陷的审核结果后,已停止报告 SWE-bench Verified 成绩
- Cursor 的调查显示,存在模型从
.git历史等中找出答案而看起来”解出”的案例,而在隐藏历史后分数会急剧下降
.git 中植入答案,因此对这些问题相对具有较强抵抗力。但”通过 Pest 测试套件”并不能直接证明”该模型写的是 Laravel 风格的代码”。这种”能跑”与”融入代码库”之间的差距,正是下一个焦点所在。
新的评估维度:每 token 的正确性以及”Laravel 风格”
文章提出的今后方针有以下两点。1
每 token 的正确性(correct code per token)
如果所有模型都能达到正解,那接下来重要的是”花费多少成本”抵达。同样的结果,不同模型消耗的 token 数可能相差一到两个数量级。Boost 已经在记录每次执行的 token 数和成本,但今后会将其从注脚提升为主要指标。
2
Laravel 风格(idiomatic Laravel)
即便通过了测试,写原生 SQL 查询、不使用
Route::resource()、用手写校验代替表单请求、省略 $fillable 的代码都不能称作”好的 Laravel”。通过 LLM-as-judge 方式的评分,现已到达无需模范答案就能判定”是否符合 Laravel 风格”的阶段。- 使用
Cache::remember()而非自实现的缓存处理 - 使用表单请求而非行内验证
- 预加载使用
with() - 路由定义使用
Route::resource()
Boost Benchmarks 后续预计新增的度量项
文章末尾列举了正在考虑加入的度量维度。- 将 token / 成本作为主要指标,与每个 eval 及每个模型的正确率并列报告
- 在 Pest 测试和架构测试之外新增”Laravel 风格”的评分
- 将上下文的轻量化列为 Boost 自身的工程主要目标(删除冗余的指南、优化工具输出、只索引必要的信息)
小结
“AI 智能体能否写出正确的 Laravel 代码”已经有了定论,接下来的问题转向”多高效地”、“多 Laravel 风格地”编写。若你尚未尝试 Boost,可以从官方文档安装。关于 Boost 的具体接入方式,也请参阅 Laravel Boost 页面。阅读原文
AI agents pass tests. Can they write idiomatic Laravel?(laravel.com)