Skip to main content

概述

2026 年 7 月 24 日,Laravel 官方博客发布了 AI agents pass tests. Can they write idiomatic Laravel?。文章介绍了 Laravel Boost 的评估基础设施 Boost Benchmarks 将大幅调整 AI 编码智能体的评估方针。
Boost Benchmarks 是一个评估套件,通过 Pest 测试和架构测试验证 AI 编码智能体是否能正确实现 Laravel 应用程序。

至今的背景:17 个 eval 已达到”几乎全对”

在此前的文章 which AI model is best for Laravel 发布时,主要模型使用 Boost 通过了 17 个 eval(评估任务)中的 16 个,正确率为 99.4%。即便如此,仍未能突破最难的那一项任务。 据本次文章介绍,GPT-5.6、Claude Fable 5 / Mythos 5、Gemini 3.x 系列等最新的前沿模型,现在几乎能 100% 通过相同的 17 个任务。对”AI 智能体能写正确的 Laravel 代码吗?“这一提问,已经给出了明确的”能”的答案。 这不仅限于 Boost,而是整个编码基准测试领域正在发生的现象。
  • SWE-bench Verified:主要模型已达到接近人类专家的水平并趋于并列,实际上已饱和
  • HumanEval:早已无法区分模型之间的差异

仅”通过测试”仍不够的原因

文章还指出,测试通过并不能完全证明”代码好”。 Boost Benchmarks 由于设计上每次都从全新的 Laravel 应用开始,且不会在 .git 中植入答案,因此对这些问题相对具有较强抵抗力。但”通过 Pest 测试套件”并不能直接证明”该模型写的是 Laravel 风格的代码”。这种”能跑”与”融入代码库”之间的差距,正是下一个焦点所在。

新的评估维度:每 token 的正确性以及”Laravel 风格”

文章提出的今后方针有以下两点。
1

每 token 的正确性(correct code per token)

如果所有模型都能达到正解,那接下来重要的是”花费多少成本”抵达。同样的结果,不同模型消耗的 token 数可能相差一到两个数量级。Boost 已经在记录每次执行的 token 数和成本,但今后会将其从注脚提升为主要指标。
2

Laravel 风格(idiomatic Laravel)

即便通过了测试,写原生 SQL 查询、不使用 Route::resource()、用手写校验代替表单请求、省略 $fillable 的代码都不能称作”好的 Laravel”。通过 LLM-as-judge 方式的评分,现已到达无需模范答案就能判定”是否符合 Laravel 风格”的阶段。
判定基准所参照的,是 Boost best-practices skill 中总结的 19 项具体规约。作为示例,列举如下几项。
  • 使用 Cache::remember() 而非自实现的缓存处理
  • 使用表单请求而非行内验证
  • 预加载使用 with()
  • 路由定义使用 Route::resource()
第一条规则是”Consistency First(一致性优先)“,要求在跳到看似更好的模式之前,先与现有同级文件的风格保持一致。

Boost Benchmarks 后续预计新增的度量项

文章末尾列举了正在考虑加入的度量维度。
  • 将 token / 成本作为主要指标,与每个 eval 及每个模型的正确率并列报告
  • 在 Pest 测试和架构测试之外新增”Laravel 风格”的评分
  • 将上下文的轻量化列为 Boost 自身的工程主要目标(删除冗余的指南、优化工具输出、只索引必要的信息)
现有的 17 个 eval 将作为回归测试保留,同时在其之上构建新的层次。

小结

“AI 智能体能否写出正确的 Laravel 代码”已经有了定论,接下来的问题转向”多高效地”、“多 Laravel 风格地”编写。若你尚未尝试 Boost,可以从官方文档安装。关于 Boost 的具体接入方式,也请参阅 Laravel Boost 页面。

阅读原文

AI agents pass tests. Can they write idiomatic Laravel?(laravel.com)
最后修改于 2026年8月2日