概要
2026年7月24日、Laravel公式ブログに AI agents pass tests. Can they write idiomatic Laravel? が公開されました。Laravel Boost の評価基盤である Boost Benchmarks が、AIコーディングエージェントの評価方針を大きく転換するという内容です。Boost Benchmarksは、AIコーディングエージェントがLaravelアプリケーションを正しく実装できるかを、Pest テストとアーキテクチャテストで検証する評価スイートです。
これまでの経緯:17個のevalは「ほぼ全問正解」に到達
以前の記事 which AI model is best for Laravel の時点では、主要モデルはBoostを使って17個のeval(評価タスク)中16個をクリアし、正答率99.4%でした。それでも最も難しいタスクだけは突破できませんでした。 今回の記事によると、GPT-5.6、Claude Fable 5 / Mythos 5、Gemini 3.x系などの最新フロンティアモデルは、同じ17タスクをほぼ100%クリアするようになりました。「AIエージェントは正しいLaravelコードを書けるか?」という問いには、はっきり「Yes」という答えが出た形です。 これはBoostに限った話ではなく、コーディングベンチマーク全体で起きている現象です。- SWE-bench Verified:主要モデルが人間エキスパートに近い水準で横並びになり、事実上飽和状態
- HumanEval:以前からモデル間の差を検出できなくなっている
「テストに合格する」だけでは不十分な理由
記事では、テスト合格が「良いコード」の完全な証明にはならない点も指摘しています。- OpenAIは、多くの問題設定に欠陥があったとする監査結果を受けてSWE-bench Verifiedの報告を取りやめました
- Cursorの調査では、モデルが
.git履歴などから正解を見つけて「解いた」ように見えるケースがあり、履歴を隠すとスコアが急落したことが報告されています
.git に答えを仕込まない設計のため、これらの問題には比較的強いとされています。ただし「Pestスイートに合格する」ことは「そのモデルがLaravelらしい書き方をする」ことを直接は証明しません。この「動く」と「そのコードベースに馴染む」の間のギャップこそが、次の焦点です。
新しい評価軸:トークンあたりの正しさ、そして「Laravelらしさ」
記事が提示する今後の方針は次の2点です。1
トークンあたりの正しさ(correct code per token)
全モデルが正解にたどり着けるなら、次に重要なのは「どれだけのコストで」到達したかです。同じ結果でも、モデルによって消費トークン数が一桁、二桁変わることがあります。Boostはすでに各実行のトークン数とコストを記録していますが、これを脚注ではなく主要指標として扱うようになります。
2
Laravelらしさ(idiomatic Laravel)
テストに通っても、生のSQLクエリを書いたり
Route::resource() を使わなかったり、フォームリクエストの代わりにバリデーションを手書きしたり、$fillable を省略したりするコードは「良いLaravel」とは言えません。LLM-as-judge方式のスコアリングにより、模範解答なしで「Laravelらしいかどうか」を判定できる段階に来ているとしています。- 独自実装のキャッシュ処理ではなく
Cache::remember()を使う - インラインバリデーションではなくフォームリクエストを使う
- Eagerロードには
with()を使う - ルート定義には
Route::resource()を使う
今後のBoost Benchmarksで計測される予定の項目
記事末尾では、今後追加を検討している計測軸が挙げられています。- トークン・コストを主要指標として eval・モデルごとに正答率と並べて報告
- LaravelらしさのスコアリングをPestテスト・アーキテクチャテストに加えて導入
- コンテキストの軽量化をBoost自身のエンジニアリング上の主目標にする(冗長なガイドラインの削除、ツール出力の最適化、必要な情報だけをインデックスする)
まとめ
「AIエージェントは正しいLaravelコードを書けるか」という問いには決着がつき、次の問いは「どれだけ効率的に」「どれだけLaravelらしく」書けるかに移っています。まだBoostを試していない場合は、公式ドキュメント からインストールできます。Boostの導入方法自体は Laravel Boost ページも参照してください。原文を読む
AI agents pass tests. Can they write idiomatic Laravel?(laravel.com)