概觀
2026 年 7 月 24 日,Laravel 官方部落格公開了 AI agents pass tests. Can they write idiomatic Laravel?。內容說明 Laravel Boost 的評測基礎 Boost Benchmarks 將大幅調整 AI 撰碼 Agent 的評測方針。Boost Benchmarks 是一套評測,透過 Pest 測試與架構測試驗證 AI 撰碼 Agent 是否能正確實作 Laravel 應用程式。
之前的進展:17 項 eval 已經「幾乎全對」
在先前的文章 which AI model is best for Laravel 發表時,主要模型使用 Boost 已能於 17 項 eval(評測任務)中通過 16 項,正確率為 99.4%。但仍有最難的一題未能突破。 依這次的文章,GPT-5.6、Claude Fable 5 / Mythos 5、Gemini 3.x 系列等最新前沿模型,同樣的 17 項任務幾乎已達 100% 通過。對「AI Agent 能寫出正確的 Laravel 程式碼嗎?」這個問題,答案明確是「Yes」。 這不僅限於 Boost,也是整個撰碼 benchmark 界的普遍現象。- SWE-bench Verified:主要模型幾乎與人類專家並駕齊驅,實質上已飽和
- HumanEval:早已無法辨別模型間差異
為什麼「通過測試」還不夠
文章也指出,通過測試並不能完全證明「好程式碼」。- OpenAI 因審計結果發現許多題目設計有瑕疵,停止報告 SWE-bench Verified
- Cursor 的調查報告,模型會從
.git記錄找到答案而看似「解出」,一旦隱藏記錄分數就急遽下滑
.git 埋答案,因此相對能抵禦這些問題。不過「通過 Pest 測試」並不直接證明「該模型寫的是 Laravel 風格的程式」。「能執行」與「融入該程式碼庫」之間的落差,正是下一個焦點。
新的評測軸:每 token 正確性,以及「Laravel 風格」
文章提出的未來方針有兩點。1
每 token 正確性(correct code per token)
當所有模型都能達到正確解時,接下來重要的是「以多少成本」達成。就算結果相同,各模型消耗的 token 數也可能相差一個數量級甚至兩個。Boost 已經記錄每次執行的 token 數與成本,未來會將此提升為主要指標,而不是註腳。
2
Laravel 風格(idiomatic Laravel)
就算測試過了,若程式碼中直接寫原生 SQL、不用
Route::resource()、以手寫驗證代替 Form Request、省略 $fillable 等,就稱不上「好 Laravel」。使用 LLM-as-judge 的計分方式,無須標準答案也能判斷「是否有 Laravel 風格」,這樣的時機已經到來。- 使用
Cache::remember()而非自訂快取處理 - 使用 Form Request 而非行內驗證
- Eager Loading 使用
with() - 路由定義使用
Route::resource()
Boost Benchmarks 未來預計會衡量的項目
文末列出未來規劃增加的量測面向。- 將 token 與成本作為主要指標,與各 eval、各模型的正確率並列報告
- 除 Pest 測試、架構測試之外,也導入Laravel 風格計分
- 將縮減 context 作為 Boost 自身工程上的主要目標(去除冗長準則、最佳化工具輸出、只索引必要資訊)
總結
「AI Agent 能寫出正確的 Laravel 程式碼嗎?」的問題已有定論,下一個問題轉為「有多有效率」以及「多有 Laravel 風格」。若尚未試用 Boost,可從官方文件安裝。Boost 的安裝方式也可參考 Laravel Boost 頁面。閱讀原文
AI agents pass tests. Can they write idiomatic Laravel?(laravel.com)