Skip to main content

概觀

2026 年 7 月 24 日,Laravel 官方部落格公開了 AI agents pass tests. Can they write idiomatic Laravel?。內容說明 Laravel Boost 的評測基礎 Boost Benchmarks 將大幅調整 AI 撰碼 Agent 的評測方針。
Boost Benchmarks 是一套評測,透過 Pest 測試與架構測試驗證 AI 撰碼 Agent 是否能正確實作 Laravel 應用程式。

之前的進展:17 項 eval 已經「幾乎全對」

在先前的文章 which AI model is best for Laravel 發表時,主要模型使用 Boost 已能於 17 項 eval(評測任務)中通過 16 項,正確率為 99.4%。但仍有最難的一題未能突破。 依這次的文章,GPT-5.6、Claude Fable 5 / Mythos 5、Gemini 3.x 系列等最新前沿模型,同樣的 17 項任務幾乎已達 100% 通過。對「AI Agent 能寫出正確的 Laravel 程式碼嗎?」這個問題,答案明確是「Yes」。 這不僅限於 Boost,也是整個撰碼 benchmark 界的普遍現象。
  • SWE-bench Verified:主要模型幾乎與人類專家並駕齊驅,實質上已飽和
  • HumanEval:早已無法辨別模型間差異

為什麼「通過測試」還不夠

文章也指出,通過測試並不能完全證明「好程式碼」。 Boost Benchmarks 每次都從全新的 Laravel 應用開始,不會在 .git 埋答案,因此相對能抵禦這些問題。不過「通過 Pest 測試」並不直接證明「該模型寫的是 Laravel 風格的程式」。「能執行」與「融入該程式碼庫」之間的落差,正是下一個焦點。

新的評測軸:每 token 正確性,以及「Laravel 風格」

文章提出的未來方針有兩點。
1

每 token 正確性(correct code per token)

當所有模型都能達到正確解時,接下來重要的是「以多少成本」達成。就算結果相同,各模型消耗的 token 數也可能相差一個數量級甚至兩個。Boost 已經記錄每次執行的 token 數與成本,未來會將此提升為主要指標,而不是註腳。
2

Laravel 風格(idiomatic Laravel)

就算測試過了,若程式碼中直接寫原生 SQL、不用 Route::resource()、以手寫驗證代替 Form Request、省略 $fillable 等,就稱不上「好 Laravel」。使用 LLM-as-judge 的計分方式,無須標準答案也能判斷「是否有 Laravel 風格」,這樣的時機已經到來。
判斷基準參考的是 Boost 的 best-practices skill 所整理的 19 項具體規約。舉例如下:
  • 使用 Cache::remember() 而非自訂快取處理
  • 使用 Form Request 而非行內驗證
  • Eager Loading 使用 with()
  • 路由定義使用 Route::resource()
第一條規則是「Consistency First(優先一致性)」,要求在採用更好的做法之前,先與現有兄弟檔的風格保持一致。

Boost Benchmarks 未來預計會衡量的項目

文末列出未來規劃增加的量測面向。
  • 將 token 與成本作為主要指標,與各 eval、各模型的正確率並列報告
  • 除 Pest 測試、架構測試之外,也導入Laravel 風格計分
  • 縮減 context 作為 Boost 自身工程上的主要目標(去除冗長準則、最佳化工具輸出、只索引必要資訊)
既有的 17 項 eval 會作為回歸測試保留,並在其上疊加新的層。

總結

「AI Agent 能寫出正確的 Laravel 程式碼嗎?」的問題已有定論,下一個問題轉為「有多有效率」以及「多有 Laravel 風格」。若尚未試用 Boost,可從官方文件安裝。Boost 的安裝方式也可參考 Laravel Boost 頁面。

閱讀原文

AI agents pass tests. Can they write idiomatic Laravel?(laravel.com)
最後修改於 2026年8月2日