> ## Documentation Index
> Fetch the complete documentation index at: https://kawax.biz/llms.txt
> Use this file to discover all available pages before exploring further.

# AI Agent 從「正確」的程式碼邁向「有 Laravel 風格」的程式碼 - Boost Benchmarks 的下一步

> 根據 Laravel 官方部落格「AI agents pass tests. Can they write idiomatic Laravel?」，說明 Boost Benchmarks 從「測試通過」轉向衡量「每個 token 的正確性」與「Laravel 風格」的來龍去脈。

## 概觀

2026 年 7 月 24 日，Laravel 官方部落格公開了 [AI agents pass tests. Can they write idiomatic Laravel?](https://laravel.com/blog/idiomatic-laravel-ai-coding-agents)。內容說明 [Laravel Boost](https://laravel.com/docs/13.x/boost) 的評測基礎 **Boost Benchmarks** 將大幅調整 AI 撰碼 Agent 的評測方針。

<Info>
  Boost Benchmarks 是一套評測，透過 [Pest](https://pestphp.com/) 測試與架構測試驗證 AI 撰碼 Agent 是否能正確實作 Laravel 應用程式。
</Info>

## 之前的進展：17 項 eval 已經「幾乎全對」

在先前的文章 [which AI model is best for Laravel](https://laravel.com/blog/which-ai-model-is-best-for-laravel) 發表時，主要模型使用 Boost 已能於 17 項 eval（評測任務）中通過 16 項，正確率為 99.4%。但仍有最難的一題未能突破。

依這次的文章，GPT-5.6、Claude Fable 5 / Mythos 5、Gemini 3.x 系列等最新前沿模型，同樣的 17 項任務幾乎已達 100% 通過。對「AI Agent 能寫出正確的 Laravel 程式碼嗎？」這個問題，答案明確是「Yes」。

這不僅限於 Boost，也是整個撰碼 benchmark 界的普遍現象。

* **SWE-bench Verified**：主要模型幾乎與人類專家並駕齊驅，實質上已飽和
* **HumanEval**：早已無法辨別模型間差異

## 為什麼「通過測試」還不夠

文章也指出，通過測試並不能完全證明「好程式碼」。

* OpenAI 因審計結果發現許多題目設計有瑕疵，[停止報告 SWE-bench Verified](https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/)
* [Cursor 的調查](https://cursor.com/blog/reward-hacking-coding-benchmarks)報告，模型會從 `.git` 記錄找到答案而看似「解出」，一旦隱藏記錄分數就急遽下滑

Boost Benchmarks 每次都從全新的 Laravel 應用開始，不會在 `.git` 埋答案，因此相對能抵禦這些問題。不過「通過 Pest 測試」並不直接證明「該模型寫的是 Laravel 風格的程式」。「能執行」與「融入該程式碼庫」之間的落差，正是下一個焦點。

## 新的評測軸：每 token 正確性，以及「Laravel 風格」

文章提出的未來方針有兩點。

<Steps>
  <Step title="每 token 正確性（correct code per token）">
    當所有模型都能達到正確解時，接下來重要的是「以多少成本」達成。就算結果相同，各模型消耗的 token 數也可能相差一個數量級甚至兩個。Boost 已經記錄每次執行的 token 數與成本，未來會將此提升為主要指標，而不是註腳。
  </Step>

  <Step title="Laravel 風格（idiomatic Laravel）">
    就算測試過了，若程式碼中直接寫原生 SQL、不用 `Route::resource()`、以手寫驗證代替 [Form Request](https://laravel.com/docs/13.x/validation)、省略 `$fillable` 等，就稱不上「好 Laravel」。使用 LLM-as-judge 的計分方式，無須標準答案也能判斷「是否有 Laravel 風格」，這樣的時機已經到來。
  </Step>
</Steps>

判斷基準參考的是 Boost 的 [best-practices skill](https://github.com/laravel/boost/blob/main/.ai/laravel/skill/laravel-best-practices/SKILL.md) 所整理的 19 項具體規約。舉例如下：

* 使用 `Cache::remember()` 而非自訂快取處理
* 使用 Form Request 而非行內驗證
* Eager Loading 使用 `with()`
* 路由定義使用 `Route::resource()`

第一條規則是「Consistency First（優先一致性）」，要求在採用更好的做法之前，先與現有兄弟檔的風格保持一致。

## Boost Benchmarks 未來預計會衡量的項目

文末列出未來規劃增加的量測面向。

* **將 token 與成本作為主要指標**，與各 eval、各模型的正確率並列報告
* 除 Pest 測試、架構測試之外，也導入**Laravel 風格計分**
* 將**縮減 context** 作為 Boost 自身工程上的主要目標（去除冗長準則、最佳化工具輸出、只索引必要資訊）

既有的 17 項 eval 會作為回歸測試保留，並在其上疊加新的層。

## 總結

「AI Agent 能寫出正確的 Laravel 程式碼嗎？」的問題已有定論，下一個問題轉為「有多有效率」以及「多有 Laravel 風格」。若尚未試用 Boost，可從[官方文件](https://laravel.com/docs/13.x/boost)安裝。Boost 的安裝方式也可參考 [Laravel Boost](/zh-TW/boost) 頁面。

<Card title="閱讀原文" icon="link" href="https://laravel.com/blog/idiomatic-laravel-ai-coding-agents">
  AI agents pass tests. Can they write idiomatic Laravel?（laravel.com）
</Card>


## Related topics

- [laravel/agent-skills — Laravel 官方 AI Agent 技能集](/zh-TW/blog/agent-skills-introduction.md)
- [Laravel Pint](/zh-TW/pint.md)
- [Laravel Boost](/zh-TW/boost.md)
- [Laravel 與 AI 開發](/zh-TW/ai.md)
- [PHP AST](/zh-TW/advanced/php-ast.md)
