> ## Documentation Index
> Fetch the complete documentation index at: https://kawax.biz/llms.txt
> Use this file to discover all available pages before exploring further.

# AI 에이전트는 '올바른' 코드에서 'Laravel다운' 코드로 - Boost Benchmarks의 다음 한 수

> Laravel 공식 블로그 'AI agents pass tests. Can they write idiomatic Laravel?'를 기반으로, Boost Benchmarks가 테스트 통과에서 '토큰당 정확성'과 'Laravel다움' 측정으로 방향을 튼 경위를 설명합니다.

## 개요

2026년 7월 24일, Laravel 공식 블로그에 [AI agents pass tests. Can they write idiomatic Laravel?](https://laravel.com/blog/idiomatic-laravel-ai-coding-agents)가 공개되었습니다. [Laravel Boost](https://laravel.com/docs/13.x/boost)의 평가 기반인 **Boost Benchmarks**가 AI 코딩 에이전트의 평가 방침을 크게 전환한다는 내용입니다.

<Info>
  Boost Benchmarks는 AI 코딩 에이전트가 Laravel 애플리케이션을 올바르게 구현할 수 있는지를 [Pest](https://pestphp.com/) 테스트와 아키텍처 테스트로 검증하는 평가 스위트입니다.
</Info>

## 지금까지의 경위: 17개 eval은 '거의 만점'에 도달

이전 기사 [which AI model is best for Laravel](https://laravel.com/blog/which-ai-model-is-best-for-laravel) 시점에서는 주요 모델이 Boost를 사용하여 17개 eval(평가 작업) 중 16개를 통과하여 정답률 99.4%였습니다. 그럼에도 가장 어려운 작업만은 돌파할 수 없었습니다.

이번 기사에 따르면, GPT-5.6, Claude Fable 5 / Mythos 5, Gemini 3.x 계열 등 최신 프런티어 모델은 같은 17개 작업을 거의 100% 통과하게 되었습니다. "AI 에이전트가 올바른 Laravel 코드를 작성할 수 있는가?"라는 질문에는 명확히 "Yes"라는 답이 나온 셈입니다.

이는 Boost에 국한된 이야기가 아니라 코딩 벤치마크 전반에서 일어나고 있는 현상입니다.

* **SWE-bench Verified**: 주요 모델이 인간 전문가에 가까운 수준에서 평준화되어 사실상 포화 상태
* **HumanEval**: 이전부터 모델 간 차이를 감지할 수 없게 됨

## '테스트에 통과한다'만으로는 불충분한 이유

기사에서는 테스트 통과가 '좋은 코드'의 완전한 증명이 되지 않는다는 점도 지적합니다.

* OpenAI는 많은 문제 설정에 결함이 있었다는 감사 결과에 따라 [SWE-bench Verified 보고를 중단했습니다](https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/)
* [Cursor 조사](https://cursor.com/blog/reward-hacking-coding-benchmarks)에서는 모델이 `.git` 이력 등에서 정답을 찾아 "푼" 것처럼 보이는 사례가 있었고, 이력을 숨기면 점수가 급락한 것이 보고되었습니다

Boost Benchmarks는 매번 새로운 Laravel 앱에서 시작하여 `.git`에 답을 심어두지 않는 설계이므로 이러한 문제에는 비교적 강하다고 여겨집니다. 다만 "Pest 스위트에 통과한다"는 것이 "그 모델이 Laravel다운 작성 방식을 한다"는 것을 직접 증명하지는 않습니다. 이 "동작한다"와 "그 코드베이스에 녹아든다" 사이의 간극이야말로 다음 초점입니다.

## 새로운 평가 축: 토큰당 정확성, 그리고 'Laravel다움'

기사가 제시하는 향후 방침은 다음 두 가지입니다.

<Steps>
  <Step title="토큰당 정확성 (correct code per token)">
    모든 모델이 정답에 도달할 수 있다면, 다음으로 중요한 것은 "얼마의 비용으로" 도달했는지입니다. 같은 결과라도 모델에 따라 소비 토큰 수가 한 자릿수, 두 자릿수 달라질 수 있습니다. Boost는 이미 각 실행의 토큰 수와 비용을 기록하고 있지만, 이를 각주가 아니라 주요 지표로 취급하게 됩니다.
  </Step>

  <Step title="Laravel다움 (idiomatic Laravel)">
    테스트에 통과해도, 원시 SQL 쿼리를 작성하거나 `Route::resource()`를 사용하지 않거나 [폼 리퀘스트](https://laravel.com/docs/13.x/validation) 대신 검증을 손으로 작성하거나 `$fillable`을 생략한 코드는 '좋은 Laravel'이라고는 할 수 없습니다. LLM-as-judge 방식의 스코어링으로 모범 해답 없이 "Laravel다운지 어떤지"를 판정할 수 있는 단계에 와 있다고 합니다.
  </Step>
</Steps>

판정 기준으로 참조되는 것이 Boost의 [best-practices skill](https://github.com/laravel/boost/blob/main/.ai/laravel/skill/laravel-best-practices/SKILL.md)에 정리된 19개 항목의 구체적인 규약입니다. 예로 다음과 같은 것이 제시됩니다.

* 자체 구현 캐시 처리가 아니라 `Cache::remember()`를 사용
* 인라인 검증이 아니라 폼 리퀘스트를 사용
* 이거 로드에는 `with()`를 사용
* 라우트 정의에는 `Route::resource()`를 사용

첫 번째 규칙은 "Consistency First(일관성 최우선)"으로, 더 낫다고 여겨지는 패턴에 뛰어들기 전에 기존 형제 파일의 스타일에 맞추는 것을 요구합니다.

## 앞으로 Boost Benchmarks에서 측정될 예정인 항목

기사 말미에서는 앞으로 추가를 검토 중인 측정 축이 제시됩니다.

* **토큰·비용을 주요 지표로** eval·모델별로 정답률과 함께 보고
* **Laravel다움 스코어링**을 Pest 테스트·아키텍처 테스트에 더해 도입
* **컨텍스트 경량화**를 Boost 자체의 엔지니어링상의 주된 목표로 삼기 (장황한 가이드라인 삭제, 도구 출력 최적화, 필요한 정보만 인덱싱)

기존 17개 eval은 회귀 테스트로 유지되면서 그 위에 새로운 계층을 구축해 나가는 방침입니다.

## 정리

"AI 에이전트가 올바른 Laravel 코드를 작성할 수 있는가"라는 물음에는 결말이 지어졌고, 다음 물음은 "얼마나 효율적으로" "얼마나 Laravel답게" 작성할 수 있는가로 옮겨가고 있습니다. 아직 Boost를 시도해 보지 않았다면 [공식 문서](https://laravel.com/docs/13.x/boost)에서 설치할 수 있습니다. Boost 도입 방법 자체는 [Laravel Boost](/ko/boost) 페이지도 참조하세요.

<Card title="원문 읽기" icon="link" href="https://laravel.com/blog/idiomatic-laravel-ai-coding-agents">
  AI agents pass tests. Can they write idiomatic Laravel? (laravel.com)
</Card>


## Related topics

- [laravel/agent-skills — Laravel 공식 AI 에이전트 스킬 모음](/ko/blog/agent-skills-introduction.md)
- [Boost의 커스텀 에이전트 만들기](/ko/advanced/boost-custom-agent.md)
- [Laravel AI 에이전트가 MCP 서버 지원](/ko/blog/ai-sdk-mcp-client.md)
- [Laravel과 AI 개발](/ko/ai.md)
- [Laravel Boost](/ko/boost.md)
