Skip to main content

개요

2026년 7월 24일, Laravel 공식 블로그에 AI agents pass tests. Can they write idiomatic Laravel?가 공개되었습니다. Laravel Boost의 평가 기반인 Boost Benchmarks가 AI 코딩 에이전트의 평가 방침을 크게 전환한다는 내용입니다.
Boost Benchmarks는 AI 코딩 에이전트가 Laravel 애플리케이션을 올바르게 구현할 수 있는지를 Pest 테스트와 아키텍처 테스트로 검증하는 평가 스위트입니다.

지금까지의 경위: 17개 eval은 ‘거의 만점’에 도달

이전 기사 which AI model is best for Laravel 시점에서는 주요 모델이 Boost를 사용하여 17개 eval(평가 작업) 중 16개를 통과하여 정답률 99.4%였습니다. 그럼에도 가장 어려운 작업만은 돌파할 수 없었습니다. 이번 기사에 따르면, GPT-5.6, Claude Fable 5 / Mythos 5, Gemini 3.x 계열 등 최신 프런티어 모델은 같은 17개 작업을 거의 100% 통과하게 되었습니다. “AI 에이전트가 올바른 Laravel 코드를 작성할 수 있는가?”라는 질문에는 명확히 “Yes”라는 답이 나온 셈입니다. 이는 Boost에 국한된 이야기가 아니라 코딩 벤치마크 전반에서 일어나고 있는 현상입니다.
  • SWE-bench Verified: 주요 모델이 인간 전문가에 가까운 수준에서 평준화되어 사실상 포화 상태
  • HumanEval: 이전부터 모델 간 차이를 감지할 수 없게 됨

’테스트에 통과한다’만으로는 불충분한 이유

기사에서는 테스트 통과가 ‘좋은 코드’의 완전한 증명이 되지 않는다는 점도 지적합니다.
  • OpenAI는 많은 문제 설정에 결함이 있었다는 감사 결과에 따라 SWE-bench Verified 보고를 중단했습니다
  • Cursor 조사에서는 모델이 .git 이력 등에서 정답을 찾아 “푼” 것처럼 보이는 사례가 있었고, 이력을 숨기면 점수가 급락한 것이 보고되었습니다
Boost Benchmarks는 매번 새로운 Laravel 앱에서 시작하여 .git에 답을 심어두지 않는 설계이므로 이러한 문제에는 비교적 강하다고 여겨집니다. 다만 “Pest 스위트에 통과한다”는 것이 “그 모델이 Laravel다운 작성 방식을 한다”는 것을 직접 증명하지는 않습니다. 이 “동작한다”와 “그 코드베이스에 녹아든다” 사이의 간극이야말로 다음 초점입니다.

새로운 평가 축: 토큰당 정확성, 그리고 ‘Laravel다움’

기사가 제시하는 향후 방침은 다음 두 가지입니다.
1

토큰당 정확성 (correct code per token)

모든 모델이 정답에 도달할 수 있다면, 다음으로 중요한 것은 “얼마의 비용으로” 도달했는지입니다. 같은 결과라도 모델에 따라 소비 토큰 수가 한 자릿수, 두 자릿수 달라질 수 있습니다. Boost는 이미 각 실행의 토큰 수와 비용을 기록하고 있지만, 이를 각주가 아니라 주요 지표로 취급하게 됩니다.
2

Laravel다움 (idiomatic Laravel)

테스트에 통과해도, 원시 SQL 쿼리를 작성하거나 Route::resource()를 사용하지 않거나 폼 리퀘스트 대신 검증을 손으로 작성하거나 $fillable을 생략한 코드는 ‘좋은 Laravel’이라고는 할 수 없습니다. LLM-as-judge 방식의 스코어링으로 모범 해답 없이 “Laravel다운지 어떤지”를 판정할 수 있는 단계에 와 있다고 합니다.
판정 기준으로 참조되는 것이 Boost의 best-practices skill에 정리된 19개 항목의 구체적인 규약입니다. 예로 다음과 같은 것이 제시됩니다.
  • 자체 구현 캐시 처리가 아니라 Cache::remember()를 사용
  • 인라인 검증이 아니라 폼 리퀘스트를 사용
  • 이거 로드에는 with()를 사용
  • 라우트 정의에는 Route::resource()를 사용
첫 번째 규칙은 “Consistency First(일관성 최우선)“으로, 더 낫다고 여겨지는 패턴에 뛰어들기 전에 기존 형제 파일의 스타일에 맞추는 것을 요구합니다.

앞으로 Boost Benchmarks에서 측정될 예정인 항목

기사 말미에서는 앞으로 추가를 검토 중인 측정 축이 제시됩니다.
  • 토큰·비용을 주요 지표로 eval·모델별로 정답률과 함께 보고
  • Laravel다움 스코어링을 Pest 테스트·아키텍처 테스트에 더해 도입
  • 컨텍스트 경량화를 Boost 자체의 엔지니어링상의 주된 목표로 삼기 (장황한 가이드라인 삭제, 도구 출력 최적화, 필요한 정보만 인덱싱)
기존 17개 eval은 회귀 테스트로 유지되면서 그 위에 새로운 계층을 구축해 나가는 방침입니다.

정리

“AI 에이전트가 올바른 Laravel 코드를 작성할 수 있는가”라는 물음에는 결말이 지어졌고, 다음 물음은 “얼마나 효율적으로” “얼마나 Laravel답게” 작성할 수 있는가로 옮겨가고 있습니다. 아직 Boost를 시도해 보지 않았다면 공식 문서에서 설치할 수 있습니다. Boost 도입 방법 자체는 Laravel Boost 페이지도 참조하세요.

원문 읽기

AI agents pass tests. Can they write idiomatic Laravel? (laravel.com)
마지막 수정일 2026년 8월 2일