Overzicht
Op 24 juli 2026 verscheen op de officiële Laravel-blog het artikel AI agents pass tests. Can they write idiomatic Laravel?. Het gaat over Boost Benchmarks, de evaluatie-infrastructuur van Laravel Boost, die zijn beoordelingsaanpak van AI-codeeragents ingrijpend verandert.Boost Benchmarks is een evaluatiesuite die met Pest-tests en architectuurtests verifieert of AI-codeeragents Laravel-applicaties correct kunnen implementeren.
De aanloop: 17 evals zijn “vrijwel foutloos” opgelost
Ten tijde van het eerdere artikel which AI model is best for Laravel haalden de belangrijkste modellen met Boost 16 van de 17 evals (evaluatietaken), met een slagingspercentage van 99,4%. Alleen de moeilijkste taak bleef onhaalbaar. Volgens het nieuwe artikel halen de nieuwste frontier-modellen — GPT-5.6, Claude Fable 5 / Mythos 5, de Gemini 3.x-serie, enzovoort — dezelfde 17 taken nu vrijwel voor 100%. Op de vraag “Kunnen AI-agents correcte Laravel-code schrijven?” is het antwoord dus een duidelijk “ja” geworden. Dit is niet iets dat alleen bij Boost speelt; het gebeurt bij codeerbenchmarks in het algemeen.- SWE-bench Verified: de belangrijkste modellen zitten dicht bij het niveau van menselijke experts en liggen op één lijn — feitelijk verzadigd
- HumanEval: kan al langer geen verschillen tussen modellen meer detecteren
Waarom “slagen voor de tests” niet genoeg is
Het artikel wijst er ook op dat het slagen voor tests geen volledig bewijs van “goede code” is.- OpenAI is gestopt met het rapporteren van SWE-bench Verified na een audit die uitwees dat veel probleemdefinities gebreken vertoonden
- Onderzoek van Cursor rapporteerde gevallen waarin modellen het juiste antwoord vonden in de
.git-geschiedenis en zo leken te “scoren”; werd de geschiedenis verborgen, dan kelderden de scores
.git, waardoor het relatief goed bestand is tegen deze problemen. Maar “slagen voor de Pest-suite” bewijst niet rechtstreeks dat “het model op een Laravel-eigen manier schrijft”. Precies die kloof tussen “het werkt” en “het past bij die codebase” is de volgende focus.
Nieuwe evaluatie-assen: correctheid per token en “Laravel-eigenheid”
Het artikel schetst twee richtingen voor de toekomst.1
Correctheid per token (correct code per token)
Als alle modellen bij het juiste antwoord kunnen uitkomen, wordt de volgende vraag: tegen welke kosten? Bij hetzelfde resultaat kan het aantal verbruikte tokens per model een factor tien of honderd verschillen. Boost registreert al het aantal tokens en de kosten per run, maar gaat dit voortaan behandelen als hoofdmetriek in plaats van als voetnoot.
2
Laravel-eigenheid (idiomatic Laravel)
Code die de tests haalt maar rauwe SQL-queries schrijft,
Route::resource() links laat liggen, validatie met de hand schrijft in plaats van form requests te gebruiken, of $fillable weglaat, is geen “goede Laravel”. Met LLM-as-judge-scoring is het volgens het artikel inmiddels mogelijk om zonder modelantwoord te beoordelen of iets “Laravel-eigen” is.- Gebruik
Cache::remember()in plaats van zelfgeschreven cachelogica - Gebruik form requests in plaats van inline validatie
- Gebruik
with()voor eager loading - Gebruik
Route::resource()voor routedefinities
Wat Boost Benchmarks in de toekomst gaat meten
Aan het einde van het artikel worden de meetassen genoemd die worden overwogen.- Tokens en kosten als hoofdmetriek, gerapporteerd naast het slagingspercentage per eval en per model
- Scoring van Laravel-eigenheid invoeren, bovenop de Pest-tests en architectuurtests
- Lichtere context als belangrijkste engineeringdoel van Boost zelf (overbodige richtlijnen schrappen, tooloutput optimaliseren, alleen de noodzakelijke informatie indexeren)
Conclusie
De vraag “Kunnen AI-agents correcte Laravel-code schrijven?” is beslecht; de volgende vraag is hoe efficiënt en hoe Laravel-eigen ze kunnen schrijven. Heb je Boost nog niet geprobeerd, dan kun je het installeren via de officiële documentatie. Zie voor de installatie van Boost zelf ook de pagina Laravel Boost.Lees het originele artikel
AI agents pass tests. Can they write idiomatic Laravel? (laravel.com)