Skip to main content

Overzicht

Op 24 juli 2026 verscheen op de officiële Laravel-blog het artikel AI agents pass tests. Can they write idiomatic Laravel?. Het gaat over Boost Benchmarks, de evaluatie-infrastructuur van Laravel Boost, die zijn beoordelingsaanpak van AI-codeeragents ingrijpend verandert.
Boost Benchmarks is een evaluatiesuite die met Pest-tests en architectuurtests verifieert of AI-codeeragents Laravel-applicaties correct kunnen implementeren.

De aanloop: 17 evals zijn “vrijwel foutloos” opgelost

Ten tijde van het eerdere artikel which AI model is best for Laravel haalden de belangrijkste modellen met Boost 16 van de 17 evals (evaluatietaken), met een slagingspercentage van 99,4%. Alleen de moeilijkste taak bleef onhaalbaar. Volgens het nieuwe artikel halen de nieuwste frontier-modellen — GPT-5.6, Claude Fable 5 / Mythos 5, de Gemini 3.x-serie, enzovoort — dezelfde 17 taken nu vrijwel voor 100%. Op de vraag “Kunnen AI-agents correcte Laravel-code schrijven?” is het antwoord dus een duidelijk “ja” geworden. Dit is niet iets dat alleen bij Boost speelt; het gebeurt bij codeerbenchmarks in het algemeen.
  • SWE-bench Verified: de belangrijkste modellen zitten dicht bij het niveau van menselijke experts en liggen op één lijn — feitelijk verzadigd
  • HumanEval: kan al langer geen verschillen tussen modellen meer detecteren

Waarom “slagen voor de tests” niet genoeg is

Het artikel wijst er ook op dat het slagen voor tests geen volledig bewijs van “goede code” is. Boost Benchmarks start elke keer vanuit een verse Laravel-app en verstopt geen antwoorden in .git, waardoor het relatief goed bestand is tegen deze problemen. Maar “slagen voor de Pest-suite” bewijst niet rechtstreeks dat “het model op een Laravel-eigen manier schrijft”. Precies die kloof tussen “het werkt” en “het past bij die codebase” is de volgende focus.

Nieuwe evaluatie-assen: correctheid per token en “Laravel-eigenheid”

Het artikel schetst twee richtingen voor de toekomst.
1

Correctheid per token (correct code per token)

Als alle modellen bij het juiste antwoord kunnen uitkomen, wordt de volgende vraag: tegen welke kosten? Bij hetzelfde resultaat kan het aantal verbruikte tokens per model een factor tien of honderd verschillen. Boost registreert al het aantal tokens en de kosten per run, maar gaat dit voortaan behandelen als hoofdmetriek in plaats van als voetnoot.
2

Laravel-eigenheid (idiomatic Laravel)

Code die de tests haalt maar rauwe SQL-queries schrijft, Route::resource() links laat liggen, validatie met de hand schrijft in plaats van form requests te gebruiken, of $fillable weglaat, is geen “goede Laravel”. Met LLM-as-judge-scoring is het volgens het artikel inmiddels mogelijk om zonder modelantwoord te beoordelen of iets “Laravel-eigen” is.
Als beoordelingscriterium dienen de 19 concrete conventies uit de best-practices skill van Boost. Voorbeelden die worden genoemd:
  • Gebruik Cache::remember() in plaats van zelfgeschreven cachelogica
  • Gebruik form requests in plaats van inline validatie
  • Gebruik with() voor eager loading
  • Gebruik Route::resource() voor routedefinities
De eerste regel is “Consistency First” (consistentie boven alles): pas je aan aan de stijl van bestaande buurbestanden voordat je naar een zogenaamd beter patroon grijpt.

Wat Boost Benchmarks in de toekomst gaat meten

Aan het einde van het artikel worden de meetassen genoemd die worden overwogen.
  • Tokens en kosten als hoofdmetriek, gerapporteerd naast het slagingspercentage per eval en per model
  • Scoring van Laravel-eigenheid invoeren, bovenop de Pest-tests en architectuurtests
  • Lichtere context als belangrijkste engineeringdoel van Boost zelf (overbodige richtlijnen schrappen, tooloutput optimaliseren, alleen de noodzakelijke informatie indexeren)
De bestaande 17 evals blijven behouden als regressietests, en daarbovenop wordt deze nieuwe laag opgebouwd.

Conclusie

De vraag “Kunnen AI-agents correcte Laravel-code schrijven?” is beslecht; de volgende vraag is hoe efficiënt en hoe Laravel-eigen ze kunnen schrijven. Heb je Boost nog niet geprobeerd, dan kun je het installeren via de officiële documentatie. Zie voor de installatie van Boost zelf ook de pagina Laravel Boost.

Lees het originele artikel

AI agents pass tests. Can they write idiomatic Laravel? (laravel.com)
Laatst gewijzigd op 6 september 2026