> ## Documentation Index
> Fetch the complete documentation index at: https://kawax.biz/llms.txt
> Use this file to discover all available pages before exploring further.

# AI-agents: van "correcte" code naar "idiomatische Laravel"-code — de volgende stap van Boost Benchmarks

> Op basis van de officiële Laravel-blogpost "AI agents pass tests. Can they write idiomatic Laravel?" leggen we uit hoe Boost Benchmarks de koers verlegt van het slagen voor tests naar het meten van "correctheid per token" en "Laravel-eigenheid".

## Overzicht

Op 24 juli 2026 verscheen op de officiële Laravel-blog het artikel [AI agents pass tests. Can they write idiomatic Laravel?](https://laravel.com/blog/idiomatic-laravel-ai-coding-agents). Het gaat over **Boost Benchmarks**, de evaluatie-infrastructuur van [Laravel Boost](https://laravel.com/docs/13.x/boost), die zijn beoordelingsaanpak van AI-codeeragents ingrijpend verandert.

<Info>
  Boost Benchmarks is een evaluatiesuite die met [Pest](https://pestphp.com/)-tests en architectuurtests verifieert of AI-codeeragents Laravel-applicaties correct kunnen implementeren.
</Info>

## De aanloop: 17 evals zijn "vrijwel foutloos" opgelost

Ten tijde van het eerdere artikel [which AI model is best for Laravel](https://laravel.com/blog/which-ai-model-is-best-for-laravel) haalden de belangrijkste modellen met Boost 16 van de 17 evals (evaluatietaken), met een slagingspercentage van 99,4%. Alleen de moeilijkste taak bleef onhaalbaar.

Volgens het nieuwe artikel halen de nieuwste frontier-modellen — GPT-5.6, Claude Fable 5 / Mythos 5, de Gemini 3.x-serie, enzovoort — dezelfde 17 taken nu vrijwel voor 100%. Op de vraag "Kunnen AI-agents correcte Laravel-code schrijven?" is het antwoord dus een duidelijk "ja" geworden.

Dit is niet iets dat alleen bij Boost speelt; het gebeurt bij codeerbenchmarks in het algemeen.

* **SWE-bench Verified**: de belangrijkste modellen zitten dicht bij het niveau van menselijke experts en liggen op één lijn — feitelijk verzadigd
* **HumanEval**: kan al langer geen verschillen tussen modellen meer detecteren

## Waarom "slagen voor de tests" niet genoeg is

Het artikel wijst er ook op dat het slagen voor tests geen volledig bewijs van "goede code" is.

* OpenAI [is gestopt met het rapporteren van SWE-bench Verified](https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/) na een audit die uitwees dat veel probleemdefinities gebreken vertoonden
* [Onderzoek van Cursor](https://cursor.com/blog/reward-hacking-coding-benchmarks) rapporteerde gevallen waarin modellen het juiste antwoord vonden in de `.git`-geschiedenis en zo leken te "scoren"; werd de geschiedenis verborgen, dan kelderden de scores

Boost Benchmarks start elke keer vanuit een verse Laravel-app en verstopt geen antwoorden in `.git`, waardoor het relatief goed bestand is tegen deze problemen. Maar "slagen voor de Pest-suite" bewijst niet rechtstreeks dat "het model op een Laravel-eigen manier schrijft". Precies die kloof tussen "het werkt" en "het past bij die codebase" is de volgende focus.

## Nieuwe evaluatie-assen: correctheid per token en "Laravel-eigenheid"

Het artikel schetst twee richtingen voor de toekomst.

<Steps>
  <Step title="Correctheid per token (correct code per token)">
    Als alle modellen bij het juiste antwoord kunnen uitkomen, wordt de volgende vraag: tegen welke kosten? Bij hetzelfde resultaat kan het aantal verbruikte tokens per model een factor tien of honderd verschillen. Boost registreert al het aantal tokens en de kosten per run, maar gaat dit voortaan behandelen als hoofdmetriek in plaats van als voetnoot.
  </Step>

  <Step title="Laravel-eigenheid (idiomatic Laravel)">
    Code die de tests haalt maar rauwe SQL-queries schrijft, `Route::resource()` links laat liggen, validatie met de hand schrijft in plaats van [form requests](https://laravel.com/docs/13.x/validation) te gebruiken, of `$fillable` weglaat, is geen "goede Laravel". Met LLM-as-judge-scoring is het volgens het artikel inmiddels mogelijk om zonder modelantwoord te beoordelen of iets "Laravel-eigen" is.
  </Step>
</Steps>

Als beoordelingscriterium dienen de 19 concrete conventies uit de [best-practices skill](https://github.com/laravel/boost/blob/main/.ai/laravel/skill/laravel-best-practices/SKILL.md) van Boost. Voorbeelden die worden genoemd:

* Gebruik `Cache::remember()` in plaats van zelfgeschreven cachelogica
* Gebruik form requests in plaats van inline validatie
* Gebruik `with()` voor eager loading
* Gebruik `Route::resource()` voor routedefinities

De eerste regel is "Consistency First" (consistentie boven alles): pas je aan aan de stijl van bestaande buurbestanden voordat je naar een zogenaamd beter patroon grijpt.

## Wat Boost Benchmarks in de toekomst gaat meten

Aan het einde van het artikel worden de meetassen genoemd die worden overwogen.

* **Tokens en kosten als hoofdmetriek**, gerapporteerd naast het slagingspercentage per eval en per model
* **Scoring van Laravel-eigenheid** invoeren, bovenop de Pest-tests en architectuurtests
* **Lichtere context** als belangrijkste engineeringdoel van Boost zelf (overbodige richtlijnen schrappen, tooloutput optimaliseren, alleen de noodzakelijke informatie indexeren)

De bestaande 17 evals blijven behouden als regressietests, en daarbovenop wordt deze nieuwe laag opgebouwd.

## Conclusie

De vraag "Kunnen AI-agents correcte Laravel-code schrijven?" is beslecht; de volgende vraag is hoe **efficiënt** en hoe **Laravel-eigen** ze kunnen schrijven. Heb je Boost nog niet geprobeerd, dan kun je het installeren via de [officiële documentatie](https://laravel.com/docs/13.x/boost). Zie voor de installatie van Boost zelf ook de pagina [Laravel Boost](/nl/boost).

<Card title="Lees het originele artikel" icon="link" href="https://laravel.com/blog/idiomatic-laravel-ai-coding-agents">
  AI agents pass tests. Can they write idiomatic Laravel? (laravel.com)
</Card>


## Related topics

- [Upgradegids van Laravel 12 naar 13](/nl/blog/upgrade-12-to-13.md)
- [Laravel Boost](/nl/boost.md)
- [Laravel en AI-ontwikkeling](/nl/ai.md)
- [Het nieuwe code-analyse-ecosysteem van Laravel — surveyor / ranger / roster](/nl/blog/laravel-ecosystem-analysis.md)
- [laravel/agent-skills — de officiële Laravel-collectie van AI-agentskills](/nl/blog/agent-skills-introduction.md)
