> ## Documentation Index
> Fetch the complete documentation index at: https://kawax.biz/llms.txt
> Use this file to discover all available pages before exploring further.

# Les agents IA passent du code « correct » au code « idiomatique Laravel » — le prochain cap de Boost Benchmarks

> À partir de l'article officiel « AI agents pass tests. Can they write idiomatic Laravel? », découvrez pourquoi Boost Benchmarks passe de la réussite aux tests à la mesure de la « justesse par token » et du caractère idiomatique du code.

## Aperçu

Le 24 juillet 2026, le blog officiel Laravel a publié [AI agents pass tests. Can they write idiomatic Laravel?](https://laravel.com/blog/idiomatic-laravel-ai-coding-agents). L'article explique comment **Boost Benchmarks**, le banc d'essai de [Laravel Boost](https://laravel.com/docs/13.x/boost), fait évoluer radicalement sa manière d'évaluer les agents de code IA.

<Info>
  Boost Benchmarks est une suite d'évaluation qui, à l'aide de tests [Pest](https://pestphp.com/) et de tests d'architecture, vérifie qu'un agent de code IA sait implémenter correctement une application Laravel.
</Info>

## Le contexte : 17 évaluations « presque toutes réussies »

Dans l'article précédent [which AI model is best for Laravel](https://laravel.com/blog/which-ai-model-is-best-for-laravel), les principaux modèles utilisant Boost passaient 16 des 17 évaluations, soit un taux de réussite de 99,4 %. Seule la tâche la plus difficile résistait.

Selon le nouvel article, les modèles à la frontière — GPT-5.6, Claude Fable 5 / Mythos 5, la famille Gemini 3.x, etc. — franchissent désormais quasiment toutes les 17 tâches. À la question « Les agents IA savent-ils écrire du code Laravel correct ? », la réponse est clairement « oui ».

Ce phénomène ne se limite pas à Boost : il touche l'ensemble des benchmarks de code.

* **SWE-bench Verified** : les principaux modèles se rapprochent du niveau d'un expert humain et se retrouvent dans un mouchoir de poche — le benchmark est saturé.
* **HumanEval** : ne distingue plus les modèles entre eux depuis un moment.

## Pourquoi « réussir les tests » ne suffit plus

L'article souligne aussi que la réussite aux tests n'est pas une preuve suffisante de « bon code ».

* OpenAI a [cessé de publier ses résultats sur SWE-bench Verified](https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/) après un audit ayant conclu que de nombreux énoncés étaient mal formés.
* Une [étude de Cursor](https://cursor.com/blog/reward-hacking-coding-benchmarks) rapporte des cas où les modèles retrouvent la solution dans l'historique `.git` : en masquant cet historique, les scores s'effondrent.

Boost Benchmarks est relativement protégé contre ces travers : chaque évaluation démarre depuis une nouvelle application Laravel et aucune réponse n'est glissée dans `.git`. Mais réussir la suite Pest ne prouve pas directement que le modèle écrit du code idiomatique Laravel. C'est précisément dans ce fossé entre « ça marche » et « ça s'intègre à la codebase » que se joue la suite.

## Nouveaux axes d'évaluation : « justesse par token » et « caractère idiomatique »

L'article propose deux nouvelles directions.

<Steps>
  <Step title="Justesse par token (correct code per token)">
    Si tous les modèles atteignent la bonne réponse, la question suivante devient : à quel coût y sont-ils arrivés ? À résultat équivalent, la consommation de tokens peut varier d'un ordre voire de deux ordres de grandeur. Boost enregistre déjà les tokens et les coûts de chaque exécution : ces valeurs vont devenir des métriques de premier plan, plus reléguées à une note de bas de page.
  </Step>

  <Step title="Caractère idiomatique (idiomatic Laravel)">
    Un code qui écrit du SQL brut, n'utilise pas `Route::resource()`, redéveloppe la validation à la main au lieu d'utiliser une [form request](https://laravel.com/docs/13.x/validation) ou oublie `$fillable` peut passer les tests sans être du « bon Laravel ». Grâce à une notation par LLM-as-judge, il est aujourd'hui possible d'évaluer sans référence explicite si un code est idiomatique.
  </Step>
</Steps>

Comme grille d'évaluation, l'article se réfère aux 19 règles concrètes de la [best-practices skill](https://github.com/laravel/boost/blob/main/.ai/laravel/skill/laravel-best-practices/SKILL.md) de Boost. Quelques exemples :

* Utiliser `Cache::remember()` plutôt qu'un cache codé à la main.
* Utiliser une form request plutôt qu'une validation inline.
* Utiliser `with()` pour l'eager loading.
* Utiliser `Route::resource()` pour définir les routes.

La toute première règle est « Consistency First » (la cohérence avant tout) : avant de se précipiter sur un pattern « meilleur », alignez-vous sur le style des fichiers voisins existants.

## Ce que Boost Benchmarks prévoit de mesurer

À la fin de l'article sont listés les axes de mesure envisagés à l'avenir.

* **Faire des tokens et du coût des métriques de premier plan**, affichés côte à côte avec le taux de réussite pour chaque évaluation et chaque modèle.
* Introduire un **score de « caractère idiomatique »** en complément des tests Pest et des tests d'architecture.
* Faire de l'**allègement du contexte** un objectif d'ingénierie majeur pour Boost lui-même : suppression des consignes redondantes, optimisation de la sortie des outils, indexation ciblée des seules informations nécessaires.

Les 17 évaluations existantes seront maintenues comme tests de non-régression, avec cette nouvelle couche construite au-dessus.

## Conclusion

La question « Les agents IA écrivent-ils du code Laravel correct ? » est tranchée ; la nouvelle question est « À quel point sont-ils efficaces ? » et « À quel point sont-ils idiomatiques ? ». Si vous n'avez pas encore essayé Boost, vous pouvez l'installer depuis la [documentation officielle](https://laravel.com/docs/13.x/boost). Pour la marche à suivre, référez-vous également à la page [Laravel Boost](/fr/boost).

<Card title="Lire l'article original" icon="link" href="https://laravel.com/blog/idiomatic-laravel-ai-coding-agents">
  AI agents pass tests. Can they write idiomatic Laravel? (laravel.com)
</Card>


## Related topics

- [Laravel et le développement IA](/fr/ai.md)
- [Créer un agent personnalisé pour Boost](/fr/advanced/boost-custom-agent.md)
- [Laravel Boost](/fr/boost.md)
- [Laravel Agent Detector — package de détection d'agents IA](/fr/blog/agent-detector-introduction.md)
- [Le nouvel écosystème d'analyse de code Laravel — surveyor / ranger / roster](/fr/blog/laravel-ecosystem-analysis.md)
