> ## Documentation Index
> Fetch the complete documentation index at: https://kawax.biz/llms.txt
> Use this file to discover all available pages before exploring further.

# Gli agenti AI passano dal codice "corretto" al codice "idiomatico Laravel" — la prossima mossa di Boost Benchmarks

> Sulla base dell'articolo ufficiale del blog Laravel "AI agents pass tests. Can they write idiomatic Laravel?", ricostruiamo come Boost Benchmarks stia passando dal semplice superamento dei test alla misura di "correttezza per token" e "idiomaticità Laravel".

## Panoramica

Il 24 luglio 2026 sul blog ufficiale di Laravel è stato pubblicato [AI agents pass tests. Can they write idiomatic Laravel?](https://laravel.com/blog/idiomatic-laravel-ai-coding-agents). Il tema è che la piattaforma di valutazione di [Laravel Boost](https://laravel.com/docs/13.x/boost) — **Boost Benchmarks** — sta cambiando in modo significativo il modo in cui valuta gli agenti di coding AI.

<Info>
  Boost Benchmarks è una suite di valutazione che verifica, tramite test [Pest](https://pestphp.com/) e test architetturali, se un agente di coding AI riesce a implementare correttamente un'applicazione Laravel.
</Info>

## Il percorso finora: 17 eval quasi tutti risolti

Nell'articolo precedente [which AI model is best for Laravel](https://laravel.com/blog/which-ai-model-is-best-for-laravel), i modelli principali usando Boost superavano 16 dei 17 eval (task di valutazione), con un tasso di successo del 99,4%. Solo il task più difficile restava fuori portata.

Secondo l'articolo attuale, i modelli di frontiera più recenti — GPT-5.6, Claude Fable 5 / Mythos 5, la famiglia Gemini 3.x — arrivano ora a superare quasi il 100% degli stessi 17 task. Alla domanda "gli agenti AI riescono a scrivere codice Laravel corretto?", la risposta è ormai chiara: sì.

Non è un fenomeno limitato a Boost, ma si osserva in tutti i benchmark di coding.

* **SWE-bench Verified**: i modelli principali si allineano vicino al livello degli esperti umani, di fatto saturando il benchmark.
* **HumanEval**: da tempo non riesce più a distinguere i modelli tra loro.

## Perché "passare i test" non basta

L'articolo evidenzia anche che superare i test non è la prova definitiva di "codice buono".

* OpenAI, in seguito a un audit che ha rilevato molte carenze nella formulazione dei problemi, ha [smesso di riportare i risultati di SWE-bench Verified](https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/).
* Uno [studio di Cursor](https://cursor.com/blog/reward-hacking-coding-benchmarks) ha rilevato casi in cui i modelli sembravano "risolvere" i problemi trovando le soluzioni nei `.git` history: nascondendo la history, il punteggio crollava.

Boost Benchmarks è considerato relativamente robusto verso questi problemi perché parte ogni volta da un'app Laravel nuova e non nasconde le risposte nel `.git`. Tuttavia, "superare la suite Pest" non prova direttamente che "il modello scriva Laravel in modo idiomatico". Il gap tra "funziona" e "si integra con la codebase" è proprio il prossimo tema di analisi.

## I nuovi assi di valutazione: correttezza per token e "idiomaticità Laravel"

L'articolo indica due direzioni per il futuro.

<Steps>
  <Step title="Correttezza per token (correct code per token)">
    Se tutti i modelli arrivano alla soluzione, ciò che conta davvero è "a che costo". A parità di risultato, il consumo di token tra i modelli può variare di un ordine di grandezza, se non due. Boost già registra token e costo di ogni esecuzione: ora questi dati passano da nota a piè di pagina a metrica principale.
  </Step>

  <Step title="Idiomaticità Laravel">
    Anche se i test passano, non si può parlare di "buon Laravel" se il codice scrive query SQL a mano, non usa `Route::resource()`, riscrive validazioni al posto delle [form request](https://laravel.com/docs/13.x/validation) o dimentica `$fillable`. Con uno scoring in stile LLM-as-judge siamo arrivati a poter giudicare "quanto è idiomatico Laravel" senza bisogno di soluzioni di riferimento.
  </Step>
</Steps>

Come riferimento di valutazione si utilizzano le 19 regole concrete raccolte nella [best-practices skill](https://github.com/laravel/boost/blob/main/.ai/laravel/skill/laravel-best-practices/SKILL.md) di Boost. Alcuni esempi:

* Usare `Cache::remember()` invece di implementare a mano la logica di caching.
* Usare le form request invece della validazione inline.
* Usare `with()` per l'eager loading.
* Usare `Route::resource()` per la definizione delle route.

La prima regola, "Consistency First" (la coerenza prima di tutto), invita ad allinearsi allo stile dei file "fratelli" esistenti prima di lanciarsi su pattern presunti migliori.

## Cosa Boost Benchmarks misurerà a breve

Alla fine dell'articolo sono elencati gli assi di misurazione che si stanno considerando di aggiungere.

* **Token e costo come metriche principali**, riportati a fianco del tasso di successo, per ciascun eval e modello.
* **Scoring dell'idiomaticità Laravel** in aggiunta ai test Pest e ai test architetturali.
* **Contesto più leggero** come obiettivo ingegneristico principale di Boost stesso (rimozione di linee guida ridondanti, ottimizzazione dell'output dei tool, indicizzazione delle sole informazioni necessarie).

I 17 eval esistenti restano come test di regressione, e su di essi si costruirà il nuovo livello.

## Conclusioni

La domanda "gli agenti AI possono scrivere codice Laravel corretto?" ha una risposta. Le prossime domande sono "con quanta efficienza" e "quanto in stile Laravel". Se non hai ancora provato Boost, puoi installarlo dalla [documentazione ufficiale](https://laravel.com/docs/13.x/boost). Per l'installazione consulta anche la pagina [Laravel Boost](/it/boost).

<Card title="Leggi l'articolo originale" icon="link" href="https://laravel.com/blog/idiomatic-laravel-ai-coding-agents">
  AI agents pass tests. Can they write idiomatic Laravel? (laravel.com)
</Card>


## Related topics

- [Laravel e lo sviluppo con AI](/it/ai.md)
- [Laravel Agent Detector — pacchetto per rilevare gli agenti AI](/it/blog/agent-detector-introduction.md)
- [Laravel Boost](/it/boost.md)
- [Il nuovo ecosistema di analisi del codice Laravel — surveyor / ranger / roster](/it/blog/laravel-ecosystem-analysis.md)
- [laravel/agent-skills — la raccolta ufficiale di skill per agenti AI di Laravel](/it/blog/agent-skills-introduction.md)
