> ## Documentation Index
> Fetch the complete documentation index at: https://kawax.biz/llms.txt
> Use this file to discover all available pages before exploring further.

# Los agentes de IA pasan de código «correcto» a código «idiomático de Laravel»: el siguiente paso de Boost Benchmarks

> Basado en el artículo oficial del blog de Laravel «AI agents pass tests. Can they write idiomatic Laravel?», explica cómo Boost Benchmarks está pasando de la aprobación de pruebas a medir «corrección por token» y «carácter idiomático de Laravel».

## Descripción general

El 24 de julio de 2026, el blog oficial de Laravel publicó [AI agents pass tests. Can they write idiomatic Laravel?](https://laravel.com/blog/idiomatic-laravel-ai-coding-agents). El contenido explica que **Boost Benchmarks**, la base de evaluación de [Laravel Boost](https://laravel.com/docs/13.x/boost), da un giro importante en su enfoque para evaluar a los agentes de codificación de IA.

<Info>
  Boost Benchmarks es una suite de evaluación que comprueba si un agente de codificación de IA puede implementar correctamente una aplicación Laravel mediante pruebas de [Pest](https://pestphp.com/) y pruebas de arquitectura.
</Info>

## Contexto: los 17 evals llegaron al «casi todo correcto»

En el momento del artículo anterior, [which AI model is best for Laravel](https://laravel.com/blog/which-ai-model-is-best-for-laravel), los principales modelos superaban 16 de 17 evals (tareas de evaluación) usando Boost, con una tasa de acierto del 99,4%. Aun así, solo la tarea más difícil se resistía.

Según el nuevo artículo, los últimos modelos frontera —GPT-5.6, Claude Fable 5 / Mythos 5, la familia Gemini 3.x, etc.— superan ya prácticamente al 100% las mismas 17 tareas. A la pregunta «¿Pueden los agentes de IA escribir código Laravel correcto?», la respuesta es un rotundo «sí».

Este fenómeno no es exclusivo de Boost, sino que se está produciendo en los benchmarks de codificación en general.

* **SWE-bench Verified**: los principales modelos se sitúan al mismo nivel, cercano al de expertos humanos, prácticamente saturados.
* **HumanEval**: hace tiempo que dejó de detectar diferencias entre modelos.

## Por qué «pasar las pruebas» no es suficiente

El artículo también señala que aprobar las pruebas no es una prueba completa de que el código sea «bueno».

* OpenAI [dejó de informar sobre SWE-bench Verified](https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/) tras una auditoría que concluyó que muchos de los planteamientos de los problemas eran defectuosos.
* La [investigación de Cursor](https://cursor.com/blog/reward-hacking-coding-benchmarks) reportó casos en los que el modelo encontraba la solución en el historial `.git` y aparentaba haberla «resuelto»; al ocultar el historial, la puntuación caía en picado.

Boost Benchmarks arranca cada vez desde una app Laravel nueva y su diseño no oculta respuestas en `.git`, por lo que se le considera relativamente resistente a estos problemas. Sin embargo, «pasar la suite de Pest» no demuestra directamente que «el modelo escriba de forma idiomática en Laravel». Esa brecha entre «funciona» y «encaja en el código base» es precisamente el nuevo foco.

## Los nuevos ejes de evaluación: corrección por token y «carácter idiomático de Laravel»

Las dos direcciones futuras que plantea el artículo son las siguientes.

<Steps>
  <Step title="Corrección por token (correct code per token)">
    Si todos los modelos son capaces de llegar a la respuesta correcta, lo siguiente en importancia es «con qué coste» han llegado. Con el mismo resultado, el número de tokens consumidos puede variar en un orden o dos de magnitud entre modelos. Boost ya registra el número de tokens y el coste de cada ejecución, pero pasará a tratarlos como métricas principales y no como una nota al pie.
  </Step>

  <Step title="Carácter idiomático de Laravel (idiomatic Laravel)">
    Incluso pasando las pruebas, no puede considerarse «buen Laravel» un código que escribe consultas SQL a pelo, no usa `Route::resource()`, escribe validación a mano en lugar de una [Form Request](https://laravel.com/docs/13.x/validation) o se salta `$fillable`. Se afirma que ya hemos llegado al punto en que, mediante puntuación con LLM-as-judge, puede evaluarse si el código es «idiomático de Laravel» sin necesidad de una solución de referencia.
  </Step>
</Steps>

Como base para el juicio se referencia la [best-practices skill](https://github.com/laravel/boost/blob/main/.ai/laravel/skill/laravel-best-practices/SKILL.md) de Boost, un compendio de 19 convenciones concretas. Algunos ejemplos:

* Usar `Cache::remember()` en lugar de una lógica de caché propia.
* Usar Form Requests en lugar de validación en línea.
* Usar `with()` para el eager loading.
* Usar `Route::resource()` en la definición de rutas.

La primera regla es «Consistency First» (la coherencia primero): antes de saltar a un patrón supuestamente mejor, hay que adaptarse al estilo de los archivos hermanos existentes.

## Métricas que Boost Benchmarks planea medir a partir de ahora

Al final del artículo se enumeran los ejes de medición cuya incorporación está estudiándose.

* **Tratar los tokens y el coste como métrica principal**, junto con la tasa de acierto por eval y por modelo.
* **Introducir puntuación de carácter idiomático de Laravel** junto con las pruebas Pest y de arquitectura.
* **Reducir el peso del contexto** como objetivo principal de la ingeniería del propio Boost (eliminar guías redundantes, optimizar la salida de las herramientas, indexar solo la información necesaria).

Los 17 evals actuales se mantienen como pruebas de regresión y sobre ellos se construirá una nueva capa.

## Resumen

La pregunta de si los agentes de IA pueden escribir código Laravel correcto ha quedado zanjada; la siguiente pregunta se traslada a «con qué eficiencia» y «hasta qué punto de forma idiomática» son capaces de escribirlo. Si aún no has probado Boost, puedes instalarlo desde la [documentación oficial](https://laravel.com/docs/13.x/boost). Para el propio procedimiento de introducción de Boost, consulta también la página [Laravel Boost](/es/boost).

<Card title="Leer el original" icon="link" href="https://laravel.com/blog/idiomatic-laravel-ai-coding-agents">
  AI agents pass tests. Can they write idiomatic Laravel? (laravel.com)
</Card>


## Related topics

- [Laravel y el desarrollo con IA](/es/ai.md)
- [Laravel Boost](/es/boost.md)
- [Nuevo ecosistema de análisis de código de Laravel — surveyor / ranger / roster](/es/blog/laravel-ecosystem-analysis.md)
- [Laravel Agent Detector — Paquete de detección de agentes de IA](/es/blog/agent-detector-introduction.md)
- [laravel/agent-skills — Colección oficial de skills para agentes de IA de Laravel](/es/blog/agent-skills-introduction.md)
