Skip to main content

Descripción general

El 24 de julio de 2026, el blog oficial de Laravel publicó AI agents pass tests. Can they write idiomatic Laravel?. El contenido explica que Boost Benchmarks, la base de evaluación de Laravel Boost, da un giro importante en su enfoque para evaluar a los agentes de codificación de IA.
Boost Benchmarks es una suite de evaluación que comprueba si un agente de codificación de IA puede implementar correctamente una aplicación Laravel mediante pruebas de Pest y pruebas de arquitectura.

Contexto: los 17 evals llegaron al «casi todo correcto»

En el momento del artículo anterior, which AI model is best for Laravel, los principales modelos superaban 16 de 17 evals (tareas de evaluación) usando Boost, con una tasa de acierto del 99,4%. Aun así, solo la tarea más difícil se resistía. Según el nuevo artículo, los últimos modelos frontera —GPT-5.6, Claude Fable 5 / Mythos 5, la familia Gemini 3.x, etc.— superan ya prácticamente al 100% las mismas 17 tareas. A la pregunta «¿Pueden los agentes de IA escribir código Laravel correcto?», la respuesta es un rotundo «sí». Este fenómeno no es exclusivo de Boost, sino que se está produciendo en los benchmarks de codificación en general.
  • SWE-bench Verified: los principales modelos se sitúan al mismo nivel, cercano al de expertos humanos, prácticamente saturados.
  • HumanEval: hace tiempo que dejó de detectar diferencias entre modelos.

Por qué «pasar las pruebas» no es suficiente

El artículo también señala que aprobar las pruebas no es una prueba completa de que el código sea «bueno».
  • OpenAI dejó de informar sobre SWE-bench Verified tras una auditoría que concluyó que muchos de los planteamientos de los problemas eran defectuosos.
  • La investigación de Cursor reportó casos en los que el modelo encontraba la solución en el historial .git y aparentaba haberla «resuelto»; al ocultar el historial, la puntuación caía en picado.
Boost Benchmarks arranca cada vez desde una app Laravel nueva y su diseño no oculta respuestas en .git, por lo que se le considera relativamente resistente a estos problemas. Sin embargo, «pasar la suite de Pest» no demuestra directamente que «el modelo escriba de forma idiomática en Laravel». Esa brecha entre «funciona» y «encaja en el código base» es precisamente el nuevo foco.

Los nuevos ejes de evaluación: corrección por token y «carácter idiomático de Laravel»

Las dos direcciones futuras que plantea el artículo son las siguientes.
1

Corrección por token (correct code per token)

Si todos los modelos son capaces de llegar a la respuesta correcta, lo siguiente en importancia es «con qué coste» han llegado. Con el mismo resultado, el número de tokens consumidos puede variar en un orden o dos de magnitud entre modelos. Boost ya registra el número de tokens y el coste de cada ejecución, pero pasará a tratarlos como métricas principales y no como una nota al pie.
2

Carácter idiomático de Laravel (idiomatic Laravel)

Incluso pasando las pruebas, no puede considerarse «buen Laravel» un código que escribe consultas SQL a pelo, no usa Route::resource(), escribe validación a mano en lugar de una Form Request o se salta $fillable. Se afirma que ya hemos llegado al punto en que, mediante puntuación con LLM-as-judge, puede evaluarse si el código es «idiomático de Laravel» sin necesidad de una solución de referencia.
Como base para el juicio se referencia la best-practices skill de Boost, un compendio de 19 convenciones concretas. Algunos ejemplos:
  • Usar Cache::remember() en lugar de una lógica de caché propia.
  • Usar Form Requests en lugar de validación en línea.
  • Usar with() para el eager loading.
  • Usar Route::resource() en la definición de rutas.
La primera regla es «Consistency First» (la coherencia primero): antes de saltar a un patrón supuestamente mejor, hay que adaptarse al estilo de los archivos hermanos existentes.

Métricas que Boost Benchmarks planea medir a partir de ahora

Al final del artículo se enumeran los ejes de medición cuya incorporación está estudiándose.
  • Tratar los tokens y el coste como métrica principal, junto con la tasa de acierto por eval y por modelo.
  • Introducir puntuación de carácter idiomático de Laravel junto con las pruebas Pest y de arquitectura.
  • Reducir el peso del contexto como objetivo principal de la ingeniería del propio Boost (eliminar guías redundantes, optimizar la salida de las herramientas, indexar solo la información necesaria).
Los 17 evals actuales se mantienen como pruebas de regresión y sobre ellos se construirá una nueva capa.

Resumen

La pregunta de si los agentes de IA pueden escribir código Laravel correcto ha quedado zanjada; la siguiente pregunta se traslada a «con qué eficiencia» y «hasta qué punto de forma idiomática» son capaces de escribirlo. Si aún no has probado Boost, puedes instalarlo desde la documentación oficial. Para el propio procedimiento de introducción de Boost, consulta también la página Laravel Boost.

Leer el original

AI agents pass tests. Can they write idiomatic Laravel? (laravel.com)
Última modificación el 2 de agosto de 2026