Descripción general
El 24 de julio de 2026, el blog oficial de Laravel publicó AI agents pass tests. Can they write idiomatic Laravel?. El contenido explica que Boost Benchmarks, la base de evaluación de Laravel Boost, da un giro importante en su enfoque para evaluar a los agentes de codificación de IA.Boost Benchmarks es una suite de evaluación que comprueba si un agente de codificación de IA puede implementar correctamente una aplicación Laravel mediante pruebas de Pest y pruebas de arquitectura.
Contexto: los 17 evals llegaron al «casi todo correcto»
En el momento del artículo anterior, which AI model is best for Laravel, los principales modelos superaban 16 de 17 evals (tareas de evaluación) usando Boost, con una tasa de acierto del 99,4%. Aun así, solo la tarea más difícil se resistía. Según el nuevo artículo, los últimos modelos frontera —GPT-5.6, Claude Fable 5 / Mythos 5, la familia Gemini 3.x, etc.— superan ya prácticamente al 100% las mismas 17 tareas. A la pregunta «¿Pueden los agentes de IA escribir código Laravel correcto?», la respuesta es un rotundo «sí». Este fenómeno no es exclusivo de Boost, sino que se está produciendo en los benchmarks de codificación en general.- SWE-bench Verified: los principales modelos se sitúan al mismo nivel, cercano al de expertos humanos, prácticamente saturados.
- HumanEval: hace tiempo que dejó de detectar diferencias entre modelos.
Por qué «pasar las pruebas» no es suficiente
El artículo también señala que aprobar las pruebas no es una prueba completa de que el código sea «bueno».- OpenAI dejó de informar sobre SWE-bench Verified tras una auditoría que concluyó que muchos de los planteamientos de los problemas eran defectuosos.
- La investigación de Cursor reportó casos en los que el modelo encontraba la solución en el historial
.gity aparentaba haberla «resuelto»; al ocultar el historial, la puntuación caía en picado.
.git, por lo que se le considera relativamente resistente a estos problemas. Sin embargo, «pasar la suite de Pest» no demuestra directamente que «el modelo escriba de forma idiomática en Laravel». Esa brecha entre «funciona» y «encaja en el código base» es precisamente el nuevo foco.
Los nuevos ejes de evaluación: corrección por token y «carácter idiomático de Laravel»
Las dos direcciones futuras que plantea el artículo son las siguientes.1
Corrección por token (correct code per token)
Si todos los modelos son capaces de llegar a la respuesta correcta, lo siguiente en importancia es «con qué coste» han llegado. Con el mismo resultado, el número de tokens consumidos puede variar en un orden o dos de magnitud entre modelos. Boost ya registra el número de tokens y el coste de cada ejecución, pero pasará a tratarlos como métricas principales y no como una nota al pie.
2
Carácter idiomático de Laravel (idiomatic Laravel)
Incluso pasando las pruebas, no puede considerarse «buen Laravel» un código que escribe consultas SQL a pelo, no usa
Route::resource(), escribe validación a mano en lugar de una Form Request o se salta $fillable. Se afirma que ya hemos llegado al punto en que, mediante puntuación con LLM-as-judge, puede evaluarse si el código es «idiomático de Laravel» sin necesidad de una solución de referencia.- Usar
Cache::remember()en lugar de una lógica de caché propia. - Usar Form Requests en lugar de validación en línea.
- Usar
with()para el eager loading. - Usar
Route::resource()en la definición de rutas.
Métricas que Boost Benchmarks planea medir a partir de ahora
Al final del artículo se enumeran los ejes de medición cuya incorporación está estudiándose.- Tratar los tokens y el coste como métrica principal, junto con la tasa de acierto por eval y por modelo.
- Introducir puntuación de carácter idiomático de Laravel junto con las pruebas Pest y de arquitectura.
- Reducir el peso del contexto como objetivo principal de la ingeniería del propio Boost (eliminar guías redundantes, optimizar la salida de las herramientas, indexar solo la información necesaria).
Resumen
La pregunta de si los agentes de IA pueden escribir código Laravel correcto ha quedado zanjada; la siguiente pregunta se traslada a «con qué eficiencia» y «hasta qué punto de forma idiomática» son capaces de escribirlo. Si aún no has probado Boost, puedes instalarlo desde la documentación oficial. Para el propio procedimiento de introducción de Boost, consulta también la página Laravel Boost.Leer el original
AI agents pass tests. Can they write idiomatic Laravel? (laravel.com)