> ## Documentation Index
> Fetch the complete documentation index at: https://kawax.biz/llms.txt
> Use this file to discover all available pages before exploring further.

# KI-Agenten: Von „korrektem“ Code zu „idiomatischem Laravel“ – Der nächste Schritt der Boost Benchmarks

> Basierend auf dem offiziellen Laravel-Blogpost „AI agents pass tests. Can they write idiomatic Laravel?“ erläutern wir, warum sich Boost Benchmarks vom bloßen Bestehen von Tests hin zur Messung von „Korrektheit pro Token“ und „Idiomatik im Laravel-Sinne“ wandelt.

## Überblick

Am 24. Juli 2026 wurde im offiziellen Laravel-Blog der Artikel [AI agents pass tests. Can they write idiomatic Laravel?](https://laravel.com/blog/idiomatic-laravel-ai-coding-agents) veröffentlicht. Er beschreibt, wie **Boost Benchmarks** – die Bewertungsgrundlage von [Laravel Boost](https://laravel.com/docs/13.x/boost) – eine grundlegende Neuausrichtung bei der Bewertung von KI-Coding-Agenten vollzieht.

<Info>
  Boost Benchmarks ist eine Bewertungssuite, die anhand von [Pest](https://pestphp.com/)-Tests und Architekturtests überprüft, ob KI-Coding-Agenten Laravel-Anwendungen korrekt implementieren können.
</Info>

## Der bisherige Weg: 17 Evals erreichen „nahezu alle korrekt"

Zum Zeitpunkt des früheren Artikels [which AI model is best for Laravel](https://laravel.com/blog/which-ai-model-is-best-for-laravel) bestanden die führenden Modelle mit Boost 16 von 17 Evals (Bewertungsaufgaben), was einer Erfolgsquote von 99,4 % entspricht. Dennoch konnte nur die schwierigste Aufgabe nicht bewältigt werden.

Laut dem aktuellen Artikel meistern die neuesten Frontier-Modelle wie GPT-5.6, Claude Fable 5 / Mythos 5 und die Gemini-3.x-Reihe dieselben 17 Aufgaben nun nahezu zu 100 %. Auf die Frage „Können KI-Agenten korrekten Laravel-Code schreiben?" gibt es damit ein klares „Ja".

Das ist nicht auf Boost beschränkt, sondern ein Phänomen, das sich in Coding-Benchmarks insgesamt zeigt.

* **SWE-bench Verified**: Führende Modelle liegen inzwischen auf annähernd menschlichem Expertenniveau gleichauf – faktisch gesättigt.
* **HumanEval**: Kann Modellunterschiede schon lange nicht mehr sinnvoll erkennen.

## Warum „Tests bestehen" allein nicht ausreicht

Der Artikel weist auch darauf hin, dass das Bestehen von Tests kein vollständiger Beweis für „guten Code" ist.

* OpenAI hat nach einer Prüfung, die viele fehlerhafte Aufgabenstellungen aufdeckte, [die Berichterstattung zu SWE-bench Verified eingestellt](https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/).
* [Untersuchungen von Cursor](https://cursor.com/blog/reward-hacking-coding-benchmarks) zeigen Fälle, in denen Modelle die Lösung aus dem `.git`-Verlauf o. ä. „ableiteten" und scheinbar löste; wurden diese Verläufe verborgen, brach der Score ein.

Boost Benchmarks gilt gegenüber diesen Problemen als vergleichsweise robust, weil jeder Durchlauf mit einer frischen Laravel-Anwendung beginnt und keine Antworten in `.git` versteckt sind. Dennoch beweist das Bestehen der Pest-Suite nicht direkt, dass „das Modell im Laravel-Stil schreibt". Genau diese Lücke zwischen „funktioniert" und „fügt sich in die Codebasis ein" steht als Nächstes im Fokus.

## Neue Bewertungsdimensionen: Korrektheit pro Token und „Laravel-Idiomatik"

Der Artikel schlägt für die Zukunft die folgenden zwei Richtungen vor.

<Steps>
  <Step title="Korrektheit pro Token (correct code per token)">
    Wenn alle Modelle die richtige Lösung erreichen, wird als Nächstes wichtig, „mit welchen Kosten" sie das tun. Für dasselbe Ergebnis kann sich der Token-Verbrauch zwischen Modellen um eine oder zwei Größenordnungen unterscheiden. Boost erfasst bereits die Token-Zahl und die Kosten jedes Durchlaufs, wird diese aber künftig nicht mehr als Fußnote, sondern als Kernmetrik behandeln.
  </Step>

  <Step title="Laravel-Idiomatik (idiomatic Laravel)">
    Selbst wenn Tests bestehen: Code, der rohe SQL-Queries schreibt, `Route::resource()` nicht nutzt, statt einer [Form Request](https://laravel.com/docs/13.x/validation) manuelle Validierung schreibt oder `$fillable` auslässt, ist kein „guter Laravel-Code". Mit LLM-as-Judge-basierter Bewertung ist inzwischen der Punkt erreicht, an dem sich auch ohne Musterlösung beurteilen lässt, „ob etwas Laravel-typisch ist".
  </Step>
</Steps>

Als Bewertungsmaßstab dienen die 19 konkreten Konventionen der [best-practices skill](https://github.com/laravel/boost/blob/main/.ai/laravel/skill/laravel-best-practices/SKILL.md) von Boost. Beispiele daraus:

* `Cache::remember()` verwenden statt eigener Cache-Logik.
* Form Requests statt Inline-Validierung nutzen.
* Für Eager Loading `with()` einsetzen.
* Bei Routen-Definitionen `Route::resource()` verwenden.

Die erste Regel „Consistency First" (Konsistenz an erster Stelle) verlangt, sich zunächst am Stil bestehender benachbarter Dateien zu orientieren, bevor man auf ein vermeintlich besseres Muster umspringt.

## Was Boost Benchmarks künftig messen soll

Am Ende des Artikels werden folgende zu ergänzende Messgrößen genannt.

* **Token und Kosten als Kernmetrik**: pro Eval und Modell zusammen mit der Erfolgsquote ausweisen.
* **Idiomatik-Bewertung** zusätzlich zu Pest- und Architekturtests einführen.
* **Kontext schlank halten** als zentrales Engineering-Ziel von Boost selbst (Streichen redundanter Guidelines, Optimieren von Tool-Ausgaben, gezieltes Indexieren nur notwendiger Informationen).

Die bestehenden 17 Evals bleiben als Regressionstests erhalten; darauf aufbauend soll eine neue Ebene entstehen.

## Fazit

Die Frage „Können KI-Agenten korrekten Laravel-Code schreiben?" ist entschieden. Die nächste Frage lautet nun: „Wie effizient?" und „Wie Laravel-typisch?" können sie ihn schreiben. Falls Sie Boost noch nicht ausprobiert haben, können Sie es über die [offizielle Dokumentation](https://laravel.com/docs/13.x/boost) installieren. Zur Einrichtung von Boost selbst siehe auch die Seite [Laravel Boost](/de/boost).

<Card title="Originalartikel lesen" icon="link" href="https://laravel.com/blog/idiomatic-laravel-ai-coding-agents">
  AI agents pass tests. Can they write idiomatic Laravel? (laravel.com)
</Card>


## Related topics

- [Laravel und KI-Entwicklung](/de/ai.md)
- [Einen eigenen Agenten für Boost erstellen](/de/advanced/boost-custom-agent.md)
- [Laravel Agent Detector – Paket zur Erkennung von KI-Agenten](/de/blog/agent-detector-introduction.md)
- [Laravel Boost](/de/boost.md)
- [laravel/agent-skills – Offizielle KI-Agent-Skills-Sammlung von Laravel](/de/blog/agent-skills-introduction.md)
