Ein Sprachmodell liefert nur Text. Erst der Harness lässt es Dateien lesen und Befehle ausführen. Was dahintersteckt, was es kostet und wo die Grenzen liegen.
Dasselbe Modell in zwei Auflösungen und mit zugeschalteter Vorhersage, auf derselben Karte vermessen. Eine der drei Einstellungen bringt viel, eine kostet nur, und eine wirkt bei zwei Modellen genau entgegengesetzt.
Lokale Modelle gegen Claude Code und Codex: 550 Läufe, gleiche Aufgaben, gemessene Ergebnisse. Vier bis sechs Prozentpunkte Abstand, und vier Fehldeutungen auf dem Weg dorthin.