Netlify testet 11 KI-Modelle fürs Programmieren: Welches ist am besten?
Netlify hat einen praxisnahen Vergleich von 11 KI-Modellen veröffentlicht, die identische Codier-Prompts ausführen, und dabei ihr neu als Open Source veröffentlichtes Bewertungswerkzeug AXIS verwendet. Die Tests decken gängige Webentwicklungsaufgaben ab, wie den Bau einer Coffee-Shop-Website, einer To-do-App und einer KI-Rezept-App, und liefern Ihnen konkrete Daten zu Modellqualität und Kreditkosten.
Dieser Vergleich kommt direkt nach der Partnerschaft von Netlify mit OpenRouter, die es Ihren Projekten ermöglicht, jedes Modell auf OpenRouter über ihr AI Gateway zu nutzen. Für ihre Agent Runners (das Chat-Prompt-Feld in Netlify, das Projekte erstellt oder weiterentwickelt) haben sie den Open-Source-Agenten OpenCode hinzugefügt, sodass Sie eine breitere Palette von Modellen verwenden können, einschließlich Kimi K3, GLM 5.2 und DeepSeek V4.
Was sie getestet haben
Netlify verwendete ihr internes AXIS-Framework, um drei einfache Anwendungsfälle durchzuführen:
- Coffee-Shop-Website – einfache statische Website, plus ein Follow-up, um Tischreservierungen hinzuzufügen.
- To-do-Listen-App – erfordert von Anfang an eine gemeinsame Datenbank und fügt dann optionale Foto-Uploads hinzu.
- „Was kann ich kochen“-App – Benutzer geben Zutaten ein, und die Website verwendet das AI Gateway, um Rezepte zu generieren.
Sie bewerteten nach Funktionalität (nicht nach Design) und prüften Dinge wie: Verwendet sie bei Bedarf eine Datenbank? Verwendet sie die Netlify-Datenbank ordnungsgemäß? Vermeidet sie Over-Engineering? Modelle, die die Prüfungen durchweg nicht bestehen, werden in Agent Runners nicht angeboten.
Wichtige Erkenntnisse
Der vollständige Bericht, verfügbar unter ihrem Blog, zeigt die generierte Website jedes Modells, Hinweise zu bemerkenswerten Problemen und Kreditkosten. Obwohl sie in diesem Beitrag keine offiziellen Punktzahlen veröffentlichten, heben sie große Unterschiede bei den Ergebnissen hervor. Zum Beispiel erwähnen sie, dass sie GPT 5.6 Sol standardmäßig mit geringem Aufwand betreiben, was eine wirtschaftlichere Alternative zu Opus bietet, die dennoch „ziemlich gute Ergebnisse“ liefert.
Sie stellten auch fest, dass die Kreditkosten je nach Modell für dieselbe Aufgabe stark variieren, sodass Sie möglicherweise einen Aufpreis für ein Modell zahlen, das keine bessere Ausgabe liefert.
Fazit
Wenn Sie ein Codier-Modell für Ihre eigenen agentenbasierten Projekte auswählen, ist dies ein nützlicher Datenpunkt. Der Test konzentriert sich auf reale Webentwicklungsszenarien und umfasst Open-Source-Modelle, die oft gehypt werden. Die Ergebnisse sind subjektiv (das geben sie zu), aber einen Blick wert, bevor Sie sich auf ein Standardmodell festlegen oder Credits ausgeben.
Hinweis: Dies ist der erste Beitrag einer Reihe; Folgebeiträge werden sich mit den anderen Anwendungsfällen befassen.
📖 Vollständige Quelle lesen: HN LLM Tools
👀 Siehe auch
LTM: Ein JSON-Protokoll für portables Agentengedächtnis über Modelle und Maschinen hinweg
LTM ist ein JSON-Protokoll (Core Memory Packet) plus CLI/Server zum Speichern von Agentenkontext – Sackgassen, Einschränkungen, nächste Schritte – über Modelle, Editoren und Maschinen hinweg. Pakete sind 2-5 KB groß, schwärzen Geheimnisse und unterstützen MCP.

Phaselock: Ein KI-Agenten-Steuerungssystem inspiriert von Erziehungstechniken
Phaselock ist eine Open-Source-Agent-Skill, die vier Kontrollmechanismen für KI-Agenten implementiert: explizite Gates vor Aktionen, sofortiges Feedback bei Fehlern, eingeschränkte Auswahlmöglichkeiten und mechanische Regelbefolgung. Es funktioniert mit Claude Code, Cursor, Windsurf und Tools, die Hooks unterstützen.
TextGen (text-generation-webui) wird native Desktop-App mit portablen Builds
TextGen, die Open-Source-Alternative zu LM Studio, hat sich von einer Web-UI zu einer Desktop-App ohne Installation für Windows, Linux und macOS mit portablen Builds, vollständiger Privatsphäre und erweiterter Quantisierungsunterstützung entwickelt.

Clarc v1.0: Workflow-Betriebssystem für Claude Code mit 63 Agenten und 249 Fähigkeiten
Clarc ist eine Plugin-Schicht für Claude Code, die 63 spezialisierte Subagenten, 249 Domänen-Fähigkeiten und 178 Slash-Befehle für Entwicklungs-Workflows bereitstellt. Die Installation erfolgt über npx mit Unterstützung für mehrere Editoren, einschließlich Cursor und OpenCode.