Netlify testet 11 KI-Modelle fürs Programmieren: Welches ist am besten?
Netlify hat einen praxisnahen Vergleich von 11 KI-Modellen veröffentlicht, die identische Codier-Prompts ausführen, und dabei ihr neu als Open Source veröffentlichtes Bewertungswerkzeug AXIS verwendet. Die Tests decken gängige Webentwicklungsaufgaben ab, wie den Bau einer Coffee-Shop-Website, einer To-do-App und einer KI-Rezept-App, und liefern Ihnen konkrete Daten zu Modellqualität und Kreditkosten.
Dieser Vergleich kommt direkt nach der Partnerschaft von Netlify mit OpenRouter, die es Ihren Projekten ermöglicht, jedes Modell auf OpenRouter über ihr AI Gateway zu nutzen. Für ihre Agent Runners (das Chat-Prompt-Feld in Netlify, das Projekte erstellt oder weiterentwickelt) haben sie den Open-Source-Agenten OpenCode hinzugefügt, sodass Sie eine breitere Palette von Modellen verwenden können, einschließlich Kimi K3, GLM 5.2 und DeepSeek V4.
Was sie getestet haben
Netlify verwendete ihr internes AXIS-Framework, um drei einfache Anwendungsfälle durchzuführen:
- Coffee-Shop-Website – einfache statische Website, plus ein Follow-up, um Tischreservierungen hinzuzufügen.
- To-do-Listen-App – erfordert von Anfang an eine gemeinsame Datenbank und fügt dann optionale Foto-Uploads hinzu.
- „Was kann ich kochen“-App – Benutzer geben Zutaten ein, und die Website verwendet das AI Gateway, um Rezepte zu generieren.
Sie bewerteten nach Funktionalität (nicht nach Design) und prüften Dinge wie: Verwendet sie bei Bedarf eine Datenbank? Verwendet sie die Netlify-Datenbank ordnungsgemäß? Vermeidet sie Over-Engineering? Modelle, die die Prüfungen durchweg nicht bestehen, werden in Agent Runners nicht angeboten.
Wichtige Erkenntnisse
Der vollständige Bericht, verfügbar unter ihrem Blog, zeigt die generierte Website jedes Modells, Hinweise zu bemerkenswerten Problemen und Kreditkosten. Obwohl sie in diesem Beitrag keine offiziellen Punktzahlen veröffentlichten, heben sie große Unterschiede bei den Ergebnissen hervor. Zum Beispiel erwähnen sie, dass sie GPT 5.6 Sol standardmäßig mit geringem Aufwand betreiben, was eine wirtschaftlichere Alternative zu Opus bietet, die dennoch „ziemlich gute Ergebnisse“ liefert.
Sie stellten auch fest, dass die Kreditkosten je nach Modell für dieselbe Aufgabe stark variieren, sodass Sie möglicherweise einen Aufpreis für ein Modell zahlen, das keine bessere Ausgabe liefert.
Fazit
Wenn Sie ein Codier-Modell für Ihre eigenen agentenbasierten Projekte auswählen, ist dies ein nützlicher Datenpunkt. Der Test konzentriert sich auf reale Webentwicklungsszenarien und umfasst Open-Source-Modelle, die oft gehypt werden. Die Ergebnisse sind subjektiv (das geben sie zu), aber einen Blick wert, bevor Sie sich auf ein Standardmodell festlegen oder Credits ausgeben.
Hinweis: Dies ist der erste Beitrag einer Reihe; Folgebeiträge werden sich mit den anderen Anwendungsfällen befassen.
📖 Vollständige Quelle lesen: HN LLM Tools
👀 Siehe auch

OpenClaw iOS-App fügt historische Apple Health-Daten-Synchronisation bis zu 18 Monate hinzu
Die neueste Version der OpenClaw iOS-App ermöglicht den Export historischer Apple Health-Daten, sodass Benutzer bis zu 18 Monate Gesundheitsdaten mit ihrem Agent synchronisieren können, um personalisierte Einblicke oder KI-Training zu erhalten.

Runtime: Sandbox-Codierungsagenten für jedes Teammitglied
Runtime (YC P26) bietet eine sandboxed Infrastruktur für Coding-Agenten, die es auch Nicht-Entwicklern ermöglicht, Claude Code, Codex und andere Agenten sicher zu nutzen. Es erstellt Snapshots von Multi-Service-Umgebungen (Docker, Kafka, Redis, seedete Datenbanken), die in Millisekunden starten, mit Sicherheitsvorkehrungen auf Infrastrukturebene.

Terminalbasierter 3D-Renderer erstellt mit Multi-Agent-Claude-Code-System
Ein Entwickler hat tortuise erstellt, einen rein terminalbasierten 3D-Renderer, der Gaußsche Splats mithilfe von Unicode- und ASCII-Symbolen darstellt, entwickelt über 3 Tage mit 70-80 KI-Agenten, die durch ein Claude-Code-Setup mit Subagenten innerhalb von Subagenten koordiniert wurden.

Argus: Eine GitHub-App, die CLAUDE.md-Dateien überprüft und Bewertungen in PRs veröffentlicht
Argus ist eine GitHub-App, die mit Claude Code entwickelt wurde und CLAUDE.md-Dateien überprüft und bei jedem Pull Request eine Bewertung veröffentlicht. Nach Tests an mehreren Repositories sind die häufigsten Fehler fehlende explizite Grenzen des Anwendungsbereichs und Eskalationspfade.