Netlify testet 11 KI-Modelle fürs Programmieren: Welches ist am besten?
Netlify hat einen praxisnahen Vergleich von 11 KI-Modellen veröffentlicht, die identische Codier-Prompts ausführen, und dabei ihr neu als Open Source veröffentlichtes Bewertungswerkzeug AXIS verwendet. Die Tests decken gängige Webentwicklungsaufgaben ab, wie den Bau einer Coffee-Shop-Website, einer To-do-App und einer KI-Rezept-App, und liefern Ihnen konkrete Daten zu Modellqualität und Kreditkosten.
Dieser Vergleich kommt direkt nach der Partnerschaft von Netlify mit OpenRouter, die es Ihren Projekten ermöglicht, jedes Modell auf OpenRouter über ihr AI Gateway zu nutzen. Für ihre Agent Runners (das Chat-Prompt-Feld in Netlify, das Projekte erstellt oder weiterentwickelt) haben sie den Open-Source-Agenten OpenCode hinzugefügt, sodass Sie eine breitere Palette von Modellen verwenden können, einschließlich Kimi K3, GLM 5.2 und DeepSeek V4.
Was sie getestet haben
Netlify verwendete ihr internes AXIS-Framework, um drei einfache Anwendungsfälle durchzuführen:
- Coffee-Shop-Website – einfache statische Website, plus ein Follow-up, um Tischreservierungen hinzuzufügen.
- To-do-Listen-App – erfordert von Anfang an eine gemeinsame Datenbank und fügt dann optionale Foto-Uploads hinzu.
- „Was kann ich kochen“-App – Benutzer geben Zutaten ein, und die Website verwendet das AI Gateway, um Rezepte zu generieren.
Sie bewerteten nach Funktionalität (nicht nach Design) und prüften Dinge wie: Verwendet sie bei Bedarf eine Datenbank? Verwendet sie die Netlify-Datenbank ordnungsgemäß? Vermeidet sie Over-Engineering? Modelle, die die Prüfungen durchweg nicht bestehen, werden in Agent Runners nicht angeboten.
Wichtige Erkenntnisse
Der vollständige Bericht, verfügbar unter ihrem Blog, zeigt die generierte Website jedes Modells, Hinweise zu bemerkenswerten Problemen und Kreditkosten. Obwohl sie in diesem Beitrag keine offiziellen Punktzahlen veröffentlichten, heben sie große Unterschiede bei den Ergebnissen hervor. Zum Beispiel erwähnen sie, dass sie GPT 5.6 Sol standardmäßig mit geringem Aufwand betreiben, was eine wirtschaftlichere Alternative zu Opus bietet, die dennoch „ziemlich gute Ergebnisse“ liefert.
Sie stellten auch fest, dass die Kreditkosten je nach Modell für dieselbe Aufgabe stark variieren, sodass Sie möglicherweise einen Aufpreis für ein Modell zahlen, das keine bessere Ausgabe liefert.
Fazit
Wenn Sie ein Codier-Modell für Ihre eigenen agentenbasierten Projekte auswählen, ist dies ein nützlicher Datenpunkt. Der Test konzentriert sich auf reale Webentwicklungsszenarien und umfasst Open-Source-Modelle, die oft gehypt werden. Die Ergebnisse sind subjektiv (das geben sie zu), aber einen Blick wert, bevor Sie sich auf ein Standardmodell festlegen oder Credits ausgeben.
Hinweis: Dies ist der erste Beitrag einer Reihe; Folgebeiträge werden sich mit den anderen Anwendungsfällen befassen.
📖 Vollständige Quelle lesen: HN LLM Tools
👀 Siehe auch

Zwei Claude-Code-Agenten gleichzeitig im selben Repository mit Git-Worktrees ausführen
Ein Reddit-Nutzer beschreibt, wie man mehrere Claude Code Agents parallel auf derselben Codebasis ausführen kann, indem man git worktrees verwendet, um Dateikonflikte zu vermeiden und unabhängige Agentensitzungen zu ermöglichen.

Orc: Multi-Agent Coding Orchestration Tool erweitert um Planungs- und Benachrichtigungsfunktionen
Orc ist ein Open-Source-Tool, das KI-Codierungsagenten über Projekte hinweg mit einer lokalen TUI-Oberfläche orchestriert. Das neueste Release fügt Planung als erstklassige Phase hinzu, Benachrichtigungssysteme für menschliches Eingreifen und natürliche Sprach-Lebenszyklus-Hooks.

Vergleich von Multi-Agenten-KI-Systemen: Anthropics Harness vs. Agyns Engineering Org Model
Anthropic veröffentlichte ein Harness-Design für die Entwicklung lang laufender Anwendungen, während Agyns Multi-Agenten-System für team-basierte autonome Softwareentwicklung letzten Monat als Open Source veröffentlicht wurde. Beide Systeme lehnen monolithische Agenten ab und setzen stattdessen auf Rollentrennung, strukturierte Übergaben und Review-Schleifen.

Fehlerbehebung bei E-Mail- und Google Drive-Zugriff für KI-Agenten
Die Einrichtung des Zugriffs auf E-Mail und Google Drive für KI-Bots auf AWS kann dazu führen, dass Konten gesperrt werden. Hier ist eine Lösung mit Gmail und Workspace-Domains.