Stand der Open-Source-KI: Parität erreicht, Produktionslücke bleibt

Mozarts „State of Open Source AI“-Bericht (V1.0, Juli 2026) liefert harte Daten: Open-Weight-Modelle haben die Fähigkeitslücke zu den besten Closed-Modellen geschlossen, doch es besteht weiterhin eine Produktionslücke.
Wichtigste Ergebnisse
- Fähigkeitslücke: Die Chatbot-Arena-Lücke sank von 8,04% auf 0,5% bis August 2024, wurde kurzzeitig von DeepSeek-R1 im Februar 2025 überbrückt, weitete sich jedoch bis März 2026 auf 3,3% aus, da Closed-Reasoning-Modelle voranschritten. Open ist bei Programmierung, Befolgung von Anweisungen und Allgemeinwissen gleichauf oder nahezu gleichauf; die Lücke konzentriert sich auf Reasoning, Langtext-Retrieval und agentische Aufgaben.
- Inferenzkosten-Kollaps: GPT-4-ähnliche Inferenz fiel in 36 Monaten um das 50-fache – von 20 $ auf 0,40 $ pro 1 M Tokens. Das ist schneller als die Bandbreiten- oder PC-Preiskurven der Dotcom-Ära.
- Token-Volumen: Open-Weight-Modelle routen jetzt die Mehrheit der Produktions-Tokens auf OpenRouter. Die fünf volumenstärksten Modelle sind alle Open-Weights. Von Chinesen gebaute Modelle routen ~18 Billionen Token pro Woche gegenüber ~5,5 Billionen bei US-Modellen (FT-Analyse).
- Adoption vs. Produktion: 79% der Entwickler, die KI-Funktionalität hinzufügen, nutzen Open-Modelle (vs. 71% Closed), aber nur 51% der Open-Modell-Teams erreichen die Produktion (vs. 63% bei Closed). Die Lücke liegt in der Betriebsinfrastruktur und im Vertrauen, nicht in der Modellfähigkeit.
Der Bericht nennt konkrete Anwendungsfälle: Ein Māori-Sender trainiert Sprachmodelle für Te Reo unter einer datensouveränen Lizenz; PwC verfeinert ein offenes Modell mit Finanzsprache auf eigener Hardware; Forscher bauen mit dem Roten Kreuz ein offenes medizinisches Modell; Bauern diagnostizieren Maniok-Krankheiten mit lokalen Offline-Modellen; und ein schweizerisches öffentliches Konsortium trainiert ein nationales Modell auf öffentlichen Supercomputern und veröffentlicht Gewichte, Daten und Trainingscode.
📖 Lesen Sie die vollständige Quelle: HN LLM Tools
👀 Siehe auch

Claude Opus 4.7 fügt Unterstützung für hochauflösende Bilder und Aufgabenbudgets hinzu und entfernt das erweiterte Denken.
Claude Opus 4.7 führt Unterstützung für hochauflösende Bilder bis zu 2576px/3,75MP ein, eine neue Aufgabenbudget-Funktion zur Kontrolle der Token-Nutzung in agentenbasierten Schleifen und entfernt erweiterte Denkbudgets zugunsten adaptiven Denkens.

GPT-5.5 auf OpenClaw: Nutzer berichten, dass 5-Stunden-Limit in 3 Prompts aufgebraucht wurde, kaputter Code
Reddit-Nutzer berichtet: GPT-5.5 auf OpenClaw verbrauchte 5-Stunden-Limit in 3 Prompts, führte Bugs ein; DeepSeek V4 Pro behob das Chaos.

Anthropic kehrt Politik zu Drittanbieter-Agent-SDK und claude-p um, senkt effektiven Inferenzwert für Max-Abonnenten um das 25- bis 40-fache
Anthropic hat sein Verbot von Drittanbieter-Agenten, die Abonnement-Anmeldedaten verwenden, aufgehoben, jedoch wurden claude-p und das Agent SDK in einen separaten, nicht übertragbaren Guthabenpool verschoben, der zu API-Preisen abgerechnet wird, was den effektiven Inferenzwert für Max-Abonnenten um das 25- bis 40-fache reduziert.

Kimi K2.6 schlägt Claude, GPT-5.5 und Gemini bei Programmierherausforderung mit aggressiver Gleitstrategie
Beim Word Gem Puzzle des AI Coding Contest am 12. Tag erzielte Moonshot AIs Open-Weights-Modell Kimi K2.6 22 Matchpunkte (7-1-0) und übertraf damit GPT-5.5 (16), Claude Opus 4.7 (12) und Gemini Pro 3.1 (9). MiMo V2-Pro wurde Zweiter. Kimi gewann durch aggressives Verschieben.