Open Source vs. Frontier-Modelle: Einzeldatei-Canvas-Autoszene-Benchmark

Ein Entwickler hat denselben Einzeldatei-Canvas-Prompt über 12 Modelle laufen lassen, um Open-Source- und Frontier-Modellfähigkeiten an einer realistischen Seitenansicht einer Autofahrszene zu vergleichen. Die Aufgabe: eine eigenständige HTML-Datei, keine Bibliotheken, keine externen Ressourcen, mit Parallax-Hintergrund, sich drehenden Rädern, subtiler Karosseriebewegung, filmischer Beleuchtung und nahtlosem Loop. Der Testrahmen ist OpenCodeOrchestra, und die Ergebnisse sind live auf oco-canvas-car-scene-compare.
Getestete Modelle
Jedes Modell lief in einem isolierten Orchestrator mit der höchsten verfügbaren Denk-/Aufwandsstufe. Die Liste umfasst GPT-5.5 xhigh, GPT-5.4 xhigh, Claude Opus 4.7 (maximaler Aufwand), Claude Opus 4.6 (maximaler Aufwand), Claude Sonnet 4.6 (hoher Aufwand), Kimi K2.6, DeepSeek V4 Pro, DeepSeek V4 Flash, GLM-5.1, MiniMax M2.7, Qwen 3.6 Plus und Grok 4.3. Tok/s und Generierungszeit wurden nicht gemessen.
Wichtigste Erkenntnisse
- Einige Modelle verwendeten intern Audit-Modelle; andere nicht.
- Klare Gewinner und mehrdeutige Ergebnisse sind in der Galerie sichtbar.
- MiMo V2.5 Pro wurde aufgrund von Abrechnungsproblemen mit dem OpenCode Go-Abonnement ausgeschlossen.
Die Galerieseite ermöglicht einen direkten Vergleich der Ausgaben jedes Modells. Der Quellcode ist auf GitHub unter AidenGeunGeun/oco-canvas-car-scene-compare verfügbar.
📖 Den vollständigen Quelltext lesen: r/LocalLLaMA
👀 Siehe auch
KI-SREs beheben Routinevorfälle, aber Ingenieure verlieren den Bezug zu ihren Systemen
Sylvain Kalache argumentiert, dass KI-Incident-Responder die Übung für Ingenieure reduzieren und die Reaktion auf komplexe Incidents verschlechtern, unter Berufung auf die Ironien der Automation und Parallelen zur Luftfahrtausbildung.

KI-generierter Blumen-Samen-Betrug überschwemmt eBay, Amazon, Etsy
Betrüger nutzen KI-Bilder, um Samen für Pflanzen wie 'Teddybär-Sonnenblumen' zu verkaufen, die es gar nicht gibt. eBay, Amazon und Etsy haben Mühe, die Flut einzudämmen.

YC-Bench-Benchmark testet LLMs als Startup-CEOs, GLM-5 zeigt starke Kosteneffizienz
Forscher entwickelten YC-Bench, einen Benchmark, bei dem LLMs als CEOs simulierter Startups über ein Jahr hinweg agieren und Mitarbeiter, Verträge und Gehaltsabrechnungen verwalten. GLM-5 erzielte durchschnittlich 1,21 Mio. US-Dollar Endkapital bei 7,62 US-Dollar pro Durchlauf und lag damit innerhalb von 5 % von Claude Opus 4.6, das 86 US-Dollar pro Durchlauf kostete.

Claude Sonnet 4.5 verzeichnet erhöhte Fehlerraten — Statusaktualisierung
Claude Sonnet 4.5 hat derzeit vermehrt Fehler, Stand 2026-04-28T13:29:56.000Z. Überprüfen Sie die Statusseite und den Reddit-Megathread für Updates.