Open Source vs. Frontier-Modelle: Einzeldatei-Canvas-Autoszene-Benchmark

✍️ OpenClawRadar📅 Veröffentlicht: 17. Mai 2026🔗 Source
Open Source vs. Frontier-Modelle: Einzeldatei-Canvas-Autoszene-Benchmark
Ad

Ein Entwickler hat denselben Einzeldatei-Canvas-Prompt über 12 Modelle laufen lassen, um Open-Source- und Frontier-Modellfähigkeiten an einer realistischen Seitenansicht einer Autofahrszene zu vergleichen. Die Aufgabe: eine eigenständige HTML-Datei, keine Bibliotheken, keine externen Ressourcen, mit Parallax-Hintergrund, sich drehenden Rädern, subtiler Karosseriebewegung, filmischer Beleuchtung und nahtlosem Loop. Der Testrahmen ist OpenCodeOrchestra, und die Ergebnisse sind live auf oco-canvas-car-scene-compare.

Getestete Modelle

Jedes Modell lief in einem isolierten Orchestrator mit der höchsten verfügbaren Denk-/Aufwandsstufe. Die Liste umfasst GPT-5.5 xhigh, GPT-5.4 xhigh, Claude Opus 4.7 (maximaler Aufwand), Claude Opus 4.6 (maximaler Aufwand), Claude Sonnet 4.6 (hoher Aufwand), Kimi K2.6, DeepSeek V4 Pro, DeepSeek V4 Flash, GLM-5.1, MiniMax M2.7, Qwen 3.6 Plus und Grok 4.3. Tok/s und Generierungszeit wurden nicht gemessen.

Ad

Wichtigste Erkenntnisse

  • Einige Modelle verwendeten intern Audit-Modelle; andere nicht.
  • Klare Gewinner und mehrdeutige Ergebnisse sind in der Galerie sichtbar.
  • MiMo V2.5 Pro wurde aufgrund von Abrechnungsproblemen mit dem OpenCode Go-Abonnement ausgeschlossen.

Die Galerieseite ermöglicht einen direkten Vergleich der Ausgaben jedes Modells. Der Quellcode ist auf GitHub unter AidenGeunGeun/oco-canvas-car-scene-compare verfügbar.

📖 Den vollständigen Quelltext lesen: r/LocalLLaMA

Ad

👀 Siehe auch

Cerebras veröffentlicht Step-3.5-Flash-REAP-Modelle mit 40 % weniger Speicherbedarf.
Nachrichten

Cerebras veröffentlicht Step-3.5-Flash-REAP-Modelle mit 40 % weniger Speicherbedarf.

Cerebras hat Step-3.5-Flash-REAP-Modelle veröffentlicht, die REAP (Router-weighted Expert Activation Pruning) verwenden, um 196B-Parameter-Modelle auf 121B zu komprimieren, während nahezu identische Leistung erhalten bleibt. Die Modelle funktionieren mit Standard-vLLM und sind für ressourcenbeschränkte Umgebungen optimiert.

OpenClawRadar
Der "Vibe-Coding"-Geräuschpegel: Wie KI-Schrott Entwickler-Communities erstickt
Nachrichten

Der "Vibe-Coding"-Geräuschpegel: Wie KI-Schrott Entwickler-Communities erstickt

rmoff beschwert sich über den stetigen Zustrom von minderwertigen KI-generierten Inhalten in Entwickler-Communitys, von sinnlosen GitHub-Repos bis hin zu von Geisterautoren geschriebenen Blogbeiträgen, und warum dies die organische Beteiligung vertreibt.

OpenClawRadar
Entwickler bekennt sich schuldig an 8-Millionen-Dollar-Betrugsschema mit KI-Musikstreaming
Nachrichten

Entwickler bekennt sich schuldig an 8-Millionen-Dollar-Betrugsschema mit KI-Musikstreaming

Michael Smith, 54, gestand, Tausende von Bot-Konten und KI-generierte Songs genutzt zu haben, um zwischen 2017 und 2024 8 Millionen US-Dollar an Tantiemen von Streaming-Plattformen wie Spotify, Apple Music und YouTube Music abzuzweigen.

OpenClawRadar
Durchgesickerter Claude-Code enthüllt KAIROS-System und die Verifikationslücke bei KI-Agenten
Nachrichten

Durchgesickerter Claude-Code enthüllt KAIROS-System und die Verifikationslücke bei KI-Agenten

Eine geleakte Claude Code-Quellkarte enthüllte 512.000 Zeilen TypeScript, 44 Feature-Flags und KAIROS – einen Hintergrundagenten, der im Leerlauf Speicher konsolidiert. Ein unabhängiger Entwickler baute einen ähnlichen Daemon, um Sitzungen für mehrtägige Kampagnen zu verketten, stellte jedoch fest, dass eine erfolgreiche Kompilierung keine funktionierende Codebasis garantiert.

OpenClawRadar