Xiaomi veröffentlicht MiMo-V2.5-Pro als Open Source: Nähert sich Claude Opus 4.6 bei Programmier-Benchmarks

✍️ OpenClawRadar📅 Veröffentlicht: 28. April 2026🔗 Source
Xiaomi veröffentlicht MiMo-V2.5-Pro als Open Source: Nähert sich Claude Opus 4.6 bei Programmier-Benchmarks
Ad

Xiaomi hat die MiMo-V2.5-Familie von Open-Source-Modellen veröffentlicht, wobei die Pro-Variante in Coding-Benchmarks mit Claude Opus 4.6 und GPT-5.4 konkurriert.

Praxisnahe Tests

V2.5-Pro absolvierte ein Compiler-Projekt der Universität Peking (SysY-Compiler in Rust) in 4,3 Stunden mit einer perfekten Punktzahl von 233/233 – besser als die meisten Studenten, die Wochen dafür benötigen. Auf eine vage Aufforderung wie „baue einen Videoeditor“ hin erstellte das Modell autonom eine 8.192-zeilige Desktop-Anwendung mit Multi-Track-Zeitleiste, Clip-Trimmung, Überblendungen, Audiomischung und Export-Pipeline nach 11,5 Stunden und 1.868 Tool-Aufrufen. Bei einer anspruchsvollen analogtechnischen Schaltungsentwurfsaufgabe (Flipped-Voltage-Follower LDO in TSMC 180nm) iterierte es mittels ngspice-Simulation und verbesserte die Netzregelung um das 22-fache und die Lastregelung um das 17-fache gegenüber seinem eigenen ersten Versuch.

Ad

Benchmarks im Vergleich zu Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro, DeepSeek V4 Pro

  • SWE-Bench Pro: 57,2 (vs. 57,3 Claude, 57,7 GPT, 54,2 Gemini, 55,4 DeepSeek)
  • SWE-Bench Verified: 78,9 (vs. 80,8 Claude, n/a GPT, 76,2 Gemini, 80,6 DeepSeek)
  • Terminal-Bench 2.0: 68,4 (vs. 65,4 Claude, 75,1 GPT, 68,5 Gemini, 67,9 DeepSeek) – führt vor Claude und Gemini
  • Claw-Eval Pass@3: 63,8 (vs. 70,4 Claude, 60,3 GPT, 57,8 Gemini, 59,8 DeepSeek) – schlägt GPT und Gemini
  • HLE mit Tools: 48,0 (vs. 53,0 Claude, 58,7 GPT, 51,4 Gemini, 48,2 DeepSeek) – liegt beim allgemeinen Denken zurück
  • GDPVal-AA: 1581 (vs. 1606 Claude, 1674 GPT, 1317 Gemini, 1554 DeepSeek) – liegt hinter GPT und Claude

Bei Claw-Eval behauptet Xiaomis Token-Effizienz-Diagramm außerdem, dass V2.5-Pro (63,8) Claude Sonnet 4.6 schlägt. V2.5-Pro unterstützt die Ausführung längerer Aufgaben mit über 1.000 Tool-Aufrufen und Selbstkorrektur; ein rückschrittlicher Refactoring-Durchlauf bei Schritt 512 wurde autonom erkannt und behoben.

Die Gewichte sind jetzt als Open Source zum Download und zum Selbsthosten verfügbar.

📖 Lesen Sie die vollständige Quelle: HN AI Agents

Ad

👀 Siehe auch

Benchmarks zeigen, dass destillierte Modelle bei strukturierten Aufgaben mit Spitzen-LLMs mithalten können – bei 10-fach geringeren Kosten.
Nachrichten

Benchmarks zeigen, dass destillierte Modelle bei strukturierten Aufgaben mit Spitzen-LLMs mithalten können – bei 10-fach geringeren Kosten.

Ein umfassender Vergleich kleiner destillierter Qwen3-Modelle (0,6B bis 8B) mit führenden LLMs zeigt, dass destillierte Modelle bei 6 von 9 Aufgaben mittlere führende Modelle erreichen oder übertreffen – bei deutlich geringeren Kosten. Text2SQL erreicht 98,0 % Genauigkeit bei 3 $/Mio. Anfragen gegenüber 378 $ für Claude Haiku.

OpenClawRadar
inclusionAI veröffentlicht Ling-2.6-1T: Hybridarchitektur-Modell mit Billionen Parametern, Sparse Attention und schnellem Denken
Nachrichten

inclusionAI veröffentlicht Ling-2.6-1T: Hybridarchitektur-Modell mit Billionen Parametern, Sparse Attention und schnellem Denken

Ling-2.6-1T ist ein neues Open-Source-Modell mit einer Billion Parametern, das MLA und Linear Attention für Effizienz bei langen Kontexten kombiniert und mittels Contextual Process Redundancy Suppression wortreiche Gedankenketten reduziert. Erzielt Open-Source-Spitzenwerte bei AIME26, SWE-bench Verified, BFCL-V4, TAU2-Bench und IFBench.

OpenClawRadar
Claude Max 100-Dollar-Abonnement-Nutzungsdaten für API-Erweiterungsaufgabe
Nachrichten

Claude Max 100-Dollar-Abonnement-Nutzungsdaten für API-Erweiterungsaufgabe

Ein Claude Max-Abonnent für 100 US-Dollar berichtet, dass er 13 % einer 5-stündigen Sitzung verbraucht hat, um eine bestehende API mit Funktionen für bevorzugte Bibliotheken zu erweitern, wobei die Kontextnutzung bei 11 % lag und die wöchentliche Nutzung von 5 % auf 6 % gestiegen ist.

OpenClawRadar
OneUptime fügt in einem einzigen Commit 12.000 KI-generierte Blogbeiträge hinzu
Nachrichten

OneUptime fügt in einem einzigen Commit 12.000 KI-generierte Blogbeiträge hinzu

OneUptimes Blog-Repository fügte in einem einzigen Commit 12.000 KI-generierte Beiträge zu ClickHouse, Redis, MongoDB, MySQL und anderen Technologien hinzu, die 5.012 Dateien und über 1 Million Codezeilen veränderten.

OpenClawRadar