MiMo-V2.5-Pro im Benchmark: Starke soziale Deduktionslogik, gutes Preis-Leistungs-Verhältnis im Vergleich zu K2.6

MiMo-V2.5-Pro, Xiaomis neuestes Open-Weights-Modell, wurde in autonomen Spielen von Blood on the Clocktower getestet – einem komplexen sozialen Deduktionsspiel ähnlich wie Mafia/Werwolf. Der Benchmark, erstellt von Reddit-Benutzer cjami, lässt Modelle in vollständigen Spielen gegeneinander antreten und misst dabei Argumentation, Täuschung und Werkzeugnutzung.
Wichtige Ergebnisse
- Siegquote: 88% als gutes Team, 48% als böses Team – insgesamt hoch, aber unausgewogen. Die Leistung als böses Team ist die größte Schwäche im Vergleich zu Kimi K2.6.
- Tokeneffizienz: 183.639 Ausgabetoken pro Spiel, ähnlich wie Gemini 3.1 Pro. Vergleich mit Kimi K2.6 bei 580.000 Token (3x länger).
- Kosten pro Spiel: 0,99 $ – weniger als die Hälfte von Kimi K2.6 (2,65 $) und weit unter Claude Opus 4.6 (3,76 $).
- Spieldauer: 2-3 Stunden (im Vergleich zu Kimi K2.6, das aufgrund ausführlicher Argumentation 10-15 Stunden dauert).
- Fehlerquote bei Tool-Aufrufen: 0,4 % – zuverlässig für autonome Agenten-Workflows.
Bemerkenswerte Leistung
Starke Argumentation unter Unsicherheit: Beispiel für das Denken aus der Perspektive anderer im Vergleich zu GPT 5.5 und klare Schlussfolgerungen, die ein Spiel gewinnen.
Bemerkenswerte Fehler
- Ein böser Baron, von dem erwartet wurde, dass er sich selbst verrät, führte zu einer Niederlage – gegen Claude Opus 4.6.
- Ein Diener, der seine Rolle gesteht – Transkript.
Praktische Erkenntnis
Für Entwickler, die ein Open-Weights-Modell mit starker Argumentation in Multi-Agenten- oder spieltheoretischen Umgebungen benötigen, bietet MiMo-V2.5-Pro das beste Preis-Leistungs-Verhältnis unter den Top-Modellen – niedrigere Kosten, schnellere Inferenz und angemessene Zuverlässigkeit, wenn auch mit Raum für Verbesserungen in gegnerischen Rollen.
Vollständige Model-Transkripte und Spiellogs: MiMo-V2.5-Pro auf Clocktower Radio. Methodik: So funktioniert es.
📖 Lesen Sie die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch

Reddit-Benutzer meldet 18,8 Tok/s CPU-Inferenz mit Qwen 3 30B Q4 auf Zen 4
Ein Nutzer auf r/LocalLLaMA testete Qwen 3 30B Q4 auf CPU und erreichte 18,8 Token pro Sekunde mit einem Zen-4-Prozessor und DDR5-Arbeitsspeicher, was die Erwartungen von 3-5 Tok/s deutlich übertraf.

KI-Erkennungstools veranlassen Studierende, KI defensiv einzusetzen, so eine Studie
KI-Erkennungstools in der Bildung veranlassen Schüler dazu, absichtlich schlechter zu schreiben, um falsch-positive Ergebnisse zu vermeiden, wobei einige Schüler defensiv auf KI-Tools zurückgreifen, um zu prüfen, ob ihr eigenes Schreiben markiert wird.

Waymo startet vollständig autonome Einsätze mit der 6. Generation des Fahrzeugs.
Waymos 6. Generation des Fahrers beginnt mit vollautonomen Operationen und bietet ein multimodales Sensorsystem sowie moderne 17-Megapixel-Bildsensoren.

MCP ist nur neu verpackte Bibliotheken: Déjà-vu, schon wieder
Eine Reddit-Diskussion argumentiert, dass Anthropics MCP im Wesentlichen eine Neuverpackung von Programmbibliotheken ist, zieht Parallelen zum smolagents-Tool-Design von Hugging Face und stellt die Frage, ob man neue MCPs bauen oder bestehende Bibliotheksdokumentationen verbessern sollte.