MiMo-V2.5-Pro im Benchmark: Starke soziale Deduktionslogik, gutes Preis-Leistungs-Verhältnis im Vergleich zu K2.6

MiMo-V2.5-Pro, Xiaomis neuestes Open-Weights-Modell, wurde in autonomen Spielen von Blood on the Clocktower getestet – einem komplexen sozialen Deduktionsspiel ähnlich wie Mafia/Werwolf. Der Benchmark, erstellt von Reddit-Benutzer cjami, lässt Modelle in vollständigen Spielen gegeneinander antreten und misst dabei Argumentation, Täuschung und Werkzeugnutzung.
Wichtige Ergebnisse
- Siegquote: 88% als gutes Team, 48% als böses Team – insgesamt hoch, aber unausgewogen. Die Leistung als böses Team ist die größte Schwäche im Vergleich zu Kimi K2.6.
- Tokeneffizienz: 183.639 Ausgabetoken pro Spiel, ähnlich wie Gemini 3.1 Pro. Vergleich mit Kimi K2.6 bei 580.000 Token (3x länger).
- Kosten pro Spiel: 0,99 $ – weniger als die Hälfte von Kimi K2.6 (2,65 $) und weit unter Claude Opus 4.6 (3,76 $).
- Spieldauer: 2-3 Stunden (im Vergleich zu Kimi K2.6, das aufgrund ausführlicher Argumentation 10-15 Stunden dauert).
- Fehlerquote bei Tool-Aufrufen: 0,4 % – zuverlässig für autonome Agenten-Workflows.
Bemerkenswerte Leistung
Starke Argumentation unter Unsicherheit: Beispiel für das Denken aus der Perspektive anderer im Vergleich zu GPT 5.5 und klare Schlussfolgerungen, die ein Spiel gewinnen.
Bemerkenswerte Fehler
- Ein böser Baron, von dem erwartet wurde, dass er sich selbst verrät, führte zu einer Niederlage – gegen Claude Opus 4.6.
- Ein Diener, der seine Rolle gesteht – Transkript.
Praktische Erkenntnis
Für Entwickler, die ein Open-Weights-Modell mit starker Argumentation in Multi-Agenten- oder spieltheoretischen Umgebungen benötigen, bietet MiMo-V2.5-Pro das beste Preis-Leistungs-Verhältnis unter den Top-Modellen – niedrigere Kosten, schnellere Inferenz und angemessene Zuverlässigkeit, wenn auch mit Raum für Verbesserungen in gegnerischen Rollen.
Vollständige Model-Transkripte und Spiellogs: MiMo-V2.5-Pro auf Clocktower Radio. Methodik: So funktioniert es.
📖 Lesen Sie die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch
Claude Code v2.1.207: Auto-Modus GA, Terminal-Freeze-Fix und Sicherheitshärtung
Auto-Modus ist jetzt ohne Opt-in auf Bedrock/Vertex/Foundry stabil. Behebt Terminal-Freezes bei langen Ausgaben, Shell-Injection in Plugins und mehr.

Qwen KV Cache Quantisierung Deep Dive: PPL, KL-Divergenz und asymmetrische K/V-Ergebnisse
Zweite Runde Benchmarks zu Qwen 3.6-35B-A3B mit KV-Cache-Quantisierung: Perplexität, KL-Divergenz, asymmetrische K/V-Kombinationen und 64K Kontexttiefe auf Apple M5 Max.

Ontario-Prüfbericht: 60% der KI-Schreibsysteme verwechseln Medikamente, 85% übersehen psychische Details
Die Rechnungsprüfer von Ontario fanden heraus, dass 12 von 20 KI-Notizschreibern falsche Arzneimittelinformationen einfügten, 9 erfanden Behandlungsvorschläge und 17 übersahen wichtige Details zur psychischen Gesundheit aus Arzt-Patienten-Aufnahmen. Bei der Bewertung machte die Genauigkeit nur 4 % der Gesamtpunktzahl aus.

Zig-Projekts Begründung für seine strenge Anti-LLM-Beitragspolitik
Zig verhängt ein pauschales Verbot von LLM-gestützten Beiträgen: Keine KI für Issues, PRs oder Kommentare. VP Loris Cro erklärt die Philosophie des „Contributor Poker“ – das Reviewen von PRs ist eine Investition in das Wachstum vertrauenswürdiger Mitwirkender, nicht nur das Einspielen von Code.