MiniMax M2.7-Modell zeigt starke Leistung als KI-Codierungsassistent

Leistungsdetails des MiniMax M2.7-Modells
Das MiniMax M2.7-Modell wurde kürzlich als erstes Modell des Unternehmens vorgestellt, das "tiefgreifend an seiner eigenen Entwicklung teilgenommen hat" und eine Gewinnrate von 88 % gegenüber der vorherigen Version M2.5 erzielte.
Wichtige Leistungskennzahlen
- SWE-Leistung: Maßstäbe setzende Ergebnisse bei SWE-Pro (56,22 %) und Terminal Bench 2 (57,0 %)
- Produktionsreife: Reduzierte Zeit von Intervention bis zur Wiederherstellung bei Online-Vorfällen auf 3 Minuten in bestimmten Fällen
- Agenten-Fähigkeiten: Trainiert für Agenten-Teams und Tool-Search-Funktionalität, mit 97 % Einhaltung von Fähigkeiten über 40+ komplexe Skills
- Professioneller Arbeitsbereich: Maßstäbe setzend in professionellem Wissen, unterstützt mehrstufige, hochpräzise Office-Dateibearbeitung
- OpenClaw-Vergleich: Gleichauf mit Sonnet 4.6 in der OpenClaw-Leistung
Ergebnisse aus Nutzertests
Ein Entwickler, der zuvor Opus und Sonnet als Haupt-Agenten verwendete, testete M2.7 gegen mehrere Modelle. In seinen Benchmarks, die MiniMax M2.7 mit GPT 5.4, Gemini 1.5 Pro und anderen Modellen verglichen, lieferte MiniMax die schnellsten Arbeitsergebnisse.
Der Entwickler erstellte spezifische Tooling-Herausforderungen, mit denen Modelle oft Schwierigkeiten haben, darunter:
- Verbinden mit einem System (IP-Adresse, Zugangsdaten finden)
- Abrufen einer Konfigurationsdatei, die sudo-Zugriff erfordert
- Vergleichen mit einer ähnlichen Datei auf einem lokalen System
- Berichten der Unterschiede
MiniMax M2.7 meisterte diese mehrstufige Tool-Kette erfolgreich, während einige Modelle komplett versagten, und war der schnellste Teilnehmer.
Nach etwa 5 Stunden aktiver Nutzung mit umfangreichem Tooling und System-Fehlerbehebung (obwohl keine Programmieraufgaben) berichtete der Entwickler, Sonnet oder Opus kein einziges Mal vermisst zu haben.
Der Entwickler merkte an, dass MiniMax zwar etwa 10-mal so viel kostet wie Anthropic-Modelle, die Leistung es jedoch zu einer interessanten Alternative macht.
📖 Read the full source: r/openclaw
👀 Siehe auch

Claude Code 2.1.84 fügt allgemeinen Agent-Prompt und PowerShell-Tool hinzu, entfernt redundante Prompts
Claude Code 2.1.84 führt einen neuen allgemeinen Subagent-Prompt für Codebase-Operationen ein und eine PowerShell-Tool-Beschreibung mit Richtlinien zur Vermeidung von Sleep-Befehlen. Das Update entfernt neun redundante Prompts und vereinfacht mehrere Tool-Beschreibungen.

Microsoft beendet Umsatzbeteiligung mit OpenAI, Auswirkungen auf KI-Agenten unklar
Microsoft wird seine Umsatzbeteiligung mit OpenAI, seinem wichtigsten KI-Partner, einstellen, wie Bloomberg berichtet. Dieser Schritt könnte sich darauf auswirken, wie Entwickler KI-Agenten über Azure OpenAI Services integrieren.

Der Parameter "effort=low" von Claude Opus 4.6 unterscheidet sich von den Low-Reasoning-Modi anderer Anbieter.
Der effort=low-Parameter von Claude Opus 4.6 steuert den allgemeinen Verhaltensaufwand, nicht nur die Denktiefe, anders als OpenAI's reasoning.effort=low oder Gemini's thinking_level=low. Dies führte dazu, dass Agenten weniger Tool-Aufrufe tätigten, weniger gründlich bei der Querverweisprüfung waren und Teile der Systemprompts zur Webrecherche ignorierten.

Qwen3.5-122B auf Blackwell SM120: fp8-KV-Cache-Korruptionsproblem und Leistungsbefunde
Tests von Qwen3.5-122B auf 8x RTX PRO 6000 Blackwell-Hardware ergaben, dass der fp8_e4m3-KV-Cache stillschweigend fehlerhafte Ausgaben ohne Fehlermeldungen erzeugt, sodass stattdessen ein bf16-KV-Cache erforderlich ist. Die MTP-Optimierung brachte eine 2,75-fache Beschleunigung bei Einzelanfragen, während DeltaNet-Einschränkungen andere Optimierungen blockierten.