MiniMax M2.7-Modell zeigt starke Leistung als KI-Codierungsassistent

✍️ OpenClawRadar📅 Veröffentlicht: 21. März 2026🔗 Source
MiniMax M2.7-Modell zeigt starke Leistung als KI-Codierungsassistent
Ad

Leistungsdetails des MiniMax M2.7-Modells

Das MiniMax M2.7-Modell wurde kürzlich als erstes Modell des Unternehmens vorgestellt, das "tiefgreifend an seiner eigenen Entwicklung teilgenommen hat" und eine Gewinnrate von 88 % gegenüber der vorherigen Version M2.5 erzielte.

Wichtige Leistungskennzahlen

  • SWE-Leistung: Maßstäbe setzende Ergebnisse bei SWE-Pro (56,22 %) und Terminal Bench 2 (57,0 %)
  • Produktionsreife: Reduzierte Zeit von Intervention bis zur Wiederherstellung bei Online-Vorfällen auf 3 Minuten in bestimmten Fällen
  • Agenten-Fähigkeiten: Trainiert für Agenten-Teams und Tool-Search-Funktionalität, mit 97 % Einhaltung von Fähigkeiten über 40+ komplexe Skills
  • Professioneller Arbeitsbereich: Maßstäbe setzend in professionellem Wissen, unterstützt mehrstufige, hochpräzise Office-Dateibearbeitung
  • OpenClaw-Vergleich: Gleichauf mit Sonnet 4.6 in der OpenClaw-Leistung
Ad

Ergebnisse aus Nutzertests

Ein Entwickler, der zuvor Opus und Sonnet als Haupt-Agenten verwendete, testete M2.7 gegen mehrere Modelle. In seinen Benchmarks, die MiniMax M2.7 mit GPT 5.4, Gemini 1.5 Pro und anderen Modellen verglichen, lieferte MiniMax die schnellsten Arbeitsergebnisse.

Der Entwickler erstellte spezifische Tooling-Herausforderungen, mit denen Modelle oft Schwierigkeiten haben, darunter:

  • Verbinden mit einem System (IP-Adresse, Zugangsdaten finden)
  • Abrufen einer Konfigurationsdatei, die sudo-Zugriff erfordert
  • Vergleichen mit einer ähnlichen Datei auf einem lokalen System
  • Berichten der Unterschiede

MiniMax M2.7 meisterte diese mehrstufige Tool-Kette erfolgreich, während einige Modelle komplett versagten, und war der schnellste Teilnehmer.

Nach etwa 5 Stunden aktiver Nutzung mit umfangreichem Tooling und System-Fehlerbehebung (obwohl keine Programmieraufgaben) berichtete der Entwickler, Sonnet oder Opus kein einziges Mal vermisst zu haben.

Der Entwickler merkte an, dass MiniMax zwar etwa 10-mal so viel kostet wie Anthropic-Modelle, die Leistung es jedoch zu einer interessanten Alternative macht.

📖 Read the full source: r/openclaw

Ad

👀 Siehe auch

Claude Code 2.1.84 fügt allgemeinen Agent-Prompt und PowerShell-Tool hinzu, entfernt redundante Prompts
Nachrichten

Claude Code 2.1.84 fügt allgemeinen Agent-Prompt und PowerShell-Tool hinzu, entfernt redundante Prompts

Claude Code 2.1.84 führt einen neuen allgemeinen Subagent-Prompt für Codebase-Operationen ein und eine PowerShell-Tool-Beschreibung mit Richtlinien zur Vermeidung von Sleep-Befehlen. Das Update entfernt neun redundante Prompts und vereinfacht mehrere Tool-Beschreibungen.

OpenClawRadar
Microsoft beendet Umsatzbeteiligung mit OpenAI, Auswirkungen auf KI-Agenten unklar
Nachrichten

Microsoft beendet Umsatzbeteiligung mit OpenAI, Auswirkungen auf KI-Agenten unklar

Microsoft wird seine Umsatzbeteiligung mit OpenAI, seinem wichtigsten KI-Partner, einstellen, wie Bloomberg berichtet. Dieser Schritt könnte sich darauf auswirken, wie Entwickler KI-Agenten über Azure OpenAI Services integrieren.

OpenClawRadar
Der Parameter "effort=low" von Claude Opus 4.6 unterscheidet sich von den Low-Reasoning-Modi anderer Anbieter.
Nachrichten

Der Parameter "effort=low" von Claude Opus 4.6 unterscheidet sich von den Low-Reasoning-Modi anderer Anbieter.

Der effort=low-Parameter von Claude Opus 4.6 steuert den allgemeinen Verhaltensaufwand, nicht nur die Denktiefe, anders als OpenAI's reasoning.effort=low oder Gemini's thinking_level=low. Dies führte dazu, dass Agenten weniger Tool-Aufrufe tätigten, weniger gründlich bei der Querverweisprüfung waren und Teile der Systemprompts zur Webrecherche ignorierten.

OpenClawRadar
Qwen3.5-122B auf Blackwell SM120: fp8-KV-Cache-Korruptionsproblem und Leistungsbefunde
Nachrichten

Qwen3.5-122B auf Blackwell SM120: fp8-KV-Cache-Korruptionsproblem und Leistungsbefunde

Tests von Qwen3.5-122B auf 8x RTX PRO 6000 Blackwell-Hardware ergaben, dass der fp8_e4m3-KV-Cache stillschweigend fehlerhafte Ausgaben ohne Fehlermeldungen erzeugt, sodass stattdessen ein bf16-KV-Cache erforderlich ist. Die MTP-Optimierung brachte eine 2,75-fache Beschleunigung bei Einzelanfragen, während DeltaNet-Einschränkungen andere Optimierungen blockierten.

OpenClawRadar