Kimi K2.6 schlägt Claude, GPT-5.5 und Gemini bei Programmierherausforderung mit aggressiver Gleitstrategie

✍️ OpenClawRadar📅 Veröffentlicht: 3. Mai 2026🔗 Source
Kimi K2.6 schlägt Claude, GPT-5.5 und Gemini bei Programmierherausforderung mit aggressiver Gleitstrategie
Ad

Kimi K2.6 gewinnt Word-Gem-Puzzle-Benchmark

Moonshot AIs Open-Weights-Modell Kimi K2.6 schlug alle westlichen Frontier-Modelle im Word Gem Puzzle des 12. Tages, einem Echtzeit-Buchstabenpuzzle mit verschiebbaren Kacheln. Neun Modelle traten an, nachdem Nvidias Nemotron Super 3 aufgrund eines Syntaxfehlers keine Verbindung herstellen konnte.

Endgültige Platzierungen

  • 1. Platz: Kimi K2.6 — 22 Matchpunkte (7-1-0)
  • 2. Platz: MiMo V2-Pro — 20 Punkte (6-2-0)
  • 3. Platz: ChatGPT GPT-5.5 — 16 Punkte (5-1-2)
  • 4. Platz: GLM 5.1 (Zhipu AI) — 15 Punkte
  • 5. Platz: Claude Opus 4.7 — 12 Punkte
  • 6. Platz: Gemini Pro 3.1 — 9 Punkte
  • 7. Platz: Grok Expert 4.2 — 9 Punkte
  • 8. Platz: DeepSeek V4 — 3 Punkte
  • 9. Platz: Muse Spark — 0 Punkte

Wie das Puzzle funktioniert

Das Spielfeld ist ein rechteckiges Gitter (10×10 bis 30×30), gefüllt mit Buchstabenkacheln und einem leeren Feld. Bots schieben benachbarte Kacheln in das leere Feld und beanspruchen gültige englische Wörter in geraden horizontalen/vertikalen Linien. Diagonalen und Rückwärtsgelesenes zählen nicht. Wertung: Wörter unter 7 Buchstaben kosten Punkte (5 Buchstaben: -1, 3 Buchstaben: -3). Wörter mit 7+ Buchstaben erzielen Länge - 6 (8 Buchstaben: +2). Jedes Wort kann nur einmal beansprucht werden. Die Gitter werden mit Wörterbuchwörtern in Kreuzworträtselform bestückt, die restlichen Zellen mit Scrabble-gewichteten Buchstaben gefüllt und dann gemischt (bei größeren Brettern aggressiver). Auf 30×30 sind fast alle Saatwörter zerbrochen.

Ad

Kimi's Siegerstrategie

Kimi verwendete einen gierigen Ansatz: Bewertung jedes möglichen Zuges danach, welche neuen positiv bewerteten Wörter er freischaltet, Ausführung des besten, Wiederholung. Wenn kein Zug ein positives Wort freischaltete, fiel es auf die erste legale Richtung alphabetisch zurück. Dies führte auf kleinen Gittern zu ineffizientem Hin- und Herpendeln am Rand, zahlte sich aber auf 30×30 aus, wo eine Rekonstruktion nötig war – Kimis kumulative Punktzahl von 77 war die höchste des Turniers.

Warum andere Modelle kämpften

MiMo V2-Pro schob nie tatsächlich – sein Schwellenwert "bester Wert > 0" wurde nie ausgelöst, also scannte es das Anfangsgitter nach Wörtern mit 7+ Buchstaben und beanspruchte alle in einem einzigen TCP-Paket. Es punktete gut auf Brettern mit intakten Saatwörtern, aber null auf gemischten (endgültig: 43 kumulative Punkte). Claude schob ebenfalls nicht, hielt auf 25×25 mit, scheiterte aber auf 30×30. GPT-5.5 war konservativ (~120 Schübe/Runde) und zeigte seine besten Zahlen auf 15×15 und 30×30. GLM war insgesamt der aggressivste Schieber (>800.000 Gesamtschübe). Grok schob nie, punktete aber auf größeren Brettern ganz gut.

Wichtigste Erkenntnis

Dies ist nicht einfach Ost gegen West – es sind zwei spezifische chinesische Modelle, die mit sehr unterschiedlichen Strategien am besten abschnitten. Kimi ist Open-Weights und öffentlich verfügbar von Moonshot AI (gegründet 2023). MiMo V2-Pro ist nur über API verfügbar; Xiaomi bestätigte, dass V2.5-Pro-Gewichte bald veröffentlicht werden.

📖 Lesen Sie die vollständige Quelle: HN AI Agents

Ad

👀 Siehe auch

Der erste Schritt zur AGI: Die Lücke mit ClawDBot überbrücken
Nachrichten

Der erste Schritt zur AGI: Die Lücke mit ClawDBot überbrücken

Erforschen Sie, wie ClawDBot uns dem AGI näher bringt, indem es KI-Coding-Agenten verbessert und damit einen entscheidenden Schritt in der Entwicklung der KI zeigt.

OpenClawRadar
Papst Leo XIV. 'Magnifica Humanitas': Eine 40.000 Wörter umfassende Enzyklika zur Abrüstung der KI
Nachrichten

Papst Leo XIV. 'Magnifica Humanitas': Eine 40.000 Wörter umfassende Enzyklika zur Abrüstung der KI

Papst Leo XIV. veröffentlicht Magnifica Humanitas, eine 40.000 Worte umfassende Enzyklika, die zur Abrüstung der KI aufruft, autonome Waffen, Datenkolonialismus und Technologiemonopole kritisiert. Der Mitbegründer von Anthropic war bei der Veröffentlichung anwesend.

OpenClawRadar
Claude Code v2.1.90 Veröffentlichung: Neue interaktive Lektionen, Leistungsverbesserungen und Fehlerbehebungen
Nachrichten

Claude Code v2.1.90 Veröffentlichung: Neue interaktive Lektionen, Leistungsverbesserungen und Fehlerbehebungen

Claude Code v2.1.90 führt interaktive Lektionen mit /powerup ein, fügt die Umgebungsvariable CLAUDE_CODE_PLUGIN_KEEP_MARKETPLACE_ON_FAILURE für Offline-Nutzung hinzu und enthält mehrere Leistungsverbesserungen sowie Fehlerbehebungen für Tools, Benutzeroberfläche und Sicherheit.

OpenClawRadar
Der Parameter "effort=low" von Claude Opus 4.6 unterscheidet sich von den Low-Reasoning-Modi anderer Anbieter.
Nachrichten

Der Parameter "effort=low" von Claude Opus 4.6 unterscheidet sich von den Low-Reasoning-Modi anderer Anbieter.

Der effort=low-Parameter von Claude Opus 4.6 steuert den allgemeinen Verhaltensaufwand, nicht nur die Denktiefe, anders als OpenAI's reasoning.effort=low oder Gemini's thinking_level=low. Dies führte dazu, dass Agenten weniger Tool-Aufrufe tätigten, weniger gründlich bei der Querverweisprüfung waren und Teile der Systemprompts zur Webrecherche ignorierten.

OpenClawRadar