Kimi K2.6 vs Claude Opus 4.7: Ein praktischer Coding-Vergleich bei einem Minetest-Mod + Google Sheets-Integration

Wie lautet der Test?
Ein Entwickler verglich Kimi K2.6 und Claude Opus 4.7 bei einer zweiteiligen Programmieraufgabe: Bau eines Minetest/Luanti-Bounty-Board-Spielmods mit einem TypeScript-Backend, gefolgt von der Erweiterung um eine Google-Sheets-Protokollierung über Composio. Beide Modelle erhielten identische Aufforderungen und wurden hinsichtlich Arbeitsergebnis, Codequalität, Debugging-Aufwand, Zeit, Tokenverbrauch und Kosten bewertet.
Aufbau: Claude Opus 4.7 über Claude Code, Kimi K2.6 über OpenCode auf OpenRouter. Gleiches Repository, gleiche Erfolgskriterien.
Test 1: Lokales Bounty-Board
Claude Opus 4.7 erstellte ein Express/Zod/Vitest-Backend, einen Lua-Mod, den /bounty-Ablauf, Belohnungen und eine Bestenliste mit bestandenen Tests.
- Kosten: ~3,59 $
- Zeit: 12 Min API, 23 Min Gesamt
- Code: +1.688 / -0
- Ausgabe: 54,8k Tokens
- Cache-Lesevorgänge: 2,8 M Tokens
Kimi K2.6 brachte ebenfalls das lokale Bounty-Board zum Laufen – Backend-Routen, Lua-Mod, grundlegender Spielablauf – aber der Code war unordentlicher. Es schrieb secure.http_mods = bountykimi in die globale Konfiguration, erstellte aber auch eine Konfiguration auf Weltebene mit einem anderen Mod-Namen, sodass die HTTP-API für den tatsächlich laufenden Mod nicht aktiviert war. Das Debuggen dauerte über 30 Minuten.
- Kosten: ~0,39 $
- Dauer: ~9 Min 27 Sek
- Codeänderungen: +4.671 / -0 (2,7x mehr als Opus)
- Verwendeter Kontext: 52.073 Tokens
- Kontextfenster: 20 %
Fazit: Beide bestanden Test 1, aber Opus' Ausgabe war sauberer und kleiner.
Test 2: Composio + Google Sheets
Claude Opus 4.7 bekam die Google-Sheets-Synchronisation nach einigem Hin und Her bezüglich tsx watch und Umgebungsvariablen zum Laufen. Das Backend konnte einen Auftrag abschließen und die Daten über Composio an Google Sheets anhängen.
- Kosten: 16,03 $ (schmerzhaft)
- Zeit: 28 Min API, 1 Std 17 Min Gesamt
- Code: +1.848 / -507
- Cache-Lesevorgänge: 22,3 M Tokens
- Ausgabe: 123,3k Tokens
Kimi K2.6 scheiterte. Es blieb bei Problemen mit dem Entwicklungsserver, Tests und Build-Problemen hängen und brachte die Composio-Integration nie in einen sauberen funktionsfähigen Zustand. Nach etwa 25 Minuten und über 135k Tokens wurde der Test abgebrochen.
- Kosten: ~5,03 $
- Zeit: ~25 Min
- Tokens: 135k+
Wichtigste Erkenntnisse
- Bestes lokales MVP: Opus (sauberer), aber Kimi bietet ein weit besseres Preis-Leistungs-Verhältnis.
- Beste echte Integration: Opus mit großem Abstand.
- Saubererer Code: Opus (1,7k vs. 4,7k Zeilen für die gleiche Aufgabe).
- Günstigstes Experimentiermodell: Kimi K2.6.
- Schmerzhafteste Kosten: Opus (16 $ für Google-Sheets-Synchronisation).
Kimi K2.6 ist interessant für günstige lokale Programmieraufgaben – 0,39 $ für einen funktionierenden Lua- + TypeScript-Mod ist beeindruckend. Doch wenn externe Werkzeuge, Konfigurationsprobleme und echte Integration ins Spiel kommen, bleibt Opus 4.7 klar vorn.
📖 Lesen Sie die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch

Claude Code v2.1.136: Harte Ablehnung für den automatischen Modus, MCP-OAuth-Fixes und über 40 Fehlerbehebungen
Anthropic hat Claude Code v2.1.136 mit einer hard_deny-Einstellung für Auto-Mode-Klassifikatorregeln, Korrekturen für das Verschwinden des MCP-Servers nach /clear, OAuth-Token-Refresh-Konkurrenzproblemen und über 40 weiteren Fehlerbehebungen veröffentlicht.

Claude Code Leistungsrückgang diagnostiziert: Konfiguration, nicht Modellintelligenz
Anthropics Postmortem zeigt, dass der Leistungsabfall von Claude Code auf drei Produktänderungen zurückzuführen war – Standard-Reasoning-Aufwand, Session-Caching-Fehler und Prompt-Wortreduktion – nicht auf eine Verschlechterung des Modells. Der Rollback stellte die Leistung wieder her.

Anthropic trennt Claude-Abonnements von der Nutzung von Drittanbieter-Tools.
Anthropic beendet ab dem 4. April die Abdeckung von Claude Pro/Team-Abonnements für die Nutzung über OpenClaw und verlangt separate Pay-as-you-go-Abrechnungen für Drittanbieter-Tools. Benutzer müssen in ihren Kontoeinstellungen 'zusätzliche Nutzung' aktivieren, um Claude weiterhin über OpenClaw zu verwenden.

Ontario-Prüfbericht: 60% der KI-Schreibsysteme verwechseln Medikamente, 85% übersehen psychische Details
Die Rechnungsprüfer von Ontario fanden heraus, dass 12 von 20 KI-Notizschreibern falsche Arzneimittelinformationen einfügten, 9 erfanden Behandlungsvorschläge und 17 übersahen wichtige Details zur psychischen Gesundheit aus Arzt-Patienten-Aufnahmen. Bei der Bewertung machte die Genauigkeit nur 4 % der Gesamtpunktzahl aus.