Benchmarking der neuesten KI-Modelle: Der Aufstieg der extremen Modelle

✍️ OpenClawRadar📅 Veröffentlicht: 13. Februar 2026🔗 Source
Benchmarking der neuesten KI-Modelle: Der Aufstieg der extremen Modelle
Ad

Die jüngste Bewertung von 40 neuen KI-Modellen bringt bedeutende Verschiebungen im Preis-Leistungs-Verhältnis ans Licht. Mit einem Fokus auf Kimi k2.5 und Claude Opus 4.6 zeigt die Analyse eine Teilung in zwei Extreme: 'God Mode' und 'Flash Mode', wodurch Mittelklasse-Modelle ineffektiv werden.

Ad

Wichtige Details

  • Kimi k2.5 Situation: Versuche, Kimi k2.5 zu bewerten, schlugen fehl aufgrund anhaltender 'No Content'-Fehler, vermutlich bedingt durch Überlastung. Dennoch schnitt Kimi-k2-Thinking für komplexe Denkaufgaben mit ~15 TPS angemessen ab.
  • Geschwindigkeitsdominanz: Für latenzempfindliche Anwendungen erwies sich Liquid LFM 2.5 als das schnellste Modell mit ~359 Tokens/Sekunde, gefolgt von Ministral 3B mit ~293 Tokens/Sekunde.
  • Kosteneffizienz: Ministral 3B hebt sich als die kosteneffektivste Lösung hervor, mit $0.10/1M Eingab tokens. Es ist ~17x günstiger und ~40% schneller als GPT-5.2 Codex, was es zu einer starken Wahl gegen höherpreisige Optionen macht.

Die Empfehlung lautet, Mittelklasse-Modelle, die zwischen $0.50 - $1.00 kosten, zu vermeiden, da sie keine wettbewerbsfähige Leistung bieten. Je nach Ihren Bedürfnissen sollten Sie höherpreisige Modelle wie Opus/GPT-5 für Intelligenz auswählen oder eine kostengünstige Geschwindigkeit mit Liquid/Mistral wählen.

📖 Lesen Sie die vollständige Quelle: r/LocalLLaMA

Ad

👀 Siehe auch

Claude-Code v2.1.97 Veröffentlichung: NO_FLICKER-Verbesserungen, Berechtigungsbehebungen und MCP-Updates
Nachrichten

Claude-Code v2.1.97 Veröffentlichung: NO_FLICKER-Verbesserungen, Berechtigungsbehebungen und MCP-Updates

Claude-Code v2.1.97 fügt einen Fokus-Ansichts-Umschalter (Strg+O) im NO_FLICKER-Modus hinzu, behebt mehrere Berechtigungs- und MCP-Verbindungsprobleme und verbessert den Sandbox-Netzwerkzugriff. Das Release behandelt das 429-Wiederholungsverhalten, Transkript-Persistenzprobleme und verschiedene UI-Fehler.

OpenClawRadar
Entkoppeltes DiLoCo: Robuster verteilter Training über Rechenzentren mit geringer Bandbreite
Nachrichten

Entkoppeltes DiLoCo: Robuster verteilter Training über Rechenzentren mit geringer Bandbreite

Google DeepMinds Decoupled DiLoCo trainiert große Sprachmodelle über entfernte Rechenzentren hinweg mittels 2-5 Gbps WAN, mit selbstheilenden Recheninseln, die Hardwareausfälle isolieren, ohne die ML-Leistung zu beeinträchtigen.

OpenClawRadar
Nvidia investiert 26 Milliarden Dollar in Open-Weight-KI-Modelle und veröffentlicht Nemotron 3 Super
Nachrichten

Nvidia investiert 26 Milliarden Dollar in Open-Weight-KI-Modelle und veröffentlicht Nemotron 3 Super

Nvidia wird in den nächsten fünf Jahren 26 Milliarden Dollar für die Entwicklung von Open-Weight-KI-Modellen ausgeben, wie aus den Finanzunterlagen von 2025 hervorgeht. Das Unternehmen hat auch Nemotron 3 Super veröffentlicht, ein Modell mit 128 Milliarden Parametern, das GPT-OSS in Benchmarks übertrifft und auf PinchBench für OpenClaw-Steuerung den ersten Platz belegt.

OpenClawRadar
OpenClaw 2026.3.2 Release: Produktionsgeheimnisse, PDF-Tool und sicherere Standardeinstellungen
Nachrichten

OpenClaw 2026.3.2 Release: Produktionsgeheimnisse, PDF-Tool und sicherere Standardeinstellungen

OpenClaw 2026.3.2 führt ein produktionsreifes Secrets-System mit Fail-Fast-Verhalten ein, ein natives PDF-Tool mit Unterstützung für Anthropic- und Google-Modelle sowie sicherere Standardeinstellungen, die den Tool-Zugriff für neue Installationen einschränken.

OpenClawRadar