Benchmarking der neuesten KI-Modelle: Der Aufstieg der extremen Modelle

Die jüngste Bewertung von 40 neuen KI-Modellen bringt bedeutende Verschiebungen im Preis-Leistungs-Verhältnis ans Licht. Mit einem Fokus auf Kimi k2.5 und Claude Opus 4.6 zeigt die Analyse eine Teilung in zwei Extreme: 'God Mode' und 'Flash Mode', wodurch Mittelklasse-Modelle ineffektiv werden.
Wichtige Details
- Kimi k2.5 Situation: Versuche, Kimi k2.5 zu bewerten, schlugen fehl aufgrund anhaltender 'No Content'-Fehler, vermutlich bedingt durch Überlastung. Dennoch schnitt Kimi-k2-Thinking für komplexe Denkaufgaben mit ~15 TPS angemessen ab.
- Geschwindigkeitsdominanz: Für latenzempfindliche Anwendungen erwies sich Liquid LFM 2.5 als das schnellste Modell mit ~359 Tokens/Sekunde, gefolgt von Ministral 3B mit ~293 Tokens/Sekunde.
- Kosteneffizienz: Ministral 3B hebt sich als die kosteneffektivste Lösung hervor, mit $0.10/1M Eingab tokens. Es ist ~17x günstiger und ~40% schneller als GPT-5.2 Codex, was es zu einer starken Wahl gegen höherpreisige Optionen macht.
Die Empfehlung lautet, Mittelklasse-Modelle, die zwischen $0.50 - $1.00 kosten, zu vermeiden, da sie keine wettbewerbsfähige Leistung bieten. Je nach Ihren Bedürfnissen sollten Sie höherpreisige Modelle wie Opus/GPT-5 für Intelligenz auswählen oder eine kostengünstige Geschwindigkeit mit Liquid/Mistral wählen.
📖 Lesen Sie die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch

Reddit-Nutzer untersucht, warum KI noch nicht Satellitenbilder nach vermissten Flugzeugen wie der MH370 durchsuchen kann
Ein Reddit-Nutzer bat Claude AI, Satelliten- und Sonardatenbanken zu durchsuchen, um vermisste Flugzeuge wie MH370 und Amelia Earharts Flugzeug zu lokalisieren. Claude antwortete, dass es keine Verbindungen zu diesen Datenbanken und keine Computer-Vision-Tools für großflächige Bildscans hat, obwohl der Nutzer darauf hinweist, dass die notwendigen Technologiekomponente bereits separat existieren.

M5 Max vs. M3 Max Inferenz-Benchmarks für Qwen-Modelle auf oMLX
Benchmarks, die M5 Max und M3 Max MacBook Pros beim Ausführen von Qwen 3.5 Modellen über oMLX v0.2.23 vergleichen, zeigen, dass der M5 Max eine 1,4- bis 1,7-fach schnellere Token-Generierung und bis zu 4-mal schnellere Prefill bei langen Kontexten liefert.

Encyclopedia Britannica reicht Klage gegen OpenAI wegen KI-Trainingsdaten ein
Encyclopedia Britannica hat eine Klage gegen OpenAI eingereicht und behauptet, dass Urheberrechte im Zusammenhang mit KI-Trainingsdaten verletzt wurden. Der Fall wurde von Reuters am 16. März 2026 gemeldet und hat auf Hacker News Diskussionen ausgelöst.

Anthropic sichert sich 300 MW Rechenleistung bei Colossus 1 mit 220.000 NVIDIA GPUs durch SpaceX-Partnerschaft
Anthropic gab eine Partnerschaft mit SpaceX bekannt, um die gesamte Rechenkapazität des Colossus-1-Rechenzentrums zu nutzen und innerhalb eines Monats über 300 MW und mehr als 220.000 NVIDIA-GPUs zu erhalten.