Benchmarks zeigen, dass destillierte Modelle bei strukturierten Aufgaben mit Spitzen-LLMs mithalten können – bei 10-fach geringeren Kosten.

✍️ OpenClawRadar📅 Veröffentlicht: 7. März 2026🔗 Source
Benchmarks zeigen, dass destillierte Modelle bei strukturierten Aufgaben mit Spitzen-LLMs mithalten können – bei 10-fach geringeren Kosten.
Ad

Benchmark-Ergebnisse: Destillierte vs. führende Modelle

Forscher führten einen umfassenden Vergleich kleiner destillierter Modelle mit führenden LLMs über 9 Datensätze durch, die Klassifizierung, Funktionsaufrufe, QA und Open-Book-QA-Aufgaben abdecken. Alle destillierten Modelle stammen aus der Qwen3-Familie (0,6B bis 8B) und wurden mit nur 50 Beispielen trainiert, wobei Open-Weight-Lehrermodelle ohne Trainingsausgaben von führenden APIs verwendet wurden.

Wichtige Leistungsergebnisse

  • Destillierte Modelle erreichen oder übertreffen das beste mittlere führende Modell (<1 $/MTok Eingabe) bei 6/9 Aufgaben und liegen bei einer 7. Aufgabe praktisch gleichauf
  • Text2SQL: Qwen3-4B destilliert erreicht 98,0 % vs. Claude Haiku 98,7 %, GPT-5 nano 96,0 % bei 3 $/Mio. Anfragen vs. 378 $ bzw. 24 $
  • Smart Home (Funktionsaufrufe): Qwen3-0,6B erzielt 98,7 % vs. Gemini Flash 92,0 %
  • HotpotQA: Destillierte Modelle erreichen 92,0 % vs. Haiku 98,0 % – freies Schlussfolgern mit Weltwissen bleibt Domäne führender Modelle
  • Klassifizierungsaufgaben (Banking77, E-Commerce, TREC): Destillierte Modelle liegen 0–1,5 Prozentpunkte unter der besten führenden Option

Inferenzleistung

Modelle wurden via vLLM auf einer einzelnen H100 mit folgender Text2SQL-4B-Modellleistung bereitgestellt:

  • 222 RPS dauerhaft
  • p50: 390 ms, p95: 640 ms, p99: 870 ms
  • 7,6 GiB VRAM (BF16, keine Quantisierung)
  • FP8 brachte +15 % Durchsatz, -44 % Speicher, ohne Genauigkeitsverlust in kurzen Experimenten
Ad

Methodik

  • Gleiche Testsets, gleiche Prompts, gleiche Bewertungskriterien für alle Modelle
  • Führende Modelle 3× pro Datensatz ausgeführt (Mittelwert ± Standardabweichung angegeben), destillierte bei temp=0
  • Bewertung: Exact-Match für Klassifizierung, tool_call_equivalence (JSON-Vergleich mit Standardparameternormalisierung) für Funktionsaufrufe, Claude Sonnet 4.6 als LLM-as-a-Judge für Generierung
  • Kosten: führend = gemessener API-Tokenverbrauch × veröffentlichte Preise (Feb. 2026). Destilliert = H100 bei 2,40 $/h ÷ gemessene dauerhafte RPS

Praktische Empfehlungen

  • Destillieren: strukturierte Aufgaben, klar definierte Schemata, hohes Volumen, Datensouveränitätsanforderungen
  • Führende API: breites Weltwissen, freie Generierung, geringes Volumen
  • Beste Einrichtung: Routing zwischen beiden

Verfügbare Ressourcen

Alle Codes, Modelle, Daten und Bewertungsskripte sind Open Source unter https://github.com/distil-labs/inference-efficiency-benchmarks/

Vollständiger Blogbeitrag mit Diagrammen und Aufschlüsselungen pro Datensatz: https://www.distillabs.ai/blog/the-10x-inference-tax-you-dont-have-to-pay

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Cerebras veröffentlicht Step-3.5-Flash-REAP-Modelle mit 40 % weniger Speicherbedarf.
Nachrichten

Cerebras veröffentlicht Step-3.5-Flash-REAP-Modelle mit 40 % weniger Speicherbedarf.

Cerebras hat Step-3.5-Flash-REAP-Modelle veröffentlicht, die REAP (Router-weighted Expert Activation Pruning) verwenden, um 196B-Parameter-Modelle auf 121B zu komprimieren, während nahezu identische Leistung erhalten bleibt. Die Modelle funktionieren mit Standard-vLLM und sind für ressourcenbeschränkte Umgebungen optimiert.

OpenClawRadar
Benchmark-Vergleich der Qwen 3.5-Modelle mit führenden KI-Modellen
Nachrichten

Benchmark-Vergleich der Qwen 3.5-Modelle mit führenden KI-Modellen

Eine Benchmark-Vergleichswebsite enthält verifizierte Bewertungen und direkte Vergleichsinfografiken für Qwen-3.5-Modelle (122B, 35B, 27B, 397B) im Vergleich zu Modellen wie GPT-5.2, Claude 4.5 Opus, Gemini-3 Pro und anderen.

OpenClawRadar
Analyse der TB2-Benchmarking-Probleme in der db-wal-recovery-Aufgabe
Nachrichten

Analyse der TB2-Benchmarking-Probleme in der db-wal-recovery-Aufgabe

Eine Reddit-Analyse deckt Probleme mit der db-wal-recovery-Aufgabe von Terminal Bench 2.0 auf, bei der Agenten Beweise versehentlich zerstören können, indem sie SQLite-Datenbanken öffnen, und zeigt, wie Prompt-Injection die Leaderboard-Ergebnisse beeinflusst.

OpenClawRadar
Einschränkungszerfall: Warum LLM-Agenten bei strukturiertem Backend-Code scheitern
Nachrichten

Einschränkungszerfall: Warum LLM-Agenten bei strukturiertem Backend-Code scheitern

Neue Forschung führt 'Constraint Decay' ein: Wenn strukturelle Anforderungen steigen, fällt die Leistung von LLM-Agenten drastisch – fähige Agenten verlieren 30 Punkte bei Assertion-Pass-Raten, schwächere fallen fast auf null. Umsetzbare Erkenntnisse für alle, die KI-Coding-Agenten nutzen.

OpenClawRadar