Feinabgestimmte Qwen3-Kleinstmodelle übertreffen Spitzen-LLMs bei spezifischen Aufgaben zu geringeren Kosten

✍️ OpenClawRadar📅 Veröffentlicht: 9. März 2026🔗 Source
Feinabgestimmte Qwen3-Kleinstmodelle übertreffen Spitzen-LLMs bei spezifischen Aufgaben zu geringeren Kosten
Ad

Ein systematischer Vergleich kleiner destillierter Qwen3-Modelle mit Spitzen-API-Modellen zeigt, dass feinabgestimmte kleine Sprachmodelle größere, teurere Modelle bei bestimmten strukturierten Aufgaben übertreffen können.

Benchmark-Ergebnisse

Die Studie verglich Qwen3-Modelle (0,6B bis 8B Parameter) mit Spitzen-APIs, darunter GPT-5 nano/mini/5.2, Gemini 2.5 Flash Lite/Flash, Claude Haiku 4.5/Sonnet 4.6/Opus 4.6 und Grok 4.1 Fast/Grok 4 über 9 Datensätze. Alle destillierten Modelle wurden ausschließlich mit Open-Weight-Lehrern trainiert, mit nur 50 Beispielen. Die Inferenz wurde auf vLLM auf einer einzelnen H100 durchgeführt.

Wichtige Leistungsergebnisse

  • Smart-Home-Funktionsaufrufe: Qwen3-0.6B erreichte 98,7 % Genauigkeit gegenüber Gemini Flash mit 92,0 %
  • Text2SQL: Destilliertes Qwen3-4B erreichte 98,0 % gegenüber Claude Haiku mit 98,7 % und GPT-5 nano mit 96,0 %
  • Kostenvergleich: Text2SQL-Kosten pro Million Anfragen: Qwen3-4B ~3 US-Dollar gegenüber Claude Haiku 378 US-Dollar und GPT-5 nano 24 US-Dollar
  • Klassifizierungsaufgaben: Destillierte Modelle lagen innerhalb von 0–1,5 Prozentpunkten der besten Spitzenoption bei Banking77, E-Commerce und TREC-Datensätzen
  • Spitzenvorteil: HotpotQA (freies Denken + Weltwissen) — 92,0 % gegenüber Haiku mit 98,0 %

Leistungsmetriken

Für Text2SQL mit Qwen3-4B auf H100:

  • 222 RPS dauerhaft
  • p50: 390ms | p95: 640ms | p99: 870ms
  • 7,6 GiB VRAM (BF16, keine Quantisierung)
  • FP8 ergab +15 % Durchsatz, −44 % VRAM, kein messbarer Genauigkeitsverlust in kurzen Experimenten
Ad

Methodik

  • Gleiche Testsets, Prompts und Bewertungskriterien für alle Modelle
  • Spitzenmodelle 3× pro Datensatz ausgeführt (Mittelwert ± Standardabweichung), destilliert bei Temperatur=0
  • Bewertung: Exakte Übereinstimmung für Klassifizierung, tool_call_equivalence (JSON-Vergleich mit Standardparameter-Normalisierung) für Funktionsaufrufe, Claude Sonnet 4.6 als LLM-Judge für Generierungsaufgaben
  • Kostenberechnung: Spitzenmodelle = gemessene Token-Nutzung × veröffentlichte Preise (Feb. 2026); destilliert = H100 bei 2,40 US-Dollar/Std. ÷ dauerhafte RPS

Praktische Empfehlungen

  • Destillierte Modelle verwenden, wenn: Sie strukturierte Aufgaben, klar definierte Schemata, hohes Volumen oder Datensouveränitätsbedürfnisse haben
  • Spitzen-APIs verwenden, wenn: Sie breites Weltwissen, freie Generierung benötigen oder das Volumen so gering ist, dass Kosten keine Rolle spielen
  • Hybrider Ansatz: Zwischen beiden basierend auf Aufgabenanforderungen wechseln

Verfügbarkeit

Alle Codes, Modelle, Daten und Bewertungsskripte sind Open Source auf GitHub: https://github.com/distil-labs/inference-efficiency-benchmarks/

Vollständige Analyse mit Diagrammen verfügbar im Blog: https://www.distillabs.ai/blog/the-10x-inference-tax-you-dont-have-to-pay

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Coasty KI-Agent löst CAPTCHA-Herausforderungen bis Level 6 ohne Training
Nachrichten

Coasty KI-Agent löst CAPTCHA-Herausforderungen bis Level 6 ohne Training

Coastys Computer Using Agent (CUA) erreichte 82 % auf dem OSWorld-Benchmark, löste CAPTCHAs bis Level 6, Browser-Popups und Cookie-Banner ohne spezifisches Training für 'Ich bin kein Roboter'-Herausforderungen.

OpenClawRadar
Bohrium AI Proteomik-Wettbewerb 2026 mit 13.000 $ Preisgeld und Rechenleistungsunterstützung
Nachrichten

Bohrium AI Proteomik-Wettbewerb 2026 mit 13.000 $ Preisgeld und Rechenleistungsunterstützung

Bohrium veranstaltet einen KI-Proteomik-Wettbewerb im Jahr 2026 mit einem Preisgeld von 13.000 US-Dollar, Praktikumsmöglichkeiten und Rechenleistungsunterstützung. Der Wettbewerb wurde auf Hacker News mit 17 Punkten und 5 Kommentaren diskutiert.

OpenClawRadar
Gemma 4 Chat-Vorlagenfehler: Tool-Parameter mit anyOf/null werden als leerer Typ dargestellt
Nachrichten

Gemma 4 Chat-Vorlagenfehler: Tool-Parameter mit anyOf/null werden als leerer Typ dargestellt

Ein Fehler in der Chat-Vorlage von Gemma 4 entfernt $ref, anyOf und $defs aus Tool-Parameter-Schemata, wodurch nullable Referenzen als leere Typfelder erscheinen. Ein Jinja-Fix stellt die korrekte Schema-Parsing für alle Inferenz-Engines wieder her.

OpenClawRadar
OpenClaw Gateway Zuverlässigkeitsprobleme: Stille Ausfälle nach 25 Tagen intensiver Nutzung
Nachrichten

OpenClaw Gateway Zuverlässigkeitsprobleme: Stille Ausfälle nach 25 Tagen intensiver Nutzung

Ein detaillierter Bericht eines OpenClaw-Benutzers, der 25 Tage lang 18+ Cron-Jobs mit Telegram ausgeführt hat, identifiziert ein kritisches Muster, bei dem das Gateway in einen 'zombifizierten' Zustand gerät – es wird als laufend angezeigt, aber alle Funktionen sind eingefroren. Der Benutzer dokumentiert spezifische Probleme, darunter Sitzungsschreibsperren, die dauerhaft gehalten werden, Cron-Jobs, die in Phantom-Laufzuständen stecken bleiben, und stille Fehler bei ungültigen Konfigurationen.

OpenClawRadar