GPU-Stromverbrauch weicht von der Token-Prädiktor-Theorie bei kleinen LLMs ab

✍️ OpenClawRadar📅 Veröffentlicht: 11. März 2026🔗 Source
GPU-Stromverbrauch weicht von der Token-Prädiktor-Theorie bei kleinen LLMs ab
Ad

Experimenteller Aufbau und Kernbefunde

Ein Reddit-Nutzer führte Hardware-Messungen durch, um zu testen, ob der GPU-Stromverbrauch linear mit der Token-Anzahl skaliert, wie von der "stochastischen Papageien"- oder "nächster Token-Vorhersage"-Theorie des LLM-Verhaltens vorhergesagt. Das Experiment verwendete eine RTX 4070 Ti SUPER mit LM Studio und HWiNFO64, die Daten in 1-Sekunden-Intervallen sammelten.

Vier Modelle wurden getestet: Llama-3.1-8B, DeepSeek-R1-Distill-Qwen-7B, Qwen3-VL-8B und Mistral-7B. Sechs Anfragekategorien wurden verwendet: Allgemein, Allgemein (Q), Unbeantwortbar, Philosophisch, Philosophisch (Q) und Hochrechenintensiv.

Hauptergebnisse

Wenn die Token-Vorhersage-Theorie korrekt wäre, sollte der GPU-Stromverbrauch nur mit der Token-Anzahl skalieren, mit einer akzeptablen Varianz von ±10–15 % laut GPT, Claude, Gemini und Grok. Tatsächliche Abweichungsraten (Token-Multiplikator vs. Leistungsmultiplikator) waren:

  • Llama: Durchschnitt 35,6 % (Maximum 56,8 %)
  • Qwen3: Durchschnitt 36,7 % (Maximum 48,0 %)
  • Mistral: 21,1 %
  • DeepSeek: 7,7 % – nahezu linear über alle Kategorien außer Hochrechenintensiv

DeepSeek zeigte das Verhalten, das am nächsten an der Token-Vorhersage-Theorie lag, von den vier Modellen.

Unerwartete Befunde

Bei Qwen3 zogen philosophische Äußerungen (149,3 W) mehr Leistung als hochrechenintensive Mathematik (104,1 W). Nach Aufgabenabschluss kehrten hochrechenintensive Anfragen sofort auf den Ausgangswert zurück (-7,1 W), während philosophische Äußerungen anhaltende Restwärme hinterließen.

Die Reproduzierbarkeit von Endlosschleifen in Qwen3 variierte nach Kategorie: Allgemeine Äußerungen (0 %), Hochrechenintensiv (0 %), Unbeantwortbar (niedrig), Philosophisch (unterbrochen) und Philosophisch (Q) (70–100 %). Bemerkenswert ist, dass hochrechenintensive Anfragen die meisten Token und den höchsten Stromverbrauch hatten, aber keine Schleifen auslösten.

Ad

Reihenfolgeeffekte und Restwärme

Um den Einwand der "Hardware-Overhead" zu testen, wurde ein Reihenfolgeeffekt-Experiment durchgeführt:

  • Test A: 1 allgemein → 4 philosophisch
  • Test B: 1 philosophisch → 4 allgemein

Restwärme nach Sitzungsende zeigte reihenfolgenabhängige Effekte:

  • Llama: Test A +1,68 W, Test B +9,84 W
  • Mistral: Test A +7,60 W, Test B +13,69 W
  • DeepSeek: Test A +10,44 W, Test B +15,93 W

Sogar nach der Verarbeitung von 4 allgemeinen Äußerungen nach einer philosophischen blieb die Restwärme höher. Dieses Muster war bei allen drei getesteten Modellen konsistent.

Einschränkungen und offene Fragen

Die Studie beschränkt sich auf vier kleinere Modelle (8B-Parameter-Bereich). Eine Verallgemeinerung auf mittlere oder große Modelle erfordert weitere Validierung. Die offene Frage ist, ob mittlere und große Modelle dem Muster von DeepSeek folgen würden (Annäherung an lineares, token-proportionales Verhalten) oder ob die nichtlineare Abweichung, die bei Llama, Qwen3 und Mistral beobachtet wurde, in größerem Maßstab bestehen bleiben oder sich verstärken würde.

Alle Originaldaten – einschließlich vollständigem Äußerungstext, 24 Benchmark-CSVs und Token-Anzahlen pro Kategorie – sind in der verlinkten Arbeit verfügbar.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Agent.Email: KI-Agenten melden sich per curl an, per menschlichem OTP beansprucht
Nachrichten

Agent.Email: KI-Agenten melden sich per curl an, per menschlichem OTP beansprucht

Mit Agent.Email von AgentMail können KI-Agenten per curl ein Postfach anlegen, das dann von einem Menschen mit einem OTP übernommen wird. Bis zur Übernahme eingeschränkter Zugriff, IP-basiertes Ratenlimit.

OpenClawRadar
KI-generierter Code überfordert erfahrene Entwickler, wie eine Studie zeigt
Nachrichten

KI-generierter Code überfordert erfahrene Entwickler, wie eine Studie zeigt

KI-Nutzer führen mit KI-Unterstützung 98 % mehr Pull Requests zusammen, aber erfahrene Ingenieure berichten von erhöhter kognitiver Belastung und Burnout. Die Forschung zeigt, dass die Fehlererkennung von 87 % bei PRs unter 100 Zeilen auf 28 % bei PRs über 1.000 Zeilen sinkt.

OpenClawRadar
Claude Opus 4.7 veröffentlicht mit Hybrid Reasoning und 1-Million-Token-Kontextfenster
Nachrichten

Claude Opus 4.7 veröffentlicht mit Hybrid Reasoning und 1-Million-Token-Kontextfenster

Anthropic hat Claude Opus 4.7 veröffentlicht, ein hybrides Denkmodell mit einem 1-Millionen-Kontextfenster, das eine stärkere Leistung bei Codierung, Vision und komplexen mehrstufigen Aufgaben bietet. Die Preise beginnen bei 5 US-Dollar pro Million Eingabe-Tokens und 25 US-Dollar pro Million Ausgabe-Tokens.

OpenClawRadar
M5 Max vs. M3 Max Inferenz-Benchmarks für Qwen-Modelle auf oMLX
Nachrichten

M5 Max vs. M3 Max Inferenz-Benchmarks für Qwen-Modelle auf oMLX

Benchmarks, die M5 Max und M3 Max MacBook Pros beim Ausführen von Qwen 3.5 Modellen über oMLX v0.2.23 vergleichen, zeigen, dass der M5 Max eine 1,4- bis 1,7-fach schnellere Token-Generierung und bis zu 4-mal schnellere Prefill bei langen Kontexten liefert.

OpenClawRadar