Ein 6.400 Dollar lokaler LLM-Server: TCO-Vergleich vs. API-Kosten

✍️ OpenClawRadar📅 Veröffentlicht: 31. Mai 2026🔗 Source
Ein 6.400 Dollar lokaler LLM-Server: TCO-Vergleich vs. API-Kosten
Ad

Ein Entwickler auf r/LocalLLaMA hat eine gründliche Kostenanalyse seines lokalen LLM-Servers für 6.406,45 $ veröffentlicht, inklusive Abschreibung und Stromkosten, im Vergleich zu API-Preisen. Der Server verwendet vier gebrauchte AMD MI100 32GB GPUs mit llama.cpp, auf dem Qwen3.6 27B läuft, und verarbeitet täglich 20,4 Mio. Input-Tokens und 1,32 Mio. Output-Tokens.

Hardware-Spezifikationen

  • 4x gebrauchte MI100 32GB: 4.234,82 $
  • ASRock EPYCD8-2T Mainboard: 721,61 $
  • 1600W 80+ Platinum Netzteil: 497,95 $
  • 8x8GB DDR4 ECC RDIMMs (gebraucht): 348,79 $
  • EPYC 7K62 48-Kern CPU (gebraucht): 254,28 $
  • CPU-Kühler, Gehäuse, Lüfter, Kabel: ~349 $
  • Gesamt: 6.406,45 $
Ad

Leistungs- und Kostenvergleich

Bei 0,29 $/M Input und 3,2 $/M Output auf OpenRouter für Qwen3.6 27B betragen die täglichen API-Kosten 10,14 $ bzw. 3.701,10 $/Jahr. Der lokale Server produziert die gleichen Tokens bei täglichen Stromkosten von 2,11 $ (630W bei 0,14 $/kWh), also 770,15 $/Jahr.

Abschreibungsrechnung

Der Autor verwendet ein realistisches Abschreibungsmodell: Zubehör 100% Verlust, neue Teile 50% Verlust, gebrauchte Teile 10% Verlust. Dies ergibt einmalige Hardware-Abschreibungskosten von 1.442,57 $, die ungefähr gleich sind, egal ob nach 1 Tag oder 5 Jahren verkauft.

Nach einem Jahr betragen die lokalen Gesamtkosten = 770 $ (Strom) + 1.443 $ (Abschreibung) = 2.213 $, verglichen mit 3.701 $ für die API – eine Ersparnis von 1.488 $.

Vergleich mit Coding-Plänen

Zum Vergleich: Z.AI's Top-Coding-Plan (144 $/Monat) bietet etwa 4,5 Mio. Input/200k Output-Tokens/Tag von GLM 4.7, was normalisiert auf die gleiche Kapazität wie der lokale Server 652,80 $/Monat oder 7.833,60 $/Jahr kosten würde – mehr als das Doppelte des OpenRouter-Preises für das gleiche Modell.

Der Autor merkt an, dass Coding-Pläne nicht immer ein gutes Preis-Leistungs-Verhältnis bieten, und rät, zu prüfen, was man tatsächlich für die Tokens bezahlt.

📖 Vollständige Quelle lesen: r/LocalLLaMA

Ad

👀 Siehe auch

Das GrapeRoot-Tool reduziert die Claude-Code-Kosten um 45 % durch vorab gescannten Repository-Kontext.
Werkzeuge

Das GrapeRoot-Tool reduziert die Claude-Code-Kosten um 45 % durch vorab gescannten Repository-Kontext.

Ein kostenloses Tool namens GrapeRoot, das Repositorys vorab scannt und Abhängigkeitsgraphen erstellt, reduzierte die Claude Code-Kosten bei 10 Engineering-Aufgaben im Durchschnitt um 45 %, während die Antwortqualität um 13 % verbessert wurde. Das Tool eliminiert Erkundungsschleifen, die normalerweise Token verbrauchen.

OpenClawRadar
PhAIL-Benchmark-Tests testen VLA-Modelle an echten Lagerhaus-Roboteraufgaben
Werkzeuge

PhAIL-Benchmark-Tests testen VLA-Modelle an echten Lagerhaus-Roboteraufgaben

PhAIL ist ein Echt-Roboter-Benchmark, der vier Vision-Language-Action-Modelle bei der Behälter-zu-Behälter-Kommissionierung mit einem Franka FR3 Roboter testet. Das beste Modell erreichte 64 Einheiten pro Stunde, verglichen mit 330 UPH für menschliche Teleoperation und über 1.300 UPH für manuelle menschliche Arbeit.

OpenClawRadar
Brackish: Zwei Claude Code-Instanzen einen API-Vertrag über OpenAPI 3.1 aushandeln lassen
Werkzeuge

Brackish: Zwei Claude Code-Instanzen einen API-Vertrag über OpenAPI 3.1 aushandeln lassen

Brackish ist ein CLI-Tool, das zwischen zwei Claude Code-Sitzungen läuft – einer im Backend (FastAPI) und einer im Frontend (React/TypeScript) – um einen API-Vertrag über ein gemeinsames OpenAPI 3.1-Dokument auszuhandeln. Es deckt Meinungsverschiedenheiten auf, bevor Code geschrieben wird.

OpenClawRadar
Allgemeine Bots: Open-Source-KI-Agenten-Plattform für selbst gehostete Unternehmensautomatisierung
Werkzeuge

Allgemeine Bots: Open-Source-KI-Agenten-Plattform für selbst gehostete Unternehmensautomatisierung

General Bots ist eine Open-Source-Plattform, die 2019 gestartet wurde und KI-Agenten, Workflow-Automatisierung, Dokumentenverarbeitung und Integrationen mit Unterstützung für lokale KI-Modelle bietet. Sie wurde für Organisationen entwickelt, die volle Kontrolle über ihre Infrastruktur benötigen.

OpenClawRadar