KI-Inferenz ist offensichtlich profitabel: Eine Analyse der Wirtschaftlichkeit

Sean Goedecke argumentiert, dass KI-Inferenz offensichtlich profitabel ist, im Gegensatz zu Behauptungen, sie werde durch VC-Gelder subventioniert. Er schlüsselt die Mathematik und die Preise offener Modelle auf, um zu zeigen, dass der Betrieb von LLMs ein nachhaltiges Geschäft sein kann.
Kostenaufschlüsselung für ein 70B-Dense-Modell
Mit vier Nvidia A100 GPUs (400W pro Stück, ~2 Millionen Tokens/Stunde):
- Strom: ~13¢/Stunde zu Industriepreisen, plus ~13¢/Stunde Kühlung → insgesamt 26¢/Stunde
- GPU-Amortisation: 20.000 $ pro A100 über 5 Jahre → 16.000 $/Jahr oder 1,80 $/Stunde
- Gesamt: rund 1 $ pro Million Ausgabetokens
OpenAIs GPT-5.4-mini verlangt 4,50 $ pro Million Tokens, und stärkere Modelle sind 3-6x teurer. Damit sind die behaupteten 70-80 % Bruttomarge plausibel.
Offene Modelle bestätigen Rentabilität
DeepSeek behauptet über 80 % Marge bei R1-Inferenz, während es weniger als die Hälfte von OpenAI/Anthropic verlangt. Deren DeepSeek-V4-Pro-API liegt bei etwa 87¢ pro Million Ausgabetokens – nahe an den tatsächlichen Kosten, was darauf hindeutet, dass die Margen bei Spitzenmodellen sogar noch höher sind.
Warum hohe Margen existieren
KI-Labore wie OpenAI und Anthropic benötigen Inferenzgewinne, um Trainingskosten zu subventionieren, weshalb sie die API-Preise hoch halten. Aber ein reiner Inferenzanbieter ohne Trainingskosten könnte selbst zu niedrigeren Preisen Gewinne erzielen. Selbst wenn Spitzenlabore untergehen, kann derjenige, der ihre Modellrechte erwirbt, weiterhin profitabel Inferenz verkaufen.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch

Rust-Projekt-Perspektiven zu KI: Praktische Einblicke von Mitwirkenden
Ein Zusammenfassungsdokument sammelt Perspektiven von Rust-Mitwirkenden zur Nutzung von KI-Tools und hebt hervor, dass eine effektive KI-Integration sorgfältiges Engineering erfordert. Es zeigt konkrete Anwendungsfälle wie die Navigation in Codebasen, Unterstützung bei Code-Reviews und die Verarbeitung halbstrukturierter Daten.

KI-Modelle beschleunigen mathematische Forschung und Beweisfindung
KI-Modelle werden heute von Mathematikern eingesetzt, um neue Ergebnisse zu entdecken und zu beweisen, und schaffen an einem Tag, was früher Wochen oder Monate dauerte. Im Juli 2025 lösten mehrere KI-Modelle fünf von sechs Aufgaben bei der Internationalen Mathematik-Olympiade.

Claude Managed Agents fügt Träumen, Ergebnisse, Multiagenten-Orchestrierung und Webhooks hinzu
Träumen ist ein geplanter Gedächtnis-Kurationsprozess, der die Aufgabenerfüllungsrate in Harvey-Tests um etwa das Sechsfache verbesserte. Outcomes, Multiagenten-Orchestrierung und Webhooks sind jetzt in der öffentlichen Beta auf der Claude-Plattform verfügbar.

OpenClaw v2026.7.1: Überarbeitung der Steuerungs-Benutzeroberfläche, Einführung, mobile Apps, GPT-5.6, Tencent Hy3, Meta Muse Spark 1.1
OpenClaw v2026.7.1 bringt eine große Überarbeitung der Control-Benutzeroberfläche, einen neu gestalteten Onboarding-Prozess, aktualisierte iOS/Android/macOS-Apps, GPT-5.6-Kompatibilität, Unterstützung für Tencent Hy3 und Meta Muse Spark 1.1 sowie verbesserte Codex- und Coding-Agent-Workflows.