LLM-Kostenprofiler: Open-Source-Tool verfolgt API-Ausgaben, um den Einsatz lokaler Modelle zu rechtfertigen

LLM Cost Profiler ist ein Open-Source-Python-Tool, das jeden API-Aufruf Ihres Codes an OpenAI und Anthropic verfolgt und genau zeigt, wofür, wo und warum Sie Geld ausgeben. Das Tool deckt auf, welche Aufgaben im Verhältnis zu ihrer Komplexität überteuert sind, und liefert konkrete Daten, um den Fall für lokale Inferenz zu untermauern.
Wichtige Funktionen und Erkenntnisse
Das Tool speichert alles lokal in SQLite und ist unter der MIT-Lizenz lizenziert. Laut der Quelle wurden mehrere konkrete Beispiele für API-Aufruf-Verschwendung gefunden:
- Ein Klassifikator, der GPT-4o verwendet und eine von 5 Labels ausgibt – eine Aufgabe, die jedes brauchbare 7B lokale Modell problemlos bewältigt. Kosten: ~89 $/Woche für API-Aufrufe.
- Tausende doppelte Aufrufe desselben Prompts – ohne jegliches Caching. Lokale Inferenz mit Caching würde dies praktisch kostenlos machen.
- Ein Zusammenfasser, bei dem 34 % der Aufrufe Wiederholungen aufgrund von Formatfehlern waren. Ein gut abgestimmtes lokales Modell mit eingeschränkter Generierung beseitigt diese ganze Kategorie von Verschwendung.
Der Autor merkt an, dass dieses Tool Teams konkrete Argumente für Investitionen in lokale Inferenz-Infrastruktur liefert: „Hier ist der genaue Dollarbetrag, den wir sparen würden, wenn wir Aufgabe X auf ein lokales Modell umstellen.“
Das Tool ist auf GitHub unter https://github.com/BuildWithAbid/llm-cost-profiler verfügbar. Der Autor plant, Unterstützung für die Verfolgung von Kosten lokaler Modellinferenz hinzuzufügen (basierend auf Rechenzeit) und hat die Community gefragt, ob dies nützlich wäre.
Diese Art von Kostenprofiling-Tool ist besonders relevant für Entwickler, die KI-Coding-Agenten verwenden, da es datengestützte Einblicke bietet, wo API-Ausgaben im Vergleich zu lokalen Alternativen ineffizient sein könnten.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Feynman: Open-Source-Forschungsagent mit Tool zur Überprüfung von Papier-Codebasen
Feynman ist ein Open-Source-Forschungsagent-CLI, der vier Subagenten parallel einsetzt, um Forschungsfragen zu beantworten, und ein einzigartiges Audit-Tool enthält, das Behauptungen in wissenschaftlichen Arbeiten mit tatsächlichen Codebasen vergleicht. Es bietet Ein-Kommando-Installation, MIT-Lizenz und läuft auf pi für die Agentenlaufzeit mit alphaxiv für die Papiersuche.
Terry Tao portiert 24 Java-Applets mit LLM-Agenten nach JavaScript – findet Fehler im Originalcode
Terence Tao nutzte einen LLM-Coding-Agenten, um seine Java-Applets von 1999 in wenigen Stunden nach JavaScript zu portieren. Der Agent fand zwei Fehler im Originalcode und führte nur ein kleines Problem bei der Drag-Behandlung ein.

ClawTalk iOS-App ermöglicht Sprach-Chat mit selbst-gehosteten OpenClaw-KI-Agenten
ClawTalk ist eine native iOS-App, die Push-to-Talk-Sprachchat für selbst gehostete OpenClaw-LLM-Setups bietet. Sie verfügt über On-Device-Spracherkennung mit WhisperKit, Echtzeit-Streaming-Antworten mit Markdown-Rendering und unterstützt mehrere TTS-Optionen, darunter ElevenLabs, OpenAI und Apples eingebaute Stimmen.

Claude IDE Bridge: MCP-Tool für Remote-Editor-Zugriff
Claude IDE Bridge ist ein Open-Source-Tool, das Claude AI über MCP (Model Context Protocol) Fernsteuerungszugriff auf Code-Editoren ermöglicht. Es stellt Editor-Wissen wie Live-Typinformationen und Debugger-Status als aufrufbare Werkzeuge zur Verfügung.