LLM-Kostenprofiler: Open-Source-Tool verfolgt API-Ausgaben, um den Einsatz lokaler Modelle zu rechtfertigen

LLM Cost Profiler ist ein Open-Source-Python-Tool, das jeden API-Aufruf Ihres Codes an OpenAI und Anthropic verfolgt und genau zeigt, wofür, wo und warum Sie Geld ausgeben. Das Tool deckt auf, welche Aufgaben im Verhältnis zu ihrer Komplexität überteuert sind, und liefert konkrete Daten, um den Fall für lokale Inferenz zu untermauern.
Wichtige Funktionen und Erkenntnisse
Das Tool speichert alles lokal in SQLite und ist unter der MIT-Lizenz lizenziert. Laut der Quelle wurden mehrere konkrete Beispiele für API-Aufruf-Verschwendung gefunden:
- Ein Klassifikator, der GPT-4o verwendet und eine von 5 Labels ausgibt – eine Aufgabe, die jedes brauchbare 7B lokale Modell problemlos bewältigt. Kosten: ~89 $/Woche für API-Aufrufe.
- Tausende doppelte Aufrufe desselben Prompts – ohne jegliches Caching. Lokale Inferenz mit Caching würde dies praktisch kostenlos machen.
- Ein Zusammenfasser, bei dem 34 % der Aufrufe Wiederholungen aufgrund von Formatfehlern waren. Ein gut abgestimmtes lokales Modell mit eingeschränkter Generierung beseitigt diese ganze Kategorie von Verschwendung.
Der Autor merkt an, dass dieses Tool Teams konkrete Argumente für Investitionen in lokale Inferenz-Infrastruktur liefert: „Hier ist der genaue Dollarbetrag, den wir sparen würden, wenn wir Aufgabe X auf ein lokales Modell umstellen.“
Das Tool ist auf GitHub unter https://github.com/BuildWithAbid/llm-cost-profiler verfügbar. Der Autor plant, Unterstützung für die Verfolgung von Kosten lokaler Modellinferenz hinzuzufügen (basierend auf Rechenzeit) und hat die Community gefragt, ob dies nützlich wäre.
Diese Art von Kostenprofiling-Tool ist besonders relevant für Entwickler, die KI-Coding-Agenten verwenden, da es datengestützte Einblicke bietet, wo API-Ausgaben im Vergleich zu lokalen Alternativen ineffizient sein könnten.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Peek-Plugin für Claude Code: Automatische Navigation durch Sitzungsspeicher
Peek ist ein Claude Code-Plugin, das automatisch Benutzerkorrekturen und Präferenzen erfasst und einfügt, um den KI-Assistenten zu steuern. Es verwendet Fusion-Suche mit Embeddings, BM25, Zeitabfall und Metadatenfiltern, um relevanten Kontext ohne manuelle Aufforderungen bereitzustellen.

StarSteady: KI-gestützte Google-Bewertungsantworten und SMS-Anfragen für lokale Unternehmen
StarSteady ist ein von einer Einzelperson entwickeltes SaaS, das KI-generierte Antworten auf Google-/Yelp-Bewertungen erstellt und SMS-Bewertungsanfragen an Kunden sendet. Der Preis beginnt bei 39 $/Monat, mit einem kostenlosen Testangebot für 5 Antworten/5 SMS.

Zot Chrome Operator: Lassen Sie Ihren Terminal-KI-Agenten über das Seitenpanel den Browser steuern
Eine Chrome-Erweiterung mit lokaler Brücke, die es zot, einem terminalbasierten KI-Codierungs-Assistenten, ermöglicht, Browser-Tabs über ein „browser_action“-Tool zu steuern. Installation in zwei Befehlen, keine Änderungen an zot erforderlich.

OpenClaw-Integration für indische Aktienmärkte: Multi-Agenten-Analyse und Handelsplattform
Ein Open-Source-Handelsterminal für indische Märkte wurde als OpenClaw-Skill-Server eingerichtet, sodass jeder OpenClaw-Agent indische Aktienmarktdaten abrufen und vollständige Analysen über HTTP ohne lokale Installation durchführen kann. Das System nutzt sieben spezialisierte Agenten, die parallel arbeiten, um strukturierte Analysen mit Handelsplänen zu generieren.