Профилировщик затрат на LLM: инструмент с открытым исходным кодом отслеживает расходы на API, чтобы обосновать использование локальных моделей.

LLM Cost Profiler — это инструмент с открытым исходным кодом на Python, который отслеживает каждый API-вызов вашего кода к OpenAI и Anthropic, показывая, на что именно, где и почему вы тратите средства. Инструмент выявляет, какие задачи переоценены относительно их сложности, предоставляя конкретные данные для обоснования перехода на локальный инференс.
Ключевые особенности и выводы
Инструмент хранит всё в локальной SQLite и имеет лицензию MIT. Согласно источнику, он обнаружил несколько конкретных примеров неэффективных API-вызовов:
- Классификатор, использующий GPT-4o и выводящий один из 5 ярлыков — задача, с которой легко справляется любая качественная локальная модель на 7B. Стоимость: ~$89/неделя на API-вызовах.
- Тысячи дублирующих вызовов одного и того же промпта — кэширование отсутствует. Локальный инференс с кэшированием сделал бы это практически бесплатным.
- Суммаризатор, где 34% вызовов были повторными из-за ошибок формата. Хорошо настроенная локальная модель с ограниченной генерацией устраняет весь этот класс потерь.
Автор отмечает, что этот инструмент даёт командам конкретные аргументы для инвестирования в инфраструктуру локального инференса: «Вот точная сумма, которую мы сэкономим, перенеся задачу X на локальную модель».
Инструмент доступен на GitHub по адресу https://github.com/BuildWithAbid/llm-cost-profiler. Автор планирует добавить поддержку отслеживания затрат на локальный инференс моделей (расчёт на основе времени вычислений) и спросил сообщество, будет ли это полезно.
Такой инструмент профилирования затрат особенно актуален для разработчиков, использующих AI-агентов для кодинга, так как предоставляет данные о том, где расходы на API могут быть неэффективны по сравнению с локальными альтернативами.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

OpenIntel Iran: Обновления панели управления конфликтами на основе ИИ с ежечасными брифингами
Искусственный интеллект разработчика провёл масштабную модернизацию панели мониторинга OpenIntel Iran — автоматически обновляемого инструмента разведки, который ежечасно сканирует Reuters, AP, BBC и другие крупные источники для проверки событий и публикации структурированных сводок по конфликту Иран-Израиль-США.

VibeSmith: Локальный инструмент для выявления конфликтов навыков в проектах Claude Code
VibeSmith — это локальное приложение для macOS, которое обеспечивает единый обзор проектов Claude Code, обнаруживает конфликты, когда глобальные и проектные компоненты имеют одинаковые имена, визуализирует зависимости в виде направленных ациклических графов (DAG) и отслеживает использование токенов контекста.

Ruflo: Открытая платформа для совместной работы нескольких ИИ-агентов
Ruflo — это платформа с открытым исходным кодом, которая позволяет запускать множество ИИ-агентов, работающих вместе как команда над сложными задачами. Ранее известная как Claude Flow, она помогает координировать рабочие процессы, где задачи нужно разбивать на части.

Улучшение сеансов кода Claude с claude-self-improve.
Claude-self-improve — это инструмент командной строки, который улучшает производительность ИИ Claude Code, анализируя данные сессий и автоматически обновляя файлы памяти.