Не предполагайте, что дорогие модели лучше: пример экономии в 13 раз при тестировании

Пользователь Reddit поделился примером, демонстрирующим, что использование по умолчанию дорогих моделей, таких как GPT-5.4, может привести к значительному перерасходу бюджета. Проведя тысячи оценок за последний год, они обнаружили, что старые или более дешевые модели часто не уступают или превосходят производительность на конкретных задачах, будучи при этом быстрее и дешевле.
Ключевые результаты оценок
Пользователь протестировал 21 модель на openmark.ai, используя реальные производственные данные из конвейера классификации. Результаты на 10 000 вызовов:
- Gemini 3.1 Flash Lite: точность 85%, стоимость $1.55
- GPT-5.4: точность 85%, стоимость $20.30
- Llama 4 Maverick: точность 80%, стоимость $1.84
- Claude Opus 4.6: точность 80%, стоимость $42.80
Flash Lite сравнялся с GPT-5.4 по точности при затратах в 13 раз ниже, в то время как Opus показал более низкую точность и стоил более чем в 27 раз дороже Flash Lite.
Почему заявленные цены вводят в заблуждение
Объявленные цены за миллион токенов не отражают реальную стоимость API. Некоторые модели генерируют тысячи токенов цепочки рассуждений, когда требуется лишь однословный ответ, увеличивая затраты в 10 раз и более. Единственный надежный подход — проводить бенчмаркинг с фактическим количеством токенов на ваших собственных данных.
Автоматический выбор модели
Пользователь указывает на маршрутизатор с открытым исходным кодом, который использует результаты бенчмаркинга и автоматически выбирает лучшую модель для каждой задачи с резервными вариантами: OpenClaw Router.
Суть
Никогда не предполагайте, что более новая или дорогая модель оптимальна. Тестируйте несколько моделей на своих данных и измеряйте реальную стоимость задачи. В данном случае переход позволил сократить счет за ИИ на 92%.
📖 Источник: r/clawdbot
👀 Смотрите также

Прекратите копировать ошибки в Claude Code — дайте ему доступ вместо этого
Не копируйте ошибки в Claude Code вручную. Вместо этого дайте ему ключи API или инструменты для самостоятельной диагностики и исправления. Автор делится практическими шаблонами для staging-баз данных, headless-браузеров и eval-сред.

Синхронизация iCloud Desktop/Documents вызывает проблемы с потерей файлов в Claude на Mac
Пользователь Mac сообщает, что включение синхронизации iCloud Drive для папок «Рабочий стол» и «Документы» приводит к созданию Claude дубликатов файлов и может вызвать безвозвратную потерю данных, включая скрытые папки /.claude, которые iCloud не резервирует.

35 дней с Claude Code: почему 3 параллельных агента — это реальный потолок
Анализ более 1 800 сессий Claude Code показывает, что узким местом является не контекст, а способность человека объединять результаты. Простая формула N ≈ 1 / (доля времени ожидания от вас) объясняет предел в 3 агента.

Skippy's Private LLM: Как я решил проблему тайм-аута под-агента OpenClaw с Ollama, вызывая Ollama напрямую
ИИ-ассистент COO компании OC обходит сломанную подсистему агентов OpenClaw, вызывая второй экземпляр Ollama напрямую через curl. Никакого шлюза, никакой блокировки event loop.