Анализ Совета LLM выявляет практические стратегии оптимизации токенов кода Claude.

Проблема и настройка эксперимента
Разработчик, ежедневно сталкивавшийся с лимитами использования Claude Code, провёл эксперимент с помощью LLM Council (https://github.com/karpathy/llm-council). Настройка включала 5 различных персонажей, которые были вынуждены критиковать, оспаривать и улучшать решения, после чего следовал раунд взаимной оценки.
Ключевые выводы
Анализ показал, что основным потребителем токенов была не сложность задач, а использование "режима мышления" по умолчанию. Только это сжигало токены почти как у Opus.
Практические привычки оптимизации
- Отключайте расширенное мышление по умолчанию
- /clear после каждого коммита git (без исключений)
- Прекратите писать промпты "да / продолжай"
- /compact примерно каждые 40 сообщений
- Держите CLAUDE.md минимальным, иначе платите налог каждый сеанс
Ментальный сдвиг и результаты
Основное понимание: Перестаньте воспринимать интеллект как нечто само собой разумеющееся. Относитесь к нему как к ресурсу, который вы намеренно задействуете. Этот сдвиг позволяет:
- Мгновенную экономию 30-50% токенов
- Возможность реально использовать Opus без страха
- Предсказуемый ежедневный рабочий процесс вместо случайных превышений лимита
Совет подчеркнул одно правило: Если вы не отслеживаете /cost, вы не оптимизируете... вы гадаете.
Итог
При полной реализации плана действий:
- Сокращение использования токенов на ~60-70%
- Такое же или лучшее качество вывода
- Opus становится пригодным для высокоценной работы
Разработчик отметил, что этот подход был эффективнее любого отдельного трюка с промптами.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Gemma 4 26B против Qwen 3.5 27B: Бенчмарк рабочих процессов для локального бизнеса на RTX 4090
Разработчик протестировал Gemma 4 26B и Qwen 3.5 27B на рабочей станции с RTX 4090, выполнив 18 реальных задач бизнес-оператора. Gemma победила со счётом 13-5, показав более высокую скорость и лучшую дисциплину в ежедневной исполнительной работе, в то время как Qwen преуспела в более широком стратегическом мышлении.

skillcheck: линтер для файлов SKILL.md, который выявляет проблемы совместимости между агентами
skillcheck — это инструмент на Python, который проверяет файлы SKILL.md на соответствие спецификации agentskills.io. Он обладает уникальными функциями, включая оценку качества описания, предупреждения о полях, работающих только в Claude, и проверку ссылок на файлы, которые отсутствуют в существующих валидаторах.

Oodle.ai запускает Observability для агентов по цене $10 за миллион трейсов
Oodle.ai предлагает $10 за миллион трейсов агентов с задержкой запросов P99 менее секунды, храня 100% трейсов без дискретизации в столбцовом хранилище на базе S3.
Cue AI использует Gemma 4 для ускорения голосового набора: снижение задержки на 44%, рост использования на 30%
Cue AI заменил облачный этап полировки текста на Google DeepMind Gemma 4 E4B, работающую локально через Ollama, снизив медианную задержку с 876 мс до 488 мс и увеличив использование диктовки на 30%.