Обсуждение на Reddit подчеркивает снижение использования токенов на 68% для ИИ-агентов благодаря изменениям в инфраструктуре.

Обсуждение на Reddit в сообществе r/LocalLLaMA подчеркивает значительное сокращение использования токенов для ИИ-агентов за счет изменений в инфраструктуре, а не улучшений модели. В посте приводятся результаты тестирования, сравнивающие использование токенов Claude Code в двух средах.
Результаты тестирования
Сравнение показало:
- Операции проверки состояния: Обычная инфраструктура требовала ~9 команд оболочки для проверок состояния, в то время как агент-ориентированная ОС с доступом к состоянию в формате JSON требовала всего 1 структурированный вызов
- Операции поиска: Семантический поиск на агент-ориентированной инфраструктуре использовал на 91% меньше токенов по сравнению с подходами grep+cat
- Общее сокращение: Снижение общего использования токенов на 68,5%
Ключевое понимание
В посте утверждается, что это сокращение происходит за счёт «устранения слоя трения между тем, что хочет знать агент, и тем, как инструменты позволяют ему спрашивать». Автор определяет это как недооценённую проблему в развертывании ИИ-агентов, отмечая, что значительная часть стоимости токенов приходится на «инфраструктурный налог», когда агенты взаимодействуют с инструментами, созданными для людей.
В посте объясняется: «Инструменты командной оболочки предполагают участие человека, который читает вывод и решает, что делать дальше. Агентам приходится имитировать это с помощью дорогостоящего в плане токенов анализа и повторных запросов. Это не неэффективность модели. Это неэффективность среды.»
Практические последствия
Для разработчиков, запускающих агентов в масштабе, в посте предлагается:
- Эту переменную стоит проверить в производственных средах
- Сокращение на 68% значительно накапливается в масштабе (например, 100 агент-часов в день)
- Помимо экономии затрат, есть преимущества в надежности: меньше команд, меньше шагов анализа и меньше точек отказа
В посте завершается вопросом, проводили ли другие подобные тесты или обнаружили ли другие факторы инфраструктуры со сравнимым эффектом.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Вместо запрета ИИ профессор составил классный контракт со студентами
Профессор естественных наук вместо полного запрета ИИ создал со студентами контракт, определяющий допустимые рамки его использования. Контракт охватывает прозрачность, указание авторства и подотчётность.

Грамматический метод соперничает или превосходит ИИ в анализе авторства.
Исследование Манчестерского университета показало, что LambdaG, грамматический метод анализа авторства, соответствует или превосходит ведущие системы искусственного интеллекта в большинстве тестовых наборов данных, предлагая при этом большую прозрачность и меньшие вычислительные затраты.

Разработчик предпочитает Qwen3.5-27B проприетарным моделям из-за её режима отказа.
Разработчик на r/LocalLLaMA сообщает, что предпочитает Qwen3.5-27B перед Gemini 3.1 Pro и GPT-5.3 Codex, потому что он отказывается от проблемных задач, вместо того чтобы генерировать потенциально опасный код, такой как неограниченные скрипты на Perl или NodeJS.

AlphaEvolve: агент на базе Gemini от DeepMind оптимизирует алгоритмы в геномике, энергосетях и цепях TPC
AlphaEvolve, кодирующий агент на базе Gemini от Google DeepMind, снизил ошибки обнаружения вариантов DeepConsensus на 30%, повысил осуществимость AC Optimal Power Flow GNN с 14% до 88% и уменьшил ошибку квантовой схемы в 10 раз.