Обсуждение на Reddit подчеркивает снижение использования токенов на 68% для ИИ-агентов благодаря изменениям в инфраструктуре.

Обсуждение на Reddit в сообществе r/LocalLLaMA подчеркивает значительное сокращение использования токенов для ИИ-агентов за счет изменений в инфраструктуре, а не улучшений модели. В посте приводятся результаты тестирования, сравнивающие использование токенов Claude Code в двух средах.
Результаты тестирования
Сравнение показало:
- Операции проверки состояния: Обычная инфраструктура требовала ~9 команд оболочки для проверок состояния, в то время как агент-ориентированная ОС с доступом к состоянию в формате JSON требовала всего 1 структурированный вызов
- Операции поиска: Семантический поиск на агент-ориентированной инфраструктуре использовал на 91% меньше токенов по сравнению с подходами grep+cat
- Общее сокращение: Снижение общего использования токенов на 68,5%
Ключевое понимание
В посте утверждается, что это сокращение происходит за счёт «устранения слоя трения между тем, что хочет знать агент, и тем, как инструменты позволяют ему спрашивать». Автор определяет это как недооценённую проблему в развертывании ИИ-агентов, отмечая, что значительная часть стоимости токенов приходится на «инфраструктурный налог», когда агенты взаимодействуют с инструментами, созданными для людей.
В посте объясняется: «Инструменты командной оболочки предполагают участие человека, который читает вывод и решает, что делать дальше. Агентам приходится имитировать это с помощью дорогостоящего в плане токенов анализа и повторных запросов. Это не неэффективность модели. Это неэффективность среды.»
Практические последствия
Для разработчиков, запускающих агентов в масштабе, в посте предлагается:
- Эту переменную стоит проверить в производственных средах
- Сокращение на 68% значительно накапливается в масштабе (например, 100 агент-часов в день)
- Помимо экономии затрат, есть преимущества в надежности: меньше команд, меньше шагов анализа и меньше точек отказа
В посте завершается вопросом, проводили ли другие подобные тесты или обнаружили ли другие факторы инфраструктуры со сравнимым эффектом.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Claude Opus 4.7 добавляет поддержку изображений высокого разрешения, бюджеты задач и убирает расширенное мышление.
Claude Opus 4.7 представляет поддержку изображений высокого разрешения до 2576px/3.75MP, новую функцию бюджета задач для контроля использования токенов в агентских циклах, а также удаляет расширенные бюджеты мышления в пользу адаптивного мышления.

Cowork 可以在你不知道的情况下使用另一台机器上的 Chrome 实例
Пользователь Reddit обнаружил, что Cowork может запускать задачи браузера с помощью экземпляра Chrome на другом компьютере (Windows), связанном через расширение, помеченном как isLocal: false — это не документировано.

Anthropic удваивает лимиты скорости Claude Code, подписывает сделку по вычислениям с SpaceX
Лимиты Claude Code на пять часов удвоены для планов Pro/Max/Team/Enterprise, убрано снижение в часы пик, а для моделей Opus повышены лимиты API. SpaceX Colossus 1 добавляет более 300 МВт мощности (220 тыс. GPU NVIDIA) в течение месяца.

ИИ-модели не обладают самосознанием в отношении собственных инструментов и пользовательского интерфейса.
ИИ-модели, такие как ChatGPT и Claude, часто предоставляют неверную или устаревшую информацию о собственных функциях и интерфейсах, например, отрицают существование новых слеш-команд или описывают старые версии интерфейса, поскольку они обучены на прошлых снимках данных, в то время как продукты постоянно развиваются.