Project Headroom: инструмент инженера Netflix с открытым исходным кодом сокращает затраты на токены ИИ на 90%

Старший инженер Netflix Теджас Чопра опубликовал в открытом доступе Project Headroom — локальный прокси, который сжимает содержимое окна контекста до того, как оно попадет в LLM. По предварительным оценкам, до 90% токенов избыточны — и с января 2026 года инструмент сэкономил пользователям в сумме $700 000 при обработке 200 миллиардов токенов.
Как это работает
Headroom запускается как прокси на порту 8787 на машине разработчика. Вы оборачиваете свой LLM CLI командой headroom wrap, например:
headroom wrap codexОн анализирует все входные данные — историю диалогов, логи, выводы инструментов, файлы, фрагменты RAG — и применяет сжатие без потерь, обратимое. Лучше всего он сокращает:
- Серверные логи: удаляется 90%
- Выводы MCP-инструментов: 70% избыточного JSON
- Выводы баз данных: повторяющиеся схемы
- Деревья файлов: повторяющиеся метаданные
Созданный на Python и Node, Headroom имеет текущую версию v0.22 с 2000 звездами на GitHub и 120 форками.
Почему это важно
Чопра вдохновился счетом от Claude Sonnet на $287 за рутинную отладку и рефакторинг. Он выяснил, что причина — не его инструкции, а шаблонный код, JSON-схемы и машинные метаданные. «Это не проза. Это не творческое письмо. Это сжимаемые данные, замаскированные под текст», — написал он.
По умолчанию TTL кэша префиксов Claude составляет всего пять минут; после бездействия весь контекст обновляется. Можно установить более длинный TTL, но платить вдвое за запись, чтобы сэкономить 90% на чтении. Headroom обходит эти компромиссы.
Альтернативы
Существуют и другие инструменты: RTK (Rust Token Killer) обрезает многословный вывод команд, а LeanCTX — вариант. Коммерческие варианты, такие как Token Company (финансируется Y Combinator), предлагают сжатие как услугу. Но ключевая особенность Headroom — обратимое сжатие и встраивание в рабочий процесс разработчика.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Nelson v2.2.3 релиз: мульти-агентная координация для Claude Code и тест дискретно-событийного моделирования
Релиз Nelson v2.2.3 включает навык многокомпонентной координации для Claude Code, использующий военно-морскую метафору. Бенчмарк из 13 конфигураций показывает, что opus-4-7 с размышлением доминирует; выбор навыка дает меньшее изменение.

Напоминание: Сервер MCP для постоянной памяти Claude Code
Recall — это сервер MCP с открытым исходным кодом, который предоставляет Claude Code постоянную память между сессиями с помощью семантического поиска на основе эмбеддингов. Он включает четыре хука жизненного цикла: session-start, observe, pre-compact и session-end.

Werld: Открытая симуляция искусственной жизни с эволюционирующими нейронными сетями
Werld — это симуляция искусственной жизни в реальном времени, где агенты с нейронными сетями NEAT эволюционируют собственную нейронную архитектуру, сенсорную обработку и поведение без жёстко заданных правил или функций вознаграждения. Симуляция начинается с 30 агентов на графе малого мира Уоттса-Строгаца с 64 сенсорными каналами, 7 непрерывными моторными функциями и 29 наследуемыми признаками генома.

Навык OpenClaw для поиска и воспроизведения Apple Music опубликован на ClawHub.
Навык apple-music-play, опубликованный на ClawHub, позволяет искать в онлайн-каталоге Apple Music и воспроизводить треки напрямую в приложении Music на macOS, не требуя наличия песен в локальной библиотеке.