Двухмодельная архитектура сокращает потребление токенов вдвое для длинных диалогов.

Система сжатия контекста для ИИ-агентов
Разработчик на r/ClaudeAI поделился решением проблемы потери контекста ИИ-агентами после сжатия диалога. Система использует двухмодельную архитектуру, в которой дешёвая маленькая модель (называемая "подсознанием") непрерывно сжимает историю диалога в фоновом режиме.
Детали архитектуры
Система состоит из четырёх слоёв:
- Повествовательное резюме (~1 тыс. токенов)
- Сжатые фактоиды
- Семантически извлечённые дословные цитаты
- Сырые недавние реплики
Основная модель ("сознание") получает курируемый контекст примерно в 35 тысяч токенов с той же плотностью информации, которая обычно требовала бы 120 тысяч токенов сырой истории. Основная модель читает одну связную временную линию и не знает о существовании системы памяти.
Результаты производительности
Разработчик смоделировал 260 реплик в различных типах диалогов. Для длительной проектной работы (начинающейся с интенсивного исследования и постепенно переходящей к быстрым обменам по мере того, как модель осваивает предметную область) система сокращает потребление токенов примерно вдвое.
Инструменты разработки
Система была построена с использованием Claude Code для симуляции и Claude.ai на этапе консультаций и исследований. Разработчик ищет других, кто пробовал направлять меньшую модель для управления контекстом большей модели или находил другие обходные пути для проблемы сжатия.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Выпущен навык написания книг OpenClaw Multi-Agent
Многоагентная система для написания книг, построенная на OpenClaw, была выпущена в виде навыка. Она включает подключение DeepWiki через MCP, генерацию иллюстраций с помощью GLM, оценку бюджета и ревизию на уровне глав. Две главы книги «OpenClaw Paradigm Book» были обновлены с помощью этого инструмента.

Routerly: Самостоятельно размещаемый шлюз для LLM с политиками маршрутизации в реальном времени и контролем бюджета
Routerly — это бесплатный, открытый, саморазмещаемый шлюз для LLM, который обеспечивает выбор модели во время выполнения на основе политик маршрутизации, таких как самая дешёвая, самая быстрая или самая способная, а также лимиты бюджета на уровне проекта с отслеживанием затрат на токен. Он совместим с OpenAI для простой интеграции с такими инструментами, как Cursor, LangChain и Open WebUI.

Подчинённый агент Claude Code, настроенный скептически к планам, выявляет уязвимости безопасности в сгенерированных планах.
Разработчик обнаружил скептически настроенный суб-агент Claude Code, который выявляет пробелы и проблемы в планах разработки, сгенерированных ИИ, особенно находя проблемы безопасности, которые изначально не были очевидны. Этот агент работает вместе с ранее известным суб-агентом security-sheriff для повышения качества планов.

VibeAround: Локальный демон подключает агентов программирования к Telegram и Discord
VibeAround — это локальный демон, который подключает кодирующие агенты, такие как Claude Code, Gemini CLI и Codex, к платформам мгновенных сообщений, включая Telegram и Discord. Инструмент поддерживает передачу сессий с кодами для продолжения бесед на разных устройствах.