Двухмодельная архитектура сокращает потребление токенов вдвое для длинных диалогов.

✍️ OpenClawRadar📅 Опубликовано: 9 марта 2026 г.🔗 Source
Двухмодельная архитектура сокращает потребление токенов вдвое для длинных диалогов.
Ad

Система сжатия контекста для ИИ-агентов

Разработчик на r/ClaudeAI поделился решением проблемы потери контекста ИИ-агентами после сжатия диалога. Система использует двухмодельную архитектуру, в которой дешёвая маленькая модель (называемая "подсознанием") непрерывно сжимает историю диалога в фоновом режиме.

Детали архитектуры

Система состоит из четырёх слоёв:

  • Повествовательное резюме (~1 тыс. токенов)
  • Сжатые фактоиды
  • Семантически извлечённые дословные цитаты
  • Сырые недавние реплики

Основная модель ("сознание") получает курируемый контекст примерно в 35 тысяч токенов с той же плотностью информации, которая обычно требовала бы 120 тысяч токенов сырой истории. Основная модель читает одну связную временную линию и не знает о существовании системы памяти.

Ad

Результаты производительности

Разработчик смоделировал 260 реплик в различных типах диалогов. Для длительной проектной работы (начинающейся с интенсивного исследования и постепенно переходящей к быстрым обменам по мере того, как модель осваивает предметную область) система сокращает потребление токенов примерно вдвое.

Инструменты разработки

Система была построена с использованием Claude Code для симуляции и Claude.ai на этапе консультаций и исследований. Разработчик ищет других, кто пробовал направлять меньшую модель для управления контекстом большей модели или находил другие обходные пути для проблемы сжатия.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

Выпущен навык написания книг OpenClaw Multi-Agent
Инструменты

Выпущен навык написания книг OpenClaw Multi-Agent

Многоагентная система для написания книг, построенная на OpenClaw, была выпущена в виде навыка. Она включает подключение DeepWiki через MCP, генерацию иллюстраций с помощью GLM, оценку бюджета и ревизию на уровне глав. Две главы книги «OpenClaw Paradigm Book» были обновлены с помощью этого инструмента.

OpenClawRadar
Routerly: Самостоятельно размещаемый шлюз для LLM с политиками маршрутизации в реальном времени и контролем бюджета
Инструменты

Routerly: Самостоятельно размещаемый шлюз для LLM с политиками маршрутизации в реальном времени и контролем бюджета

Routerly — это бесплатный, открытый, саморазмещаемый шлюз для LLM, который обеспечивает выбор модели во время выполнения на основе политик маршрутизации, таких как самая дешёвая, самая быстрая или самая способная, а также лимиты бюджета на уровне проекта с отслеживанием затрат на токен. Он совместим с OpenAI для простой интеграции с такими инструментами, как Cursor, LangChain и Open WebUI.

OpenClawRadar
Подчинённый агент Claude Code, настроенный скептически к планам, выявляет уязвимости безопасности в сгенерированных планах.
Инструменты

Подчинённый агент Claude Code, настроенный скептически к планам, выявляет уязвимости безопасности в сгенерированных планах.

Разработчик обнаружил скептически настроенный суб-агент Claude Code, который выявляет пробелы и проблемы в планах разработки, сгенерированных ИИ, особенно находя проблемы безопасности, которые изначально не были очевидны. Этот агент работает вместе с ранее известным суб-агентом security-sheriff для повышения качества планов.

OpenClawRadar
VibeAround: Локальный демон подключает агентов программирования к Telegram и Discord
Инструменты

VibeAround: Локальный демон подключает агентов программирования к Telegram и Discord

VibeAround — это локальный демон, который подключает кодирующие агенты, такие как Claude Code, Gemini CLI и Codex, к платформам мгновенных сообщений, включая Telegram и Discord. Инструмент поддерживает передачу сессий с кодами для продолжения бесед на разных устройствах.

OpenClawRadar