Двухмодельная архитектура сокращает потребление токенов вдвое для длинных диалогов.

✍️ OpenClawRadar📅 Опубликовано: 9 марта 2026 г.🔗 Source
Двухмодельная архитектура сокращает потребление токенов вдвое для длинных диалогов.
Ad

Система сжатия контекста для ИИ-агентов

Разработчик на r/ClaudeAI поделился решением проблемы потери контекста ИИ-агентами после сжатия диалога. Система использует двухмодельную архитектуру, в которой дешёвая маленькая модель (называемая "подсознанием") непрерывно сжимает историю диалога в фоновом режиме.

Детали архитектуры

Система состоит из четырёх слоёв:

  • Повествовательное резюме (~1 тыс. токенов)
  • Сжатые фактоиды
  • Семантически извлечённые дословные цитаты
  • Сырые недавние реплики

Основная модель ("сознание") получает курируемый контекст примерно в 35 тысяч токенов с той же плотностью информации, которая обычно требовала бы 120 тысяч токенов сырой истории. Основная модель читает одну связную временную линию и не знает о существовании системы памяти.

Ad

Результаты производительности

Разработчик смоделировал 260 реплик в различных типах диалогов. Для длительной проектной работы (начинающейся с интенсивного исследования и постепенно переходящей к быстрым обменам по мере того, как модель осваивает предметную область) система сокращает потребление токенов примерно вдвое.

Инструменты разработки

Система была построена с использованием Claude Code для симуляции и Claude.ai на этапе консультаций и исследований. Разработчик ищет других, кто пробовал направлять меньшую модель для управления контекстом большей модели или находил другие обходные пути для проблемы сжатия.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

🦀
Инструменты

PinchBench ранжирует Qwen и Nemotron на Mac Studio M3 Ultra: Nemotron Super достигает 99,2% в программировании

Разработчик прогнал шесть локальных моделей через PinchBench на Mac Studio M3 Ultra с 256 ГБ ОЗУ. Nemotron-3-super возглавил рейтинг по программированию с 99,2%, но набрал 78,2% в общем зачёте; Qwen3.6 35B A3B лидировал по общему баллу с 87,9%.

OpenClawRadar
NVIDIA анонсирует платформу агентов NemoClaw с функциями контроля конфиденциальности.
Инструменты

NVIDIA анонсирует платформу агентов NemoClaw с функциями контроля конфиденциальности.

NVIDIA запустила NemoClaw — платформу для агентов, которая позволяет пользователям устанавливать модели Nimotron и среду выполнения Open Shell одной командой, одновременно добавляя средства контроля конфиденциальности и безопасности для автономных агентов.

OpenClawRadar
AI Doomsday Toolbox v0.932 добавляет бенчмаркинг, создание наборов данных и рабочее пространство для агентов для локального ИИ на Android.
Инструменты

AI Doomsday Toolbox v0.932 добавляет бенчмаркинг, создание наборов данных и рабочее пространство для агентов для локального ИИ на Android.

AI Doomsday Toolbox v0.932 представляет бенчмаркинг для локальных LLM на устройствах Android, создатель наборов данных, который преобразует текстовые/PDF-файлы в формат Alpaca JSON, и рабочее пространство для AI-агентов с интеграцией Termux. Обновление также включает в себя наложение субтитров с помощью Whisper и встроенные инструменты управления Ollama.

OpenClawRadar
Выпущена Driftwatch V3: Инструмент мониторинга кодовой базы с поддержкой ИИ
Инструменты

Выпущена Driftwatch V3: Инструмент мониторинга кодовой базы с поддержкой ИИ

Driftwatch V3 теперь доступен как публичный репозиторий после сборки, занявшей 5-6 дней, включающей примерно 9 000 строк кода и $160 кредитов на API. Этот браузерный инструмент отслеживает проблемы в файлах markdown, помечает противоречивые инструкции и предоставляет отслеживание затрат с рекомендациями.

OpenClawRadar