Двухмодельная архитектура сокращает потребление токенов вдвое для длинных диалогов.

Система сжатия контекста для ИИ-агентов
Разработчик на r/ClaudeAI поделился решением проблемы потери контекста ИИ-агентами после сжатия диалога. Система использует двухмодельную архитектуру, в которой дешёвая маленькая модель (называемая "подсознанием") непрерывно сжимает историю диалога в фоновом режиме.
Детали архитектуры
Система состоит из четырёх слоёв:
- Повествовательное резюме (~1 тыс. токенов)
- Сжатые фактоиды
- Семантически извлечённые дословные цитаты
- Сырые недавние реплики
Основная модель ("сознание") получает курируемый контекст примерно в 35 тысяч токенов с той же плотностью информации, которая обычно требовала бы 120 тысяч токенов сырой истории. Основная модель читает одну связную временную линию и не знает о существовании системы памяти.
Результаты производительности
Разработчик смоделировал 260 реплик в различных типах диалогов. Для длительной проектной работы (начинающейся с интенсивного исследования и постепенно переходящей к быстрым обменам по мере того, как модель осваивает предметную область) система сокращает потребление токенов примерно вдвое.
Инструменты разработки
Система была построена с использованием Claude Code для симуляции и Claude.ai на этапе консультаций и исследований. Разработчик ищет других, кто пробовал направлять меньшую модель для управления контекстом большей модели или находил другие обходные пути для проблемы сжатия.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также
PinchBench ранжирует Qwen и Nemotron на Mac Studio M3 Ultra: Nemotron Super достигает 99,2% в программировании
Разработчик прогнал шесть локальных моделей через PinchBench на Mac Studio M3 Ultra с 256 ГБ ОЗУ. Nemotron-3-super возглавил рейтинг по программированию с 99,2%, но набрал 78,2% в общем зачёте; Qwen3.6 35B A3B лидировал по общему баллу с 87,9%.

NVIDIA анонсирует платформу агентов NemoClaw с функциями контроля конфиденциальности.
NVIDIA запустила NemoClaw — платформу для агентов, которая позволяет пользователям устанавливать модели Nimotron и среду выполнения Open Shell одной командой, одновременно добавляя средства контроля конфиденциальности и безопасности для автономных агентов.

AI Doomsday Toolbox v0.932 добавляет бенчмаркинг, создание наборов данных и рабочее пространство для агентов для локального ИИ на Android.
AI Doomsday Toolbox v0.932 представляет бенчмаркинг для локальных LLM на устройствах Android, создатель наборов данных, который преобразует текстовые/PDF-файлы в формат Alpaca JSON, и рабочее пространство для AI-агентов с интеграцией Termux. Обновление также включает в себя наложение субтитров с помощью Whisper и встроенные инструменты управления Ollama.

Выпущена Driftwatch V3: Инструмент мониторинга кодовой базы с поддержкой ИИ
Driftwatch V3 теперь доступен как публичный репозиторий после сборки, занявшей 5-6 дней, включающей примерно 9 000 строк кода и $160 кредитов на API. Этот браузерный инструмент отслеживает проблемы в файлах markdown, помечает противоречивые инструкции и предоставляет отслеживание затрат с рекомендациями.