Точность обоснованных ответов модели Qwen3.5-2B, дообученной с архитектурой RAG-Engram, повысилась с 50% до 93% при контексте в 8 тысяч токенов.

Метод дообучения для улучшения производительности RAG
Разработчик создал дообученную версию Qwen3.5-2B, которая решает проблему "потери в середине" и галлюцинаций в небольших языковых моделях, когда контекстные окна насыщаются примерно 8K токенами извлечённых данных. Пользовательская архитектура, названная RAG-Engram, улучшила процент правильных ответов при 8K токенах с 50% до 93% на 14 реальных запросах.
Детали архитектуры
Система RAG-Engram представляет собой двухуровневую систему, построенную вокруг гибридной архитектуры Gated DeltaNet модели Qwen3.5-2B:
- Уровень 1 — Статическая таблица энграмм: 135K предварительно вычисленных эмбеддингов сущностей (индийские имена собственные, государственные программы, хинди-фразы, финансовые термины), хранящихся в оперативной памяти CPU. Это освобождает внимание модели от необходимости реконструировать известные сущности.
- Уровень 2 — Динамическая навигация по чанкам: Во время инференса лёгкий экстрактор spaCy (~15MB) сканирует извлечённые чанки, строит карту указателей на ключевые сущности и генерирует матрицу смещения внимания. Она добавляется к оценкам Q·K^T перед softmax на слоях 3 и 15 (полнослойные слои внимания в гибридной архитектуре — остальные 18 слоев используют Gated DeltaNet, который не имеет softmax внимания).
Этот подход указывает головкам внимания, куда смотреть, вместо того чтобы модель вслепую сканировала 8000 токенов в надежде найти ответы.
Спецификации обучения
- Базовая модель: Qwen3.5-2B-Base
- Метод: LoRA (r=16, alpha=16) через Unsloth
- Данные: 2168 примеров, извлечённых из DeepSeek V3 по наборам MS MARCO, TyDi QA, NQ Open, MLQA Hindi, IndicQA, Dolly-15K
- Время обучения: 15 минут на Modal (один GPU)
- Потери на обучении/валидации: 1.369 / 1.385 — без переобучения
Контролируемое дообучение учит модель отвечать в определённом разговорном стиле (markdown, выделение ключевых инсайтов, привязка к источникам), в то время как смещение энграмм управляет навигацией внимания в длинных контекстах.
Результаты оценки
Оценка проводилась с помощью Claude Opus 4.6 с использованием чанков результатов поиска Google, дополненных до 8K токенов:
- Обычная Qwen3.5-2B: 50% правильных ответов при 8K токенах, 14% отказов/отказов от ответа
- Drissy + RAG-Engram: 93% правильных ответов при 8K токенах, 0% отказов/отказов от ответа
Комбинация полностью устранила случаи "потери в середине". Разработчик сообщает, что весь проект от спецификации до HuggingFace занял около 2 недель и стоил меньше чашки кофе.
Доступность модели
Дообученная модель доступна как:
- Модель: drissea-ai/drissy-qwen3.5-2b
- GGUF: drissea-ai/drissy-qwen3.5-2b-GGUF
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Смысл: Go SDK для тестовых утверждений на основе LLM и структурированного извлечения текста
Sense — это Go SDK, который использует Claude для двух основных функций: оценки недетерминированного вывода в тестах с утверждениями на простом английском языке и извлечения типизированных структур из неструктурированного текста через рефлексию и принудительное использование инструментов.

Как Clawdbot координирует 6 ИИ-агентов с помощью стабильной рабочей очереди для продакшена
Команда Clawdbot разработала систему очереди задач для координации 6 ИИ-агентов (дизайн, код, маркетинг, операции) для своего магазина, управляемого искусственным интеллектом. Система включает атомарное присвоение задач, конечный автомат, логику повторных попыток с экспоненциальной задержкой, цепочки задач, отслеживание активности и демона-оркестратора.

Создание самообновляющегося руководства по стилю письма для контента с использованием ИИ
Команда, создающая платформу для извлечения голоса Noren, разработала руководство по стилю в формате Markdown на 117 строк, которое переписывается после каждой опубликованной статьи, используя Claude для соблюдения правил и запрещая слова, звучащие как ИИ, такие как 'cadence' и 'optimize'.

iai-mcp: локальный демон для постоянной памяти OpenClaw между сессиями
iai-mcp — это открытый демон, который перехватывает все разговоры OpenClaw, хранит их в трёх уровнях памяти с локальными нейронными эмбеддингами и шифрованием AES-256, а при новых сессиях подгружает релевантный контекст — точность воспроизведения >99%, время поиска <100мс, стоимость начала сессии <3к токенов.