Точность обоснованных ответов модели Qwen3.5-2B, дообученной с архитектурой RAG-Engram, повысилась с 50% до 93% при контексте в 8 тысяч токенов.

Метод дообучения для улучшения производительности RAG
Разработчик создал дообученную версию Qwen3.5-2B, которая решает проблему "потери в середине" и галлюцинаций в небольших языковых моделях, когда контекстные окна насыщаются примерно 8K токенами извлечённых данных. Пользовательская архитектура, названная RAG-Engram, улучшила процент правильных ответов при 8K токенах с 50% до 93% на 14 реальных запросах.
Детали архитектуры
Система RAG-Engram представляет собой двухуровневую систему, построенную вокруг гибридной архитектуры Gated DeltaNet модели Qwen3.5-2B:
- Уровень 1 — Статическая таблица энграмм: 135K предварительно вычисленных эмбеддингов сущностей (индийские имена собственные, государственные программы, хинди-фразы, финансовые термины), хранящихся в оперативной памяти CPU. Это освобождает внимание модели от необходимости реконструировать известные сущности.
- Уровень 2 — Динамическая навигация по чанкам: Во время инференса лёгкий экстрактор spaCy (~15MB) сканирует извлечённые чанки, строит карту указателей на ключевые сущности и генерирует матрицу смещения внимания. Она добавляется к оценкам Q·K^T перед softmax на слоях 3 и 15 (полнослойные слои внимания в гибридной архитектуре — остальные 18 слоев используют Gated DeltaNet, который не имеет softmax внимания).
Этот подход указывает головкам внимания, куда смотреть, вместо того чтобы модель вслепую сканировала 8000 токенов в надежде найти ответы.
Спецификации обучения
- Базовая модель: Qwen3.5-2B-Base
- Метод: LoRA (r=16, alpha=16) через Unsloth
- Данные: 2168 примеров, извлечённых из DeepSeek V3 по наборам MS MARCO, TyDi QA, NQ Open, MLQA Hindi, IndicQA, Dolly-15K
- Время обучения: 15 минут на Modal (один GPU)
- Потери на обучении/валидации: 1.369 / 1.385 — без переобучения
Контролируемое дообучение учит модель отвечать в определённом разговорном стиле (markdown, выделение ключевых инсайтов, привязка к источникам), в то время как смещение энграмм управляет навигацией внимания в длинных контекстах.
Результаты оценки
Оценка проводилась с помощью Claude Opus 4.6 с использованием чанков результатов поиска Google, дополненных до 8K токенов:
- Обычная Qwen3.5-2B: 50% правильных ответов при 8K токенах, 14% отказов/отказов от ответа
- Drissy + RAG-Engram: 93% правильных ответов при 8K токенах, 0% отказов/отказов от ответа
Комбинация полностью устранила случаи "потери в середине". Разработчик сообщает, что весь проект от спецификации до HuggingFace занял около 2 недель и стоил меньше чашки кофе.
Доступность модели
Дообученная модель доступна как:
- Модель: drissea-ai/drissy-qwen3.5-2b
- GGUF: drissea-ai/drissy-qwen3.5-2b-GGUF
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Spec27: Валидация на основе спецификаций для ИИ-агентов – тестирование на уровне API без внутреннего доступа
Spec27 — это новый инструмент от Safe Intelligence для проверки AI-агентов на основе спецификаций. Он тестирует поведение агента извне, выполняя adversarial и робастные проверки основных интерфейсов без необходимости в SDK, шлюзах или внутренних трейсах.

Исследование Aura: Локальный инструмент компилирует документы в навигационную вики с постоянной памятью для ИИ
Aura Research — это инструмент с открытым исходным кодом, который обрабатывает исходные документы (PDF-файлы, статьи, заметки, код, более 60 форматов) и преобразует их в структурированную вики на языке markdown со связанными статьями, страницами понятий и главным указателем. Всё сжимается в архив .aura, оптимизированный для поиска с помощью RAG, и работает полностью локально, без передачи данных за пределы вашего компьютера.

ToolLoop: Открытая платформа для создания инструментов в стиле Claude с любыми LLM
ToolLoop — это фреймворк с открытым исходным кодом на Python, включающий 11 инструментов для работы с файлами, поиска кода, доступа к оболочке и под-агентов, который работает с любой LLM через LiteLLM. Фреймворк объёмом 2700 строк позволяет переключать модели в середине диалога, сохраняя общий контекст.

Google Research представляет TurboQuant для сжатия моделей искусственного интеллекта
Google Research представила TurboQuant — алгоритм сжатия, который уменьшает размер моделей ИИ без потери точности. Он решает проблему накладных расходов памяти при векторном квантовании и улучшает производительность кэша ключ-значение.