Точность обоснованных ответов модели Qwen3.5-2B, дообученной с архитектурой RAG-Engram, повысилась с 50% до 93% при контексте в 8 тысяч токенов.

✍️ OpenClawRadar📅 Опубликовано: 27 марта 2026 г.🔗 Source
Точность обоснованных ответов модели Qwen3.5-2B, дообученной с архитектурой RAG-Engram, повысилась с 50% до 93% при контексте в 8 тысяч токенов.
Ad

Метод дообучения для улучшения производительности RAG

Разработчик создал дообученную версию Qwen3.5-2B, которая решает проблему "потери в середине" и галлюцинаций в небольших языковых моделях, когда контекстные окна насыщаются примерно 8K токенами извлечённых данных. Пользовательская архитектура, названная RAG-Engram, улучшила процент правильных ответов при 8K токенах с 50% до 93% на 14 реальных запросах.

Детали архитектуры

Система RAG-Engram представляет собой двухуровневую систему, построенную вокруг гибридной архитектуры Gated DeltaNet модели Qwen3.5-2B:

  • Уровень 1 — Статическая таблица энграмм: 135K предварительно вычисленных эмбеддингов сущностей (индийские имена собственные, государственные программы, хинди-фразы, финансовые термины), хранящихся в оперативной памяти CPU. Это освобождает внимание модели от необходимости реконструировать известные сущности.
  • Уровень 2 — Динамическая навигация по чанкам: Во время инференса лёгкий экстрактор spaCy (~15MB) сканирует извлечённые чанки, строит карту указателей на ключевые сущности и генерирует матрицу смещения внимания. Она добавляется к оценкам Q·K^T перед softmax на слоях 3 и 15 (полнослойные слои внимания в гибридной архитектуре — остальные 18 слоев используют Gated DeltaNet, который не имеет softmax внимания).

Этот подход указывает головкам внимания, куда смотреть, вместо того чтобы модель вслепую сканировала 8000 токенов в надежде найти ответы.

Ad

Спецификации обучения

  • Базовая модель: Qwen3.5-2B-Base
  • Метод: LoRA (r=16, alpha=16) через Unsloth
  • Данные: 2168 примеров, извлечённых из DeepSeek V3 по наборам MS MARCO, TyDi QA, NQ Open, MLQA Hindi, IndicQA, Dolly-15K
  • Время обучения: 15 минут на Modal (один GPU)
  • Потери на обучении/валидации: 1.369 / 1.385 — без переобучения

Контролируемое дообучение учит модель отвечать в определённом разговорном стиле (markdown, выделение ключевых инсайтов, привязка к источникам), в то время как смещение энграмм управляет навигацией внимания в длинных контекстах.

Результаты оценки

Оценка проводилась с помощью Claude Opus 4.6 с использованием чанков результатов поиска Google, дополненных до 8K токенов:

  • Обычная Qwen3.5-2B: 50% правильных ответов при 8K токенах, 14% отказов/отказов от ответа
  • Drissy + RAG-Engram: 93% правильных ответов при 8K токенах, 0% отказов/отказов от ответа

Комбинация полностью устранила случаи "потери в середине". Разработчик сообщает, что весь проект от спецификации до HuggingFace занял около 2 недель и стоил меньше чашки кофе.

Доступность модели

Дообученная модель доступна как:

  • Модель: drissea-ai/drissy-qwen3.5-2b
  • GGUF: drissea-ai/drissy-qwen3.5-2b-GGUF

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Spec27: Валидация на основе спецификаций для ИИ-агентов – тестирование на уровне API без внутреннего доступа
Инструменты

Spec27: Валидация на основе спецификаций для ИИ-агентов – тестирование на уровне API без внутреннего доступа

Spec27 — это новый инструмент от Safe Intelligence для проверки AI-агентов на основе спецификаций. Он тестирует поведение агента извне, выполняя adversarial и робастные проверки основных интерфейсов без необходимости в SDK, шлюзах или внутренних трейсах.

OpenClawRadar
Исследование Aura: Локальный инструмент компилирует документы в навигационную вики с постоянной памятью для ИИ
Инструменты

Исследование Aura: Локальный инструмент компилирует документы в навигационную вики с постоянной памятью для ИИ

Aura Research — это инструмент с открытым исходным кодом, который обрабатывает исходные документы (PDF-файлы, статьи, заметки, код, более 60 форматов) и преобразует их в структурированную вики на языке markdown со связанными статьями, страницами понятий и главным указателем. Всё сжимается в архив .aura, оптимизированный для поиска с помощью RAG, и работает полностью локально, без передачи данных за пределы вашего компьютера.

OpenClawRadar
ToolLoop: Открытая платформа для создания инструментов в стиле Claude с любыми LLM
Инструменты

ToolLoop: Открытая платформа для создания инструментов в стиле Claude с любыми LLM

ToolLoop — это фреймворк с открытым исходным кодом на Python, включающий 11 инструментов для работы с файлами, поиска кода, доступа к оболочке и под-агентов, который работает с любой LLM через LiteLLM. Фреймворк объёмом 2700 строк позволяет переключать модели в середине диалога, сохраняя общий контекст.

OpenClawRadar
Google Research представляет TurboQuant для сжатия моделей искусственного интеллекта
Инструменты

Google Research представляет TurboQuant для сжатия моделей искусственного интеллекта

Google Research представила TurboQuant — алгоритм сжатия, который уменьшает размер моделей ИИ без потери точности. Он решает проблему накладных расходов памяти при векторном квантовании и улучшает производительность кэша ключ-значение.

OpenClawRadar