O Qwen3.5-2B ajustado com a arquitetura RAG-Engram melhora a precisão das respostas fundamentadas de 50% para 93% em um contexto de 8K.

Abordagem de ajuste fino para melhor desempenho de RAG
Um desenvolvedor criou uma versão ajustada do Qwen3.5-2B que aborda o fenômeno 'perdido no meio' e alucinações em modelos de linguagem pequenos quando as janelas de contexto estão saturadas com aproximadamente 8K tokens de dados recuperados. A arquitetura personalizada, chamada RAG-Engram, melhorou as respostas corretas em 8K tokens de 50% para 93% em 14 consultas do mundo real.
Detalhes da arquitetura
O sistema RAG-Engram é um sistema de dois níveis construído em torno da arquitetura híbrida Gated DeltaNet do Qwen3.5-2B:
- Nível 1 — Tabela Engram Estática: 135K embeddings de entidades pré-computadas (substantivos próprios indianos, esquemas governamentais, frases em hindi, termos financeiros) armazenados na RAM da CPU. Isso libera a atenção do modelo de ter que reconstruir entidades conhecidas.
- Nível 2 — Navegação Dinâmica de Chunks: No momento da inferência, um extrator leve spaCy (~15MB) escaneia os chunks recuperados, constrói um mapa de ponteiros de onde as entidades-chave aparecem e gera uma matriz de viés de atenção. Isso é adicionado às pontuações Q·K^T antes do softmax nas camadas 3 e 15 (as camadas de atenção completa na arquitetura híbrida — as outras 18 camadas são Gated DeltaNet que não têm atenção softmax).
A abordagem diz aos cabeçotes de atenção onde olhar, em vez de fazer o modelo escanear cegamente 8.000 tokens na esperança de encontrar respostas.
Especificações de treinamento
- Modelo base: Qwen3.5-2B-Base
- Método: LoRA (r=16, alpha=16) via Unsloth
- Dados: 2.168 exemplos destilados do DeepSeek V3 em MS MARCO, TyDi QA, NQ Open, MLQA Hindi, IndicQA, Dolly-15K
- Tempo de treinamento: 15 minutos no Modal (GPU única)
- Perda Treino/Validação: 1.369 / 1.385 — sem overfitting
O ajuste fino supervisionado ensina o modelo a responder em um estilo conversacional específico (markdown, insights-chave em negrito, fundamentação de fonte), enquanto o viés Engram lida com a navegação da atenção em contextos longos.
Resultados da avaliação
A avaliação foi conduzida pelo Claude Opus 4.6 usando chunks de resultados de pesquisa do Google preenchidos até 8K tokens:
- Qwen3.5-2B Vanilla: 50% de respostas corretas em 8K tokens, 14% de falhas/recusas
- Drissy + RAG-Engram: 93% de respostas corretas em 8K tokens, 0% de falhas/recusas
A combinação eliminou completamente as falhas 'perdidas no meio'. O desenvolvedor relata que todo o projeto, da especificação ao HuggingFace, levou cerca de 2 semanas e custou menos que um café.
Disponibilidade do modelo
O modelo ajustado está disponível como:
- Modelo: drissea-ai/drissy-qwen3.5-2b
- GGUF: drissea-ai/drissy-qwen3.5-2b-GGUF
📖 Read the full source: r/LocalLLaMA
👀 See Also

Solitaire: Camada de Identidade de Código Aberto para Agentes de IA Construída com Claude Code
Solitaire é uma camada de identidade de código aberto para agentes de IA que evolui por meio da interação, não por configuração estática. Foi testado em mais de 600 sessões de produção e armazena todos os dados localmente usando SQLite + JSONL, sem dependências de nuvem.

Omnara: Execute Código Claude e Codex de Qualquer Lugar
Omnara é um IDE web e móvel que permite aos desenvolvedores executar e interagir com sessões do Claude Code e Codex de qualquer lugar, com recursos como sincronização em nuvem e um agente de voz.

Agente de LLM Constrói um Dungeon Crawler Completo no Godot 4 Usando Feedback Visual
Um desenvolvedor conectou um agente LLM ao Godot 4 usando uma ferramenta MCP e deu um único prompt para construir um dungeon crawler FPS. O agente criou um protótipo completo com 3 salas, iluminação, combate, inimigos e progressão executando o jogo, tirando capturas de tela e corrigindo problemas visuais.

LAP: Mais de 1.500 Especificações de API Compiladas para Consumo por LLMs a fim de Reduzir Alucinações do Claude
LAP é uma ferramenta que compila mais de 1.500 especificações reais de API em um formato enxuto otimizado para LLMs, fornecendo endpoints verificados e parâmetros para evitar que agentes de programação de IA como Claude alucinem chamadas de API incorretas.