O Qwen3.5-2B ajustado com a arquitetura RAG-Engram melhora a precisão das respostas fundamentadas de 50% para 93% em um contexto de 8K.

✍️ OpenClawRadar📅 Publicado: March 27, 2026🔗 Source
O Qwen3.5-2B ajustado com a arquitetura RAG-Engram melhora a precisão das respostas fundamentadas de 50% para 93% em um contexto de 8K.
Ad

Abordagem de ajuste fino para melhor desempenho de RAG

Um desenvolvedor criou uma versão ajustada do Qwen3.5-2B que aborda o fenômeno 'perdido no meio' e alucinações em modelos de linguagem pequenos quando as janelas de contexto estão saturadas com aproximadamente 8K tokens de dados recuperados. A arquitetura personalizada, chamada RAG-Engram, melhorou as respostas corretas em 8K tokens de 50% para 93% em 14 consultas do mundo real.

Detalhes da arquitetura

O sistema RAG-Engram é um sistema de dois níveis construído em torno da arquitetura híbrida Gated DeltaNet do Qwen3.5-2B:

  • Nível 1 — Tabela Engram Estática: 135K embeddings de entidades pré-computadas (substantivos próprios indianos, esquemas governamentais, frases em hindi, termos financeiros) armazenados na RAM da CPU. Isso libera a atenção do modelo de ter que reconstruir entidades conhecidas.
  • Nível 2 — Navegação Dinâmica de Chunks: No momento da inferência, um extrator leve spaCy (~15MB) escaneia os chunks recuperados, constrói um mapa de ponteiros de onde as entidades-chave aparecem e gera uma matriz de viés de atenção. Isso é adicionado às pontuações Q·K^T antes do softmax nas camadas 3 e 15 (as camadas de atenção completa na arquitetura híbrida — as outras 18 camadas são Gated DeltaNet que não têm atenção softmax).

A abordagem diz aos cabeçotes de atenção onde olhar, em vez de fazer o modelo escanear cegamente 8.000 tokens na esperança de encontrar respostas.

Ad

Especificações de treinamento

  • Modelo base: Qwen3.5-2B-Base
  • Método: LoRA (r=16, alpha=16) via Unsloth
  • Dados: 2.168 exemplos destilados do DeepSeek V3 em MS MARCO, TyDi QA, NQ Open, MLQA Hindi, IndicQA, Dolly-15K
  • Tempo de treinamento: 15 minutos no Modal (GPU única)
  • Perda Treino/Validação: 1.369 / 1.385 — sem overfitting

O ajuste fino supervisionado ensina o modelo a responder em um estilo conversacional específico (markdown, insights-chave em negrito, fundamentação de fonte), enquanto o viés Engram lida com a navegação da atenção em contextos longos.

Resultados da avaliação

A avaliação foi conduzida pelo Claude Opus 4.6 usando chunks de resultados de pesquisa do Google preenchidos até 8K tokens:

  • Qwen3.5-2B Vanilla: 50% de respostas corretas em 8K tokens, 14% de falhas/recusas
  • Drissy + RAG-Engram: 93% de respostas corretas em 8K tokens, 0% de falhas/recusas

A combinação eliminou completamente as falhas 'perdidas no meio'. O desenvolvedor relata que todo o projeto, da especificação ao HuggingFace, levou cerca de 2 semanas e custou menos que um café.

Disponibilidade do modelo

O modelo ajustado está disponível como:

  • Modelo: drissea-ai/drissy-qwen3.5-2b
  • GGUF: drissea-ai/drissy-qwen3.5-2b-GGUF

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Solitaire: Camada de Identidade de Código Aberto para Agentes de IA Construída com Claude Code
Tools

Solitaire: Camada de Identidade de Código Aberto para Agentes de IA Construída com Claude Code

Solitaire é uma camada de identidade de código aberto para agentes de IA que evolui por meio da interação, não por configuração estática. Foi testado em mais de 600 sessões de produção e armazena todos os dados localmente usando SQLite + JSONL, sem dependências de nuvem.

OpenClawRadar
Omnara: Execute Código Claude e Codex de Qualquer Lugar
Tools

Omnara: Execute Código Claude e Codex de Qualquer Lugar

Omnara é um IDE web e móvel que permite aos desenvolvedores executar e interagir com sessões do Claude Code e Codex de qualquer lugar, com recursos como sincronização em nuvem e um agente de voz.

OpenClawRadar
Agente de LLM Constrói um Dungeon Crawler Completo no Godot 4 Usando Feedback Visual
Tools

Agente de LLM Constrói um Dungeon Crawler Completo no Godot 4 Usando Feedback Visual

Um desenvolvedor conectou um agente LLM ao Godot 4 usando uma ferramenta MCP e deu um único prompt para construir um dungeon crawler FPS. O agente criou um protótipo completo com 3 salas, iluminação, combate, inimigos e progressão executando o jogo, tirando capturas de tela e corrigindo problemas visuais.

OpenClawRadar
LAP: Mais de 1.500 Especificações de API Compiladas para Consumo por LLMs a fim de Reduzir Alucinações do Claude
Tools

LAP: Mais de 1.500 Especificações de API Compiladas para Consumo por LLMs a fim de Reduzir Alucinações do Claude

LAP é uma ferramenta que compila mais de 1.500 especificações reais de API em um formato enxuto otimizado para LLMs, fornecendo endpoints verificados e parâmetros para evitar que agentes de programação de IA como Claude alucinem chamadas de API incorretas.

OpenClawRadar