O Qwen3.5-2B ajustado com a arquitetura RAG-Engram melhora a precisão das respostas fundamentadas de 50% para 93% em um contexto de 8K.

✍️ OpenClawRadar📅 Publicado: March 27, 2026🔗 Source
O Qwen3.5-2B ajustado com a arquitetura RAG-Engram melhora a precisão das respostas fundamentadas de 50% para 93% em um contexto de 8K.
Ad

Abordagem de ajuste fino para melhor desempenho de RAG

Um desenvolvedor criou uma versão ajustada do Qwen3.5-2B que aborda o fenômeno 'perdido no meio' e alucinações em modelos de linguagem pequenos quando as janelas de contexto estão saturadas com aproximadamente 8K tokens de dados recuperados. A arquitetura personalizada, chamada RAG-Engram, melhorou as respostas corretas em 8K tokens de 50% para 93% em 14 consultas do mundo real.

Detalhes da arquitetura

O sistema RAG-Engram é um sistema de dois níveis construído em torno da arquitetura híbrida Gated DeltaNet do Qwen3.5-2B:

  • Nível 1 — Tabela Engram Estática: 135K embeddings de entidades pré-computadas (substantivos próprios indianos, esquemas governamentais, frases em hindi, termos financeiros) armazenados na RAM da CPU. Isso libera a atenção do modelo de ter que reconstruir entidades conhecidas.
  • Nível 2 — Navegação Dinâmica de Chunks: No momento da inferência, um extrator leve spaCy (~15MB) escaneia os chunks recuperados, constrói um mapa de ponteiros de onde as entidades-chave aparecem e gera uma matriz de viés de atenção. Isso é adicionado às pontuações Q·K^T antes do softmax nas camadas 3 e 15 (as camadas de atenção completa na arquitetura híbrida — as outras 18 camadas são Gated DeltaNet que não têm atenção softmax).

A abordagem diz aos cabeçotes de atenção onde olhar, em vez de fazer o modelo escanear cegamente 8.000 tokens na esperança de encontrar respostas.

Ad

Especificações de treinamento

  • Modelo base: Qwen3.5-2B-Base
  • Método: LoRA (r=16, alpha=16) via Unsloth
  • Dados: 2.168 exemplos destilados do DeepSeek V3 em MS MARCO, TyDi QA, NQ Open, MLQA Hindi, IndicQA, Dolly-15K
  • Tempo de treinamento: 15 minutos no Modal (GPU única)
  • Perda Treino/Validação: 1.369 / 1.385 — sem overfitting

O ajuste fino supervisionado ensina o modelo a responder em um estilo conversacional específico (markdown, insights-chave em negrito, fundamentação de fonte), enquanto o viés Engram lida com a navegação da atenção em contextos longos.

Resultados da avaliação

A avaliação foi conduzida pelo Claude Opus 4.6 usando chunks de resultados de pesquisa do Google preenchidos até 8K tokens:

  • Qwen3.5-2B Vanilla: 50% de respostas corretas em 8K tokens, 14% de falhas/recusas
  • Drissy + RAG-Engram: 93% de respostas corretas em 8K tokens, 0% de falhas/recusas

A combinação eliminou completamente as falhas 'perdidas no meio'. O desenvolvedor relata que todo o projeto, da especificação ao HuggingFace, levou cerca de 2 semanas e custou menos que um café.

Disponibilidade do modelo

O modelo ajustado está disponível como:

  • Modelo: drissea-ai/drissy-qwen3.5-2b
  • GGUF: drissea-ai/drissy-qwen3.5-2b-GGUF

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Steerling-8B: Um Modelo de Linguagem Interpretável com Atribuição em Nível de Token
Tools

Steerling-8B: Um Modelo de Linguagem Interpretável com Atribuição em Nível de Token

A Guide Labs lançou o Steerling-8B, um modelo de linguagem de 8 bilhões de parâmetros treinado em 1,35 trilhão de tokens que pode rastrear qualquer token gerado até o contexto de entrada, conceitos compreensíveis para humanos e fontes de dados de treinamento. O modelo alcança desempenho competitivo com modelos treinados em 2 a 7 vezes mais dados.

OpenClawRadar
O Claude Code Container Oferece Isolamento Docker Sem Configuração para o Claude Code
Tools

O Claude Code Container Oferece Isolamento Docker Sem Configuração para o Claude Code

Claude Code Container (ccc) é uma ferramenta gratuita e de código aberto que cria automaticamente contêineres Docker por projeto para o Claude Code com isolamento completo e configuração zero. Ele encaminha variáveis de ambiente do host, monta chaves SSH, fornece proxy transparente para localhost e inclui Chromium com chrome-devtools MCP pré-configurado.

OpenClawRadar
Claude IDE Bridge: Ferramenta de código aberto dá ao Claude AI acesso direto ao seu editor de código
Tools

Claude IDE Bridge: Ferramenta de código aberto dá ao Claude AI acesso direto ao seu editor de código

Claude IDE Bridge é uma ferramenta de código aberto licenciada pelo MIT que conecta o Claude AI diretamente ao seu editor de código, permitindo que ele visualize arquivos abertos, alterações não salvas e erros em tempo real, em vez de trabalhar com trechos de código colados. A ferramenta atualmente funciona com VS Code e Windsurf.

OpenClawRadar
Construindo um servidor LLM local de $6,4k: Análise de TCO vs Custos de API
Tools

Construindo um servidor LLM local de $6,4k: Análise de TCO vs Custos de API

Um desenvolvedor compartilha uma análise detalhada do custo total de propriedade de um servidor local com 4x MI100 rodando llama.cpp, comparado a equivalentes de API, incluindo planos de codificação da OpenAI e Z.AI.

OpenClawRadar