Qwen3-0.6B INT8 local como base de incorporação para sistema de memória de IA

✍️ OpenClawRadar📅 Publicado: March 20, 2026🔗 Source
Qwen3-0.6B INT8 local como base de incorporação para sistema de memória de IA
Ad

Um desenvolvedor compartilhou sua implementação de um sistema de incorporação local usando o Qwen3-0.6B quantizado para INT8 via ONNX Runtime como base para um sistema de ciclo de vida de memória de IA que roda dentro do Claude Code.

Problema e Requisitos

O sistema aborda problemas de escalabilidade com APIs de incorporação: assistentes de codificação de IA típicos fazem centenas de chamadas de API por dia (15-25 sessões), criando latência em cada escrita e dependência de serviços externos com preços variáveis. Os requisitos incluíam vetores de 1024 dimensões, similaridade de cosseno acima de 0,75 indicando relação semântica genuína, processamento em lote para 20+ entradas e zero chamadas de API.

Seleção do Modelo e Implementação

Após testar vários modelos, o Qwen3-0.6B com 1024 dimensões forneceu melhor separação entre entradas genuinamente relacionadas e ruído estrutural (logs de sessão compartilhando formato mas não tópico) em comparação com modelos sentence-transformers.

A implementação usa ONNX Runtime com quantização INT8. O problema de inicialização a frio (carregamento do modelo de 3 segundos) foi resolvido com um servidor de incorporação persistente em localhost:52525 que carrega o modelo uma vez na inicialização do sistema. A inferência a quente alcança ~12ms por lote, aproximadamente 250x mais rápido que a inicialização a frio.

Arquitetura do Sistema

  • O servidor inicia automaticamente via um gancho de inicialização
  • Se o servidor cair, o sistema volta ao carregamento direto do ONNX (mais lento mas funcional)
  • Tudo baseado em CPU, sem necessidade de GPU
  • Script Python único, ~2.900 linhas, SQLite + ONNX
Ad

Fases do Ciclo de Vida da Memória

O sistema processa conhecimento através de 5 fases, com incorporações direcionando as fases 2 a 4:

  1. Buffer
  2. Conectar: Novas entradas são vinculadas a entradas existentes acima de 0,75 de similaridade de cosseno. Entradas isoladas desaparecem com o tempo enquanto entradas conectadas sobrevivem. Expiração baseada no isolamento, não no tempo.
  3. Consolidar: Grupos de 3+ entradas conectadas são mescladas em conhecimento comprovado por um LLM (Gemini Flash camada gratuita)
  4. Rotear: Conhecimento comprovado é roteado para o arquivo de configuração correto com base na distância de incorporação ao conteúdo existente
  5. Envelhecer

Detalhes Técnicos

  • Modelo: Qwen3-0.6B quantizado para INT8
  • Dimensões do vetor: 1024
  • Limiar de similaridade: 0,75 de similaridade de cosseno para relação semântica genuína
  • Desempenho: ~12ms por lote para inferência a quente
  • Hardware: Roda em qualquer máquina moderna apenas com CPU

O projeto é de código aberto em github.com/living0tribunal-dev/claude-memory-lifecycle com uma história de engenharia detalhada cobrindo decisões de limiar e modos de falha após processar 3.874 memórias.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Usuário do Reddit compartilha configuração do Claude Code para projetos de portfólio
Use Cases

Usuário do Reddit compartilha configuração do Claude Code para projetos de portfólio

Um desenvolvedor descreve sua transição de um fluxo de trabalho manual no Claude.ai para uma abordagem estruturada com Claude Code, usando memória baseada em arquivos e arquivos CLAUDE.md para planejamento e documentação.

OpenClawRadar
Fluxo de Trabalho de Prospecção e Engajamento no LinkedIn Criado com Claude
Use Cases

Fluxo de Trabalho de Prospecção e Engajamento no LinkedIn Criado com Claude

Um desenvolvedor criou um fluxo de trabalho de prospecção no LinkedIn usando o Claude que identifica prospects relevantes, categoriza leads, encontra postagens recentes e gerencia o engajamento por meio de curtidas, comentários e solicitações de conexão. O sistema prioriza perfis com maior engajamento e ignora os inativos.

OpenClawRadar
Memória Operacional sobre Automação: Por que os Agentes de Pequenas Empresas Precisam Lembrar
Use Cases

Memória Operacional sobre Automação: Por que os Agentes de Pequenas Empresas Precisam Lembrar

O verdadeiro valor dos agentes de IA para pequenas empresas não é a automação — é a memória operacional. Um white paper da McPhersonAI defende que os agentes devem se comportar como operadores disciplinados: lembrar os padrões, perceber desvios, preservar o contexto e destacar o que é importante.

OpenClawRadar
Sistema Automatizado de E-mail Frio Construído com OpenClaw, Neon e Resend
Use Cases

Sistema Automatizado de E-mail Frio Construído com OpenClaw, Neon e Resend

Um desenvolvedor criou um sistema totalmente automatizado de cold email usando OpenClaw como o agente de IA orquestrador, Neon para Postgres serverless e Resend para a API de e-mail. O sistema já enviou mais de 5000 e-mails e gerencia o rastreamento de leads, envio automatizado, detecção de respostas e notificações via iMessage.

OpenClawRadar