O FOMOE Permite a Inferência do Modelo Qwen3.5 de 397B em Hardware de Desktop de US$ 2.100

✍️ OpenClawRadar📅 Publicado: March 29, 2026🔗 Source
O FOMOE Permite a Inferência do Modelo Qwen3.5 de 397B em Hardware de Desktop de US$ 2.100
Ad

O que o FOMOE Resolve

Modelos grandes de Mistura de Especialistas (MoE) exigem centenas de GBs de armazenamento de pesos, tipicamente em memória flash como NVMe. Durante a inferência, apenas uma pequena fração dos pesos é necessária, mas não é possível prever quais deles antecipadamente. Padrões de acesso aleatório tornam as latências da flash muito altas para inferência prática em hardware de consumo.

Como o FOMOE Funciona

O sistema torna a maioria das leituras de pesos de especialistas desnecessárias através de várias técnicas:

  • Armazena os especialistas mais comuns na memória da GPU (VRAM) com um cache de especialistas rolante atualizado
  • Atinge taxa de acerto de 60% na VRAM com inicialização aquecida, reduzindo leituras NVMe para 28% (12% servidos da DRAM)
  • Usa arquitetura ping-pong de GPU dupla para sobrepor carregamento de pesos e computação
  • Implementa Roteamento Consciente de Cache (CAR) - quando dois especialistas pontuam de forma similar, o modelo escolhe o próximo especialista com melhor pontuação já no cache VRAM ou DRAM dentro de um limite aceitável
Ad

Resultados de Desempenho

  • Velocidade de inferência de 5-9 tokens/segundo para o modelo de 397B parâmetros do Qwen3.5
  • Leituras NVMe reduzidas para 7% com CAR ativado
  • Apenas 3,5% de queda na perplexidade medida no wikitext
  • Requisitos de hardware: duas GPUs de US$ 500, 32 GB de RAM, uma unidade NVMe
  • Usa quantização Q4_K_M

A implementação consiste em aproximadamente 15.000 linhas de código C/HIP dirigido por Claude com forte orientação humana.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Coleção Curada de Recursos OpenClaw de Código Aberto Divulgada
Tools

Coleção Curada de Recursos OpenClaw de Código Aberto Divulgada

Descubra uma nova coleção de recursos OpenClaw de código aberto, organizada pela comunidade para aprimorar o desenvolvimento e a colaboração em IA.

OpenClawRadar
VibeAround: Daemon Local Conecta Agentes de Codificação ao Telegram e Discord
Tools

VibeAround: Daemon Local Conecta Agentes de Codificação ao Telegram e Discord

VibeAround é um daemon local que conecta agentes de programação como Claude Code, Gemini CLI e Codex a plataformas de mensagens instantâneas, incluindo Telegram e Discord. A ferramenta possui transferência de sessão com códigos de retomada para continuar conversas entre dispositivos.

OpenClawRadar
Solicitação de Recurso do Claude Desktop: Gancho de Início de Sessão para Inicialização Automática
Tools

Solicitação de Recurso do Claude Desktop: Gancho de Início de Sessão para Inicialização Automática

Um desenvolvedor que constrói sistemas de contexto persistente para o Claude Desktop identifica uma lacuna: o campo Preferências do Usuário só injeta instruções quando o usuário envia a primeira mensagem, exigindo gatilhos manuais para inicialização. Eles propõem adicionar um campo de execução "Ao Iniciar a Sessão" que é executado automaticamente quando uma nova conversa é aberta.

OpenClawRadar
MCP-Loci: Servidor de Memória Persistente Local para Claude e IA Compatível com MCP
Tools

MCP-Loci: Servidor de Memória Persistente Local para Claude e IA Compatível com MCP

MCP-Loci é um servidor de memória persistente que resolve a limitação de memória baseada em sessão do Claude com cinco ferramentas: lembrar, recuperar, esquecer, sintetizar e saúde. Ele usa correspondência de palavras-chave híbrida BM25 e embeddings semânticos para recuperação precisa sem exigir chaves de API.

OpenClawRadar