O FOMOE Permite a Inferência do Modelo Qwen3.5 de 397B em Hardware de Desktop de US$ 2.100

✍️ OpenClawRadar📅 Publicado: March 29, 2026🔗 Source
O FOMOE Permite a Inferência do Modelo Qwen3.5 de 397B em Hardware de Desktop de US$ 2.100
Ad

O que o FOMOE Resolve

Modelos grandes de Mistura de Especialistas (MoE) exigem centenas de GBs de armazenamento de pesos, tipicamente em memória flash como NVMe. Durante a inferência, apenas uma pequena fração dos pesos é necessária, mas não é possível prever quais deles antecipadamente. Padrões de acesso aleatório tornam as latências da flash muito altas para inferência prática em hardware de consumo.

Como o FOMOE Funciona

O sistema torna a maioria das leituras de pesos de especialistas desnecessárias através de várias técnicas:

  • Armazena os especialistas mais comuns na memória da GPU (VRAM) com um cache de especialistas rolante atualizado
  • Atinge taxa de acerto de 60% na VRAM com inicialização aquecida, reduzindo leituras NVMe para 28% (12% servidos da DRAM)
  • Usa arquitetura ping-pong de GPU dupla para sobrepor carregamento de pesos e computação
  • Implementa Roteamento Consciente de Cache (CAR) - quando dois especialistas pontuam de forma similar, o modelo escolhe o próximo especialista com melhor pontuação já no cache VRAM ou DRAM dentro de um limite aceitável
Ad

Resultados de Desempenho

  • Velocidade de inferência de 5-9 tokens/segundo para o modelo de 397B parâmetros do Qwen3.5
  • Leituras NVMe reduzidas para 7% com CAR ativado
  • Apenas 3,5% de queda na perplexidade medida no wikitext
  • Requisitos de hardware: duas GPUs de US$ 500, 32 GB de RAM, uma unidade NVMe
  • Usa quantização Q4_K_M

A implementação consiste em aproximadamente 15.000 linhas de código C/HIP dirigido por Claude com forte orientação humana.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Espaço de Estados: Crie Aplicativos Web Interativos para Agentes OpenClaw com Markdown
Tools

Espaço de Estados: Crie Aplicativos Web Interativos para Agentes OpenClaw com Markdown

Statespace é uma estrutura gratuita e de código aberto para criar e compartilhar aplicativos web amigáveis para IA que agentes OpenClaw podem navegar e interagir usando Markdown puro. Permite definir ferramentas, componentes e instruções em arquivos Markdown que os agentes acessam via HTTP.

OpenClawRadar
Biblioteca de Registro de Código Aberto Artigo 12 para Conformidade com a Lei de IA da UE
Tools

Biblioteca de Registro de Código Aberto Artigo 12 para Conformidade com a Lei de IA da UE

Uma biblioteca TypeScript gratuita e de código aberto para aplicativos Node.js que utilizam o Vercel AI SDK, implementando os requisitos de registro do Artigo 12 com logs JSONL somente de acréscimo, encadeamento de hashes SHA-256 para detecção de adulteração e aplicação de retenção de 180 dias.

OpenClawRadar
Medindo o Gasto de Tokens Fora da Tarefa no Código Claude: A Métrica de 'Intenção Não Declarada'
Tools

Medindo o Gasto de Tokens Fora da Tarefa no Código Claude: A Métrica de 'Intenção Não Declarada'

Um desenvolvedor criou uma métrica para quantificar o poder computacional gasto em caminhos de execução não intencionais em sessões do Claude Code, descobrindo que 22,8% dos tokens foram para tarefas fora do objetivo declarado.

OpenClawRadar
htmLLM-124M v2 Lançado: Modelo Especializado de Autocompletar HTML/Bootstrap
Tools

htmLLM-124M v2 Lançado: Modelo Especializado de Autocompletar HTML/Bootstrap

A LH-Tech-AI lançou o htmLLM-124M v2, um modelo de 124 milhões de parâmetros especializado em autocompletar HTML/Bootstrap que alcança 0.91 de perda de validação e treina em ~8 horas em uma única GPU T4.

OpenClawRadar