O FOMOE Permite a Inferência do Modelo Qwen3.5 de 397B em Hardware de Desktop de US$ 2.100

O que o FOMOE Resolve
Modelos grandes de Mistura de Especialistas (MoE) exigem centenas de GBs de armazenamento de pesos, tipicamente em memória flash como NVMe. Durante a inferência, apenas uma pequena fração dos pesos é necessária, mas não é possível prever quais deles antecipadamente. Padrões de acesso aleatório tornam as latências da flash muito altas para inferência prática em hardware de consumo.
Como o FOMOE Funciona
O sistema torna a maioria das leituras de pesos de especialistas desnecessárias através de várias técnicas:
- Armazena os especialistas mais comuns na memória da GPU (VRAM) com um cache de especialistas rolante atualizado
- Atinge taxa de acerto de 60% na VRAM com inicialização aquecida, reduzindo leituras NVMe para 28% (12% servidos da DRAM)
- Usa arquitetura ping-pong de GPU dupla para sobrepor carregamento de pesos e computação
- Implementa Roteamento Consciente de Cache (CAR) - quando dois especialistas pontuam de forma similar, o modelo escolhe o próximo especialista com melhor pontuação já no cache VRAM ou DRAM dentro de um limite aceitável
Resultados de Desempenho
- Velocidade de inferência de 5-9 tokens/segundo para o modelo de 397B parâmetros do Qwen3.5
- Leituras NVMe reduzidas para 7% com CAR ativado
- Apenas 3,5% de queda na perplexidade medida no wikitext
- Requisitos de hardware: duas GPUs de US$ 500, 32 GB de RAM, uma unidade NVMe
- Usa quantização Q4_K_M
A implementação consiste em aproximadamente 15.000 linhas de código C/HIP dirigido por Claude com forte orientação humana.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Espaço de Estados: Crie Aplicativos Web Interativos para Agentes OpenClaw com Markdown
Statespace é uma estrutura gratuita e de código aberto para criar e compartilhar aplicativos web amigáveis para IA que agentes OpenClaw podem navegar e interagir usando Markdown puro. Permite definir ferramentas, componentes e instruções em arquivos Markdown que os agentes acessam via HTTP.

Biblioteca de Registro de Código Aberto Artigo 12 para Conformidade com a Lei de IA da UE
Uma biblioteca TypeScript gratuita e de código aberto para aplicativos Node.js que utilizam o Vercel AI SDK, implementando os requisitos de registro do Artigo 12 com logs JSONL somente de acréscimo, encadeamento de hashes SHA-256 para detecção de adulteração e aplicação de retenção de 180 dias.

Medindo o Gasto de Tokens Fora da Tarefa no Código Claude: A Métrica de 'Intenção Não Declarada'
Um desenvolvedor criou uma métrica para quantificar o poder computacional gasto em caminhos de execução não intencionais em sessões do Claude Code, descobrindo que 22,8% dos tokens foram para tarefas fora do objetivo declarado.

htmLLM-124M v2 Lançado: Modelo Especializado de Autocompletar HTML/Bootstrap
A LH-Tech-AI lançou o htmLLM-124M v2, um modelo de 124 milhões de parâmetros especializado em autocompletar HTML/Bootstrap que alcança 0.91 de perda de validação e treina em ~8 horas em uma única GPU T4.