O FOMOE Permite a Inferência do Modelo Qwen3.5 de 397B em Hardware de Desktop de US$ 2.100

O que o FOMOE Resolve
Modelos grandes de Mistura de Especialistas (MoE) exigem centenas de GBs de armazenamento de pesos, tipicamente em memória flash como NVMe. Durante a inferência, apenas uma pequena fração dos pesos é necessária, mas não é possível prever quais deles antecipadamente. Padrões de acesso aleatório tornam as latências da flash muito altas para inferência prática em hardware de consumo.
Como o FOMOE Funciona
O sistema torna a maioria das leituras de pesos de especialistas desnecessárias através de várias técnicas:
- Armazena os especialistas mais comuns na memória da GPU (VRAM) com um cache de especialistas rolante atualizado
- Atinge taxa de acerto de 60% na VRAM com inicialização aquecida, reduzindo leituras NVMe para 28% (12% servidos da DRAM)
- Usa arquitetura ping-pong de GPU dupla para sobrepor carregamento de pesos e computação
- Implementa Roteamento Consciente de Cache (CAR) - quando dois especialistas pontuam de forma similar, o modelo escolhe o próximo especialista com melhor pontuação já no cache VRAM ou DRAM dentro de um limite aceitável
Resultados de Desempenho
- Velocidade de inferência de 5-9 tokens/segundo para o modelo de 397B parâmetros do Qwen3.5
- Leituras NVMe reduzidas para 7% com CAR ativado
- Apenas 3,5% de queda na perplexidade medida no wikitext
- Requisitos de hardware: duas GPUs de US$ 500, 32 GB de RAM, uma unidade NVMe
- Usa quantização Q4_K_M
A implementação consiste em aproximadamente 15.000 linhas de código C/HIP dirigido por Claude com forte orientação humana.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Solitaire: Infraestrutura de Identidade de Código Aberto para Agentes de IA
Solitaire é uma infraestrutura de identidade de código aberto para agentes de IA que se concentra em melhorar como os agentes trabalham com os usuários ao longo do tempo, não apenas na recuperação de memória. É local-first, independente de modelo e disponível via pip install solitaire-ai.

Monitor de Tokens de IA: Ferramenta macOS Rastreia Uso e Custo Local do Claude
Um desenvolvedor criou o AI Token Monitor, um aplicativo da barra de menus do macOS que lê arquivos de sessão locais do Claude para rastrear o uso de tokens, distribuição de modelos e equivalentes de custo sem chaves de API. A ferramenta de código aberto revelou 6,5 milhões de tokens (US$ 4.924 no preço da API) ao longo de 35 dias em um caso de usuário.

Script Python de 80 linhas usa Claude para gerar sugestões de links internos, reduzindo o tempo de vinculação de 2 horas para 8 minutos
Um usuário do Reddit criou um script Python de 80 linhas que envia um rascunho de artigo e um sitemap para o Claude, que retorna links internos relevantes com texto âncora sugerido — reduzindo o tempo de linkagem manual de 2 horas para 8 minutos por artigo.

Auto-otimização: Um Plugin de Código Claude para Otimização Autônoma de Desempenho
Um desenvolvedor criou o auto-optimize, um plugin do Claude Code que executa loops autônomos de perfil → planejamento → benchmark para otimizar o desempenho do código. Em um teste, ele alcançou uma tabela de hash 27% mais rápida em todos os cenários de benchmark em cerca de 3 horas.