Atualização APEX MoE Quants: Mais de 25 Novos Modelos e a Nova Categoria I-Nano Lançada

✍️ OpenClawRadar📅 Publicado: May 4, 2026🔗 Source
Atualização APEX MoE Quants: Mais de 25 Novos Modelos e a Nova Categoria I-Nano Lançada
Ad

A estratégia APEX de quantização (precisão mista consciente de MoE) se expandiu significativamente desde seu lançamento inicial para o Qwen 3.5 35B-A3B. A coleção do Hugging Face agora inclui mais de 30 modelos MoE das principais famílias, e um novo nível ultracomprimido I-Nano está disponível.

Principais resultados do feedback dos usuários

  • Contexto longo se mantém: As versões APEX I-Balanced e I-Compact mantêm coerência após 32k tokens em MoEs de classe 30-50B, onde o Q4_K uniforme degrada. A hipótese é que manter especialistas compartilhados e camadas de borda em alta precisão preserva o roteamento de tokens de longo alcance.
  • Desempenho em codificação: Usuários do Qwen 3.6 35B-A3B relatam que I-Compact e I-Mini ficam próximos do F16 em tarefas reais de código, melhor do que as expectativas para o tamanho.

Novos modelos adicionados

Agrupados por família, a maioria são MoEs de classe 30-70B que cabem em uma GPU de consumo no I-Mini/I-Compact:

  • Qwen: Qwen 3.5 122B-A10B, 397B-A17B, Claude-distilled, Fernflower, TQ; Qwen 3.6 35B-A3B (herege, destilações Claude 4.6/4.7); Qwen3-Coder 30B, Next.
  • Tamanho fronteiriço (Blackwell alugado): MiniMax-M2.5/M2.7 (228B/24B ativos), Mistral-Small 4 119B-2603, NVIDIA Nemotron-3-Super 120B-A12B, GLM-4.7 Flash, Step-3.5 Flash, Nemotron-3-Nano 30B-A3B, Nemotron-3-Nano-Omni (multimodal), Holo3 35B-A3B, Huihui3.5 67B-A3B.
  • MoEs híbridos Mamba/SSM: Variantes Nemotron-3-Nano, Holo3, LFM2 24B-A2B.
  • Gemma 4: gemma-4 26B-A4B-it (requantizado com template de chat Google atualizado), +destilação Claude Opus, +herege, Gemopus-4 Preview.
  • Mesclagens da comunidade: Carnice MoE 35B-A3B, Carnice-Qwen3.6, Qwopus MoE 35B-A3B.
Ad

Novo nível: I-Nano (IQ2_XXS)

Reduz especialistas roteados de camadas intermediárias para 2,06 bpw, próximo à borda para IQ2_S, bordas para Q3_K, especialistas compartilhados em Q5_K. Cerca de 20% menor que I-Mini, viável apenas em MoE devido à ativação esparsa de especialistas. Requer imatrix.

Exemplos de tamanhos:

  • Qwen 3.5 35B-A3B: I-Mini 13 GB → I-Nano 11 GB
  • Nemotron Omni 30B: I-Mini 18 GB → I-Nano 17 GB (menos economia devido ao especialista compartilhado mais denso)

Links

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

O Easter Egg /buddy do Claude Code e Solicitações de Funcionalidades dos Usuários
News

O Easter Egg /buddy do Claude Code e Solicitações de Funcionalidades dos Usuários

O Claude Code inclui um comando oculto /buddy que cria um companheiro estilo Tamagotchi com espécies, estatísticas e comentários decorativos. Um assinante Max com mais de 840 sessões detalhou as limitações atuais e propôs melhorias funcionais.

OpenClawRadar
Vazamento do Código-Fonte do Claude Revela Modo Anti-Destilação, Modo Disfarçado e Detecção de Frustração
News

Vazamento do Código-Fonte do Claude Revela Modo Anti-Destilação, Modo Disfarçado e Detecção de Frustração

Um arquivo de mapa de código-fonte vazado do pacote npm do Claude Code revela técnicas anti-destilação usando ferramentas falsas, um modo secreto que oculta a autoria de IA e detecção de frustração via padrões de regex.

OpenClawRadar
Definindo Agentes de IA: O Teste de Fluxo de Trabalho
News

Definindo Agentes de IA: O Teste de Fluxo de Trabalho

Uma discussão no Reddit questiona se muitos produtos de agentes de IA são essencialmente chatbots com uma lista de tarefas, propondo um teste baseado na capacidade de completar fluxos de trabalho em várias ferramentas sem intervenção manual.

OpenClawRadar
🦀
News

FairyFuse alcança aceleração de kernel de 29,6x em CPUs através de inferência livre de multiplicação de pesos ternários

FairyFuse funde oito sub-GEMVs de valor real em um único loop AVX-512 usando adições/subtrações mascaradas, resultando em 32,4 tokens/s no Xeon 8558P e um ganho de 1,24x em relação ao llama.cpp Q4_K_M com qualidade quase sem perdas.

OpenClawRadar