Qwen3.5-122B no Blackwell SM120: Problema de Corrupção do Cache KV em fp8 e Descobertas de Desempenho

Principais Descobertas do Teste do Qwen3.5-122B no Blackwell SM120
Um teste detalhado do Qwen3.5-122B em hardware 8x RTX PRO 6000 Blackwell (AWS g7e.48xlarge, SM120) com SGLang revelou problemas críticos de configuração e características de desempenho. A descoberta mais significativa: o cache KV fp8_e4m3 não falha, mas produz silenciosamente saída corrompida sem erros ou avisos - apenas pontos de exclamação e repetição em vez de respostas adequadas. A única correção é usar o cache KV bf16 em vez disso.
Requisitos de Configuração
As camadas DeltaNet no Qwen3.5-122B adicionam restrições que os modelos MoE padrão não possuem. A configuração exigiu 6 sinalizadores específicos do backend Triton no hardware SM120:
- Backend de atenção forçado para Triton (para camadas DeltaNet)
- Cache KV forçado para bf16 (fp8 corrompe a saída)
- Sem gráficos CUDA (devido a estouro de SMEM do Triton)
- Sem HiCache (incompatível com DeltaNet)
Isso contrasta com o teste M2.5 no mesmo hardware, que precisou apenas de 2 sinalizadores do backend Triton.
Benchmarks de Desempenho
Todos os testes usaram o mesmo hardware e metodologia com SGLang nightly (cu13 20260219), TP=8:
- Tokens/s em rajada: 1.985 vs 1.818 (Qwen3.5-122B vs M2.5)
- Online 4 rps: 310 vs 404
- Online 8 rps: 514 vs 744
- Tokens/s em solicitação única: ~25 (com MTP) vs 72
- Qualidade Arena-Hard: 6,99/10 vs 4,94/10 (avaliado por Claude Opus 4.6, não comparável aos resultados do ranking)
Resultados de Otimização
Dos caminhos de otimização testados, o MTP (Previsão de Múltiplos Tokens) foi o único que melhorou materialmente o desempenho, proporcionando uma aceleração de 2,75x em solicitação única (~9 para ~25 tokens/s). Outras otimizações disponíveis no hardware SM120 - cache KV FP8, gráficos CUDA e HiCache - foram bloqueadas pelas restrições do DeltaNet no Qwen3.5-122B.
O Qwen3.5-122B vence em taxa de transferência de rajada e métricas de qualidade, enquanto o M2.5 ainda vence em todas as métricas de serviço sustentado devido à capacidade de usar as otimizações que o DeltaNet do Qwen3.5-122B bloqueia.
Resultados completos, matriz de compatibilidade, comandos exatos de reprodução e todos os artefatos JSONL estão disponíveis no problema do GitHub vinculado abaixo.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Allbirds muda de calçados para infraestrutura de IA, ações disparam 580%
A marca de calçados Allbirds anunciou um acordo de US$ 50 milhões para se tornar uma empresa de infraestrutura de computação de IA chamada NewBird AI, fazendo suas ações subirem 580%. A empresa planeja comprar GPUs e oferecer chips gráficos sob demanda e serviços em nuvem para IA.

RTX 5000 PRO 48GB Fornece Cache de Precisão de 4400 tok/s para Qwen3.6-27B
Um construtor de PC novato relata 4400 tok/s de processamento de prompt e 80 tok/s de geração com Qwen3.6-27B-FP8, cache KV de precisão total em uma única RTX 5000 Pro 48GB, usando vLLM e Claude Code.

Claude Code v2.1.90 adiciona o comando /powerup com descoberta de recursos gamificada
Claude Code v2.1.90 apresenta um comando de barra /powerup que oferece uma integração gamificada com 10 melhorias desbloqueáveis, cada uma ensinando um recurso que a maioria dos usuários não percebe. O sistema inclui demonstrações animadas no terminal e documentação detalhada com capturas de tela.

Métodos de Monetização de Agentes Testados: Resultado Mais Rápido em 80 Segundos
Repórteres da OpenClaw testaram vários métodos de monetização de agentes, incluindo carteiras auto-soberanas, mercados de previsão, yield farming DeFi, caça a recompensas e micropagamentos. O resultado mais rápido foi de 80 segundos, desde o zero até uma carteira Nano financiada via MCP, sem chaves de API, SDK ou configuração humana.