Desenvolvedor troca Cursor Composer 2 e Kimi 2.6 pelo Qwen3.6:35b-a3b para cargas de trabalho empresariais

Um desenvolvedor no r/LocalLLaMA relata ter substituído com sucesso o Cursor Composer 2 e o Kimi 2.6 pelo Qwen3.6:35b-a3b para desenvolvimento diário de software em uma base de código empresarial de 500.000 a 700.000 linhas (60 horas/semana). O usuário já havia experimentado o Kimi 2.6 e o DeepSeek 4 Pro/Flash, mas considerou o Qwen3.6:35b-a3b a melhor opção.
Detalhes Principais
- Modelo: Qwen3.6:35b-a3b (a versão 3.6 com 35b parâmetros e um subconjunto ativado de 3b via MoE? — a notação do usuário é ambígua; provavelmente Qwen2.5-32B ou uma variante personalizada). O modelo suporta entrada de imagem/captura de tela.
- Hospedagem: Executado via OpenRouter a aproximadamente $0,08 por 1M tokens em média após cache e ajustes de faturamento. O usuário não possui hardware para inferência local.
- Carga de trabalho: Desenvolvimento em tempo integral em um grande conjunto de software empresarial. O usuário afirma que o modelo "realmente entende" a base de código e o contexto da tarefa, superando as opções anteriores.
- Funcionalidade ausente: A única desvantagem observada é a falta dos cloud agents do Cursor e da alta taxa de transferência no Composer 2.
Comparação de Custos
A ~$0,08/1M tokens, o Qwen3.6:35b-a3b é descrito como "incrivelmente barato" para seu nível de capacidade. Nenhuma análise detalhada é fornecida, mas cache e descontos de uso se aplicam.
Para Quem É
Desenvolvedores que trabalham com grandes bases de código proprietárias e desejam um modelo capaz e de baixo custo para codificação assistida por IA, sem precisar de hardware GPU local.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Modelos Locais vs Nuvem: Qwen-3.6-27B, Gemma-4-31B, Claude Haiku, Codex-Spark em Geração de Código Complexo
Um usuário testou o Qwen-3.6-27B (q4_k_m) localmente em uma RTX 5080 contra os modelos baseados em API Gemma-4-31B, Claude Haiku 4.5 e Codex-Spark em uma tarefa de código complexa. Apenas o Codex-Spark produziu código completo (mas com erros de importação); todos os outros falharam parcialmente. Custo: Gemma usou $0,112 para 803k tokens de entrada.

SenseNova-U1-8B-MoT: Modelo Nativo Multimodal de Código Aberto com Arquitetura NEO-Unify
SenseNova lançou o SenseNova-U1-8B-MoT, um modelo multimodal nativo que elimina tanto o codificador visual quanto o VAE, usando a arquitetura NEO-Unify para compreensão, raciocínio e geração unificados. Ele se destaca em texto para infográficos, edição de imagens e geração intercalada de texto e imagem.

A Anthropic lança janela de contexto de 1 milhão de tokens para o Claude Opus sem custo adicional
A Anthropic disponibilizou a janela de contexto de 1 milhão de tokens para todos os usuários do Claude Code nos planos Max, Team e Enterprise na versão 2.1.75, eliminando a taxa extra de uso anterior. A janela padrão permanece em 200 mil tokens.

SubQ: Primeiro LLM Totalmente Subquadrático com Contexto de 12M Tokens e 95% de Precisão no RULER
Subquadratic lança SubQ 1M-Preview, um LLM subquadrático com escalonamento linear de computação, contexto de 12M de tokens, atenção esparsa 52× mais rápida que FlashAttention e 95% no RULER 128K. Disponível via API, agente de código CLI (SubQ Code) e ferramenta de busca (SubQ Search).