Qwen 3.6 27B avaliado no DeepSWE: 2% de pontuação, 70 horas, 44k tokens médios de saída

Um usuário do Reddit testou o Qwen 3.6 27B no benchmark DeepSWE, obtendo 2% (1,79% arredondado) — 18º lugar entre 20, acima do Haiku 4.5 e Minimax M2.7. A execução completa levou 70 horas, com tempo médio por tarefa de 32 minutos e média de tokens de saída por tarefa de 44k — surpreendentemente equivalente ao Qwen 3.6 Plus maior, apesar da reputação do modelo 27B por ser prolixo.
Metodologia
- Modelo: Qwen 3.6 27B FP8 com cache KV BF16, raciocínio ativado, janela de contexto de 262k, servido via VLLM
- Hardware: 1x RTX6000 Pro Blackwell no RunPod
- Harness do agente: mini-swe em sandboxes Modal
- 1 execução por tarefa (em vez das 4 oficiais) para economizar tempo; sem intervalo de pontuação
- Custos calculados com base na taxa horária do RunPod para tarefas concluídas
- Orquestração: Codex 5.5xhigh monitorou e gerenciou toda a execução
Observações Principais
O autor observa que a pontuação está suspeitamente próxima do Qwen 3.6 Plus, levantando questões sobre diferenças arquitetônicas. Ele argumenta que os modelos locais estão ficando cada vez mais para trás em relação às ofertas fechadas de ponta: K2.6 é o melhor modelo open-source, mas a maioria nem consegue executá-lo localmente. O Qwen 3.6 27B é posicionado como uma opção local de "SOTA para pobres". A tendência sugere que o desempenho de ponta requer grande escala, o que frequentemente leva ao fechamento do código, tornando a inferência local um jogo perdido em termos de competitividade.
📖 Leia a fonte original: r/LocalLLaMA
👀 See Also

Fundador da OpenClaw, Peter Steinberger, no Radar: Insights da Entrevista da YC
O fundador da OpenClaw, Peter Steinberger, chama a atenção da YC, gerando discussões sobre o futuro dos agentes de IA para programação. Mergulhe nos destaques desta conversa significativa que promete influenciar a trajetória da automação e da integração de agentes de IA.

Programa ACCESS do Medicare: Modelo de Pagamento Criado para Agentes de IA, Detalhes Internos
O programa ACCESS do CMS paga por cuidados crônicos baseados em IA, não apenas por tempo com médicos. A IA de voz Flora da Pair Team reduziu visitas ao pronto-socorro em 50%. A coorte entra em operação em 5 de julho.

Claude Code v2.1.162 Lança Informações de Espera de Sessão, Correção de Timeout MCP e Reformulação da Visão de Agentes
Claude Code v2.1.162 adiciona `waitingFor` à saída `--json`, corrige o bug de timeout do MCP abaixo de 1000ms, melhora a renderização do terminal para a visualização de agentes e muito mais. Detalhes internos.
Por que Escrever Código em 2026: A Codificação Humana Ainda Importa para Agentes de IA
Doug Turnbull argumenta que, mesmo com agentes de codificação de IA poderosos, os humanos devem escrever código para entender a arquitetura, reduzir a fragilidade e orientar os agentes de forma eficaz.