Qwen 3.6 27B avaliado no DeepSWE: 2% de pontuação, 70 horas, 44k tokens médios de saída

Um usuário do Reddit testou o Qwen 3.6 27B no benchmark DeepSWE, obtendo 2% (1,79% arredondado) — 18º lugar entre 20, acima do Haiku 4.5 e Minimax M2.7. A execução completa levou 70 horas, com tempo médio por tarefa de 32 minutos e média de tokens de saída por tarefa de 44k — surpreendentemente equivalente ao Qwen 3.6 Plus maior, apesar da reputação do modelo 27B por ser prolixo.
Metodologia
- Modelo: Qwen 3.6 27B FP8 com cache KV BF16, raciocínio ativado, janela de contexto de 262k, servido via VLLM
- Hardware: 1x RTX6000 Pro Blackwell no RunPod
- Harness do agente: mini-swe em sandboxes Modal
- 1 execução por tarefa (em vez das 4 oficiais) para economizar tempo; sem intervalo de pontuação
- Custos calculados com base na taxa horária do RunPod para tarefas concluídas
- Orquestração: Codex 5.5xhigh monitorou e gerenciou toda a execução
Observações Principais
O autor observa que a pontuação está suspeitamente próxima do Qwen 3.6 Plus, levantando questões sobre diferenças arquitetônicas. Ele argumenta que os modelos locais estão ficando cada vez mais para trás em relação às ofertas fechadas de ponta: K2.6 é o melhor modelo open-source, mas a maioria nem consegue executá-lo localmente. O Qwen 3.6 27B é posicionado como uma opção local de "SOTA para pobres". A tendência sugere que o desempenho de ponta requer grande escala, o que frequentemente leva ao fechamento do código, tornando a inferência local um jogo perdido em termos de competitividade.
📖 Leia a fonte original: r/LocalLLaMA
👀 See Also

Anthropic adquire Stainless por mais de $300M — Agora possui o gerador de servidor MCP dominante
Anthropic comprou a Stainless, geradora de SDKs, por mais de US$ 300 milhões. A Stainless gera a maioria dos servidores MCP de produção a partir de especificações OpenAPI. O produto hospedado está sendo descontinuado; novas inscrições foram interrompidas na segunda-feira.

Resultados da Pesquisa sobre Confiabilidade e Padrões de Desenvolvimento de Agentes de IA
Uma sessão colaborativa de pesquisa com o Claude Opus analisou 15 artigos sobre agentes de IA, revelando problemas de confiabilidade quantificados: os agentes produzem 2 a 4 sequências de ações diferentes em 10 execuções, com 69% da divergência ocorrendo na primeira decisão. Agentes de autoaperfeiçoamento mostraram taxas de recusa de segurança caindo de 99,4% para 54,4% por meio de seu próprio aprendizado.

Migração do OpenClaw 5.2 Quebra Tarefas Cron e Chamadas de Plugin MCP
Atualizar do OpenClaw 4.23 para 5.2 faz com que plugins de ferramentas MCP fiquem visíveis, mas não possam ser chamados pelo agente, e o registro de cron jobs via CLI falha com erros de pareamento de dispositivo.

Claude-Code v2.1.108 adiciona controles de cache de prompt, recurso de recapitulação e descoberta de comandos de barra.
Claude-Code v2.1.108 introduz as variáveis de ambiente ENABLE_PROMPT_CACHING_1H e FORCE_PROMPT_CACHING_5M para controle de TTL do cache, adiciona um recurso de resumo de sessão configurável via /config ou /recap, e permite que o modelo descubra comandos de barra integrados através da ferramenta Skill.