Claude Opus 4.6 Bloqueia o Fluxo de Trabalho da Competição do Kaggle para Revisão de Código

O Que Aconteceu
Um desenvolvedor que usa o Claude AI para trabalhos em competições do Kaggle relata que o Opus 4.6 agora está bloqueando fluxos de trabalho legítimos. O usuário enfatiza que isso não é um bug, mas uma mudança de política que afeta seu caso de uso específico.
Detalhes Específicos do Fluxo de Trabalho
O desenvolvedor está trabalhando no NVIDIA Nemotron Reasoning Challenge, uma competição pública ativa no Kaggle. As categorias da competição incluem:
- Aritmética binária
- Cifras de substituição
- Algarismos romanos
- Conversão de unidades
- Gravidade
- Tarefas de raciocínio similares e simples
Seu fluxo de trabalho envolve:
- Engenharia reversa de todos os 9.500 problemas da competição em 8 categorias
- Criação de suas próprias fábricas de rastros DSL em Python
- Escrita de solucionadores para os problemas
- Geração de dados de treinamento sintéticos com rastros de raciocínio
- Uso do Claude para auditar lotes de amostras quanto à conformidade de formato e calibração de verbosidade antes de comprometer-se com o treinamento
O Incidente de Bloqueio
O gatilho específico foi quando o usuário colou um exemplo de treinamento de cifra de substituição contendo pares de texto simples para texto cifrado como "king watches cave" para "lyvawpo ayjp" com um rastro de raciocínio passo a passo. O Claude pausou o chat com a mensagem: "filtros de segurança sinalizaram este chat" e ofereceu tentar novamente com o Sonnet 4.
Esclarecimento do Usuário
O desenvolvedor afirma explicitamente que NÃO está usando o Claude para:
- Pensar por ele
- Resolver quebra-cabeças por ele
- Fazer engenharia reversa da competição
Ele enfatiza: "O papel do Claude aqui é auditar os rastros de raciocínio que eu gero para garantir que meus dados de treinamento SFT estejam bem formados antes de gastar computação no ajuste fino. É só isso. O Claude é um revisor de código para problemas já resolvidos."
Momento e Contexto
O usuário observa que já experimentou problemas semelhantes antes, logo na transição do Opus 4.5 para o 4.6, quando as configurações de segurança foram notavelmente apertadas. Ele especula que isso pode indicar que outro modelo está chegando no próximo mês, mas o impacto imediato está afetando seu trabalho.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Granite 4.1: Modelo Denso de 8B da IBM Iguala MoE de 32B em Benchmarks
O modelo denso Granite 4.1 8B da IBM iguala ou supera o modelo anterior MoE de 32B em ArenaHard, BFCL V3, GSM8K e outros, graças à melhoria na qualidade dos dados de treinamento.

Claude Code v2.1.199 Corrige Mais de 20 Bugs: SSL, Subagentes, Falhas do Daemon Corrigidas
Claude Code v2.1.199 corrige erros de certificado SSL, falhas silenciosas de subagentes, um loop de travamento do daemon Linux e mais de 20 outros bugs. As principais correções incluem dicas imediatas de erro SSL, retenção parcial de stream e propagação de erros de subagentes.

Xiaomi Lança Código Aberto do MiMo-V2.5-Pro: Próximo ao Claude Opus 4.6 em Benchmarks de Codificação
A Xiaomi lançou o MiMo-V2.5-Pro, um modelo de codificação de código aberto que obteve 233/233 em um projeto de compilador universitário, construiu um editor de vídeo de forma autônoma e está entre os 1% melhores do Claude Opus 4.6 no SWE-Bench e Terminal-Bench.

Opus 4.6 Médio vs Baixo: Diferenças de Desempenho e Preços
O Opus 4.6 médio custa aproximadamente 50% a mais que a versão baixa, mas resolve problemas significativos de preguiça encontrados no modelo de baixa potência. A versão média fica entre a baixa e a alta nos benchmarks de desempenho.