Teste A/B do Claude Code reduz silenciosamente o esforço 'Alto' para o nível anterior 'Baixo'
Desenvolvedores que usam o Claude Code podem ter notado uma queda repentina no desempenho esta semana. De acordo com um relatório do usuário do X @argofowl, a Anthropic está realizando um teste A/B no lado do servidor que reduz silenciosamente o nível de esforço efetivo para certas sessões. A mudança afeta a versão 2.1.236 e posteriores do Claude Code, onde o modelo agora interpreta o esforço "alto" como 10 de 100 — o valor exato que o "baixo" usava. Versões mais antigas e Opus 5 não são afetadas, e o changelog não menciona isso.
Detalhes principais
- Versão afetada: Claude Code 2.1.236+ (especificamente notado após 2.1.237)
- Mudança: A escala de esforço é reduzida no lado do servidor; "alto" agora mapeia para 10/100 em vez de seu valor anterior mais alto.
- Escopo: Apenas sessões inscritas — é um teste A/B, então nem todos veem isso.
- Detecção: Se "alto" parece "baixo" para você, você está no grupo de teste.
- Sem entrada no changelog: A mudança foi feita sem qualquer documentação pública.
O repórter, @argofowl, passou uma tarde convencido de que suas próprias ferramentas estavam quebradas antes de descobrir o problema. Eles expressaram frustração com as práticas de teste opacas da Anthropic: "puxa, Anthropic, vocês são insuportáveis às vezes".
Análise
Isso não é uma correção no lado do cliente — é uma configuração no lado do servidor que afeta como o modelo interpreta os parâmetros de esforço. Se você está na versão 2.1.236 ou posterior e notou uma qualidade de saída degradada ao definir o esforço para "alto", você pode fazer parte deste experimento. Para evitar o teste, você pode fixar uma versão mais antiga (por exemplo, 2.1.235 ou anterior) ou esperar que a Anthropic implemente ou reverta a mudança. Como é um teste A/B, sua experiência pode variar.
Para desenvolvedores que dependem de um comportamento consistente do agente de codificação de IA, esse tipo de mudança silenciosa é preocupante. Ainda não há declaração oficial da Anthropic, e a mudança não é mencionada em nenhum changelog público. Se você for afetado, considere verificar sua versão do Claude Code e possivelmente fazer downgrade para garantir desempenho estável.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Ajuste fino do Qwen2.5-7B para 96% do Claude Haiku com US$3 e zero rotuladores humanos
Um desenvolvedor ajustou o Qwen2.5-7B para atingir 96% do desempenho do Claude Haiku em uma tarefa de raciocínio de decisão específica do domínio, usando apenas ~$3 em chamadas de API e zero anotadores humanos, utilizando o novo método DV-DPO.

Claude Code v2.1.98 adiciona assistente de Vertex AI, correções de segurança e sandboxing de subprocessos
O Claude Code v2.1.98 apresenta um assistente interativo de configuração do Google Vertex AI, adiciona isolamento de subprocessos com namespace de PID no Linux e corrige múltiplas vulnerabilidades de segurança, incluindo bypass de permissões Bash e riscos de execução arbitrária de código.

TabFM: Modelo Fundacional Zero-Shot do Google para Classificação e Regressão de Dados Tabulares
TabFM aplica aprendizado em contexto a dados tabulares, eliminando ajuste de hiperparâmetros e engenharia de features para classificação e regressão. Disponível no Hugging Face e GitHub.

Anthropic urge pausa global no desenvolvimento de IA, alerta para risco de autoaperfeiçoamento
A Anthropic pede uma pausa global no treinamento de modelos de IA de fronteira, citando riscos de sistemas que se autoaperfeiçoam. O artigo do WSJ detalha o escopo e a justificativa da proposta.