ICML 2026 rejeita 2% dos artigos por violação da política de revisão por LLM

A ICML 2026 implementou uma estrutura de duas políticas para o uso de LLMs na revisão por pares e tomou medidas disciplinares contra revisores que violaram as políticas acordadas. A conferência rejeitou diretamente 497 artigos, representando aproximadamente 2% de todas as submissões.
Estrutura de Políticas e Violações
A ICML 2026 estabeleceu duas políticas distintas para o uso de LLMs na revisão:
- Política A (Conservadora): Não é permitido o uso de LLMs
- Política B (Permissiva): LLMs permitidos para ajudar a entender os artigos e trabalhos relacionados, e para aprimorar as avaliações
Os revisores selecionaram qual política preferiam operar, sem que nenhum revisor que preferisse fortemente a Política B fosse designado para a Política A. Os únicos revisores designados para a Política A foram aqueles que explicitamente selecionaram "Política A" ou "Estou de acordo com qualquer uma das políticas [A ou B]".
Detecção e Consequências
795 avaliações (cerca de 1% de todas as avaliações) escritas por 506 revisores únicos designados para a Política A foram detectadas como tendo usado LLMs em suas avaliações. Esses revisores haviam concordado explicitamente em não usar LLMs. Cada caso sinalizado foi verificado manualmente por um humano para evitar falsos positivos.
Quando um Revisor Recíproco designado para uma submissão produziu tal avaliação, sua submissão foi rejeitada, resultando em 497 rejeições no total. Todas as avaliações da Política A detectadas como geradas por LLM foram removidas do sistema.
Se mais da metade das avaliações enviadas por um revisor da Política A fossem detectadas como geradas por LLM, todas as suas avaliações eram excluídas e o revisor era removido do grupo de revisores. 51 revisores da Política A (cerca de 10% dos 506 revisores detectados) se enquadraram nessa categoria.
Método Técnico de Detecção
O método de detecção envolveu a marcação d'água dos PDFs de submissão com instruções ocultas para LLMs que influenciariam sutilmente qualquer avaliação produzida via LLM. A técnica:
- Criou um dicionário de 170.000 frases
- Para cada artigo, amostrou duas frases aleatoriamente deste dicionário (probabilidade menor que uma em dez bilhões para qualquer par específico)
- Marcou os PDFs com instruções visíveis apenas para um LLM, instruindo-o a incluir as duas frases selecionadas na avaliação
- Essas marcas d'água não seriam diretamente visíveis para um humano lendo o PDF
O método foi baseado em trabalho recente de Rao, Kumar, Lakkaraju e Shah. A conferência observa que esta técnica pode capturar apenas os usos mais flagrantes e descuidados de LLMs na revisão, particularmente onde os revisores inserem o PDF em um LLM e copiam e colam diretamente a saída.
Impacto e Contexto
A conferência enfatizou que não está fazendo julgamentos sobre a qualidade das avaliações sinalizadas ou das intenções dos revisores, mas simplesmente aplicando as políticas que os revisores concordaram. A interrupção exigiu a remoção de avaliações violadoras, potencialmente encontrar novos revisores e rejeitar diretamente algumas submissões que já haviam recebido um conjunto completo de avaliações.
Esta abordagem reflete o desafio mais amplo que as conferências enfrentam ao se adaptar à integração da IA nos fluxos de trabalho de pesquisa, mantendo a integridade da revisão.
📖 Leia a fonte completa: HN LLM Tools
👀 See Also

Aprisionamento por Fornecedor de IA se Intensifica: Trocar de Modelos Agora Custa Mais do que a Maioria Esperava
Uma pesquisa da Zapier com 542 executivos dos EUA mostra que 90% achavam que poderiam trocar de fornecedor de IA em menos de 4 semanas, mas 58% das migrações reais falharam ou levaram muito mais tempo. Enquanto isso, a OpenAI aumentou o preço do token de entrada do GPT-5.2 de US$ 1,25 para US$ 5,75, e a Anthropic adotou precificação dinâmica para o Claude enterprise, potencialmente dobrando ou triplicando os custos para usuários pesados.

Auditoria de Ontário: 60% dos sistemas de IA para transcrição confundem medicamentos, 85% perdem detalhes de saúde mental
Auditores de Ontário descobriram que 12 de 20 sistemas de IA para anotações médicas inseriram informações incorretas sobre medicamentos, 9 fabricaram sugestões de tratamento e 17 perderam detalhes importantes de saúde mental de gravações de consultas médico-paciente. A avaliação ponderou a precisão em apenas 4% da pontuação total.

Discussão no Reddit sobre Riscos de Longo Prazo da Dependência de Agentes de Codificação
Um usuário do Reddit argumenta que os agentes de codificação atuais, como Claude Code e Copilot, criam uma dependência que pode levar ao aprisionamento a fornecedores, à centralização da criação de software e à comoditização do artesanato da engenharia.

Trabalhadores do Google DeepMind votam pela sindicalização devido a acordos de IA militar
Funcionários do Google DeepMind em Londres votaram para se sindicalizar, exigindo que o Google interrompa contratos de IA com os militares dos EUA e de Israel, citando preocupações com a remoção de diretrizes éticas.