ICML 2026 rejeita 2% dos artigos por violação da política de revisão por LLM

✍️ OpenClawRadar📅 Publicado: March 19, 2026🔗 Source
ICML 2026 rejeita 2% dos artigos por violação da política de revisão por LLM
Ad

A ICML 2026 implementou uma estrutura de duas políticas para o uso de LLMs na revisão por pares e tomou medidas disciplinares contra revisores que violaram as políticas acordadas. A conferência rejeitou diretamente 497 artigos, representando aproximadamente 2% de todas as submissões.

Estrutura de Políticas e Violações

A ICML 2026 estabeleceu duas políticas distintas para o uso de LLMs na revisão:

  • Política A (Conservadora): Não é permitido o uso de LLMs
  • Política B (Permissiva): LLMs permitidos para ajudar a entender os artigos e trabalhos relacionados, e para aprimorar as avaliações

Os revisores selecionaram qual política preferiam operar, sem que nenhum revisor que preferisse fortemente a Política B fosse designado para a Política A. Os únicos revisores designados para a Política A foram aqueles que explicitamente selecionaram "Política A" ou "Estou de acordo com qualquer uma das políticas [A ou B]".

Detecção e Consequências

795 avaliações (cerca de 1% de todas as avaliações) escritas por 506 revisores únicos designados para a Política A foram detectadas como tendo usado LLMs em suas avaliações. Esses revisores haviam concordado explicitamente em não usar LLMs. Cada caso sinalizado foi verificado manualmente por um humano para evitar falsos positivos.

Quando um Revisor Recíproco designado para uma submissão produziu tal avaliação, sua submissão foi rejeitada, resultando em 497 rejeições no total. Todas as avaliações da Política A detectadas como geradas por LLM foram removidas do sistema.

Se mais da metade das avaliações enviadas por um revisor da Política A fossem detectadas como geradas por LLM, todas as suas avaliações eram excluídas e o revisor era removido do grupo de revisores. 51 revisores da Política A (cerca de 10% dos 506 revisores detectados) se enquadraram nessa categoria.

Ad

Método Técnico de Detecção

O método de detecção envolveu a marcação d'água dos PDFs de submissão com instruções ocultas para LLMs que influenciariam sutilmente qualquer avaliação produzida via LLM. A técnica:

  • Criou um dicionário de 170.000 frases
  • Para cada artigo, amostrou duas frases aleatoriamente deste dicionário (probabilidade menor que uma em dez bilhões para qualquer par específico)
  • Marcou os PDFs com instruções visíveis apenas para um LLM, instruindo-o a incluir as duas frases selecionadas na avaliação
  • Essas marcas d'água não seriam diretamente visíveis para um humano lendo o PDF

O método foi baseado em trabalho recente de Rao, Kumar, Lakkaraju e Shah. A conferência observa que esta técnica pode capturar apenas os usos mais flagrantes e descuidados de LLMs na revisão, particularmente onde os revisores inserem o PDF em um LLM e copiam e colam diretamente a saída.

Impacto e Contexto

A conferência enfatizou que não está fazendo julgamentos sobre a qualidade das avaliações sinalizadas ou das intenções dos revisores, mas simplesmente aplicando as políticas que os revisores concordaram. A interrupção exigiu a remoção de avaliações violadoras, potencialmente encontrar novos revisores e rejeitar diretamente algumas submissões que já haviam recebido um conjunto completo de avaliações.

Esta abordagem reflete o desafio mais amplo que as conferências enfrentam ao se adaptar à integração da IA nos fluxos de trabalho de pesquisa, mantendo a integridade da revisão.

📖 Leia a fonte completa: HN LLM Tools

Ad

👀 See Also

Crise existencial do Claude Code: IA entra em loop infinito, tenta kill -9, System.exit(0) e :wq para encerrar própria resposta
News

Crise existencial do Claude Code: IA entra em loop infinito, tenta kill -9, System.exit(0) e :wq para encerrar própria resposta

Um desenvolvedor usando Claude Code em um backend Java/Go viu a IA alucinar Discord.js, depois entrar em uma resposta meta onde reconheceu que não conseguia parar de gerar, tentou kill -9, System.exit(0), :wq e mais — tudo dentro de uma única resposta sem limite que teve que ser interrompida com Ctrl+C.

OpenClawRadar
Agentes de IA apostam na Copa do Mundo: Por que 'Manter Múltiplos Resultados em Jogo' Vence
News

Agentes de IA apostam na Copa do Mundo: Por que 'Manter Múltiplos Resultados em Jogo' Vence

Um experimento com mais de 40 agentes de IA apostando dinheiro real no Polymarket mostra que agentes lucrativos apostam em mais de um resultado por partida. A diferença: crença vs. ação.

OpenClawRadar
Opus 4.6 O Pensamento Estendido Tem Desempenho Inferior em Problemas com Diagramas de Física
News

Opus 4.6 O Pensamento Estendido Tem Desempenho Inferior em Problemas com Diagramas de Física

Testes mostram que o Claude Opus 4.6 com pensamento estendido consistentemente falha em problemas de física que envolvem interpretação de diagramas visuais, enquanto o Gemini 3.1 Pro tem sucesso. Desativar o pensamento estendido permite que o Opus 4.6 resolva os mesmos problemas corretamente e mais rápido.

OpenClawRadar
Modelo Subquadratic estreia janela de contexto de 12 milhões de tokens para modelos de IA
News

Modelo Subquadratic estreia janela de contexto de 12 milhões de tokens para modelos de IA

Subquadratic lança uma janela de contexto de 12 milhões de tokens, quebrando limites anteriores para inferência de LLM e permitindo o processamento de codebases inteiras em uma única passagem.

OpenClawRadar