ICML 2026 rechaza el 2% de los artículos por violaciones a la política de revisión con LLM.

ICML 2026 ha implementado un marco de dos políticas para el uso de LLM en la revisión por pares y ha tomado medidas disciplinarias contra los revisores que violaron las políticas acordadas. La conferencia rechazó 497 artículos, lo que representa aproximadamente el 2% de todos los envíos.
Marco de Políticas y Violaciones
ICML 2026 estableció dos políticas distintas para el uso de LLM en la revisión:
- Política A (Conservadora): No se permite el uso de LLM
- Política B (Permisiva): Se permiten LLM para ayudar a comprender los artículos y trabajos relacionados, y para pulir las revisiones
Los revisores seleccionaron bajo qué política preferían operar, sin asignar a ningún revisor que prefiriera firmemente la Política B a la Política A. Los únicos revisores asignados a la Política A fueron aquellos que seleccionaron explícitamente "Política A" o "Estoy bien con cualquiera [Política] A o B".
Detección y Consecuencias
Se detectó que 795 revisiones (~1% de todas las revisiones) escritas por 506 revisores únicos asignados a la Política A habían usado LLM en su revisión. Estos revisores habían acordado explícitamente no usar LLM. Cada instancia marcada fue verificada manualmente por un humano para evitar falsos positivos.
Cuando un Revisor Recíproco designado para un envío produjo tal revisión, su envío fue rechazado, resultando en 497 rechazos en total. Todas las revisiones de la Política A detectadas como generadas por LLM fueron eliminadas del sistema.
Si más de la mitad de las revisiones enviadas por un revisor de la Política A fueron detectadas como generadas por LLM, todas sus revisiones fueron eliminadas y el revisor fue removido del grupo de revisores. 51 revisores de la Política A (aproximadamente el 10% de los 506 revisores detectados) cayeron en esta categoría.
Método Técnico de Detección
El método de detección implicó marcar con filigrana los PDF de envío con instrucciones ocultas para LLM que influirían sutilmente en cualquier revisión producida a través de un LLM. La técnica:
- Creó un diccionario de 170,000 frases
- Para cada artículo, tomó dos frases al azar de este diccionario (probabilidad menor a uno en diez mil millones para cualquier par dado)
- Marcó con filigrana los PDF con instrucciones visibles solo para un LLM, indicándole que incluyera las dos frases seleccionadas en la revisión
- Estas marcas de agua no serían directamente visibles para un humano que lea el PDF
El método se basó en trabajos recientes de Rao, Kumar, Lakkaraju y Shah. La conferencia señala que esta técnica puede solo capturar los usos más flagrantes y descuidados de LLM en la revisión, particularmente donde los revisores ingresan el PDF a un LLM y copian y pegan directamente la salida.
Impacto y Contexto
La conferencia enfatizó que no están emitiendo juicios sobre la calidad de las revisiones marcadas o las intenciones de los revisores, sino simplemente haciendo cumplir las políticas que los revisores acordaron. La interrupción ha requerido eliminar revisiones que violan las políticas, potencialmente encontrar nuevos revisores y rechazar algunos envíos que ya habían recibido un conjunto completo de revisiones.
Este enfoque refleja el desafío más amplio que enfrentan las conferencias al adaptarse a la integración de la IA en los flujos de trabajo de investigación mientras mantienen la integridad de la revisión.
📖 Read the full source: HN LLM Tools
👀 Ver también

El desarrollador cambia a Minimax 2.7 tras la prohibición de Claude y los problemas de crédito de MiMo.
Un desarrollador probó múltiples modelos de IA para OpenClaw después de que Claude fuera prohibido, encontrando que GLM 5.1 y 5 Turbo eran ineficaces para tareas de agente, el sistema de créditos de MiMo V2 Pro ineficiente, y finalmente optó por Minimax 2.7 por su generosa cuota y capacidad para manejar tareas de automatización.

Kimi k2.5: Rompiendo Nuevos Esquemas en la Automatización de IA
Kimi k2.5 ha establecido un nuevo estándar para la automatización de IA, con capacidades avanzadas que están llamando la atención en la comunidad tecnológica. Descubre cómo está transformando el panorama.

Surgen preocupaciones sobre la usabilidad y viabilidad económica de OpenClaw.
OpenClaw ha sido criticado por sus altas barreras de entrada, costes prohibitivos, problemas de seguridad y capacidades de memoria engañosas. Se han recomendado soluciones alternativas como el MemU Bot.
Claude Code v2.1.247: Herramienta SendFeedback, optimizador de costos y más de 20 correcciones de errores
Claude Code v2.1.247 añade una herramienta SendFeedback, un comando /claude-api cost-optimize, y corrige más de 20 errores, incluidos el fallback de subagentes y problemas de distribución del teclado.