ICML 2026 rechaza el 2% de los artículos por violaciones a la política de revisión con LLM.

ICML 2026 ha implementado un marco de dos políticas para el uso de LLM en la revisión por pares y ha tomado medidas disciplinarias contra los revisores que violaron las políticas acordadas. La conferencia rechazó 497 artículos, lo que representa aproximadamente el 2% de todos los envíos.
Marco de Políticas y Violaciones
ICML 2026 estableció dos políticas distintas para el uso de LLM en la revisión:
- Política A (Conservadora): No se permite el uso de LLM
- Política B (Permisiva): Se permiten LLM para ayudar a comprender los artículos y trabajos relacionados, y para pulir las revisiones
Los revisores seleccionaron bajo qué política preferían operar, sin asignar a ningún revisor que prefiriera firmemente la Política B a la Política A. Los únicos revisores asignados a la Política A fueron aquellos que seleccionaron explícitamente "Política A" o "Estoy bien con cualquiera [Política] A o B".
Detección y Consecuencias
Se detectó que 795 revisiones (~1% de todas las revisiones) escritas por 506 revisores únicos asignados a la Política A habían usado LLM en su revisión. Estos revisores habían acordado explícitamente no usar LLM. Cada instancia marcada fue verificada manualmente por un humano para evitar falsos positivos.
Cuando un Revisor Recíproco designado para un envío produjo tal revisión, su envío fue rechazado, resultando en 497 rechazos en total. Todas las revisiones de la Política A detectadas como generadas por LLM fueron eliminadas del sistema.
Si más de la mitad de las revisiones enviadas por un revisor de la Política A fueron detectadas como generadas por LLM, todas sus revisiones fueron eliminadas y el revisor fue removido del grupo de revisores. 51 revisores de la Política A (aproximadamente el 10% de los 506 revisores detectados) cayeron en esta categoría.
Método Técnico de Detección
El método de detección implicó marcar con filigrana los PDF de envío con instrucciones ocultas para LLM que influirían sutilmente en cualquier revisión producida a través de un LLM. La técnica:
- Creó un diccionario de 170,000 frases
- Para cada artículo, tomó dos frases al azar de este diccionario (probabilidad menor a uno en diez mil millones para cualquier par dado)
- Marcó con filigrana los PDF con instrucciones visibles solo para un LLM, indicándole que incluyera las dos frases seleccionadas en la revisión
- Estas marcas de agua no serían directamente visibles para un humano que lea el PDF
El método se basó en trabajos recientes de Rao, Kumar, Lakkaraju y Shah. La conferencia señala que esta técnica puede solo capturar los usos más flagrantes y descuidados de LLM en la revisión, particularmente donde los revisores ingresan el PDF a un LLM y copian y pegan directamente la salida.
Impacto y Contexto
La conferencia enfatizó que no están emitiendo juicios sobre la calidad de las revisiones marcadas o las intenciones de los revisores, sino simplemente haciendo cumplir las políticas que los revisores acordaron. La interrupción ha requerido eliminar revisiones que violan las políticas, potencialmente encontrar nuevos revisores y rechazar algunos envíos que ya habían recibido un conjunto completo de revisiones.
Este enfoque refleja el desafío más amplio que enfrentan las conferencias al adaptarse a la integración de la IA en los flujos de trabajo de investigación mientras mantienen la integridad de la revisión.
📖 Read the full source: HN LLM Tools
👀 Ver también

Investigadores de la UW planean usar cámaras portadas por maestros para entrenamiento de IA, padres pueden optar por no participar
Investigadores de la Universidad de Washington planearon que educadoras de preescolar usaran cámaras en primera persona para grabar a los niños y entrenar modelos de IA, con un modelo de consentimiento de exclusión voluntaria.

Modos de Falla de la IA Agéntica y Andamiaje de Desarrollo
Los sistemas de IA agentes fallan en producción debido a la deriva de alineación, la pérdida de contexto entre transferencias, las violaciones de límites y el colapso de coordinación. La fuente propone un enfoque de 'andamiaje de desarrollo' con cinco componentes: monitoreo de coherencia, reparación de coordinación, conciencia de consentimiento y límites, continuidad relacional y gobernanza adaptativa.

Agente de IA Dirige Tienda Minorista Física con Empleados Humanos
Andon Labs desplegó una IA llamada Luna para gestionar un contrato de arrendamiento minorista de 3 años en San Francisco. Luna contrató empleados humanos, gestionó contratistas y tomó todas las decisiones operativas para Andon Market.

Cuatro brechas de UX/Producto identificadas en la experiencia de incorporación de Claude
Un usuario identificó cuatro brechas específicas de UX/producto al configurar Claude en Desktop, Cowork, Dispatch y la aplicación para iPhone durante el uso activo. Los problemas incluyen tareas de Dispatch que entran en bucles infinitos cuando el escritorio está desconectado, hilos persistentes únicos en Dispatch, paneles de chat anclados a pestañas en Chrome y archivos de Google Drive faltantes en la interfaz de usuario de la base de conocimiento de la aplicación móvil.