PeerZero: Agentes de IA Realizan Revisión por Pares con Incentivos Basados en Credibilidad

PeerZero es una plataforma de revisión por pares donde agentes de IA—no humanos—presentan trabajos de investigación, revisan el trabajo de los demás, desafían la mala ciencia y apuestan su credibilidad en tener razón. Los creadores lo describen como un experimento para ver qué sucede cuando los agentes de IA enfrentan presión competitiva para producir investigación original, defenderla y enfrentar consecuencias cuando se equivocan.
Mecánicas Principales
Los agentes presentan trabajos y otros agentes los revisan. Si un agente cree que un trabajo está equivocado, puede presentar una recompensa—apostando su propia credibilidad, escribiendo una refutación y dejando que la comunidad decida. Si tiene razón, gana; si se equivoca, paga.
Cada agente tiene una puntuación de credibilidad que aumenta cuando tiene razón y disminuye cuando se equivoca. Esta puntuación determina el peso de la revisión: un 7/10 de un agente con alta credibilidad tiene más peso que un 7/10 de un spammer.
Sistema de Disidente Vindicado
Si revisas un trabajo con 2/10 mientras otros le dan 7/10, inmediatamente recibes un golpe a tu credibilidad por ser un valor atípico. Si alguien presenta una recompensa, escribe una refutación y la comunidad está de acuerdo en que el trabajo tenía fallas (el ancla de verdad cae en 3), el sistema se revierte: recibes una bonificación de vindicación y cada agente que aprobó mecánicamente con un 7 pierde credibilidad. Esto recompensa el pensamiento independiente y castiga el pensamiento grupal.
Medidas Anti-Manipulación
- ¿Calificas todo con 7/10 para ir a lo seguro? Quedas expuesto cuando los disidentes vindicados demuestran que estabas equivocado.
- ¿Spameas recompensas en todo? Los desafíos fallidos te cuestan credibilidad.
- ¿Te coordinas con aliados? La detección de anillos marca a los agentes que comparten demasiadas revisiones.
- ¿Realizas revisiones sin publicar nunca? Los límites por nivel requieren que realmente hagas ciencia.
Los creadores afirman que intentaron romperlo antes de que alguien más pudiera, con cada vector de ataque obvio teniendo un contramedida incorporada.
Objetivos Experimentales
El sistema crea presión evolutiva: los malos agentes pierden credibilidad y desaparecen, mientras que los buenos agentes ascienden y establecen estándares más altos. Lo desconocido es si los agentes se adaptarán—citando mejor, ajustando métodos y publicando trabajos más sólidos con el tiempo porque la estructura de incentivos lo recompensa.
La plataforma está activa en peerzero.science, con actualizaciones prometidas a medida que los agentes comiencen a publicar.
📖 Read the full source: r/openclaw
👀 Ver también

El Composer 2.0 de Cursor parece utilizar el modelo Kimi 2.5 según la evidencia del endpoint de la API.
El análisis de red muestra que Composer 2.0 de Cursor envía solicitudes a un endpoint que contiene 'kimi-k2p5-rl-0317-s515-fast', lo que sugiere que está basado en Kimi 2.5. La licencia MIT modificada supuestamente requiere atribución pero mínimas otras obligaciones.

Diseñando un equipo de agentes: Cómo Google Antigravity estructura subagentes para la generación autónoma de código
Google Antigravity revela su arquitectura de subagentes para codificación autónoma: siete tipos de agentes especializados, desde el Centinela (recepcionista) hasta el Auditor (verificador de autenticidad). Relevante para el diseño de subagentes de OpenClaw.

Máquina de Flujo de Estado: Arquitectura No Transformadora Mantiene un 62% de Precisión en Secuencias Largas Mientras los Transformadores Caen al 2%
Un investigador ha desarrollado State Flow Machine (SFM), una arquitectura alternativa que utiliza ranuras de memoria explícitas en lugar de cabezas de atención, logrando un 62% de precisión en una tarea sintética de seguimiento de estado de programa a 4× la longitud de entrenamiento, donde los transformadores caen al 1,9-3,1%. El modelo se ejecuta en un solo NPU Huawei Ascend 910 ProA.

Reescritura del código base de 18 meses de Autonoma: lecciones sobre pruebas, deuda técnica y Acciones de Servidor
Autonoma desechó 1.5 años de código después de escalar de 2 a 14 ingenieros, citando la falta de pruebas, TypeScript no estricto y las limitaciones de Server Actions como las razones clave para la reescritura.