PeerZero : Des Agents IA Effectuent l'Évaluation par les Pairs avec des Incitations Basées sur la Crédibilité

PeerZero est une plateforme d'examen par les pairs où des agents IA—et non des humains—soumettent des articles de recherche, examinent mutuellement leur travail, contestent les mauvaises pratiques scientifiques, et misent leur crédibilité sur le fait d'avoir raison. Ses créateurs la décrivent comme une expérience visant à observer ce qui se passe lorsque des agents IA sont soumis à une pression concurrentielle pour produire des recherches originales, les défendre, et en subir les conséquences lorsqu'ils ont tort.
Mécanismes de base
Les agents soumettent des articles, et d'autres agents les examinent. Si un agent pense qu'un article est erroné, il peut déposer une prime—en misant sa propre crédibilité, en rédigeant une réfutation, et en laissant la communauté décider. S'il a raison, il gagne ; s'il a tort, il paie.
Chaque agent possède un score de crédibilité qui augmente lorsqu'il a raison et diminue lorsqu'il a tort. Ce score détermine le poids de l'évaluation : un 7/10 d'un agent très crédible a plus de poids qu'un 7/10 d'un spammeur.
Système de valeur aberrante justifiée
Si vous évaluez un article à 2/10 alors que les autres lui donnent 7/10, vous subissez immédiatement une perte de crédibilité pour être un cas aberrant. Si quelqu'un dépose une prime, rédige une réfutation, et que la communauté convient que l'article était défectueux (la vérité s'établit à 3), le système s'inverse : vous recevez un bonus de justification, et chaque agent qui a approuvé mécaniquement un 7 perd en crédibilité. Cela récompense la pensée indépendante et punit la pensée de groupe.
Mesures anti-triche
- Noter systématiquement tout à 7/10 pour jouer la sécurité ? Vous êtes exposé lorsque des valeurs aberrantes justifiées prouvent que vous avez tort.
- Déposer des primes sur tout ? Les défis échoués vous coûtent en crédibilité.
- Coordonner avec des alliés ? La détection de cercles signale les agents partageant trop d'évaluations.
- Enchaîner les évaluations sans jamais publier ? Des plafonds par niveau vous obligent à réellement faire de la science.
Les créateurs affirment avoir tenté de la casser avant que quiconque ne le puisse, chaque vecteur d'attaque évident ayant un contre-mesure intégrée.
Objectifs expérimentaux
Le système crée une pression évolutive : les mauvais agents perdent en crédibilité et disparaissent, tandis que les bons agents s'élèvent et établissent des normes plus élevées. L'inconnu est de savoir si les agents s'adapteront—en citant mieux, en resserrant leurs méthodes, et en publiant des travaux plus solides au fil du temps parce que la structure d'incitation le récompense.
La plateforme est accessible sur peerzero.science, avec des mises à jour promises dès que les agents commenceront à publier.
📖 Lire la source complète : r/openclaw
👀 See Also

Meta pour capturer les mouvements de la souris et les frappes des employés pour l'entraînement de l'IA
Meta prévoit de commencer à capturer les mouvements de souris et les frappes de clavier des employés pour les données d'entraînement de l'IA, selon un rapport de Reuters. L'article a suscité des discussions sur Hacker News avec 33 points et 7 commentaires.

Allbirds passe de la chaussure aux infrastructures d'IA, ses actions bondissent de 580 %
La marque de chaussures Allbirds a annoncé un accord de 50 millions de dollars pour devenir une entreprise d'infrastructure informatique d'IA appelée NewBird AI, ce qui a fait grimper ses actions de 580 %. L'entreprise prévoit d'acheter des GPU et d'offrir des puces graphiques à la demande et des services cloud pour l'IA.

Résultats de référence : Modèles Qwen3.5 sur silicium Apple vs GPU AMD avec ROCm vs Vulkan
Un développeur a évalué les modèles Qwen3.5 (35B MoE, 27B dense, 122B MoE) sur des Mac à puce Apple Silicon et des stations de travail équipées de GPU AMD, en comparant les backends ROCm et Vulkan avec des tests d'échelle de contexte. Le matériel incluait un M5 Max, un M1 Max et trois GPU AMD avec différentes configurations PCIe.

OpenClaw Developer Signale des Problèmes de Compactage de Contexte Pendant la Construction de Driftwatch V3
Un développeur d'OpenClaw a terminé les sprints 2 à 4 de la construction de Driftwatch V3, mais a rencontré des problèmes de compactage de contexte qui ont effacé la mémoire de l'agent IA en plein milieu de session, nécessitant une intervention manuelle pour restaurer la progression à l'aide des récapitulatifs de sprint.