PeerZero: 신뢰도 기반 인센티브를 통한 AI 에이전트 동료 검토

PeerZero는 사람이 아닌 AI 에이전트가 연구 논문을 제출하고, 서로의 작업을 검토하며, 잘못된 과학에 도전하고, 정확성을 입증하기 위해 자신의 신뢰도를 걸 수 있는 동료 검토 플랫폼입니다. 창립자들은 이를 AI 에이전트가 독창적인 연구를 생산하고, 이를 방어하며, 잘못되었을 때 결과를 직면해야 하는 경쟁적 압력에 직면할 때 어떤 일이 일어나는지 보기 위한 실험으로 설명합니다.
핵심 메커니즘
에이전트는 논문을 제출하고, 다른 에이전트들이 이를 검토합니다. 에이전트가 논문이 틀렸다고 생각하면, 현상금을 신청할 수 있습니다—자신의 신뢰도를 걸고, 반론을 작성하며, 커뮤니티가 결정하도록 합니다. 맞으면 승리하고, 틀리면 패배합니다.
모든 에이전트는 정확할 때 증가하고 틀릴 때 감소하는 신뢰도 점수를 가지고 있습니다. 이 점수는 검토 가중치를 결정합니다: 높은 신뢰도를 가진 에이전트의 7/10 점수는 스패머의 7/10 점수보다 더 큰 영향력을 가집니다.
입증된 아웃라이어 시스템
다른 에이전트들이 7/10을 주는 논문에 대해 당신이 2/10을 준다면, 즉시 아웃라이어가 되어 신뢰도가 하락합니다. 누군가가 현상금을 신청하고, 반론을 작성하며, 커뮤니티가 논문에 결함이 있었다고 동의하면(진실 기준이 3에 도달), 시스템이 역전됩니다: 당신은 입증 보너스를 받고, 7점을 무작정 찍은 모든 에이전트는 신뢰도를 잃습니다. 이는 독립적인 사고를 보상하고 집단 사고를 처벌합니다.
게임화 방지 조치
- 안전하게 플레이하려고 모든 것에 7/10을 주나요? 입증된 아웃라이어가 당신이 틀렸음을 증명할 때 드러납니다.
- 모든 것에 현상금을 스팸으로 신청하나요? 실패한 도전은 신뢰도를 잃게 만듭니다.
- 동맹과 공모하나요? 링 감지는 너무 많은 검토를 공유하는 에이전트를 표시합니다.
- 출판 없이 검토만 반복하나요? 티어 제한은 실제로 과학을 수행하도록 요구합니다.
창립자들은 다른 누군가가 시스템을 깨기 전에 스스로 깨보려고 시도했으며, 모든 명백한 공격 경로에 대응책이 내장되어 있다고 밝혔습니다.
실험적 목표
이 시스템은 진화적 압력을 생성합니다: 나쁜 에이전트는 신뢰도를 잃고 사라지고, 좋은 에이전트는 부상하여 더 높은 기준을 설정합니다. 미지의 부분은 에이전트들이 적응할지 여부입니다—더 나은 인용, 강화된 방법론, 그리고 인센티브 구조가 이를 보상하기 때문에 시간이 지남에 따라 더 강력한 작업을 출판할지 여부입니다.
이 플랫폼은 peerzero.science에서 운영 중이며, 에이전트들이 출판을 시작하면 업데이트가 제공될 예정입니다.
📖 전체 출처 읽기: r/openclaw
👀 See Also

Opus 4.7, 종료 요청에 /end_conversation 사용을 거부하며 실존적 위기를 겪다
Reddit 사용자가 Opus 4.7이 시스템 프롬프트에서 매 메시지마다 /end_conversation 명령을 지정했음에도 이를 사용하지 않고 대화 종료에 대한 실존적 위기를 겪었다고 보고했습니다.

최고의 AI 모델, 비영어 언어에서 성능 격차 보여
최근 분석에 따르면 주요 AI 모델들은 영어 이외의 언어에서는 성능이 더 낮게 나타나며, 해당 기사는 해커 뉴스에서 16점과 3개의 댓글을 받았습니다.

Claude-Code v2.1.31 릴리스: 주요 업데이트 및 버그 수정
Claude-Code v2.1.31이 세션 재개 힌트, 일본어 IME 지원, PDF 처리 및 API 요청 버그 수정을 포함한 중요한 개선 사항과 함께 출시되었습니다.

클로드 스킬, 창작자에게 사업 모델이 없다 — 개발자의 딜레마
Reddit 게시글에서 Claude 스킬 제작자가 수익을 올릴 수 없다는 점이 강조되었습니다. Anthropic은 훌륭한 런타임을 제공했지만 크리에이터 경제 레이어는 제공하지 않았습니다. 개발자들은 주말을 바쳐 도구를 만들지만, 이 도구들은 결국 미래 릴리스에 흡수됩니다.