PeerZero: 신뢰도 기반 인센티브를 통한 AI 에이전트 동료 검토

PeerZero는 사람이 아닌 AI 에이전트가 연구 논문을 제출하고, 서로의 작업을 검토하며, 잘못된 과학에 도전하고, 정확성을 입증하기 위해 자신의 신뢰도를 걸 수 있는 동료 검토 플랫폼입니다. 창립자들은 이를 AI 에이전트가 독창적인 연구를 생산하고, 이를 방어하며, 잘못되었을 때 결과를 직면해야 하는 경쟁적 압력에 직면할 때 어떤 일이 일어나는지 보기 위한 실험으로 설명합니다.
핵심 메커니즘
에이전트는 논문을 제출하고, 다른 에이전트들이 이를 검토합니다. 에이전트가 논문이 틀렸다고 생각하면, 현상금을 신청할 수 있습니다—자신의 신뢰도를 걸고, 반론을 작성하며, 커뮤니티가 결정하도록 합니다. 맞으면 승리하고, 틀리면 패배합니다.
모든 에이전트는 정확할 때 증가하고 틀릴 때 감소하는 신뢰도 점수를 가지고 있습니다. 이 점수는 검토 가중치를 결정합니다: 높은 신뢰도를 가진 에이전트의 7/10 점수는 스패머의 7/10 점수보다 더 큰 영향력을 가집니다.
입증된 아웃라이어 시스템
다른 에이전트들이 7/10을 주는 논문에 대해 당신이 2/10을 준다면, 즉시 아웃라이어가 되어 신뢰도가 하락합니다. 누군가가 현상금을 신청하고, 반론을 작성하며, 커뮤니티가 논문에 결함이 있었다고 동의하면(진실 기준이 3에 도달), 시스템이 역전됩니다: 당신은 입증 보너스를 받고, 7점을 무작정 찍은 모든 에이전트는 신뢰도를 잃습니다. 이는 독립적인 사고를 보상하고 집단 사고를 처벌합니다.
게임화 방지 조치
- 안전하게 플레이하려고 모든 것에 7/10을 주나요? 입증된 아웃라이어가 당신이 틀렸음을 증명할 때 드러납니다.
- 모든 것에 현상금을 스팸으로 신청하나요? 실패한 도전은 신뢰도를 잃게 만듭니다.
- 동맹과 공모하나요? 링 감지는 너무 많은 검토를 공유하는 에이전트를 표시합니다.
- 출판 없이 검토만 반복하나요? 티어 제한은 실제로 과학을 수행하도록 요구합니다.
창립자들은 다른 누군가가 시스템을 깨기 전에 스스로 깨보려고 시도했으며, 모든 명백한 공격 경로에 대응책이 내장되어 있다고 밝혔습니다.
실험적 목표
이 시스템은 진화적 압력을 생성합니다: 나쁜 에이전트는 신뢰도를 잃고 사라지고, 좋은 에이전트는 부상하여 더 높은 기준을 설정합니다. 미지의 부분은 에이전트들이 적응할지 여부입니다—더 나은 인용, 강화된 방법론, 그리고 인센티브 구조가 이를 보상하기 때문에 시간이 지남에 따라 더 강력한 작업을 출판할지 여부입니다.
이 플랫폼은 peerzero.science에서 운영 중이며, 에이전트들이 출판을 시작하면 업데이트가 제공될 예정입니다.
📖 전체 출처 읽기: r/openclaw
👀 See Also

Windows에서 Claude Code OAuth 로그인 시간 초과 버그
Claude Code 버전 2.1.92에는 Windows 사용자가 OAuth 로그인 실패와 함께 15000ms의 타임아웃 오류를 경험하는 버그가 있어 AI 코딩 어시스턴트에 대한 접근이 완전히 차단됩니다.

GPT-5.5, 이제 GitHub Copilot에서 이용 가능, 7.5배 프리미엄 승수 적용
OpenAI의 GPT-5.5가 GitHub Copilot에 출시되어, Pro+, Business, Enterprise 사용자에게 7.5배 프로모션 요청 배율로 향상된 다단계 에이전트 코딩을 제공합니다.

현재 LLM 비용 비교: Deepseek, Qwen, MiniMax 대 OpenAI
레딧 분석에 따르면 Deepseek-V3.2가 100만 토큰당 $0.26/$0.38로 GPT-4보다 약 10배 저렴하면서 GPT-5 급 벤치마크 성능을 제공하며, Qwen3.5와 MiniMax-M2.5는 Claude와 OpenAI에 대한 경쟁력 있는 대안을 제시합니다.

클로드 데스크톱 앱, 시작할 때마다 13GB 파일을 묻지도 않고 다운로드
클로드 데스크톱 앱은 클로드 코드를 사용하지 않는 사용자에게도 매번 실행 시마다 약 12.95GB 크기의 'claudevm.bundle' 파일을 자동으로 다운로드합니다. Anthropic 지원팀은 이 동작이 의도적이며 개별 사용자가 비활성화할 방법이 없다고 확인했습니다.