Opus 4.6은 연구에서 뛰어난 반면, Gemini 3.1 Pro는 예측 벤치마크에서 더 나은 판단력을 보입니다

한 Reddit 사용자가 2025년 10월부터 12월까지의 1,417개 이진 예측 질문에 대해 Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro, Grok 4.20 등 4개 최첨단 모델을 비교한 벤치마크 결과를 게시했습니다. 핵심 혁신은 성능을 두 가지 평가 조건으로 분해한 것입니다: 에이전틱(각 모델이 도구를 사용하여 자체 웹 연구 수행)과 고정 증거(모든 모델이 Bosse et al. 2026 표준화 방법론으로 편집된 약 12,000자 분량의 동일한 연구 자료를 제공받음)입니다.
주요 결과
- Opus 4.6은 에이전틱 조건에서 훨씬 더 뛰어난 성능을 보입니다: 무엇을 검색할지 결정하고, 어떤 페이지를 읽을지 결정하며, 관련 세부 정보를 추출하는 데 더 능숙합니다. 그러나 연구가 제거되면 이점이 사라집니다.
- Gemini 3.1 Pro는 고정 증거에 대해 더 날카로운 판단을 내립니다 — 예측 작업에서 정보 가중치를 더 정확하게 부여합니다. 표준화된 자료가 주어졌을 때 보정이 실제로 개선되는 반면, Opus의 보정은 급격히 하락합니다.
- GPT-5.4와 Grok 4.20은 조건 간에 거의 변화가 없어, 성능이 검색 전략에 덜 의존적임을 시사합니다.
- 순위는 조건에 따라 Opus와 Gemini 사이에서 바뀌었으며, 이는 평가가 깨지거나 편향되지 않았음을 시사한다고 게시자는 주장합니다(편향된 평가는 모든 모델을 같은 방향으로 움직였을 것입니다).
해석
보정의 비대칭성 — Opus의 보정은 검색이 제거될 때 하락하는 반면, Gemini의 보정은 개선됨 — 은 Opus가 검색 추적을 확률 할당을 위한 스캐폴딩으로 사용할 수 있음을 시사합니다. 즉, 검색 루프를 수행하는 행위 자체가 표면화하는 정보와 별개로 인식론적 작업의 일부를 수행합니다. 이는 AI 연구 에이전트를 평가하고 설계하는 방식에 영향을 미칠 수 있는 새로운 발견입니다.
한계 및 리소스
고정 증거 자료 자체가 LM에 의해 생성되었으므로, 테스트는 각 모델이 추상적인 판단보다는 특정 표준화된 버전의 증거를 얼마나 잘 해석하는지 측정할 수 있습니다. 게시자는 이를 한계로 지적하지만, 모델 간 상이한 행동이 우려를 줄인다고 주장합니다.
전체 보정 점수, 정제 점수, 조건별 분석은 다음에서 확인할 수 있습니다: futuresearch.ai/opus-research-gemini-judgment. 벤치마크 및 리더보드는 evals.futuresearch.ai에 있습니다.
게시자가 아는 한, 이는 최첨단 모델의 성능을 연구 단계와 판단 단계로 분해한 최초의 직접 평가입니다. 다른 도메인에서의 복제를 초대합니다.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also
발견된 소재: AI 에이전트가 500개 이상의 신소재를 발견했지만, 합성 경로가 타당한 것은 단 1개뿐
Discovered Materials(YC P26)는 최첨단 LLM을 사용하여 500개 이상의 새로운 반도체 재료를 컴퓨터로 발견했습니다. 그중 단 하나만이 실현 가능한 합성 경로를 가지고 있어 실험실에서 공장까지의 격차를 강조합니다.

Claude Code v2.1.196: 조직 기본 모델, 보안 수정, 백그라운드 작업 복구
Claude Code v2.1.196에 조직 기본 모델이 추가되고, MCP 서버 스폰의 보안 문제가 수정되었으며, 백그라운드 세션 안정성이 개선되고 /code-review의 토큰 사용량이 25% 절감되었습니다.

Claude Code v2.1.157: .claude/skills에서 플러그인 자동 로드, 에이전트 및 워크트리 개선
Claude Code v2.1.157는 .claude/skills 디렉토리에서 플러그인을 자동 로드하고, claude plugin init 스캐폴딩을 추가하며, settings.json의 agent 설정을 준수하고, 에이전트, 워크트리, 터미널 통합의 다양한 버그를 수정합니다.

AI 에이전트 일관성 연구: 주요 결과와 실용적 시사점
Claude, GPT-4o, Llama 모델을 대상으로 한 3,000건의 실험 연구에 따르면, 일관된 에이전트는 80~92%의 정확도를 보인 반면, 일관되지 않은 에이전트는 25~60%로 떨어졌으며, 69%의 차이는 첫 번째 도구 호출 시 발생했습니다.