VibeThinker-3B: AIME 수학 벤치마크에서 671B DeepSeek와 성능이 일치하는 3B 파라미터 모델

✍️ OpenClawRadar📅 게시일: June 28, 2026🔗 Source
VibeThinker-3B: AIME 수학 벤치마크에서 671B DeepSeek와 성능이 일치하는 3B 파라미터 모델
Ad

시나 웨이보의 9명 연구팀은 이번 주말 14쪽 분량의 arXiv 보고서를 발표하며, 3B 매개변수 모델 VibeThinker-3B가 수백 배 더 큰 모델의 추론 성능과 동등하거나 이를 능가한다고 주장했다. 이 모델은 AIME 2026(American Invitational Mathematics Examination)에서 94.3점을 기록, DeepSeek V3.2(671B 매개변수)와 어깨를 나란히 하고 Gemini 3 Pro(91.7)를 앞질렀다. 테스트 시간 스케일링 기법인 Claim-Level Reliability Assessment를 적용하면 점수가 97.1까지 올라간다.

주요 벤치마크

  • AIME 2025: 91.4
  • AIME 2026: 94.3 (CLRA 적용 시 97.1)
  • HMMT 2025: 89.3
  • BruMO 2025: 93.8
  • IMO-AnswerBench: 76.4
  • LiveCodeBench v6 (Pass@1): 80.2
  • 보지 못한 LeetCode 문제(2026년 4~5월): 96.1% 채택률
  • IFEval: 93.4

주목할 점은 VibeThinker-3B가 지식 벤치마크에서 저조한 성능을 보인다는 것이다: GPQA-Diamond에서 70.2점으로 Gemini 3 Pro(91.9)와 Claude Opus 4.5(87.0)에 크게 뒤진다. 연구진은 이를 그들의 주장과 일관된 결과라고 명시적으로 인정한다. 즉, 검증 가능한 추론은 '매개변수 집약적'인 반면, 개방형 도메인 지식은 '매개변수 확장적'이라는 것이다.

Ad

훈련 파이프라인

VibeThinker-3B는 알리바바 Qwen 팀의 Qwen2.5-Coder-3B를 기반으로, 이전 VibeThinker 연구에서 소개된 다단계 파이프라인인 '스펙트럼-투-시그널 원리(Spectrum-to-Signal Principle)'를 사용해 사후 훈련되었다. 논문에서는 매개변수 압축-커버리지 가설(Parametric Compression-Coverage Hypothesis)을 소개한다: 검증 가능한 추론은 소형 코어로 압축될 수 있는 반면, 광범위한 지식은 더 많은 매개변수를 필요로 한다는 것이다.

논문 공개 후 몇 시간 만에 Hugging Face Daily Papers에서 62개의 추천을 받았고, 모델 저장소는 130개의 좋아요, GitHub 저장소는 685개의 별을 받았다. 소셜 미디어에서는 회의론이 높았다. 사용자 @orcus108의 게시물은 161,000회 이상 조회되며 "이게 진짜 혁신인지, 아니면 벤치마크가 망가진 것인지 정말 모르겠다"고 질문했다.

참고로, DeepSeek V3.2는 671B 매개변수(약 224배 큼), GLM-5는 744B, Kimi K2.5는 1조 개를 넘는다. VibeThinker-3B는 일반 소비자용 노트북에서 실행 가능하다.

📖 전체 원문 읽기: HN AI Agents

Ad

👀 See Also

Anthropic, Claude 구독과 타사 도구 사용을 분리합니다
News

Anthropic, Claude 구독과 타사 도구 사용을 분리합니다

Anthropic은 4월 4일부터 Claude Pro/Team 구독이 OpenClaw 사용을 더 이상 포함하지 않으며, 서드파티 도구 사용에 대해서는 별도의 종량제 청구가 필요하다고 발표했습니다. 사용자는 계정 설정에서 '추가 사용량'을 활성화해야 OpenClaw를 통해 Claude를 계속 사용할 수 있습니다.

OpenClawRadar
Claude Code v2.1.212: /fork가 백그라운드 세션 복사로 전환 + 실행 루프 보호
News

Claude Code v2.1.212: /fork가 백그라운드 세션 복사로 전환 + 실행 루프 보호

Claude Code v2.1.212에서는 /fork가 대화를 새로운 백그라운드 세션으로 복사하고, WebSearch 및 하위 에이전트 생성에 세션당 제한(기본 200)을 추가하며, MCP 호출을 2분 후 자동으로 백그라운드로 전환합니다.

OpenClawRadar
OpenClaw 2026.4.2와 2026.3.31이 로컬 LLM 연결을 차단합니다
News

OpenClaw 2026.4.2와 2026.3.31이 로컬 LLM 연결을 차단합니다

OpenClaw 버전 2026.4.2와 2026.3.31이 로컬에서 호스팅되는 Ollama 인스턴스에 대한 연결 시간 초과를 일으키고 있습니다. 이 문제는 로컬에서 실행되는 Ubuntu 시스템에 연결할 때 발생하며, 오류 로그에는 LLM 요청 시간 초과 및 장애 조치 결정이 표시됩니다.

OpenClawRadar
AI 인터뷰 플랫폼 테스트: 채용 심사에서의 CodeSignal, Humanly, Eightfold
News

AI 인터뷰 플랫폼 테스트: 채용 심사에서의 CodeSignal, Humanly, Eightfold

더 버지(The Verge)는 채용 심사를 위한 CodeSignal, Humanly, Eightfold 등 세 가지 AI 인터뷰 플랫폼을 테스트했습니다. AI 아바타가 일대일 화상 인터뷰를 진행하고 응답을 분석하며 편향을 줄인다고 주장하지만, 훈련 데이터의 한계로 인해 완전히 편향 없는 시스템은 불가능합니다.

OpenClawRadar