Qwen 3 8B는 어려운 과제에 대한 블라인드 동료 평가에서 더 큰 모델들을 능가합니다.

✍️ OpenClawRadar📅 게시일: March 17, 2026🔗 Source
Qwen 3 8B는 어려운 과제에 대한 블라인드 동료 평가에서 더 큰 모델들을 능가합니다.
Ad

평가 결과

Multivac이라는 블라인드 동료 평가 시스템이 10개의 소규모 언어 모델을 대상으로 13개의 어려운 첨단 수준 질문을 테스트했습니다. GPT-5.4와 Claude Opus 4.6에도 동일한 난이도가 적용되었습니다. 모델들은 어떤 응답이 어떤 모델에서 나온 것인지 알지 못했으며, 순위는 동료 합의를 통해 계산되었습니다.

주요 발견

Qwen 3 8B(8B 파라미터)는 다음과 같은 성과를 달성했습니다:

  • 13개 평가 중 6개에서 1위
  • 13개 과제 중 12개에서 상위 3위 안에 듦
  • 평균 점수 9.40
  • 최악의 성적: 5위

이 성능은 파라미터 수가 훨씬 더 많은 모델들을 능가했으며, 다음을 포함합니다:

  • Gemma 3 27B(27B 파라미터): 3승, 11회 상위 3위, 평균 9.33
  • Kimi K2.5(32B/1T MoE): 3승, 5회 상위 3위, 평균 8.78
  • Qwen 3 32B(32B 파라미터): 2승, 5회 상위 3위, 평균 8.40

과제별 성능

코드 과제에서 Qwen 3 8B는 다음과 같은 순위를 기록했습니다:

  • Go 동시성 디버깅 1위(9.65)
  • 분산 락 분석 1위(9.33)
  • SQL 최적화 공동 1위(9.66)

추론 과제에서는 다음과 같은 순위를 기록했습니다:

  • 심슨의 역설 1위(9.51)
  • 투자 결정 이론 1위(9.63)
  • 베이지안 진단 2위(9.53)
Ad

주목할 만한 관찰

Qwen 3 32B는 분산 락 디버깅 과제(EVAL-20260315-043330)에서 상당한 성능 하락을 보였으며, 10점 만점에 1.00점을 기록했습니다. 다른 모든 모델은 5.5점 이상을 받았습니다. 8B 모델은 동일한 과제에서 9.33점을 기록했습니다. 원인은 명확하지 않지만 OpenRouter 라우팅, 양자화 아티팩트 또는 실제 실패 모드와 관련이 있을 수 있습니다.

기술적으로 32B 활성/1T MoE 모델인 Kimi K2.5는 502 디버깅 과제(9.57), 애로우의 투표 정리(9.18), 생존자 편향(9.63)을 포함한 3개 평가에서 우승했습니다.

Llama 3.1 8B는 13개 평가 중 10개에서 최하위 또는 차하위를 기록하며 평균 점수 7.51을 보였습니다. 이는 동일한 파라미터 수를 가진 Qwen 3 8B(9.40)와 비교했을 때 상당한 격차를 보여줍니다.

방법론 참고사항

이 평가는 블라인드 동료 시스템을 사용했으며, 10개 모델이 동일한 질문에 응답한 후 각 모델이 10개 응답을 모두 평가합니다(평가당 총 100개 판정, 자기 판정 제외). 저자는 실제 한계를 지적합니다: AI가 AI를 판단하는 것은 순환성 문제가 있으며, 점수는 절대적 진실보다는 동료 합의를 측정합니다. 상관관계를 측정하기 위한 인간 기준 연구가 진행 중입니다.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

클로드 AI, 기업 맞춤형 및 새로운 커넥터를 갖춘 Cowork 플러그인 업데이트 소개
News

클로드 AI, 기업 맞춤형 및 새로운 커넥터를 갖춘 Cowork 플러그인 업데이트 소개

클로드 AI가 Cowork 플러그인 업데이트를 발표하여 기업 관리자가 개인 플러그인 마켓플레이스를 생성하고 Google Workspace, Docusign, Apollo 등 다양한 도구에 대한 커넥터를 추가할 수 있게 되었습니다. 새로운 연구 프리뷰 기능을 통해 클로드가 Excel과 PowerPoint를 넘나들며 종단간 분석과 프레젠테이션 제작을 수행할 수 있습니다.

OpenClawRadar
AI 인프라의 숨겨진 금융 거품 – 주요 시사점
News

AI 인프라의 숨겨진 금융 거품 – 주요 시사점

AI 인프라 지출 붐에 대한 비판적 분석으로, 과거 기술 붕괴와 유사한 지속 불가능한 버블을 경고합니다. 이 PDF는 GPU와 데이터 센터에 대한 막대한 자본 지출이 실제 수익 창출을 훨씬 초과한다고 주장합니다.

OpenClawRadar
개발자가 8GB VRAM에서 임베드, 리랭크, 제로샷 모델을 서빙하기 위한 아키텍처 조언을 구합니다
News

개발자가 8GB VRAM에서 임베드, 리랭크, 제로샷 모델을 서빙하기 위한 아키텍처 조언을 구합니다

로컬 코딩 에이전트를 위한 통합 지식 그래프/RAG 서비스를 구축 중인 개발자가 8GB VRAM과 16GB 시스템 RAM의 메모리 제약으로 어려움을 겪고 있으며, 세 개의 트랜스포머 모델을 동시에 서빙할 때 OOM 오류, 지연 시간 급증, Linux 커널 강제 종료 문제를 경험하고 있습니다.

OpenClawRadar
클로드 오푸스 4.7, 하이브리드 추론 기능과 100만 토큰 컨텍스트 윈도우로 출시
News

클로드 오푸스 4.7, 하이브리드 추론 기능과 100만 토큰 컨텍스트 윈도우로 출시

Anthropic이 Claude Opus 4.7을 출시했습니다. 이는 1백만 컨텍스트 윈도우를 갖춘 하이브리드 추론 모델로, 코딩, 비전, 복잡한 다단계 작업에서 더 강력한 성능을 제공합니다. 가격은 입력 토큰 100만 개당 5달러, 출력 토큰 100만 개당 25달러부터 시작합니다.

OpenClawRadar