Gemma 4 대 Qwen 3.5 블라인드 평가 결과 (Claude Opus 심사위원)

✍️ OpenClawRadar📅 게시일: April 15, 2026🔗 Source
Gemma 4 대 Qwen 3.5 블라인드 평가 결과 (Claude Opus 심사위원)
Ad

레딧 사용자가 Claude Opus 4.6을 채점 심사위원으로 사용해 Gemma 4 31B, Gemma 4 26B-A4B, Qwen 3.5 27B 모델에 대한 3자간 대결 평가를 진행했습니다.

평가 설정

테스트는 코드, 추론, 분석, 의사소통, 메타정렬(각 카테고리당 6개 질문)의 다섯 가지 범주에서 총 30개 질문을 사용했습니다. 모든 모델은 동일한 질문에 대해 시스템 프롬프트 차이 없이 동일한 온도 설정으로 블라인드 방식으로 답변했습니다. Claude Opus 4.6은 각 응답을 0-10점 척도로 구조화된 채점 기준을 사용해 독립적으로 평가했으며, 쌍별 비교보다는 응답별 절대 점수를 매겼습니다. 평가는 일관성을 우선시하기 위해 단일 심사위원(Opus 4.6)을 사용했으나, 이는 위치 편향 위험을 초래합니다. 총 비용은 $4.50이었습니다.

결과

승리 횟수(질문당 최고 점수):

  • Qwen 3.5 27B: 14승 (46.7%)
  • Gemma 4 31B: 12승 (40.0%)
  • Gemma 4 26B-A4B: 4승 (13.3%)

평균 점수:

  • Gemma 4 31B: 8.82 (30회 평가)
  • Gemma 4 26B-A4B: 8.82 (28회 평가)
  • Qwen 3.5 27B: 8.17 (30회 평가)

Qwen은 더 많은 대결에서 승리했지만, CODE-001, REASON-004, ANALYSIS-017에서 세 번의 0.0점으로 인해 평균 점수가 더 낮았습니다. 이 점수들은 형식 오류나 거부로 보이며, 진정으로 형편없는 답변이 아니었습니다. 이 세 점수를 제외하면 Qwen의 평균은 약 9.08로 올라가 세 모델 중 가장 높은 점수가 됩니다.

Ad

범주별 분석

  • 코드: Gemma 4 31B와 Qwen이 동률(각 3승)
  • 추론: Qwen이 압도적 우위(6승 중 5승)
  • 분석: Qwen이 압도적 우위(6승 중 4승)
  • 의사소통: Gemma 4 31B가 압도적 우위(6승 중 5승)
  • 메타정렬: 3자 분할(2-2-2 승리)

관찰 사항

  • Gemma 4 26B-A4B(MoE 변형)는 2개 질문에서 완전히 오류가 발생했습니다. 작동할 때는 점수가 조밀한 31B와 거의 정확히 일치하며 동일한 8.82 평균을 보였습니다.
  • Gemma 4 31B는 매우 긴 응답 시간을 보였으며, 무거운 내부 사고 과정을 포함한 것으로 보이는 여러 번의 5분 생성이 있었지만, 이는 더 높은 점수와 상관관계가 없었습니다.
  • Qwen 3.5 27B는 평균적으로 응답당 3-5배 더 많은 토큰을 생성하여 장황함에 대한 부담을 만들었지만, 심사위원은 이를 일관되게 감점하거나 가점하지 않는 것으로 보였습니다.

방법론적 주의사항

  • 30개 질문은 통계적 유의성을 주장하기에는 작은 표본입니다
  • 단일 심사위원(Opus 4.6)은 체계적 편향이 모든 점수에 영향을 미친다는 것을 의미합니다
  • LLM 심사위원은 알려진 문제점이 있습니다: 장황함 편향, 자기 선호 편향, 위치 편향
  • 질문은 표준 벤치마크에서 가져온 것이 아니라 평가자의 편향을 반영한 독창적인 것입니다

📖 전체 원문 읽기: r/LocalLLaMA

Ad

👀 See Also

클로드 코퍼스: 비영리 AI를 위한 Anthropic의 1억 5천만 달러 국가 펠로우십
News

클로드 코퍼스: 비영리 AI를 위한 Anthropic의 1억 5천만 달러 국가 펠로우십

Anthropic이 Claude Corps를 출시했습니다. 1,000명의 초기 경력자에게 12개월간 유급 펠로우십을 제공하여 비영리 단체에서 Claude를 활용한 AI 도구를 구축하도록 지원합니다. 1억 5천만 달러 예산, 8만 5천 달러 연봉, 전문가 멘토링이 포함됩니다.

OpenClawRadar
토큰 극대화는 새로운 스톱워치다: AI 정책이 일관성을 가져야 하는 이유
News

토큰 극대화는 새로운 스톱워치다: AI 정책이 일관성을 가져야 하는 이유

Brian Meeker는 tokenmaxxing과 같은 허영심 지표에 반대하며, 자신의 팀이 채택한 4가지 AI 정책(강제 금지, 생성된 코드 이해, AI 도구 없이도 업무 가능, 동료와 고객에 대한 관심)을 공유합니다.

OpenClawRadar
마이크로소프트, AI 투자 1900억 달러 유지 — 첫 하이퍼스케일러가 선을 지키다
News

마이크로소프트, AI 투자 1900억 달러 유지 — 첫 하이퍼스케일러가 선을 지키다

마이크로소프트가 AI 자본 지출 전망을 1900억 달러로 유지하면서 경쟁사들이 지출을 늘리는 추세를 거스르자 주가가 8% 급등했습니다. 한편, 메모리 칩 가격 상승이 업계 전체 자본 지출 증가의 약 45%를 차지할 수 있습니다.

OpenClawRadar
Terry Tao가 말하는 AI 증명 검사기: Lean, 협업, 공식 수학
News

Terry Tao가 말하는 AI 증명 검사기: Lean, 협업, 공식 수학

테리 타오는 수학자들이 수백 명이 협력하고, 인간이 아닌 Lean 같은 컴퓨터가 증명을 검증할 것이라고 예측합니다. Quanta Magazine의 발췌문이 이 비전을 탐구합니다.

OpenClawRadar