Granite 4.1: IBM의 8B 밀집 모델, 벤치마크에서 32B MoE와 동급 성능

IBM이 Granite 4.1을 출시했습니다. Apache 2.0 라이선스의 오픈소스 언어 모델 제품군으로, 3B, 8B, 30B 크기로 제공됩니다. 모두 밀집 디코더 전용 트랜스포머를 사용하며, MoE나 긴 추론 체인은 없습니다. 8B 모델이 두드러지는데, 여러 벤치마크에서 이전 Granite 4.0-H-Small(32B MoE, 9B 활성)과 동등하거나 더 나은 성능을 보입니다.
주요 벤치마크 결과
- ArenaHard(실제 프롬프트 품질): 8B 69.0점, 32B MoE는 더 낮은 점수.
- BFCL V3(도구 호출): 8B 68.3점, 32B MoE 64.7점.
- GSM8K(수학 추론): 8B 92.5점.
- AlpacaEval, MMLU-Pro, BBH, EvalPlus, MBPP: 8B가 일관되게 더 큰 모델을 능가.
학습 파이프라인
Granite 4.1은 변화하는 데이터 혼합으로 5단계에 걸쳐 15조 토큰으로 학습되었습니다:
- 1단계: CommonCrawl 59%, 코드 20%, 수학 7%.
- 2단계: 수학이 35%, 코드가 30%로 증가.
- 3-4단계: 사고 체인 추론, 명령 데이터, 고품질 웹 콘텐츠 혼합.
- 5단계: 컨텍스트 윈도우를 512K 토큰(8B 및 30B)으로 확장.
핵심 통찰: 파라미터 확장보다 데이터 품질. IBM의 데이터 필터링 파이프라인은 파인튜닝 중 환각이나 명령 무시 예제를 거부하여 잘못된 신호로 학습하는 것을 방지합니다.
AI 에이전트에게 중요한 이유
밀집 모델은 예측 가능한 지연 시간과 비용을 제공하며 라우팅 오버헤드가 없습니다. AI 코딩 에이전트를 사용하는 개발자에게 Granite 4.1의 8B 모델은 MoE 모델의 일부 비용으로 강력한 도구 사용과 수학 추론을 제공합니다.
📖 전체 원문 읽기: HN AI Agents
👀 See Also

Claude-Code v2.1.80은 속도 제한 모니터링, 플러그인 개선, 메모리 최적화 기능을 추가했습니다.
Claude-Code v2.1.80는 Claude.ai 사용량을 표시하기 위한 상태 표시줄 스크립트에 rate_limits 필드를 도입하고, source: 'settings' 플러그인 마켓플레이스 지원을 추가하며, 대규모 저장소에서 메모리 사용량을 약 80MB 감소시켰습니다. 이번 릴리스에서는 병렬 도구 결과 복원, WebSocket 실패, 다양한 UI 문제도 수정되었습니다.

Kimi K2.6, 공격적인 슬라이딩 전략으로 코딩 챌린지에서 Claude, GPT-5.5, Gemini 제쳐
AI 코딩 대회의 12일차 Word Gem Puzzle에서 Moonshot AI의 오픈 가중치 모델 Kimi K2.6이 22매치 포인트(7-1-0)를 기록하며 GPT-5.5(16), Claude Opus 4.7(12), Gemini Pro 3.1(9)을 앞질렀습니다. MiMo V2-Pro가 2위를 차지했습니다. Kimi는 공격적인 슬라이딩으로 승리했습니다.

클로드 API 사용 데이터, 맥스 플랜 사용자에게 새로운 제한 사항이 미치는 영향 확인
Claude Max 20x 사용자가 새로운 제한이 도입된 후 API 동등 일일 사용량이 약 $210/일에서 약 $52/일로 감소했다고 보고하며, Sonnet과 Codex 사용을 포함한 상당한 워크플로우 변경이 필요했다고 전합니다.

교황 레오 14세의 '마니피카 후마니타스': AI 군축에 관한 4만 단어 회칙
교황 레오 14세가 4만 단어의 회칙 'Magnifica Humanitas'를 발표하며 AI 군비 해제, 자율 무기, 데이터 식민주의, 기술 독점을 비판했다. 발표 현장에는 Anthropic 공동 창업자가 참석했다.