오픈소스 AI 현황: 패리티 달성, 생산 격차는 여전

Mozilla의 State of Open Source AI 보고서(V1.0, 2026년 7월)는 하드 데이터를 제공합니다: 오픈웨이트 모델이 최고 클로즈드 모델과의 성능 격차를 좁혔지만, 프로덕션 배포 격차는 여전히 존재합니다.
주요 발견 사항
- 성능 격차: Chatbot Arena에서의 격차가 2024년 8월 8.04%에서 0.5%로 줄었고, 2025년 2월 DeepSeek-R1이 잠시 동등해졌으나, 2026년 3월까지 클로즈드 추론 모델의 발전으로 3.3%로 다시 벌어졌습니다. 오픈은 코딩, 지시 수행, 일반 지식에서 패리티 또는 근접한 수준이며, 격차는 추론, 장문 컨텍스트 검색, 에이전트 작업에 집중되어 있습니다.
- 추론 비용 급감: GPT-4급 추론 비용이 36개월 만에 50배 하락하여 토큰 100만 개당 $20에서 $0.40가 되었습니다. 이는 닷컴 시대 대역폭이나 PC 컴퓨팅 가격 곡선보다 빠른 속도입니다.
- 토큰 볼륨: 오픈웨이트 모델이 이제 OpenRouter에서 프로덕션 토큰의 대부분을 처리합니다. 상위 5개 고용량 모델은 모두 오픈웨이트입니다. 중국 개발 모델은 주당 약 18T 토큰을 처리하며, 미국 개발 모델은 약 5.5T입니다(FT 분석).
- 도입 대비 프로덕션: 개발자의 79%가 AI 기능 추가 시 오픈 모델을 사용하는 반면(클로즈드 71%), 오픈 모델 팀 중 프로덕션에 도달한 비율은 51%에 불과합니다(클로즈드 63%). 격차는 운영 도구와 신뢰에 기인하며, 모델 성능의 문제가 아닙니다.
보고서는 구체적인 사용 사례를 인용합니다: 마오리 방송사가 데이터 소유권 라이선스 하에 te reo 언어를 위한 음성 모델 훈련; PwC가 자체 하드웨어에서 금융 언어로 오픈 모델을 미세 조정; 연구자들이 적십자사와 함께 오픈 의료 모델 구축; 농부들이 기기 내 오프라인 모델로 카사바 질병 진단; 스위스 공공 컨소시엄이 공공 슈퍼컴퓨터에서 국가 모델을 훈련하고 가중치, 데이터, 훈련 코드를 공개.
📖 전체 출처 읽기: HN LLM Tools
👀 See Also

구글, '모든 합법적' AI 사용에 대한 기밀 국방부 계약 체결
Google은 미국 국방부가 자사의 AI 모델을 '합법적인 정부 목적'으로 사용할 수 있도록 허용하는 기밀 계약을 체결한 것으로 알려졌으며, 대규모 감시와 자율 무기에 대한 제한은 구속력 없는 합의에 불과하다고 The Information이 보도했다.

AI 생성 코드의 숨겨진 비용: 스파게티 코드 디버깅
레딧 게시물이 AI 생성 코드를 빠르게 배포한 후 부풀려진 함수, 널 상태 버그, 난해한 변수명을 디버깅하는 데 몇 주를 보내는 현실을 포착했습니다.

Anthropic, 메시징 통합을 위한 Claude 코드 채널 출시
Anthropic이 Claude Code Channels를 출시하여 개발자들이 Telegram이나 Discord에서 Claude Code 세션에 DM을 보내 파일 편집, 테스트 실행, git 작업을 포함한 전체 도구 접근 권한을 가질 수 있게 되었습니다. 이 기능은 유료 Anthropic 플랜이 필요하며, OpenClaw의 20개 이상 플랫폼 지원에 비해 2개 플랫폼만 지원합니다.

LLM 공간 추론 능력 테스트: 소코반 벤치마크에서 ChatGPT, Qwen3.7-max, Gemini 3.5-thinking 선두
맞춤형 소코반 벤치마크가 엄격한 형식으로 LLM의 제로샷 공간 추론을 테스트했습니다. ChatGPT, Qwen3.7-max, Gemini 3.5-thinking만 통과했습니다. Gemini 3.5-flash, Qwen3.7-plus 등은 잘못된 이동이나 교착 상태로 실패했습니다.