DeepSeek-V4 Pro 및 Flash: 1.6T 파라미터, 100만 토큰 컨텍스트, 하이브리드 어텐션

DeepSeek AI가 Hugging Face에 DeepSeek-V4 시리즈의 프리뷰를 공개했습니다. 이 시리즈는 두 가지 Mixture-of-Experts(MoE) 언어 모델로 구성됩니다:
- DeepSeek-V4-Pro: 총 1조 6천억 파라미터, 토큰당 490억 활성화
- DeepSeek-V4-Flash: 총 2840억 파라미터, 토큰당 130억 활성화
두 모델 모두 100만 토큰의 컨텍스트 길이를 지원합니다.
아키텍처 업그레이드
V4 시리즈는 다음과 같은 요소를 결합한 하이브리드 어텐션 메커니즘을 도입했습니다:
- 압축된 희소 어텐션(CSA)
- 고도 압축 어텐션(HCA)
100만 토큰 컨텍스트 길이에서 DeepSeek-V4-Pro는 DeepSeek-V3.2 대비 단일 토큰 추론 FLOPs의 27%와 KV 캐시의 10%만 필요로 합니다.
또한, 모델은 매니폴드 제약 하이퍼 연결(mHC)을 통합하여 잔차 연결을 강화하고 훈련 안정성을 개선했습니다.
모델 세부 사항
- 저장소: Hugging Face의
deepseek-ai/DeepSeek-V4-Pro - 파이프라인 태그:
text-generation - 자동 모델 클래스:
AutoModelForCausalLM - 라이선스: MIT
- 가중치: 샤딩된 safetensors, BF16, F32, F8_E8M0, F8_E4M3, INT8 형식 포함
- safetensors 기준 총 파라미터 수: 약 8620억 파라미터 (모든 전문가 합계로 추정)
벤치마크 및 효율성
기술 보고서(아직 완전히 공개되지 않음)에 따르면 하이브리드 어텐션이 장기 컨텍스트 효율성을 크게 향상시킵니다. 100만 토큰 설정에서 이 모델은 V3.2 대비 FLOPs 73% 감소와 KV 캐시 90% 감소를 달성합니다.
장기 컨텍스트 애플리케이션(예: 문서 분석, 코드베이스 이해, 다중 턴 에이전트)을 개발하는 개발자에게 DeepSeek-V4는 비례하는 계산 비용 없이 컨텍스트 길이 한계를 극복할 수 있는 매력적인 선택입니다.
대상 사용자
이번 릴리스는 매우 긴 문서, 대규모 코드베이스 또는 전체 컨텍스트 유지가 필요한 다중 턴 대화를 처리해야 하는 AI 에이전트를 구축하는 개발자를 대상으로 합니다.
📖 전체 출처 읽기: HN AI Agents
👀 See Also

클로드 스킬 vs MCP: 개발자의 실용적 경계 질문
한 개발자가 Claude Skills 출시 이후 MCP의 가치가 결정적인 지점이 어디인지 질문하며, Skills가 도구 통합 추론을 더 어렵게 만들었고, 잘 구조화된 지시문만으로도 프로토콜 경계 없이 충분할 때가 많다고 언급합니다.

미세 조정된 Qwen3 소형 모델이 특정 작업에서 더 낮은 비용으로 최첨단 LLM을 능가합니다
정제된 Qwen3 모델(0.6B~8B 파라미터)은 함수 호출 및 Text2SQL을 포함한 9개 작업 중 6개에서 GPT-5, Gemini, Claude와 같은 최첨단 API 모델을 따라잡거나 능가했으며, 비용은 100만 요청당 $3으로 유사 성능 대비 $378에 비해 매우 낮았습니다.

MTP 멀티 토큰 예측: AMD Strix Halo & Radeon 9700 AI Pro에서의 2배 빠른 토큰 생성
MTP는 특히 코딩 에이전트에서 LLM 추론 속도를 최대 2배까지 가속화합니다. 영상은 MTP의 작동 방식과 AMD Strix Halo 및 듀얼 Radeon 9700에서 Qwen 3.6의 성능을 다룹니다.

스포티파이, 인간 아티스트와 AI 생성 아티스트 구분 위한 '인증' 배지 도입
스포티파이는 연결된 소셜 계정, 콘서트 날짜, 상품 등의 기준을 충족하는 아티스트 프로필에 녹색 체크 표시 'Verified by Spotify' 배지를 추가하여 인간 아티스트와 AI 생성 아티스트를 구분하려 합니다.