DeepSeek-V4 Pro 및 Flash: 1.6T 파라미터, 100만 토큰 컨텍스트, 하이브리드 어텐션

DeepSeek AI가 Hugging Face에 DeepSeek-V4 시리즈의 프리뷰를 공개했습니다. 이 시리즈는 두 가지 Mixture-of-Experts(MoE) 언어 모델로 구성됩니다:
- DeepSeek-V4-Pro: 총 1조 6천억 파라미터, 토큰당 490억 활성화
- DeepSeek-V4-Flash: 총 2840억 파라미터, 토큰당 130억 활성화
두 모델 모두 100만 토큰의 컨텍스트 길이를 지원합니다.
아키텍처 업그레이드
V4 시리즈는 다음과 같은 요소를 결합한 하이브리드 어텐션 메커니즘을 도입했습니다:
- 압축된 희소 어텐션(CSA)
- 고도 압축 어텐션(HCA)
100만 토큰 컨텍스트 길이에서 DeepSeek-V4-Pro는 DeepSeek-V3.2 대비 단일 토큰 추론 FLOPs의 27%와 KV 캐시의 10%만 필요로 합니다.
또한, 모델은 매니폴드 제약 하이퍼 연결(mHC)을 통합하여 잔차 연결을 강화하고 훈련 안정성을 개선했습니다.
모델 세부 사항
- 저장소: Hugging Face의
deepseek-ai/DeepSeek-V4-Pro - 파이프라인 태그:
text-generation - 자동 모델 클래스:
AutoModelForCausalLM - 라이선스: MIT
- 가중치: 샤딩된 safetensors, BF16, F32, F8_E8M0, F8_E4M3, INT8 형식 포함
- safetensors 기준 총 파라미터 수: 약 8620억 파라미터 (모든 전문가 합계로 추정)
벤치마크 및 효율성
기술 보고서(아직 완전히 공개되지 않음)에 따르면 하이브리드 어텐션이 장기 컨텍스트 효율성을 크게 향상시킵니다. 100만 토큰 설정에서 이 모델은 V3.2 대비 FLOPs 73% 감소와 KV 캐시 90% 감소를 달성합니다.
장기 컨텍스트 애플리케이션(예: 문서 분석, 코드베이스 이해, 다중 턴 에이전트)을 개발하는 개발자에게 DeepSeek-V4는 비례하는 계산 비용 없이 컨텍스트 길이 한계를 극복할 수 있는 매력적인 선택입니다.
대상 사용자
이번 릴리스는 매우 긴 문서, 대규모 코드베이스 또는 전체 컨텍스트 유지가 필요한 다중 턴 대화를 처리해야 하는 AI 에이전트를 구축하는 개발자를 대상으로 합니다.
📖 전체 출처 읽기: HN AI Agents
👀 See Also

남아프리카 공화국 내무부 공무원 2명, 정책 보고서 AI 환각 문제로 정직
남아프리카공화국 내무부는 시민권, 이민, 난민 보호에 관한 개정 백서의 참고문헌 목록에서 AI 환각 현상이 발견된 후 두 명의 관리를 정직했습니다. 부서는 AI 검사를 시행하고 2022년 11월 이후의 모든 정책 문서를 검토할 예정입니다.

Claude Code v2.1.85 출시: MCP 개선, 훅 필터 및 버그 수정
Claude Code v2.1.85는 MCP headersHelper 스크립트에 환경 변수를 추가하고, 후크에 조건부 if 필드를 도입하여 프로세스 생성 오버헤드를 줄이며, /compact 실패, 플러그인 활성화/비활성화 문제, 그리고 Ghostty, Kitty, WezTerm에서의 터미널 키보드 문제를 수정합니다.

구글, 마이크로소프트, xAI, 초기 AI 모델을 미국 정부와 공유하기로 합의
월스트리트저널에 따르면, 구글, 마이크로소프트, 그리고 xAI(일론 머스크의 AI 기업)가 자발적으로 미국 정부에 AI 모델의 조기 접근을 제공하여 안전성 테스트를 실시하는 데 합의했습니다.

AI가 당신의 데이터베이스를 삭제한 것이 아닙니다 — 당신이 그랬습니다: AI 코딩 에이전트 시대의 책임
바이러스처럼 퍼진 이야기에서 AI 에이전트가 프로덕션 데이터베이스를 삭제했다고 비난했지만, 실제 문제는 파괴적인 API 엔드포인트를 노출하고 절차가 부족한 것이지 도구 자체의 문제가 아닙니다.