MTP 멀티 토큰 예측: AMD Strix Halo & Radeon 9700 AI Pro에서의 2배 빠른 토큰 생성

멀티 토큰 예측(MTP)은 로컬 LLM의 토큰 생성 속도를 최대 2배까지 향상시킵니다. 새로운 데모 영상에서는 AMD Strix Halo와 듀얼 Radeon 9700 AI Pro 하드웨어에서 MTP를 실행하며, Qwen 3.6급 모델을 대상으로 합니다.
주요 내용
- 성능: MTP는 LLM 추론 속도를 최대 2배 가속화하며, 특히 코딩 에이전트에 유용합니다.
- 테스트된 하드웨어: AMD Strix Halo (Ryzen AI 300 시리즈로 추정) 및 듀얼 Radeon 9700 AI Pro (RDNA 4).
- 모델: Qwen 3.6 (Qwen2.5-7B 또는 유사 모델로 추정, 정확한 변형은 명시되지 않음).
- 데모 형식: MTP 작동 방식과 측정된 개선 사항을 다루는 YouTube 영상.
MTP는 단일 순방향 패스에서 여러 미래 토큰을 병렬로 예측하여 자기회귀 단계 수를 줄입니다. 이 기술은 코드처럼 토큰 패턴이 더 예측 가능한 구조화된 출력에 특히 효과적입니다.
컨텍스트를 제공하자면, AMD의 최신 GPU 컴퓨트 스택(ROCm)은 LLM 추론에서 NVIDIA의 CUDA를 따라잡고 있으며, llama.cpp 또는 vLLM을 통한 MTP 구현이 격차를 더 좁힐 수 있습니다. 로컬 코딩 에이전트(예: CodeLlama, DeepSeek-Coder)를 실행하는 개발자는 지원되는 하드웨어에서 의미 있는 속도 향상을 기대할 수 있습니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

블룸버그 보도, AI 노출로 인한 미국 일자리 손실 증가 시작
블룸버그는 AI에 노출된 직종에서 미국의 일자리 손실이 심각하다고 보도했으며, Hacker News 토론에서는 개발자와 기타 지식 근로자에 대한 실제 영향을 지목하고 있습니다.

Anthropic, Claude AI 에이전트 관련 코드 유출에 대응하다
Anthropic이 Claude AI 에이전트와 관련된 코드 유출을 막기 위해 노력하고 있으며, WSJ 보고서에 따르면 Hacker News에서 13점과 6개의 댓글을 받으며 논의되었습니다.

Claude Cowork 사용 제한이 7월 5일까지 10시간으로 두 배 증가
Anthropic이 Claude Cowork의 5시간 사용 제한을 다음 달 동안 10시간으로 두 배 늘렸습니다. 7월 5일까지 데스크톱 앱을 통해 이용 가능합니다.

Claude Code v2.1.163: 버전 고정, 플러그인 목록, 후크 개선 및 주요 버그 수정
Claude Code v2.1.163에서는 requiredMinimumVersion/requiredMaximumVersion 관리 설정, /plugin list 명령어, 훅 컨텍스트 개선, 그리고 claude -p 중단, Windows EEXIST, Bazel/EDR 워크플로우 관련 버그 수정이 추가되었습니다.