AMD 라이젠 AI NPU, 레모네이드 10.0 및 패스트플로우LM을 통해 리눅스 LLM 지원 획득

새로운 소식
AMD Ryzen AI NPU가 이제 오픈소스 Lemonade 서버 버전 10.0을 통해 Linux에서 대규모 언어 모델을 실행할 수 있게 되었으며, 이 버전은 LLM과 Whisper에 대한 Linux NPU 지원을 포함합니다. 이는 니치 코드를 넘어 Linux에서 Ryzen AI NPU의 첫 번째 실용적인 사용을 의미합니다.
기술적 세부사항
이 구현은 현재 세대 Ryzen AI NPU로 최대 256k 토큰의 컨텍스트 길이를 지원할 수 있는 Ryzen AI 전용으로 구축된 NPU 우선 런타임인 FastFlowLM 0.9.35를 기반으로 합니다. Lemonade 10.0은 또한 Claude Code와의 네이티브 통합을 추가합니다.
시스템 요구사항:
- Linux 7.0 커널 또는 기존 안정적인 커널 버전에 대한 AMDXDNA 드라이버 백포트
- FastFlowLM 0.9.35 런타임
- Lemonade 10.0 서버
이 지원은 모든 현재 AMD Ryzen AI 300/400 시리즈 SoC와 호환되어야 합니다. AMD는 지난 2년 동안 메인라인 Linux 커널에서 AMDXDNA 가속기 드라이버를 개발해 왔지만, 지금까지 사용자 공간 소프트웨어 지원은 극히 제한적이었습니다.
배경
이전에는 AMD 자체의 Linux용 GAIA 소프트웨어가 NPU 지원 대신 iGPU와 함께 Vulkan을 사용했습니다. 이 Linux 지원 시기는 Ryzen AI Embedded P100 시리즈가 시장에 출시되고 Ryzen AI PRO 400 시리즈가 소비자 Windows 배포보다 더 많은 Linux 사용을 보게 될 가능성이 있는 시점에 주목할 만합니다.
Lemonade는 FastFlowLM과 Lemonade를 사용하여 Linux에서 LLM을 실행하는 방법에 대한 문서를 제공합니다.
📖 전체 원문 읽기: HN AI Agents
👀 See Also

RTX 5080 16GB: Qwen3.6 35B MoE, 128k 컨텍스트에서 56 tok/s, 그리고 MTP가 도움이 되지 않는 이유
새로운 벤치마크 결과, RTX 5080 16GB에서 Qwen3.6 35B MoE가 128k 컨텍스트에서 초당 56토큰 생성 속도를 기록했습니다. MTP(멀티 토큰 예측)는 VRAM 압박으로 인해 전문가 레이어를 CPU로 밀어내면서 23% 느려집니다.

AI 지원 창작에서의 이중 잣대: 코딩 대 글쓰기
레딧 토론에서는 AI 지원 코딩(바이브 코딩)과 AI 지원 글쓰기에 대한 상반된 반응을 강조하며, 동일한 작업 흐름에도 불구하고 문화적 인식이 다르다는 점을 지적합니다.

DeepSeek V4 가격 현실 점검: Opus 대비 캐시 토큰 178배 저렴, 그러나 성능 격차 인정
DeepSeek V4 Pro 입력은 토큰 100만 개당 $0.145로, Claude Opus 4.7의 $5(34배 저렴)와 비교됩니다. 캐시 적중 시 $0.0036/$0.625(173배 저렴). 성능은 GPT-5.4 및 Gemini 3.1 Pro보다 3~6개월 뒤쳐집니다.

레딧 사용자가 블로그 작업 10가지로 Claude Sonnet 4.6과 GPT-5를 비교합니다
레딧 사용자가 10가지 일반적인 블로깅 작업에 대해 동일한 프롬프트를 사용하여 Claude Sonnet 4.6과 GPT-5를 테스트한 결과, 편집 시간 차이가 가장 유용한 지표로 나타났습니다.