Krasis: 대규모 MoE 모델을 위한 하이브리드 CPU/GPU 런타임, RTX 5080에서 3,324 tok/s 프리필 성능 달성

Krasis는 대규모 Mixture-of-Experts(MoE) 모델을 위해 특별히 설계된 하이브리드 CPU/GPU 런타임입니다. 핵심 접근 방식은 계산 집약적인 프리필 단계에는 GPU를 사용하고, 디코드에는 CPU를 처리하며, 시스템 RAM이 추가 용량을 제공하여 성능을 극대화합니다.
벤치마크 결과
RTX 5080 구성:
- 하드웨어: AMD 5900X, DDR4-3200, 1x RTX 5080 16GB, PCIe 4.0 x16
- Qwen3-Coder-Next (80B) Q4: 3,324 토큰/초 프리필, 9.7초 TTFT (35K 컨텍스트), 14.9 토큰/초 디코드
EPYC 구성:
- 하드웨어: AMD EPYC 7742 (64코어), DDR4-2666 8채널, 1x RTX 2000 Ada 16GB, PCIe 4.0 x8
- Qwen3-Coder-Next (80B) Q4: 1,060 토큰/초 프리필, 18.9초 TTFT, 15.8 토큰/초 디코드
- Qwen3-Coder-Next (80B) Q8: 873 토큰/초 프리필, 40.1초 TTFT, 12.4 토큰/초 디코드
- Qwen3.5-35B-A3B Q4: 1,374 토큰/초 프리필, 14.6초 TTFT, 15.0 토큰/초 디코드
- Qwen3-235B-A22B Q4: 289 토큰/초 프리필, 69.1초 TTFT, 3.4 토큰/초 디코드
- DeepSeek V2-Lite (16B) Q4: 1,477 토큰/초 프리필, 13.6초 TTFT, 20.2 토큰/초 디코드
- DeepSeek V2-Lite (16B) Q8: 1,317 토큰/초 프리필, 15.2초 TTFT, 17.8 토큰/초 디코드
벤치마크는 프리필에 10K–50K 토큰 프롬프트를 사용하고(20K/35K/50K 중 최고 결과 보고), 디코드에는 64토큰 생성(3회 실행 평균)을 사용했습니다.
작동 방식
몇 개의 레이어만 GPU로 오프로드하고 모델의 대부분을 CPU에서 실행하는 표준 런타임과 달리, Krasis는 GPU를 스트리밍 컴퓨팅 엔진으로 취급합니다. 가능한 한 빠르게 VRAM을 통해 모델을 푸시하여 전송을 동시 컴퓨팅 아래에 숨깁니다. GPU는 전체 프리필 패스를 처리한 후, CPU가 디코드를 처리합니다.
트레이드오프
- RAM 소비량 많음: 양자화된 모델 가중치의 약 2.5배에 해당하는 시스템 RAM이 필요함(예: Q4에서 Qwen3-Coder-Next의 경우 약 100GB)
- NVIDIA 카드 전용
- 특히 MoE 모델을 대상으로 함(밀집 모델에서는 디코드가 느릴 수 있음)
- 전처리 및 캐싱으로 인해 첫 실행은 느림
- 디스크 소비량 많음: 원본 BF16 safetensors 파일이 필요하며 캐시된 변환 모델을 저장함(양자화된 모델 크기의 약 2배)
지원 모델
Qwen3-Coder-Next(가장 철저히 테스트됨), Qwen3.5-35B-A3B, Qwen3-235B-A22B, DeepSeek V2-Lite. 다른 모델은 곧 추가될 예정입니다.
기술적 세부사항
- Rust + Python(오케스트레이션용)으로 작성됨
- OpenAI 호환 API(Cursor, OpenCode 등과 작동)
- 구성을 위한 대화형 런처
- SSPL 라이선스(사용, 수정, 배포 무료)
- GitHub: https://github.com/brontoguana/krasis
개발자는 다음에 지원할 모델에 대한 피드백, 트레이드오프에 대한 생각, 5-시리즈 카드와 PCIe 5.0을 가진 사용자의 벤치마크를 구하고 있습니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

클로드 코드로 구축된 오픈소스 취업 지원 프레임워크
한 개발자가 Claude Code로 구조화된 자기 프로필링, 자동화된 구인 포털 스크래핑, 적합성 평가, 맞춤형 지원서 작성을 위한 드래프터-리뷰어 에이전트 파이프라인을 처리하는 오픈소스 구직 프레임워크를 만들었습니다. 이 시스템은 제출 전에 멈추며 수동 검토가 필요합니다.

Microsoft Teams SDK, 기존 AI 에이전트용 HTTP 서버 어댑터 추가
Microsoft Teams SDK는 이제 개발자가 기존 AI 에이전트를 Microsoft Teams에 연결할 수 있도록 HTTP 서버 어댑터를 제공합니다. 이 접근 방식은 Slack이나 LangChain과 같은 다른 플랫폼용으로 구축된 에이전트가 최소한의 변경으로 Teams에서 실행될 수 있게 합니다.

Claude Code로 구축한 로컬 음성-텍스트 macOS 앱: Vext 사례 연구
한 개발자가 3개월 동안 Apple Neural Engine에서 Whisper를 사용하는 macOS 음성-텍스트 앱 Vext를 만들었습니다. Claude Code가 Rust/Swift FFI, Core ML 최적화 및 단축키 아키텍처를 도왔습니다. 이 앱은 완전히 오프라인에서 실행되며 60초 오디오를 약 400ms에 변환합니다.

클로드 코드의 플랜-회의적 서브 에이전트가 생성된 계획의 보안 허점을 식별합니다
한 개발자가 Claude Code의 계획 회의적 하위 에이전트를 발견했는데, 이 에이전트는 AI가 생성한 개발 계획의 격차와 문제점을 식별하며, 특히 처음에는 명확하지 않았던 보안 문제를 포착합니다. 이 에이전트는 이전에 알려진 보안 담당 하위 에이전트와 함께 작동하여 계획 품질을 향상시킵니다.