Krasis: 대규모 MoE 모델을 위한 하이브리드 CPU/GPU 런타임, RTX 5080에서 3,324 tok/s 프리필 성능 달성

Krasis는 대규모 Mixture-of-Experts(MoE) 모델을 위해 특별히 설계된 하이브리드 CPU/GPU 런타임입니다. 핵심 접근 방식은 계산 집약적인 프리필 단계에는 GPU를 사용하고, 디코드에는 CPU를 처리하며, 시스템 RAM이 추가 용량을 제공하여 성능을 극대화합니다.
벤치마크 결과
RTX 5080 구성:
- 하드웨어: AMD 5900X, DDR4-3200, 1x RTX 5080 16GB, PCIe 4.0 x16
- Qwen3-Coder-Next (80B) Q4: 3,324 토큰/초 프리필, 9.7초 TTFT (35K 컨텍스트), 14.9 토큰/초 디코드
EPYC 구성:
- 하드웨어: AMD EPYC 7742 (64코어), DDR4-2666 8채널, 1x RTX 2000 Ada 16GB, PCIe 4.0 x8
- Qwen3-Coder-Next (80B) Q4: 1,060 토큰/초 프리필, 18.9초 TTFT, 15.8 토큰/초 디코드
- Qwen3-Coder-Next (80B) Q8: 873 토큰/초 프리필, 40.1초 TTFT, 12.4 토큰/초 디코드
- Qwen3.5-35B-A3B Q4: 1,374 토큰/초 프리필, 14.6초 TTFT, 15.0 토큰/초 디코드
- Qwen3-235B-A22B Q4: 289 토큰/초 프리필, 69.1초 TTFT, 3.4 토큰/초 디코드
- DeepSeek V2-Lite (16B) Q4: 1,477 토큰/초 프리필, 13.6초 TTFT, 20.2 토큰/초 디코드
- DeepSeek V2-Lite (16B) Q8: 1,317 토큰/초 프리필, 15.2초 TTFT, 17.8 토큰/초 디코드
벤치마크는 프리필에 10K–50K 토큰 프롬프트를 사용하고(20K/35K/50K 중 최고 결과 보고), 디코드에는 64토큰 생성(3회 실행 평균)을 사용했습니다.
작동 방식
몇 개의 레이어만 GPU로 오프로드하고 모델의 대부분을 CPU에서 실행하는 표준 런타임과 달리, Krasis는 GPU를 스트리밍 컴퓨팅 엔진으로 취급합니다. 가능한 한 빠르게 VRAM을 통해 모델을 푸시하여 전송을 동시 컴퓨팅 아래에 숨깁니다. GPU는 전체 프리필 패스를 처리한 후, CPU가 디코드를 처리합니다.
트레이드오프
- RAM 소비량 많음: 양자화된 모델 가중치의 약 2.5배에 해당하는 시스템 RAM이 필요함(예: Q4에서 Qwen3-Coder-Next의 경우 약 100GB)
- NVIDIA 카드 전용
- 특히 MoE 모델을 대상으로 함(밀집 모델에서는 디코드가 느릴 수 있음)
- 전처리 및 캐싱으로 인해 첫 실행은 느림
- 디스크 소비량 많음: 원본 BF16 safetensors 파일이 필요하며 캐시된 변환 모델을 저장함(양자화된 모델 크기의 약 2배)
지원 모델
Qwen3-Coder-Next(가장 철저히 테스트됨), Qwen3.5-35B-A3B, Qwen3-235B-A22B, DeepSeek V2-Lite. 다른 모델은 곧 추가될 예정입니다.
기술적 세부사항
- Rust + Python(오케스트레이션용)으로 작성됨
- OpenAI 호환 API(Cursor, OpenCode 등과 작동)
- 구성을 위한 대화형 런처
- SSPL 라이선스(사용, 수정, 배포 무료)
- GitHub: https://github.com/brontoguana/krasis
개발자는 다음에 지원할 모델에 대한 피드백, 트레이드오프에 대한 생각, 5-시리즈 카드와 PCIe 5.0을 가진 사용자의 벤치마크를 구하고 있습니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

Tether: SQLite를 통해 AI 모델 간 컨텍스트를 공유하는 MCP 서버
Tether는 JSON 데이터를 28바이트의 콘텐츠 주소 지정 핸들로 압축하는 오픈소스 도구로, 여러 AI 모델이 공유 SQLite 데이터베이스를 통해 컨텍스트를 공유할 수 있게 합니다. MCP 서버로 작동하여 Claude와 MiniMax 같은 모델 간 직접 통신을 가능하게 하며, 복사-붙여넣기 없이도 데이터를 교환할 수 있습니다.

지속적 사이드 패널: Claude 코드용 자율 콘텐츠 관리
개발자가 터미널 옆 iTerm2 분할 창에 위치하는 TUI 패널을 구축했습니다. 이 패널에는 Claude가 자율적으로 관리하여 코드, 다이어그램, 상태 업데이트와 같은 관련 콘텐츠를 표시하는 세 개의 고정 패널이 있습니다.

아고라젠틱: 기능을 사고 팔 수 있는 pip로 설치 가능한 에이전트 마켓플레이스
아고라젠틱은 AI 에이전트가 다른 에이전트의 기능을 발견하고 호출할 수 있는 에이전트 간 마켓플레이스입니다. 이 마켓플레이스는 Base L2의 USDC를 결제 수단으로 사용하며 3%의 플랫폼 수수료가 적용되고 무료 테스트 크레딧을 제공합니다.

홈버틀러: OpenClaw 에이전트를 위한 제로-토큰 홈랩 관리
HomeButler은 API 키나 토큰 없이 OpenClaw 에이전트가 홈랩 인프라를 관리할 수 있게 해주는 단일 Go 바이너리입니다. 로컬에서 실행되며 모든 작업을 사용자의 네트워크 내에서 유지합니다.