Krasis: 대규모 MoE 모델을 위한 하이브리드 CPU/GPU 런타임, RTX 5080에서 3,324 tok/s 프리필 성능 달성

✍️ OpenClawRadar📅 게시일: February 27, 2026🔗 Source
Krasis: 대규모 MoE 모델을 위한 하이브리드 CPU/GPU 런타임, RTX 5080에서 3,324 tok/s 프리필 성능 달성
Ad

Krasis는 대규모 Mixture-of-Experts(MoE) 모델을 위해 특별히 설계된 하이브리드 CPU/GPU 런타임입니다. 핵심 접근 방식은 계산 집약적인 프리필 단계에는 GPU를 사용하고, 디코드에는 CPU를 처리하며, 시스템 RAM이 추가 용량을 제공하여 성능을 극대화합니다.

벤치마크 결과

RTX 5080 구성:

  • 하드웨어: AMD 5900X, DDR4-3200, 1x RTX 5080 16GB, PCIe 4.0 x16
  • Qwen3-Coder-Next (80B) Q4: 3,324 토큰/초 프리필, 9.7초 TTFT (35K 컨텍스트), 14.9 토큰/초 디코드

EPYC 구성:

  • 하드웨어: AMD EPYC 7742 (64코어), DDR4-2666 8채널, 1x RTX 2000 Ada 16GB, PCIe 4.0 x8
  • Qwen3-Coder-Next (80B) Q4: 1,060 토큰/초 프리필, 18.9초 TTFT, 15.8 토큰/초 디코드
  • Qwen3-Coder-Next (80B) Q8: 873 토큰/초 프리필, 40.1초 TTFT, 12.4 토큰/초 디코드
  • Qwen3.5-35B-A3B Q4: 1,374 토큰/초 프리필, 14.6초 TTFT, 15.0 토큰/초 디코드
  • Qwen3-235B-A22B Q4: 289 토큰/초 프리필, 69.1초 TTFT, 3.4 토큰/초 디코드
  • DeepSeek V2-Lite (16B) Q4: 1,477 토큰/초 프리필, 13.6초 TTFT, 20.2 토큰/초 디코드
  • DeepSeek V2-Lite (16B) Q8: 1,317 토큰/초 프리필, 15.2초 TTFT, 17.8 토큰/초 디코드

벤치마크는 프리필에 10K–50K 토큰 프롬프트를 사용하고(20K/35K/50K 중 최고 결과 보고), 디코드에는 64토큰 생성(3회 실행 평균)을 사용했습니다.

Ad

작동 방식

몇 개의 레이어만 GPU로 오프로드하고 모델의 대부분을 CPU에서 실행하는 표준 런타임과 달리, Krasis는 GPU를 스트리밍 컴퓨팅 엔진으로 취급합니다. 가능한 한 빠르게 VRAM을 통해 모델을 푸시하여 전송을 동시 컴퓨팅 아래에 숨깁니다. GPU는 전체 프리필 패스를 처리한 후, CPU가 디코드를 처리합니다.

트레이드오프

  • RAM 소비량 많음: 양자화된 모델 가중치의 약 2.5배에 해당하는 시스템 RAM이 필요함(예: Q4에서 Qwen3-Coder-Next의 경우 약 100GB)
  • NVIDIA 카드 전용
  • 특히 MoE 모델을 대상으로 함(밀집 모델에서는 디코드가 느릴 수 있음)
  • 전처리 및 캐싱으로 인해 첫 실행은 느림
  • 디스크 소비량 많음: 원본 BF16 safetensors 파일이 필요하며 캐시된 변환 모델을 저장함(양자화된 모델 크기의 약 2배)

지원 모델

Qwen3-Coder-Next(가장 철저히 테스트됨), Qwen3.5-35B-A3B, Qwen3-235B-A22B, DeepSeek V2-Lite. 다른 모델은 곧 추가될 예정입니다.

기술적 세부사항

  • Rust + Python(오케스트레이션용)으로 작성됨
  • OpenAI 호환 API(Cursor, OpenCode 등과 작동)
  • 구성을 위한 대화형 런처
  • SSPL 라이선스(사용, 수정, 배포 무료)
  • GitHub: https://github.com/brontoguana/krasis

개발자는 다음에 지원할 모델에 대한 피드백, 트레이드오프에 대한 생각, 5-시리즈 카드와 PCIe 5.0을 가진 사용자의 벤치마크를 구하고 있습니다.

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

클로드 코드로 구축된 오픈소스 취업 지원 프레임워크
Tools

클로드 코드로 구축된 오픈소스 취업 지원 프레임워크

한 개발자가 Claude Code로 구조화된 자기 프로필링, 자동화된 구인 포털 스크래핑, 적합성 평가, 맞춤형 지원서 작성을 위한 드래프터-리뷰어 에이전트 파이프라인을 처리하는 오픈소스 구직 프레임워크를 만들었습니다. 이 시스템은 제출 전에 멈추며 수동 검토가 필요합니다.

OpenClawRadar
Microsoft Teams SDK, 기존 AI 에이전트용 HTTP 서버 어댑터 추가
Tools

Microsoft Teams SDK, 기존 AI 에이전트용 HTTP 서버 어댑터 추가

Microsoft Teams SDK는 이제 개발자가 기존 AI 에이전트를 Microsoft Teams에 연결할 수 있도록 HTTP 서버 어댑터를 제공합니다. 이 접근 방식은 Slack이나 LangChain과 같은 다른 플랫폼용으로 구축된 에이전트가 최소한의 변경으로 Teams에서 실행될 수 있게 합니다.

OpenClawRadar
Claude Code로 구축한 로컬 음성-텍스트 macOS 앱: Vext 사례 연구
Tools

Claude Code로 구축한 로컬 음성-텍스트 macOS 앱: Vext 사례 연구

한 개발자가 3개월 동안 Apple Neural Engine에서 Whisper를 사용하는 macOS 음성-텍스트 앱 Vext를 만들었습니다. Claude Code가 Rust/Swift FFI, Core ML 최적화 및 단축키 아키텍처를 도왔습니다. 이 앱은 완전히 오프라인에서 실행되며 60초 오디오를 약 400ms에 변환합니다.

OpenClawRadar
클로드 코드의 플랜-회의적 서브 에이전트가 생성된 계획의 보안 허점을 식별합니다
Tools

클로드 코드의 플랜-회의적 서브 에이전트가 생성된 계획의 보안 허점을 식별합니다

한 개발자가 Claude Code의 계획 회의적 하위 에이전트를 발견했는데, 이 에이전트는 AI가 생성한 개발 계획의 격차와 문제점을 식별하며, 특히 처음에는 명확하지 않았던 보안 문제를 포착합니다. 이 에이전트는 이전에 알려진 보안 담당 하위 에이전트와 함께 작동하여 계획 품질을 향상시킵니다.

OpenClawRadar