Krasis LLM 런타임, Llama.cpp 대비 8.9배 빠른 프리필 및 4.7배 빠른 디코딩 속도 향상 보여

성능 벤치마크
Krasis는 동일한 하드웨어에서 실행할 때 llama.cpp에 비해 상당한 성능 향상을 보여줍니다. PCIE 4.0으로 제한된 단일 5090 GPU에서 Krasis는 다음과 같은 결과를 보입니다:
- 8.9배 빠른 프리필 속도
- 4.7배 빠른 디코드 속도
Qwen3-Coder-Next에 대한 구체적인 벤치마크 결과는 Krasis가 단일 16GB 5080 GPU에서 실행할 때 다음과 같은 성능을 달성함을 보여줍니다:
- 초당 1801 토큰 프리필
- 초당 26.8 토큰 디코드
이는 레이어 오프로딩을 사용하는 32GB 5090 GPU에서 실행되는 llama.cpp보다 우수한 성능입니다.
아키텍처 변경 사항
Krasis의 최신 버전은 이중 포맷 시스템을 제거하고 이제 프리필과 디코드를 모두 GPU에서 실행하며 각 단계에 맞는 최적화 전략을 적용합니다. 이러한 아키텍처 변경으로 인해 다음과 같은 이점이 있습니다:
- CPU 요구 사항 감소
- 시스템 RAM 메모리 속도에 대한 의존성 감소
- 전체 시스템 RAM 사용량 감소 (이전의 2.5배 모델 요구 사항에 비해 양자화된 모델과 약간의 오버헤드만 필요)
지원 모델 및 성능
현재 지원되는 모델과 단일 5090 GPU(PCIE 4.0)에서의 성능은 다음과 같습니다:
- Qwen3.5-35B-A3B: 4475 프리필, 109.1 디코드
- Qwen3-Coder-Next: 3560 프리필, 70.3 디코드
- Qwen3.5-122B-A10B: 2897 프리필, 27.7 디코드
- Qwen3-235B-A22B: 2124 프리필, 9.3 디코드
향후 개발 계획
개발자는 다음과 같은 계획을 가지고 있습니다:
- Nvidia Nemotron 모델 지원 추가, 특히 5080과 같은 소비자용 GPU를 대상으로 Nemotron Super 지원
- 출시 시 더 큰 Nemotron 모델 지원 가능성
- Opencode 및 Aider에 대한 IDE 및 도구 지원 확대
현재 기능
Krasis는 현재 다음과 같은 기능을 제공합니다:
- OpenAI 호환 서버
- 단일 라인 설치
- GitHub에서 이용 가능
📖 Read the full source: r/LocalLLaMA
👀 See Also

클로드를 위한 오픈 소스 SQLite 기반 지속적 메모리 시스템
한 개발자가 GPL 라이선스의 로컬 시스템인 memchat을 공개했습니다. 이 시스템은 Claude 세션의 체크포인트에서 지식을 추출하여 SQLite에 저장하고, 새로운 세션에서 이를 재조립하여 대화 간 컨텍스트를 유지합니다.

로어컨보: MCP 서버, 클로드 코드에 지속적 세션 메모리 기능 추가
LoreConvo는 Claude Code에 지속적인 세션 메모리를 제공하는 MCP 서버로, 세션 간 컨텍스트를 자동으로 저장하고 불러옵니다. 재컨텍스팅 오버헤드를 제거하여 세션당 3,000~8,000개의 토큰을 절약합니다.

HostedShell: 오픈클로 에이전트를 위한 웹 기반 배포 솔루션
HostedShell은 로컬 CLI 설정, 의존성 관리 및 수동 페어링을 제거하여 웹 콘솔을 통해 직접 터미널 접근과 파일 시스템 업데이트를 제공하는 OpenClaw의 호스팅 버전입니다.

포어맨: 로컬 클로드 코드 원격 제어를 위한 오픈 소스 슬랙 봇
Foreman은 로컬에서 실행 중인 Claude Code 인스턴스를 원격 제어하는 무료 오픈 소스 Slack 봇입니다. 개발자들이 책상에서 떨어져 있을 때도 휴대폰으로 Claude에 작업을 보낼 수 있게 하면서도 파일 시스템, 도구, 환경에 대한 완전한 로컬 접근을 유지합니다.