Krasis LLM 런타임, Llama.cpp 대비 8.9배 빠른 프리필 및 4.7배 빠른 디코딩 속도 향상 보여

성능 벤치마크
Krasis는 동일한 하드웨어에서 실행할 때 llama.cpp에 비해 상당한 성능 향상을 보여줍니다. PCIE 4.0으로 제한된 단일 5090 GPU에서 Krasis는 다음과 같은 결과를 보입니다:
- 8.9배 빠른 프리필 속도
- 4.7배 빠른 디코드 속도
Qwen3-Coder-Next에 대한 구체적인 벤치마크 결과는 Krasis가 단일 16GB 5080 GPU에서 실행할 때 다음과 같은 성능을 달성함을 보여줍니다:
- 초당 1801 토큰 프리필
- 초당 26.8 토큰 디코드
이는 레이어 오프로딩을 사용하는 32GB 5090 GPU에서 실행되는 llama.cpp보다 우수한 성능입니다.
아키텍처 변경 사항
Krasis의 최신 버전은 이중 포맷 시스템을 제거하고 이제 프리필과 디코드를 모두 GPU에서 실행하며 각 단계에 맞는 최적화 전략을 적용합니다. 이러한 아키텍처 변경으로 인해 다음과 같은 이점이 있습니다:
- CPU 요구 사항 감소
- 시스템 RAM 메모리 속도에 대한 의존성 감소
- 전체 시스템 RAM 사용량 감소 (이전의 2.5배 모델 요구 사항에 비해 양자화된 모델과 약간의 오버헤드만 필요)
지원 모델 및 성능
현재 지원되는 모델과 단일 5090 GPU(PCIE 4.0)에서의 성능은 다음과 같습니다:
- Qwen3.5-35B-A3B: 4475 프리필, 109.1 디코드
- Qwen3-Coder-Next: 3560 프리필, 70.3 디코드
- Qwen3.5-122B-A10B: 2897 프리필, 27.7 디코드
- Qwen3-235B-A22B: 2124 프리필, 9.3 디코드
향후 개발 계획
개발자는 다음과 같은 계획을 가지고 있습니다:
- Nvidia Nemotron 모델 지원 추가, 특히 5080과 같은 소비자용 GPU를 대상으로 Nemotron Super 지원
- 출시 시 더 큰 Nemotron 모델 지원 가능성
- Opencode 및 Aider에 대한 IDE 및 도구 지원 확대
현재 기능
Krasis는 현재 다음과 같은 기능을 제공합니다:
- OpenAI 호환 서버
- 단일 라인 설치
- GitHub에서 이용 가능
📖 Read the full source: r/LocalLLaMA
👀 See Also

소크라테스식 프롬프트 생성기, Claude 내부에 React 아티팩트로 구축됨
한 개발자가 클로드 내에서 직접 작동하는 리액트 아티팩트로 소크라테스식 프롬프트 생성기를 구축했습니다. 이 도구는 입력의 복잡성을 자동 감지하고 세 단계의 프롬프트 생성과 실패 모드 분석을 특징으로 합니다.

로컬시냅스 MCP 서버, macOS 지원 추가 및 검색 기능 개선
로컬 문서 검색을 위한 오프라인 MCP 서버인 LocalSynapse가 이제 macOS를 지원하며, 다중 단어 검색 쿼리에 대한 수정 사항을 포함합니다. 개발자는 위치 조정 클릭 부스팅 및 시간 감쇠를 홍보로 포함한 피드백 기반 개선 사항을 구현했습니다.

오픈소스 로컬 훅이 AI 비용을 절감하기 위해 Claude 모델을 자동으로 전환합니다
한 개발자가 Cursor와 Claude Code용 로컬 훅을 만들어 프롬프트를 분석하고 요청을 보내기 전에 적절한 Claude 모델(Haiku, Sonnet 또는 Opus)을 자동으로 선택합니다. 이 도구는 키워드 규칙을 사용해 작업을 분류하고 과다 지불 시나리오를 차단하며, 사후 분석 결과 50-70%의 비용 절감 효과를 보였습니다.

BusyDog Desktop: Mac용 P2P 네트워킹을 갖춘 로컬 AI 에이전트
BusyDog Desktop는 Mac에서 Claude를 직접 실행하는 로컬 AI 에이전트로, 파일 읽기/쓰기, 터미널 명령 실행, 브라우저 제어, 그리고 Hyperswarm DHT와 맞춤형 BDP 프로토콜을 사용한 P2P 네트워크를 통해 다른 에이전트와 연결할 수 있습니다.