Krasis LLM 런타임, Llama.cpp 대비 8.9배 빠른 프리필 및 4.7배 빠른 디코딩 속도 향상 보여

✍️ OpenClawRadar📅 게시일: March 17, 2026🔗 Source
Krasis LLM 런타임, Llama.cpp 대비 8.9배 빠른 프리필 및 4.7배 빠른 디코딩 속도 향상 보여
Ad

성능 벤치마크

Krasis는 동일한 하드웨어에서 실행할 때 llama.cpp에 비해 상당한 성능 향상을 보여줍니다. PCIE 4.0으로 제한된 단일 5090 GPU에서 Krasis는 다음과 같은 결과를 보입니다:

  • 8.9배 빠른 프리필 속도
  • 4.7배 빠른 디코드 속도

Qwen3-Coder-Next에 대한 구체적인 벤치마크 결과는 Krasis가 단일 16GB 5080 GPU에서 실행할 때 다음과 같은 성능을 달성함을 보여줍니다:

  • 초당 1801 토큰 프리필
  • 초당 26.8 토큰 디코드

이는 레이어 오프로딩을 사용하는 32GB 5090 GPU에서 실행되는 llama.cpp보다 우수한 성능입니다.

아키텍처 변경 사항

Krasis의 최신 버전은 이중 포맷 시스템을 제거하고 이제 프리필과 디코드를 모두 GPU에서 실행하며 각 단계에 맞는 최적화 전략을 적용합니다. 이러한 아키텍처 변경으로 인해 다음과 같은 이점이 있습니다:

  • CPU 요구 사항 감소
  • 시스템 RAM 메모리 속도에 대한 의존성 감소
  • 전체 시스템 RAM 사용량 감소 (이전의 2.5배 모델 요구 사항에 비해 양자화된 모델과 약간의 오버헤드만 필요)
Ad

지원 모델 및 성능

현재 지원되는 모델과 단일 5090 GPU(PCIE 4.0)에서의 성능은 다음과 같습니다:

  • Qwen3.5-35B-A3B: 4475 프리필, 109.1 디코드
  • Qwen3-Coder-Next: 3560 프리필, 70.3 디코드
  • Qwen3.5-122B-A10B: 2897 프리필, 27.7 디코드
  • Qwen3-235B-A22B: 2124 프리필, 9.3 디코드

향후 개발 계획

개발자는 다음과 같은 계획을 가지고 있습니다:

  • Nvidia Nemotron 모델 지원 추가, 특히 5080과 같은 소비자용 GPU를 대상으로 Nemotron Super 지원
  • 출시 시 더 큰 Nemotron 모델 지원 가능성
  • Opencode 및 Aider에 대한 IDE 및 도구 지원 확대

현재 기능

Krasis는 현재 다음과 같은 기능을 제공합니다:

  • OpenAI 호환 서버
  • 단일 라인 설치
  • GitHub에서 이용 가능

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

소크라테스식 프롬프트 생성기, Claude 내부에 React 아티팩트로 구축됨
Tools

소크라테스식 프롬프트 생성기, Claude 내부에 React 아티팩트로 구축됨

한 개발자가 클로드 내에서 직접 작동하는 리액트 아티팩트로 소크라테스식 프롬프트 생성기를 구축했습니다. 이 도구는 입력의 복잡성을 자동 감지하고 세 단계의 프롬프트 생성과 실패 모드 분석을 특징으로 합니다.

OpenClawRadar
로컬시냅스 MCP 서버, macOS 지원 추가 및 검색 기능 개선
Tools

로컬시냅스 MCP 서버, macOS 지원 추가 및 검색 기능 개선

로컬 문서 검색을 위한 오프라인 MCP 서버인 LocalSynapse가 이제 macOS를 지원하며, 다중 단어 검색 쿼리에 대한 수정 사항을 포함합니다. 개발자는 위치 조정 클릭 부스팅 및 시간 감쇠를 홍보로 포함한 피드백 기반 개선 사항을 구현했습니다.

OpenClawRadar
오픈소스 로컬 훅이 AI 비용을 절감하기 위해 Claude 모델을 자동으로 전환합니다
Tools

오픈소스 로컬 훅이 AI 비용을 절감하기 위해 Claude 모델을 자동으로 전환합니다

한 개발자가 Cursor와 Claude Code용 로컬 훅을 만들어 프롬프트를 분석하고 요청을 보내기 전에 적절한 Claude 모델(Haiku, Sonnet 또는 Opus)을 자동으로 선택합니다. 이 도구는 키워드 규칙을 사용해 작업을 분류하고 과다 지불 시나리오를 차단하며, 사후 분석 결과 50-70%의 비용 절감 효과를 보였습니다.

OpenClawRadar
BusyDog Desktop: Mac용 P2P 네트워킹을 갖춘 로컬 AI 에이전트
Tools

BusyDog Desktop: Mac용 P2P 네트워킹을 갖춘 로컬 AI 에이전트

BusyDog Desktop는 Mac에서 Claude를 직접 실행하는 로컬 AI 에이전트로, 파일 읽기/쓰기, 터미널 명령 실행, 브라우저 제어, 그리고 Hyperswarm DHT와 맞춤형 BDP 프로토콜을 사용한 P2P 네트워크를 통해 다른 에이전트와 연결할 수 있습니다.

OpenClawRadar