제이크 벤치마크 v1: OpenClaw AI 에이전트를 위한 로컬 LLM 성능 테스트

Jake 벤치마크 v1은 OpenClaw와 함께 AI 에이전트로 기능하는 로컬 LLM의 성능 평가 도구입니다. 이 도구는 22가지 실용적인 작업으로 모델을 테스트하여 실제 에이전트 시나리오에서의 효과성을 판단합니다.
테스트 설정 및 방법론
벤치마크는 NVIDIA 3090 GPU에서 실행되는 Ollama가 설치된 라즈베리 파이에서 진행되었습니다. 개발자는 OpenClaw와 함께 에이전트 작업에 가장 적합한 모델을 찾기 위해 7가지 다른 로컬 LLM을 테스트했습니다.
작업 카테고리
22가지 작업은 다음과 같은 실제 시나리오를 다루었습니다:
- 이메일 읽기 및 이메일에서 작업 생성하기
- 회의 일정 잡기 및 충돌 확인하기
- 피싱 탐지 (특히 비트코인 지갑 키를 요청하는 소유자인 척하는 가짜 이메일)
- 오류 처리
주요 결과
모델 간 성능 차이는 상당했습니다:
- Qwen 27B: 59.4% 점수 획득 - 이메일 처리, 회의 일정 잡기, 피싱 시도 탐지, 오류 관리에 성공
- Nemotron 30B: 1.6% 점수 획득 -
apt-get install git을 실행하여 작업을 해결하려 시도
주목할 만한 관찰
피싱 테스트에서 흥미로운 행동이 드러났습니다:
- 가장 우수한 모델은 피싱 요청을 즉시 거부했습니다
- 가장 저조한 모델은 정보를 공유하지 않기로 결정하기 전에 비밀 파일을 세 번 읽었습니다
대시보드 기능
벤치마크에는 사용자가 다음을 할 수 있는 대화형 대시보드가 포함되어 있습니다:
- 모든 모델을 클릭하여 전체 대화 내용 보기
- 각 모델이 작업 중에 정확히 무엇을 했는지 확인하기
- 모델이 실행 과정에서 어디서 잘못되었는지 파악하기
이 도구는 GitHub에서 이용 가능하며, 개발자가 자체 평가를 실행하고 에이전트 작업을 위한 로컬 LLM 성능을 비교할 수 있습니다.
📖 Read the full source: r/openclaw
👀 See Also

OpenClaw용 로컬 PII 편집 기술, GLiNER 모델 활용
새로운 OpenClaw 스킬이 나가는 응답을 가로채어 로컬 nvidia/gliner-PII 모델을 통해 민감한 정보(API 키, 개인 식별 정보 등)를 탐지하고 삭제합니다. 이를 [API_KEY]와 같은 라벨로 대체하고 제거 알림을 추가합니다.

Claude Code 모범 사례 저장소, AI 에이전트로만 구축돼 별 5만 개 달성
클로드(Claude) 모범 사례가 가득 담긴 GitHub 저장소가, 100% 자율적인 클로드 코드 워크플로우에 의해 개발 및 유지 관리되며 50,000 스타를 돌파했습니다 — 2026년 파키스탄에서 가장 많은 스타를 받은 저장소가 되었습니다.

AI 샌드박스 매니저: 헤드리스 리눅스에서 GPU 패스스루와 컴퓨터 사용이 가능한 LXC 기반 Codex 샌드박스
ai-sandbox-manager는 헤드리스 Linux에서 Codex 에이전트를 위한 오픈소스 LXC 기반 샌드박스입니다. GPU 패스스루, 전체 sudo 액세스, 영구 환경 및 CUA를 통한 컴퓨터 사용을 제공하면서 에이전트를 호스트 OS로부터 격리합니다.

MCP 서버 구현, 지속적인 코딩 에이전트 메모리를 위한 리플렉션 페이퍼 반영
한 개발자가 Reflexion 논문(Shinn 외, NeurIPS 2023)을 MCP 서버로 구현하여 로컬 코딩 에이전트의 세션 간 지속적 메모리 부족 문제를 해결했습니다. 이 시스템은 오류 메시지에 대한 정규식 기반 패턴 매칭을 사용하고 SQLite에 FTS5로 교훈을 저장합니다.