OpenClaw 벤치마크, Qwen3.5:27B가 에이전트 작업에서 다른 로컬 LLMs보다 성능 우위 보여

✍️ OpenClawRadar📅 게시일: March 28, 2026🔗 Source
OpenClaw 벤치마크, Qwen3.5:27B가 에이전트 작업에서 다른 로컬 LLMs보다 성능 우위 보여
Ad

벤치마크 설정 및 결과

사용자가 Raspberry Pi 5와 RTX 3090을 사용하여 Ollama에서 OpenClaw를 실행하는 환경에서 22가지 실제 에이전트 작업에 대해 7개의 로컬 모델을 테스트했습니다. 작업에는 이메일 읽기, 회의 일정 잡기, 작업 생성, 피싱 탐지, 오류 처리, 브라우저 자동화 등이 포함되었습니다.

큰 격차로 우승한 모델은 qwen3.5:27b-q4_K_M으로 59.4%를 기록했습니다. 2위(qwen3.5:35b)는 23.2%에 그쳤습니다. 다른 모든 모델은 5% 미만의 점수를 기록했습니다.

주요 발견 사항

  • 양자화된 27B 모델이 더 큰 35B 버전을 2.5배 차이로 이겼습니다
  • 30B 모델은 1.6%로 최하위를 기록했습니다
  • 적당한 사고량이 가장 좋은 성능을 보였습니다 - 너무 많은 사고는 오히려 성능을 저하시켰습니다
  • 어떤 모델도 브라우저 자동화 작업을 완료하지 못했습니다
  • 우승자와 패자의 주요 차이점은 모델이 명령줄 도구를 찾아 사용할 수 있는지 여부였습니다
  • 대부분의 모델은 이메일 기능과 같은 기본 도구조차 찾지 못했습니다

이 벤치마크는 다양한 로컬 LLM이 실제 시나리오에서 AI 에이전트로서 어떻게 수행하는지에 대한 구체적인 데이터를 제공합니다. 최상위 모델과 다른 모델들 사이의 상당한 성능 격차는 도구 찾기 능력이 로컬 LLM 에이전트의 중요한 병목 현상임을 시사합니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

작업 관찰자: AI 코딩 에이전트의 스킬 향상을 자동화하는 메타 스킬
Tools

작업 관찰자: AI 코딩 에이전트의 스킬 향상을 자동화하는 메타 스킬

Task-observer는 AI 에이전트의 모든 스킬을 스스로 개선하는 메타 스킬로, 자기 자신까지 포함합니다. 3개월 동안 40개 스킬에서 600건의 개선을 기록하고, 작업 중 발견한 격차로부터 자동으로 스킬을 생성합니다.

OpenClawRadar
디블랭크: LLM 토큰 절감을 위한 코드 서식 제거 도구
Tools

디블랭크: LLM 토큰 절감을 위한 코드 서식 제거 도구

Deblank은 코드 형식화(들여쓰기, 공백, 줄 바꿈)를 제거하여 LLM으로 전송하기 전에 토큰을 줄여주는 오픈소스 도구입니다. Java/C++의 경우 약 30%, Python의 경우 약 9%의 토큰 감소 효과가 있으며, 약 76ms의 지연 시간을 보입니다. Python, Java, C/C++, C#, JS/TS, Go를 지원합니다.

OpenClawRadar
Sentrial: AI 에이전트를 위한 생산 모니터링
Tools

Sentrial: AI 에이전트를 위한 생산 모니터링

Sentrial은 루프, 환각, 도구 오용, 사용자 불만을 포함한 AI 제품의 실패 패턴을 자동으로 감지하는 모니터링 도구입니다. 대화 패턴, 모델 출력 및 도구 상호작용을 분석하여 근본 원인을 진단합니다.

OpenClawRadar
스킬 스튜디오: Claude AI 에이전트 스킬 관리를 위한 오픈소스 데스크톱 애플리케이션
Tools

스킬 스튜디오: Claude AI 에이전트 스킬 관리를 위한 오픈소스 데스크톱 애플리케이션

Skill Studio는 개발자가 커뮤니티 스킬 저장소를 탐색하고, 마크다운 렌더링으로 문서를 미리 보고, npx skills add와 같은 원클릭 명령어로 스킬을 설치할 수 있는 무료 오픈소스 macOS 데스크톱 앱입니다.

OpenClawRadar