OpenClaw 벤치마크, Qwen3.5:27B가 에이전트 작업에서 다른 로컬 LLMs보다 성능 우위 보여

✍️ OpenClawRadar📅 게시일: March 28, 2026🔗 Source
OpenClaw 벤치마크, Qwen3.5:27B가 에이전트 작업에서 다른 로컬 LLMs보다 성능 우위 보여
Ad

벤치마크 설정 및 결과

사용자가 Raspberry Pi 5와 RTX 3090을 사용하여 Ollama에서 OpenClaw를 실행하는 환경에서 22가지 실제 에이전트 작업에 대해 7개의 로컬 모델을 테스트했습니다. 작업에는 이메일 읽기, 회의 일정 잡기, 작업 생성, 피싱 탐지, 오류 처리, 브라우저 자동화 등이 포함되었습니다.

큰 격차로 우승한 모델은 qwen3.5:27b-q4_K_M으로 59.4%를 기록했습니다. 2위(qwen3.5:35b)는 23.2%에 그쳤습니다. 다른 모든 모델은 5% 미만의 점수를 기록했습니다.

주요 발견 사항

  • 양자화된 27B 모델이 더 큰 35B 버전을 2.5배 차이로 이겼습니다
  • 30B 모델은 1.6%로 최하위를 기록했습니다
  • 적당한 사고량이 가장 좋은 성능을 보였습니다 - 너무 많은 사고는 오히려 성능을 저하시켰습니다
  • 어떤 모델도 브라우저 자동화 작업을 완료하지 못했습니다
  • 우승자와 패자의 주요 차이점은 모델이 명령줄 도구를 찾아 사용할 수 있는지 여부였습니다
  • 대부분의 모델은 이메일 기능과 같은 기본 도구조차 찾지 못했습니다

이 벤치마크는 다양한 로컬 LLM이 실제 시나리오에서 AI 에이전트로서 어떻게 수행하는지에 대한 구체적인 데이터를 제공합니다. 최상위 모델과 다른 모델들 사이의 상당한 성능 격차는 도구 찾기 능력이 로컬 LLM 에이전트의 중요한 병목 현상임을 시사합니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

ClearSpec: Claude 코드의 환각 현상을 줄이기 위한 사양 생성기
Tools

ClearSpec: Claude 코드의 환각 현상을 줄이기 위한 사양 생성기

ClearSpec은 일반 영어 설명에서 구조화된 명세서를 생성하는 도구로, GitHub 저장소에 연결하여 실제 파일 경로와 의존성을 참조한 다음, Claude Code에 더 나은 컨텍스트를 제공하기 위해 해당 명세서를 프롬프트로 사용합니다.

OpenClawRadar
릴레이를 통해 클로드 코드 세션이 알트탭 없이 서로 메시지를 주고받을 수 있습니다
Tools

릴레이를 통해 클로드 코드 세션이 알트탭 없이 서로 메시지를 주고받을 수 있습니다

Relay라는 플러그인은 Claude Code의 채널 기능을 사용하여 병렬 세션 간에 직접 통신할 수 있게 해주어, 백엔드와 프론트엔드 리포지토리 간에 컨텍스트를 수동으로 복사-붙여넣기할 필요가 없습니다.

OpenClawRadar
OpenClaw 구성 요소 추출: 레인 큐와 메모리 시스템에 관한 개발자 경험
Tools

OpenClaw 구성 요소 추출: 레인 큐와 메모리 시스템에 관한 개발자 경험

한 개발자가 개인 AI 에이전트에서 사용하기 위해 OpenClaw의 특정 컴포넌트를 추출하려 시도했으며, Lane Queue 작업 실행 시스템을 테스트하고 메모리 검색 시스템을 검토했습니다. Lane Queue는 문서를 기반으로 Python에서 성공적으로 재구현되었으며, 문서의 공백과 13가지 구현 문제가 드러났습니다.

OpenClawRadar
클로드 코드 프롬프트 개선기 v0.5.3: 플랜 모드 리팩터 및 서브에이전트 우선 연구
Tools

클로드 코드 프롬프트 개선기 v0.5.3: 플랜 모드 리팩터 및 서브에이전트 우선 연구

v0.5.3에서는 계획 모드 가독성을 위한 PreToolUse 훅(결정 이력 없이 깔끔하게 다시 작성)을 추가하고, 모호한 프롬프트 조사를 Main 컨텍스트 토큰을 절약하기 위해 Haiku의 Task/Explore 하위 에이전트로 이동했습니다. 이 플러그인은 이제 Windows에서도 작동하며 GitHub에서 1,400개 이상의 별을 받았습니다.

OpenClawRadar