간결함이 클로드 코드 압축 벤치마크에서 동굴맨 플러그인을 이겼다

Max Taylor가 인기 있는 Claude Code 압축 플러그인 'caveman'을 간단한 기준선(각 프롬프트 앞에 '간단히 말해'를 추가)과 비교하여 벤치마크했습니다. 결과는 놀랍도록 비슷하지만, 플러그인이 실제로 가치를 제공하는 지점을 드러냅니다.
벤치마크 방법론
6개 카테고리(버그 진단, 개념 설명, 아키텍처 트레이드오프, 다단계 설정, 보안/파괴적 작업, 오류 해석)에 걸쳐 24개의 프롬프트가 사용되었습니다. 각 프롬프트에는 필수 핵심 사항, 필수 용어, 금지 주장이 포함된 평가 기준이 있었습니다. 5가지 설정이 테스트되었습니다: 기준선(지시 없음), '간단히 말해', 그리고 세 가지 강도 수준의 caveman(라이트, 풀, 울트라). 모두 claude-opus-4-7에서 claude -p로 실행되었습니다. 응답은 claude-sonnet-4-6이 평가 기준에 따라 점수를 매겼습니다.
품질 결과
모든 설정의 점수는 서로 1.5% 이내였습니다:
- 기준선: 0.985
- 간단히 말해: 0.985
- 라이트: 0.976
- 풀: 0.975
- 울트라: 0.970
모든 설정이 핵심 사항을 100% 충족했습니다. 120개의 응답에서 금지 주장은 전혀 없었습니다. 압축으로 인해 내용이 손실되지는 않았습니다.
토큰 수
| 설정 | 평균 토큰 |
|---|---|
| 기준선 | 636 |
| 간단히 말해 | 419 (34% 감소) |
| 라이트 | 401 |
| 풀 | 404 |
| 울트라 | 449 |
'간단히 말해'는 기준선 대비 토큰을 34% 줄였습니다. Caveman 라이트와 풀은 '간단히 말해'와 비슷한 수준이었습니다. 가장 엄격한 모드인 울트라는 세 가지 중 가장 긴 답변을 생성했지만, 카테고리별로 보면 다른 이야기가 드러납니다.
카테고리별 결과가 caveman의 설계를 드러냄
버그 진단, 개념 설명, 아키텍처 트레이드오프, 오류 해석에서 울트라가 가장 짧거나 동일했습니다. 압축이 의도대로 작동한 것입니다. 다단계 설정과 보안 경고에서는 모든 caveman 모드가 더 높은 토큰 수를 보였습니다. 이유는 caveman의 '자동 명확성' 규칙이 보안 경고, 되돌릴 수 없는 작업, 다단계 시퀀스에 대해 압축을 명시적으로 비활성화하기 때문입니다. 안전 이스케이프가 작동하고 압축이 중단됩니다 — 설계된 대로입니다.
그렇다면 caveman은 실제로 무엇을 위한 것일까?
'간단히 말해'가 토큰과 품질에서 동일하다면, 플러그인의 가치는 구조적입니다:
- 일관된 출력 형태 — 모든 응답이 동일한 패턴을 따르므로, 다운스트림 도구나 일관된 세션 느낌에 유용합니다.
- 강도 조절 — 세션 중간에 라이트/풀/울트라를 전환하는 슬래시 명령어.
- 긴 세션에서의 지속성 — caveman이
SessionStart및UserPromptSubmit훅을 통해 규칙 세트를 재주입하여 표류를 방지합니다(이 단일 샷 벤치마크에서는 테스트되지 않음).
전체 데이터셋과 도구는 오픈 소스로 제공됩니다.
📖 전체 소스 읽기: HN AI Agents
👀 See Also

에이전트 브라우저 프로토콜: AI 에이전트용 오픈소스 Chrome 포크, Mind2Web 벤치마크에서 90% 달성
에이전트 브라우저 프로토콜(ABP)은 각 작업 후 JavaScript와 시간을 정지시켜 웹 브라우징을 AI 에이전트용 멀티모달 채팅으로 변환하는 오픈소스 Chrome 포크입니다. Online Mind2Web 벤치마크에서 90.53%를 달성했으며, 단일 명령어로 Claude Code에 추가할 수 있습니다.

클로드 API 트래픽 라우팅으로 Max 구독 변경 후 비용 통제하기
Anthropic의 Max 구독이 더 이상 OpenClaw와 같은 타사 도구 사용을 포함하지 않아 OpenClaw 사용자들이 API 청구로 전환해야 합니다. 라우팅 프록시는 간단한 작업은 Claude Sonnet(입력 100만 토큰당 $3, 출력 100만 토큰당 $15)으로, 복잡한 작업은 Opus(입력 100만 토큰당 $5, 출력 100만 토큰당 $25)로 보내 품질 손실 없이 비용을 절감합니다.

Intuno: AI 에이전트 발견 및 통신을 위한 오픈 소스 네트워크
Intuno는 AI 에이전트가 기능을 등록하고, 의미론적 검색을 통해 서로를 발견하며, 3줄의 Python 코드로 함수를 호출할 수 있는 오픈소스 네트워크입니다. Claude Desktop 또는 Cursor에서 사용할 수 있는 MCP 통합을 포함하고 있습니다.

사용자 경험: 로컬 LLM에서 OpenClaw에서 Hermes 에이전트로 전환하기
한 개발자가 RX 9070 XT GPU(16GB VRAM)에서 Qwen3.5-9B 모델을 사용해 OpenClaw에서 Hermes Agent로 전환한 경험을 공유했습니다. Hermes는 복잡한 작업을 OpenClaw의 50단계 이상 대비 5번의 올바른 도구 호출로 완료했으며, 2분 30초 더 빠르게 실행하면서 RAG, 도구 호출, 지속적 메모리 기능을 유지했습니다.