벤치마크 결과, 정확도는 동일함에도 AI 브라우저 자동화 도구 간 토큰 비용이 최대 2.6배 차이를 보이는 것으로 나타났습니다.

벤치마크 결과: 동일한 정확도, 다른 비용
실제 웹사이트를 대상으로 6가지 실제 작업에 대해 동일한 모델(Claude Sonnet 4.6)을 사용하여 4가지 CLI 브라우저 자동화 도구를 벤치마크 테스트했습니다. 모든 도구가 18개 작업 실행에서 100% 정확도를 기록했지만 토큰 사용량은 크게 달랐습니다:
- openbrowser-ai: 36,010 토큰 / 84.8초 / 15.3 도구 호출
- browser-use: 77,123 토큰 / 106.0초 / 20.7 도구 호출
- playwright-cli (Microsoft): 94,130 토큰 / 118.3초 / 25.7 도구 호출
- agent-browser (Vercel): 90,107 토큰 / 99.0초 / 25.0 도구 호출
Openbrowser-ai는 다른 도구들보다 2.1~2.6배 적은 토큰을 사용했습니다. 벤치마크 결과, 도구 호출 횟수가 토큰 비용의 가장 강력한 예측 변수로 나타났는데, 이는 모든 호출이 LLM이 전체 대화 기록을 재처리하도록 강제하기 때문입니다.
도구 구현 방식의 차이
네 가지 도구 모두 백그라운드 데몬을 통해 지속적인 브라우저 세션을 유지하고, 서버 측에서 JavaScript를 실행하여 결과만 반환하며, 페이지 상태를 간결하게 만들고, 일부 형태의 코드 실행을 지원합니다.
browser-use는 개별 CLI 명령어를 제공합니다: open, click, input, scroll, state, eval. LLM은 도구 호출당 하나의 명령어를 실행합니다. eval은 페이지 컨텍스트에서 JavaScript를 실행합니다. 페이지 상태는 페이지당 약 880자 정도의 [N] 인덱스가 있는 향상된 DOM 트리입니다. cdp-use 라이브러리를 통해 Chrome과 직접 CDP로 통신합니다.
agent-browser도 유사한 패턴을 따릅니다: open, click, fill, snapshot, eval. Chrome과 직접 CDP로 통신하는 네이티브 Rust 바이너리입니다. 페이지 상태는 u/eN 참조가 있는 접근성 트리입니다. -i 플래그는 약 590자 정도의 간결한 대화형 전용 출력을 생성합니다. 명령어는 &&로 연결할 수 있지만 각각은 여전히 별도의 데몬 요청입니다.
playwright-cli는 개별 명령어와 함께 run-code를 제공하며, 이는 전체 API 접근 권한이 있는 임의의 Playwright JavaScript를 허용합니다. LLM은 run-code "async page => { await page.goto('url'); await page.click('.btn'); return await page.title(); }"과 같은 코드를 작성하여 한 번의 호출로 여러 작업을 실행할 수 있습니다. 페이지 상태는 약 1,420자 정도의 .yml 파일에 저장된 접근성 트리이며, 증분 스냅샷은 첫 번째 읽기 이후에는 차이점만 전송합니다.
openbrowser-ai는 개별 명령어가 전혀 없습니다. 유일한 인터페이스는 -c를 통한 Python 코드입니다:
openbrowser-ai -c 'await navigate("https://en.wikipedia.org/wiki/Python") info = await evaluate("document.querySelector('.infobox')?.innerText") print(info)'navigate, click, input_text, evaluate, scroll은 지속적인 네임스페이스의 비동기 Python 함수입니다. 페이지 상태는 약 450자 정도의 [i_N] 인덱스가 있는 DOM입니다. 변수는 Jupyter 노트북처럼 호출 간에 유지됩니다.
벤치마크에서 관찰된 바에 따르면, LLM은 OpenBrowser에서 더 적은 도구 호출을 수행했으며(다른 도구의 20-26회 대비 15.3회), 저자들은 이 코드 전용 인터페이스가 작업 배치 처리를 자연스럽게 장려하기 때문이라고 분석했습니다.
📖 전체 원문 읽기: r/ClaudeAI
👀 See Also

MegaClaw: Playwright와 Homebrew를 활용한 컨테이너화된 OpenClaw 설정
MegaClaw는 OpenClaw의 일반적인 설치 문제인 권한 오류와 누락된 종속성을 해결하기 위한 두 개의 이미지 Podman 설정입니다. 사전 설치된 Playwright와 Homebrew를 사용하는 멀티 스테이지 빌드를 활용하며, 사용자 구성을 런타임 이미지에 포함시킵니다.

클로드 텍스트 어드벤처 스킬 v1.1.0, 캠페인 아크와 향상된 NPC 기능 추가
Claude 텍스트 어드벤처 스킬 업데이트 v1.1.0에서는 캐릭터 진행 상황이 여러 모험에 걸쳐 지속되는 캠페인 아크, 숨겨진 스탯과 레벨을 가진 NPC, 선택적 시각/오디오 모듈이 도입되었습니다. Claude Desktop 또는 claude.ai에서 사용하려면 GitHub 릴리스에서 text-adventure.zip을 다운로드하세요.

OpenClaw Codex-GPT5.4 작업 검증 루프 문제
개발자가 OpenClaw를 통해 Codex-GPT5.4를 사용하여 자율 프로젝트 작업 중 작업 검증 루프에 갇히는 문제를 보고했습니다. 모델이 작업을 식별하고 확인만 반복하며 실제로 실행하지 않는 현상입니다. 이 문제를 해결하기 위해 TASKS.md, 하트비트 규칙, 페르소나 파일 등 작업 공간 제어 장치를 구현했습니다.

토탈 리콜: 클로드 코드 대화 기록을 위한 로컬 지식 그래프
토탈 리콜은 Claude Code의 JSONL 대화 기록을 SQLite 데이터베이스에 수집하여 전체 텍스트 검색과 벡터 임베딩을 제공하는 오픈소스 시스템으로, 세션 간 대화 기록을 검색 가능하게 만듭니다. 이 시스템은 DAG 인식 컨텍스트로 실제 대화 발췌문을 검색하며 ChatGPT 가져오기 기능을 포함합니다.