벤치마크 결과, 정확도는 동일함에도 AI 브라우저 자동화 도구 간 토큰 비용이 최대 2.6배 차이를 보이는 것으로 나타났습니다.

벤치마크 결과: 동일한 정확도, 다른 비용
실제 웹사이트를 대상으로 6가지 실제 작업에 대해 동일한 모델(Claude Sonnet 4.6)을 사용하여 4가지 CLI 브라우저 자동화 도구를 벤치마크 테스트했습니다. 모든 도구가 18개 작업 실행에서 100% 정확도를 기록했지만 토큰 사용량은 크게 달랐습니다:
- openbrowser-ai: 36,010 토큰 / 84.8초 / 15.3 도구 호출
- browser-use: 77,123 토큰 / 106.0초 / 20.7 도구 호출
- playwright-cli (Microsoft): 94,130 토큰 / 118.3초 / 25.7 도구 호출
- agent-browser (Vercel): 90,107 토큰 / 99.0초 / 25.0 도구 호출
Openbrowser-ai는 다른 도구들보다 2.1~2.6배 적은 토큰을 사용했습니다. 벤치마크 결과, 도구 호출 횟수가 토큰 비용의 가장 강력한 예측 변수로 나타났는데, 이는 모든 호출이 LLM이 전체 대화 기록을 재처리하도록 강제하기 때문입니다.
도구 구현 방식의 차이
네 가지 도구 모두 백그라운드 데몬을 통해 지속적인 브라우저 세션을 유지하고, 서버 측에서 JavaScript를 실행하여 결과만 반환하며, 페이지 상태를 간결하게 만들고, 일부 형태의 코드 실행을 지원합니다.
browser-use는 개별 CLI 명령어를 제공합니다: open, click, input, scroll, state, eval. LLM은 도구 호출당 하나의 명령어를 실행합니다. eval은 페이지 컨텍스트에서 JavaScript를 실행합니다. 페이지 상태는 페이지당 약 880자 정도의 [N] 인덱스가 있는 향상된 DOM 트리입니다. cdp-use 라이브러리를 통해 Chrome과 직접 CDP로 통신합니다.
agent-browser도 유사한 패턴을 따릅니다: open, click, fill, snapshot, eval. Chrome과 직접 CDP로 통신하는 네이티브 Rust 바이너리입니다. 페이지 상태는 u/eN 참조가 있는 접근성 트리입니다. -i 플래그는 약 590자 정도의 간결한 대화형 전용 출력을 생성합니다. 명령어는 &&로 연결할 수 있지만 각각은 여전히 별도의 데몬 요청입니다.
playwright-cli는 개별 명령어와 함께 run-code를 제공하며, 이는 전체 API 접근 권한이 있는 임의의 Playwright JavaScript를 허용합니다. LLM은 run-code "async page => { await page.goto('url'); await page.click('.btn'); return await page.title(); }"과 같은 코드를 작성하여 한 번의 호출로 여러 작업을 실행할 수 있습니다. 페이지 상태는 약 1,420자 정도의 .yml 파일에 저장된 접근성 트리이며, 증분 스냅샷은 첫 번째 읽기 이후에는 차이점만 전송합니다.
openbrowser-ai는 개별 명령어가 전혀 없습니다. 유일한 인터페이스는 -c를 통한 Python 코드입니다:
openbrowser-ai -c 'await navigate("https://en.wikipedia.org/wiki/Python") info = await evaluate("document.querySelector('.infobox')?.innerText") print(info)'navigate, click, input_text, evaluate, scroll은 지속적인 네임스페이스의 비동기 Python 함수입니다. 페이지 상태는 약 450자 정도의 [i_N] 인덱스가 있는 DOM입니다. 변수는 Jupyter 노트북처럼 호출 간에 유지됩니다.
벤치마크에서 관찰된 바에 따르면, LLM은 OpenBrowser에서 더 적은 도구 호출을 수행했으며(다른 도구의 20-26회 대비 15.3회), 저자들은 이 코드 전용 인터페이스가 작업 배치 처리를 자연스럽게 장려하기 때문이라고 분석했습니다.
📖 전체 원문 읽기: r/ClaudeAI
👀 See Also

TeenyApp를 통해 클로드가 단일 채팅 링크로 풀스택 웹사이트를 구축 및 배포할 수 있습니다
TeenyApp는 Claude가 HTTP를 통해 사용할 수 있는 라이브 서브도메인과 에이전트 토큰을 제공하여, 채팅을 떠나지 않고도 코드 스캐폴딩, 마이그레이션 실행, 인증 설정, 실제 URL에 직접 배포할 수 있게 해줍니다.

프로덕션 AI IDE에서 Ollama를 지원하는 다중 제공자 LLM 폴백 체인
Resonant Genesis AI IDE는 Groq, OpenAI, Anthropic, Gemini와 함께 로컬 LLM 지원을 1급 제공자로 통합하여 30개 이상의 마이크로서비스에서 공유된 UnifiedLLMClient 라이브러리와 자동 폴백 체인을 사용합니다.

Creation OS: 모델이 환각 대신 '모르겠습니다'라고 말할 수 있게 하는 로컬 σ-게이트 LLM 런타임
Creation OS는 로컬 LLM(BitNet, Qwen, Gemma, 모든 GGUF)을 σ-게이트로 감싸서 여러 불확실성 채널을 측정하고 출력마다 ACCEPT, RETHINK 또는 ABSTAIN을 결정합니다. 클라우드나 API가 필요 없습니다. 선택적 재생성을 통해 TruthfulQA 정확도가 약 29% 향상되었습니다.

러스트 기반 자체 호스팅 컨텍스추얼 밴딧: 적응형 의사 결정 시스템을 위한 신트라와 라이칸
두 개의 오픈소스 프로젝트: Lycan(전략 노드와 학습된 가중치를 갖춘 그래프 실행 언어)과 Syntra(컴파일된 Lycan 캡슐을 제공하는 Docker/API 어플라이언스). AI 주식 토론 제품을 직접 사용하면서 런타임 버그보다 데이터 파이프라인 버그를 먼저 발견했습니다.