Cowork vs. Claude Chat: 문서 추출 정확도 비교

✍️ OpenClawRadar📅 게시일: March 1, 2026🔗 Source
Cowork vs. Claude Chat: 문서 추출 정확도 비교
Ad

상장 주식 연간 보고서 분석 도구를 개발 중인 한 개발자가 복잡한 금융 PDF에서 데이터를 추출하는 데 있어 Claude.ai 채팅과 Cowork을 통제된 비교 실험을 진행했습니다. 이 테스트는 동일한 프롬프트와 금융 테이블, 각주, 상호 참조 공시가 포함된 140페이지 이상의 동일한 PDF 파일을 사용했습니다.

테스트 결과

테스트 1 - Claude.ai 채팅: PDF를 업로드하고 프롬프트를 붙여넣었습니다. 출력 결과는 모든 항목이 원본과 검증된 기관급 수준이었습니다. 모델은 추출 중 자신의 실수를 발견하고 수정하는 자체 수정 행동을 보였습니다. 확인된 150개 이상의 데이터 포인트에서 오류가 발견되지 않았습니다.

테스트 2 - Cowork (기존 프로젝트 폴더가 있는 워크플로우): 5개의 사실 오류를 생성했으며, 30% 적은 콘텐츠를 추출하고 대부분의 심층 분석 자료를 놓쳤습니다. 주요 수치는 정확했지만, 세부 구성 요소에 대한 정보는 손실되었습니다.

테스트 3 - Cowork (깨끗한 폴더, PDF와 프롬프트만): 여전히 다음과 같은 오류를 생성했습니다:

  • 조정 항목 조작
  • 역산된 단위 수
  • 실제 재무제표 각주와 20-90% 차이가 나는 다중 범주
  • 전년도 열 오염 (당해 연도 수치는 정확했지만, FY2024 비교 수치는 수익 및 FCF 테이블 전반에 걸쳐 오류가 있었음)
Ad

패턴 분석

개발자는 Cowork이 일관되게 정확한 당해 연도 합계를 생성하지만 신뢰할 수 없는 세부 항목 분류를 생성한다는 점을 관찰했습니다. 이 모델은 문서에서 읽어내기보다는 알려진 희석 총액에 맞추기 위해 조정 플러그를 조작하고 역산하는 방식으로 공백을 메우는 것으로 보였습니다. 반대로 Claude 채팅은 세부 사항을 정확히 추출하거나 찾을 수 없는 내용을 표시했습니다.

결론적으로 Cowork의 에이전트 작업 분해(청킹, 하위 에이전트, 병렬 처리)는 길고 상호 참조된 금융 문서에 필요한 지속적인 주의력을 유지할 수 없는 것으로 보입니다. 채팅은 PDF를 단일 심층 패스로 처리하는 반면, Cowork은 이를 분할하여 정확도를 잃습니다.

이 정확도 차이는 모든 숫자를 독립적으로 검증하지 않으면 조작이 보이지 않는 전문적 사용 사례에서 중요합니다. 개발자는 다른 사용자들도 Cowork이 그럴듯하지만 조작된 세부 사항을 생성하는 유사한 패턴을 관찰했는지, Claude 채팅이 깔끔하게 처리하는지에 대한 커뮤니티 피드백을 구하고 있습니다.

📖 전체 출처 읽기: r/ClaudeAI

Ad

👀 See Also

거버너: 출력 압축, 컨텍스트 슬림화, 도구 필터링을 통한 토큰 낭비 절감을 위한 클로드 코드 플러그인
Tools

거버너: 출력 압축, 컨텍스트 슬림화, 도구 필터링을 통한 토큰 낭비 절감을 위한 클로드 코드 플러그인

Governor는 Claude Code 플러그인으로, 간결한 전문 출력, 메모리 파일 압축, 도구 출력 필터링 및 표류 방지 기능을 통해 토큰/컨텍스트 낭비를 줄입니다. 벤치마크 결과, 제어군 대비 출력 토큰 55.5% 절감.

OpenClawRadar
PhAIL 벤치마크, 실제 창고 로봇 작업에서 VLA 모델 성능 평가
Tools

PhAIL 벤치마크, 실제 창고 로봇 작업에서 VLA 모델 성능 평가

PhAIL은 Franka FR3 로봇을 사용한 빈-투-빈 주문 피킹 작업에서 4가지 비전-언어-액션 모델을 테스트하는 실제 로봇 벤치마크입니다. 최고 성능 모델은 시간당 64개 단위를 달성했으며, 이는 인간 원격 조작의 330 UPH와 인간 수동 작업의 1,300+ UPH와 비교됩니다.

OpenClawRadar
스펙맥싱: YAML 스펙과 ACAI로 AI 정신병과 싸우기
Tools

스펙맥싱: YAML 스펙과 ACAI로 AI 정신병과 싸우기

Acai.sh가 Specsmaxxing을 소개합니다: 요구사항을 YAML로 작성하고 번호가 매겨진 AI 수용 기준(ACAI)을 사용하여 AI 에이전트가 코드에서 참조함으로써 컨텍스트 손실 문제를 해결하는 방법입니다.

OpenClawRadar
🦀
Tools

Zillow-풀: 수동 부동산 조사를 자동 거래 파이프라인으로 전환한 오픈클로 스킬

한 개발자가 OpenClaw에 'zillow-full'을 구축하여 부동산별 Zestimate, 세금 이력, 가격 이력 및 비교 항목을 가져옵니다. 매일 밤 크론 작업이 조건에 따라 매물을 평가한 결과, 도매 거래가 월 2건에서 11건으로 증가했습니다.

OpenClawRadar