Cowork vs. Claude Chat: 文書抽出精度の比較

公開株の年次報告書を分析するツールを開発している開発者が、密度の高い財務PDFからデータを抽出するために、Claude.aiチャットとCoworkの間で制御された比較を行いました。このテストでは、同一のプロンプトと、財務表、脚注、相互参照された開示を含む140ページ以上の同じPDFを使用しました。
テスト結果
テスト1 - Claude.aiチャット: PDFをアップロードし、プロンプトを貼り付けました。出力は機関投資家級で、すべての明細項目がソースに対して検証されました。このモデルは自己修正行動を示し、抽出中に自らの誤りを検出して修正しました。150以上のデータポイントをチェックした結果、エラーは見つかりませんでした。
テスト2 - Cowork(既存のプロジェクトフォルダを使用したワークフロー): 5つの事実誤りを生成し、30%少ないコンテンツしか抽出せず、ほとんどの詳細な資料を見逃しました。見出しの数字は正しかったものの、サブコンポーネントの詳細は失われました。
テスト3 - Cowork(クリーンなフォルダ、PDFとプロンプトのみ): 依然として以下のようなエラーを生成しました:
- 調整項目の捏造
- 単位カウントの逆算
- 財務諸表注記から20-90%ずれた複数のカテゴリー
- 前年度の列への混入(当期数値は正しいが、FY2024の比較数値に利益とFCF表全体で誤りがあった)
パターン分析
開発者は、Coworkが一貫して正しい当期合計を生成する一方で、明細項目の内訳は信頼できないことを観察しました。このモデルは、文書から読み取るのではなく、既知の希薄化後の合計に合わせるために調整項目を捏造し、逆算することでギャップを埋めているように見えました。対照的に、Claudeチャットは詳細を正しく抽出するか、見つけられなかったものを明示しました。
この結論は、Coworkのエージェント的なタスク分解(チャンキング、サブエージェント、並列処理)が、長く相互参照された財務文書に必要な持続的な注意力を維持できないことを示唆しています。チャットはPDFを単一の深いパスで処理しますが、Coworkはそれらを分割し、忠実度を失います。
この精度の差は、すべての数値を独立して検証しなければ捏造が見えないプロフェッショナルなユースケースにおいて重要です。開発者は、Claudeチャットがきれいに処理する一方で、Coworkがもっともらしいが捏造された詳細を生成する同様のパターンを他の人々が観察しているかどうかについて、コミュニティのフィードバックを求めています。
📖 全文を読む: r/ClaudeAI
👀 See Also

AutoDream:安全機能を備えたClaude Code用11フックメモリシステム
AutoDreamは、Claude Codeにプロジェクトメモリの永続性とコマンドの安全性を追加するオープンソースツールです。6つのイベントにまたがる11個のフックを使用して、コンテキストの注入、危険なコマンドのブロック、/compact操作の生存を実現します。

Claude Code v2.1.59では、自動メモリ機能、コピーコマンド、およびシェルの改善が追加されました。
Claude Code v2.1.59では、/memory管理による自動メモリへの自動コンテキスト保存、インタラクティブなコードブロック選択のための/copyコマンドの追加、複合bashコマンドのプレフィックス提案の改善が導入されました。

ホームラボAIセンチネル:LLM統合を備えたセルフホスト監視アシスタント
Homelab AI Sentinelは、監視WebhookをLLMで処理し、平易な英語の診断を生成するセルフホスト型ツールです。11のアラートソースと10の通知プラットフォームをサポートし、OllamaやLM Studioを含むあらゆるOpenAI互換エンドポイントで動作し、ローカル推論が可能です。

運命:古典東洋占星術を用いた決定論的占いのためのClaude Codeプラグイン
DestinyはClaude Codeのプラグインで、あなたの八字(四柱推命の8文字)、今日の日柱、易経の卦をPythonで決定論的に計算し、Claudeが散文的なリーディングを生成します。LLMによる幻覚のホロスコープではありません。