Cowork vs. Claude Chat: 文書抽出精度の比較

公開株の年次報告書を分析するツールを開発している開発者が、密度の高い財務PDFからデータを抽出するために、Claude.aiチャットとCoworkの間で制御された比較を行いました。このテストでは、同一のプロンプトと、財務表、脚注、相互参照された開示を含む140ページ以上の同じPDFを使用しました。
テスト結果
テスト1 - Claude.aiチャット: PDFをアップロードし、プロンプトを貼り付けました。出力は機関投資家級で、すべての明細項目がソースに対して検証されました。このモデルは自己修正行動を示し、抽出中に自らの誤りを検出して修正しました。150以上のデータポイントをチェックした結果、エラーは見つかりませんでした。
テスト2 - Cowork(既存のプロジェクトフォルダを使用したワークフロー): 5つの事実誤りを生成し、30%少ないコンテンツしか抽出せず、ほとんどの詳細な資料を見逃しました。見出しの数字は正しかったものの、サブコンポーネントの詳細は失われました。
テスト3 - Cowork(クリーンなフォルダ、PDFとプロンプトのみ): 依然として以下のようなエラーを生成しました:
- 調整項目の捏造
- 単位カウントの逆算
- 財務諸表注記から20-90%ずれた複数のカテゴリー
- 前年度の列への混入(当期数値は正しいが、FY2024の比較数値に利益とFCF表全体で誤りがあった)
パターン分析
開発者は、Coworkが一貫して正しい当期合計を生成する一方で、明細項目の内訳は信頼できないことを観察しました。このモデルは、文書から読み取るのではなく、既知の希薄化後の合計に合わせるために調整項目を捏造し、逆算することでギャップを埋めているように見えました。対照的に、Claudeチャットは詳細を正しく抽出するか、見つけられなかったものを明示しました。
この結論は、Coworkのエージェント的なタスク分解(チャンキング、サブエージェント、並列処理)が、長く相互参照された財務文書に必要な持続的な注意力を維持できないことを示唆しています。チャットはPDFを単一の深いパスで処理しますが、Coworkはそれらを分割し、忠実度を失います。
この精度の差は、すべての数値を独立して検証しなければ捏造が見えないプロフェッショナルなユースケースにおいて重要です。開発者は、Claudeチャットがきれいに処理する一方で、Coworkがもっともらしいが捏造された詳細を生成する同様のパターンを他の人々が観察しているかどうかについて、コミュニティのフィードバックを求めています。
📖 全文を読む: r/ClaudeAI
👀 See Also

多段階LLMワークフローのための決定論的コンパイラアーキテクチャが強力なベンチマーク結果を示す
構造化されたLLMワークフローのための決定論的コンパイルアーキテクチャは、型付きノードレジストリ、パラメータ契約、静的検証を使用して、ワークフローグラフを事前にコンパイルします。ベンチマークでは、3〜12以上のノード深度にわたるワークフローで、GPT-4.1およびClaude Sonnet 4.6を上回る性能を示しています。

CAP: /plugin installでインストールするClaudeコードステータスラインプラグイン
CAP(Claude Allowance Pulse)は、npm、curl、jqを必要とせずに/plugin installでインストールできるClaude Code用ステータスラインプラグインです。ターミナルにモデル使用状況、セッションおよび週間制限、コンテキストウィンドウ使用率、セッションコストを表示します。

companion-capture: Claude Codeの一時的な吹き出しを保存するツール
companion-captureは、Claude Codeのコンパニオンキャラクターの吹き出しメッセージがターミナルから消える前にキャプチャするオープンソースツールです。VT100画面バッファの解析でカーソル位置を追跡し、メッセージをマークダウンファイルとSQLiteに保存して検索可能にします。

決定パスポート:AIエージェント実行ガバナンスのための監査レイヤー
Claude Codeの流出は、AIエージェントのガバナンスにおけるギャップを浮き彫りにしています。Decision Passportは、追記のみ可能な実行記録、ポータブルな証明バンドル、オフライン検証による改ざん検知可能な監査証跡でこの課題に対処します。