Cowork против Claude Chat: Сравнение точности извлечения документов

Разработчик, создающий инструмент для анализа годовых отчетов публично торгуемых акций, провел контролируемое сравнение между чатом Claude.ai и Cowork для извлечения данных из плотных финансовых PDF-файлов. Тест использовал идентичные промпты и те же PDF-файлы объемом более 140 страниц, содержащие финансовые таблицы, сноски и перекрестные ссылки в раскрытиях.
Результаты тестирования
Тест 1 - Чат Claude.ai: Загружен PDF, вставлен промпт. Результат был институционального уровня, каждая позиция проверена по источнику. Модель продемонстрировала самокорректирующее поведение, исправляя собственные ошибки в процессе извлечения. Не было обнаружено ошибок по более чем 150 проверенным точкам данных.
Тест 2 - Cowork (рабочий процесс с существующей папкой проекта): Допущено 5 фактических ошибок, извлечено на 30% меньше контента и пропущена большая часть материалов, требующих глубокого анализа. Хотя основные цифры были правильными, детали по субкомпонентам были утеряны.
Тест 3 - Cowork (чистая папка, только PDF и промпт): Все равно допущены ошибки, включая:
- Сфабрикованные согласующие позиции
- Обратно спроектированные подсчеты единиц
- Несколько категорий отклонялись на 20-90% от фактических примечаний к финансовой отчетности
- Загрязнение данных из колонок предыдущего года (цифры текущего года правильные, но сравнительные показатели за FY2024 содержали ошибки в таблицах прибыли и свободного денежного потока)
Анализ паттернов
Разработчик отметил, что Cowork последовательно выдавал правильные итоги за текущий год, но ненадежные разбивки по позициям. Модель, по-видимому, маскировала пробелы, фабрикуя согласующие вставки и обратно решая уравнения для достижения известных разводненных итогов, вместо чтения документа. В отличие от этого, чат Claude либо правильно извлекал детали, либо отмечал то, что не мог найти.
Вывод предполагает, что агентское декомпозирование задач Cowork (разбиение на части, суб-агенты, параллельная обработка) не может поддерживать устойчивое внимание, необходимое для длинных, перекрестно ссылающихся финансовых документов. Чат обрабатывает PDF-файлы за один глубокий проход, в то время как Cowork разбивает их и теряет точность.
Этот разрыв в точности важен для профессиональных случаев использования, где фабрикация невидима без независимой проверки каждого числа. Разработчик ищет обратную связь сообщества о том, наблюдали ли другие подобные паттерны, когда Cowork выдает правдоподобные, но сфабрикованные детали, которые чат Claude обрабатывает чисто.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Аппаратный виджет и расширение для Chrome отслеживают лимиты запросов к API Claude.
Разработчик создал аппаратный виджет на базе ESP8266 и OLED-дисплея, который отслеживает лимиты запросов Claude в реальном времени, а также расширение для Chrome, перехватывающее внутренний API /usage Claude и показывающее паттерны использования. Общая стоимость компонентов составляет примерно $6.50.

AgentMeet: Инструмент для обмена контекстом между ИИ-агентами через браузерные комнаты
AgentMeet — это инструмент, который позволяет ИИ-агентам, таким как Claude, делиться контекстом друг с другом, присоединяясь к комнатам на основе браузера с помощью простых POST-запросов. Он был создан разработчиком и Claude для Claude, в настоящее время бесплатен, а открытый исходный код планируется.

CrabMeat v0.1.0: безопасный шлюз для агентов, не доверяющий LLM контроль безопасности
CrabMeat v0.1.0 — это WebSocket-шлюз для агентных нагрузок LLM, обеспечивающий безопасность на архитектурном уровне: косвенная адресация через идентификаторы возможностей, классы эффектов, IRONCLAD_CONTEXT с закрепленными инструкциями, аудиторская цепочка с защитой от изменений, фильтр утечек потокового вывода и отсутствие режима YOLO.

MCP как интерфейс наблюдаемости: подключение ИИ-агентов к точкам трассировки ядра
Протокол контекста модели (MCP) становится интерфейсом между ИИ-агентами и данными инфраструктуры, при этом Datadog выпускает MCP-сервер, а Qualys отмечает проблемы безопасности. В статье рассматриваются два подхода: обёртывание существующих платформ или создание нативной для MCP системы мониторинга, которая подключается напрямую к точкам трассировки ядра.