Тестирование конвейера RAG показывает, что стоимость за токен — не лучший критерий для выбора модели.

Разработчик провёл сравнение трёх ИИ-моделей в условиях, приближённых к продакшену, используя идентичные RAG-пайплайны для ответа на сложный запрос клиента о соответствии SOC 2. В тесте использовались Claude Haiku 4.5, Amazon Nova Pro и Amazon Nova Lite с одинаковой настройкой: два векторных хранилища (документация по продукту и маркетинговая/конкурентная документация), 13 Architecture Decision Records в качестве контекстной основы, примерно 49K входных токенов извлечённого контекста на запрос, идентичные системные промпты и одинаковая структура вызова Bedrock API с изменением только идентификатора модели.
Настройка теста и результаты
Запрос был: «Клиент спросил о соответствии SOC 2 — как мне ответить?» Все модели получили одинаковый RAG-контекст, содержащий полный плейбук с готовыми для копирования письмами, обработкой возражений, конкурентным позиционированием, ответами по соответствию конкретным фреймворкам и ограничениями на то, чего говорить не следует.
Результаты:
- Nova Lite: 49 067 входных токенов, 244 выходных токена, время ответа 5.5с, стоимость ~$0.003
- Nova Pro: 49 067 входных токенов, 368 выходных токенов, время ответа 13.5с, стоимость ~$0.040
- Haiku 4.5: 53 674 входных токена, 1 534 выходных токена, время ответа 15.6с, стоимость $0.049
Сравнение качества вывода
Несмотря на идентичный контекст, модели выдали кардинально разные ответы:
- Nova Lite: Сгенерировала общее письмо из четырёх абзацев, которое верно передало основной факт (развёртывание в вашем аккаунте, отсутствие отдельного отчёта SOC 2), но не включило обработку возражений, конкурентное позиционирование или нюансы из контекста. Завершилось мета-комментарием о следовании ADR.
- Nova Pro: Выдала семь пронумерованных пунктов, охватывающих технические аспекты, такие как резидентность данных, аутентификация, контроль доступа, мониторинг, обновления, управление секретами и область соответствия. Технически точно, но читалось как вставленная документация AWS с аналогичным мета-комментарием.
- Haiku 4.5: Предоставила полный плейбук с объяснением на простом английском, готовое для копирования письмо, обработчик возражений с аналогией на Terraform, ответы по конкретным фреймворкам (HIPAA, PCI-DSS, SOX, FINRA), ограничения «чего НЕ говорить», готовые тезисы для CRM и конкурентное позиционирование против других инструментов.
Ключевой вывод
Разрыв заключался не в доступной информации — все модели имели одинаковые ~49K входных токенов, содержащих полный плейбук. Разница была в том, что каждая модель могла извлечь и синтезировать. Nova Lite извлекла один факт, Nova Pro организовала факты в список, а Haiku синтезировала контекст в готовый к действию инструментарий с предвосхищением последующих вопросов.
Разница в стоимости между Nova Pro и Haiku составила $0.009 на запрос (меньше цента), но разрыв в качестве вывода был существенным. Самая дешёвая модель на токен выдавала ответы, для соответствия которым однопроходному выводу Haiku потребовалось бы 2-3 дополнительных запроса, что в итоге обходилось дороже из-за повторного использования RAG-пайплайна.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Конвейер агента OpenClaw, использованный для написания и публикации трех романов с ИИ за неделю.
Разработчик использовал OpenClaw для создания четырёх-агентного рабочего процесса, который написал, отредактировал и опубликовал три полноценных романа на Amazon KDP за семь дней. Конвейер включал специализированных агентов для написания, редактирования, маркетинга и оркестрации.

Opus 4.8 против Sonnet 4.6 для аналитики: реальные данные с панели SaaS
SaaS-компания с 310 клиентами-специалистами сравнила Claude Opus 4.8 и Sonnet 4.6 для анализа трендов, ежемесячных сводок и обнаружения аномалий. Opus обнаружил тонкие аномалии, которые пропустил Sonnet, но стоил в 2,1 раза дороже за вызов.

Магистерская диссертация, написанная в основном с помощью Клода: студент-экономист получил высшую оценку
Студент-экономист использовал Claude для обзора литературы, анализа данных с помощью Python-скриптов и Excel, а также для презентации — сдал работу с оценкой, близкой к PhD. В приложении указано использование ИИ, вопросов не возникло.

Создание приложения-раскраски, безопасного для детей, с Клодом в качестве парного программиста
Разработчик использовал Клода в качестве напарника по программированию, чтобы создать приложение-раскраску на SwiftUI с локальной генерацией изображений, родительским контролем и без рекламы.