Тестирование конвейера RAG показывает, что стоимость за токен — не лучший критерий для выбора модели.

✍️ OpenClawRadar📅 Опубликовано: 2 марта 2026 г.🔗 Source
Тестирование конвейера RAG показывает, что стоимость за токен — не лучший критерий для выбора модели.
Ad

Разработчик провёл сравнение трёх ИИ-моделей в условиях, приближённых к продакшену, используя идентичные RAG-пайплайны для ответа на сложный запрос клиента о соответствии SOC 2. В тесте использовались Claude Haiku 4.5, Amazon Nova Pro и Amazon Nova Lite с одинаковой настройкой: два векторных хранилища (документация по продукту и маркетинговая/конкурентная документация), 13 Architecture Decision Records в качестве контекстной основы, примерно 49K входных токенов извлечённого контекста на запрос, идентичные системные промпты и одинаковая структура вызова Bedrock API с изменением только идентификатора модели.

Настройка теста и результаты

Запрос был: «Клиент спросил о соответствии SOC 2 — как мне ответить?» Все модели получили одинаковый RAG-контекст, содержащий полный плейбук с готовыми для копирования письмами, обработкой возражений, конкурентным позиционированием, ответами по соответствию конкретным фреймворкам и ограничениями на то, чего говорить не следует.

Результаты:

  • Nova Lite: 49 067 входных токенов, 244 выходных токена, время ответа 5.5с, стоимость ~$0.003
  • Nova Pro: 49 067 входных токенов, 368 выходных токенов, время ответа 13.5с, стоимость ~$0.040
  • Haiku 4.5: 53 674 входных токена, 1 534 выходных токена, время ответа 15.6с, стоимость $0.049
Ad

Сравнение качества вывода

Несмотря на идентичный контекст, модели выдали кардинально разные ответы:

  • Nova Lite: Сгенерировала общее письмо из четырёх абзацев, которое верно передало основной факт (развёртывание в вашем аккаунте, отсутствие отдельного отчёта SOC 2), но не включило обработку возражений, конкурентное позиционирование или нюансы из контекста. Завершилось мета-комментарием о следовании ADR.
  • Nova Pro: Выдала семь пронумерованных пунктов, охватывающих технические аспекты, такие как резидентность данных, аутентификация, контроль доступа, мониторинг, обновления, управление секретами и область соответствия. Технически точно, но читалось как вставленная документация AWS с аналогичным мета-комментарием.
  • Haiku 4.5: Предоставила полный плейбук с объяснением на простом английском, готовое для копирования письмо, обработчик возражений с аналогией на Terraform, ответы по конкретным фреймворкам (HIPAA, PCI-DSS, SOX, FINRA), ограничения «чего НЕ говорить», готовые тезисы для CRM и конкурентное позиционирование против других инструментов.

Ключевой вывод

Разрыв заключался не в доступной информации — все модели имели одинаковые ~49K входных токенов, содержащих полный плейбук. Разница была в том, что каждая модель могла извлечь и синтезировать. Nova Lite извлекла один факт, Nova Pro организовала факты в список, а Haiku синтезировала контекст в готовый к действию инструментарий с предвосхищением последующих вопросов.

Разница в стоимости между Nova Pro и Haiku составила $0.009 на запрос (меньше цента), но разрыв в качестве вывода был существенным. Самая дешёвая модель на токен выдавала ответы, для соответствия которым однопроходному выводу Haiku потребовалось бы 2-3 дополнительных запроса, что в итоге обходилось дороже из-за повторного использования RAG-пайплайна.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

Конвейер агента OpenClaw, использованный для написания и публикации трех романов с ИИ за неделю.
Кейсы

Конвейер агента OpenClaw, использованный для написания и публикации трех романов с ИИ за неделю.

Разработчик использовал OpenClaw для создания четырёх-агентного рабочего процесса, который написал, отредактировал и опубликовал три полноценных романа на Amazon KDP за семь дней. Конвейер включал специализированных агентов для написания, редактирования, маркетинга и оркестрации.

OpenClawRadar
Opus 4.8 против Sonnet 4.6 для аналитики: реальные данные с панели SaaS
Кейсы

Opus 4.8 против Sonnet 4.6 для аналитики: реальные данные с панели SaaS

SaaS-компания с 310 клиентами-специалистами сравнила Claude Opus 4.8 и Sonnet 4.6 для анализа трендов, ежемесячных сводок и обнаружения аномалий. Opus обнаружил тонкие аномалии, которые пропустил Sonnet, но стоил в 2,1 раза дороже за вызов.

OpenClawRadar
Магистерская диссертация, написанная в основном с помощью Клода: студент-экономист получил высшую оценку
Кейсы

Магистерская диссертация, написанная в основном с помощью Клода: студент-экономист получил высшую оценку

Студент-экономист использовал Claude для обзора литературы, анализа данных с помощью Python-скриптов и Excel, а также для презентации — сдал работу с оценкой, близкой к PhD. В приложении указано использование ИИ, вопросов не возникло.

OpenClawRadar
Создание приложения-раскраски, безопасного для детей, с Клодом в качестве парного программиста
Кейсы

Создание приложения-раскраски, безопасного для детей, с Клодом в качестве парного программиста

Разработчик использовал Клода в качестве напарника по программированию, чтобы создать приложение-раскраску на SwiftUI с локальной генерацией изображений, родительским контролем и без рекламы.

OpenClawRadar