Оценка RAG-чатбота: как прогон модели + исправление ретривера сократили затраты на 79% и повысили качество на 19%

Пользователь Reddit провел полную оценку RAG-чатбота для поддержки клиентов, который работал на ChromaDB с порогом схожести по умолчанию 0,7 (косинусное расстояние) и использовал Gemini 3.1 Flash Lite Preview для генерации. Он обнаружил, что самая дорогая модель показала наихудшие результаты, а несколько неочевидных изменений действительно повлияли на эффективность.
Проблемы поиска, маскирующиеся под проблемы LLM
Бот отвечал «У меня нет доступа к конкретной информации об услугах нашей компании», когда пользователи задавали неформальные вводные вопросы вроде «эй, чем вы занимаетесь?». Инстинктивно хотелось изменить промпты или заменить модель, но корень проблемы был в поиске: порог схожести в ChromaDB был установлен на 0,7 (косинусное расстояние, где меньшее значение означает большую схожесть, так что порог на самом деле строгий). Неформальные вводные не давали эмбеддингов, достаточно близких к какому-либо чанку, поэтому не было получено ни одного документа. Урок: логируйте, какой контекст на самом деле получает LLM, прежде чем обвинять генерацию. Если поиск ничего не возвращает, никакое инженерное улучшение промптов это не исправит.
Эвристические оценщики хуже, чем их отсутствие
Сопоставление ключевых слов и подсчет ссылок на источники давали числа, не коррелирующие с удовлетворенностью пользователей. Автор перешел на LLM-судью (Claude Haiku 4.5 через OpenRouter), который оценивал релевантность, точность, полезность и общую оценку по шкале от 0 до 10. Стоимость: несколько центов за полный прогон.
Дедупликация чанков
В двух оборотах в окне контекста были три почти идентичных чанка из FAQ. Добавление проверки на >80% совпадения токенов из того же исходного файла очистило контекст, сократило количество токенов и остановило галлюцинацию названий продуктов в одном обороте.
Компромисс более строгой привязки
Добавление правила, что агент сообщает только факты из полученных документов, повысило точность, но снизило полезность в оборотах, где в документах не было информации: бот начал говорить «документы этого не указывают, обратитесь в поддержку» вместо того, чтобы догадываться. Автор отмечает, что это правильное решение для бота техподдержки, основанного на фактах, но его нужно принимать осознанно.
Результаты сравнения моделей
Запуск того же оценочного инструмента на 5 моделях показал, что Gemma 4 26B набрала 7,88 против 7,33 у оригинального Gemini 3.1 Flash Lite Preview — и стоила на 75% меньше за сессию. Mistral Small 3.2 занял второе место с небольшим отрывом. Nova Micro была самой дешевой, но краткие ответы получили штраф за отсутствие конкретных действий. В целом качество улучшилось с 6,62 до 7,88 (+19%), а стоимость снизилась с $0,002420 до $0,000509 за сессию (−79%).
Вся оценка проводилась с помощью Neo AI Engineer, который создал оценочный инструмент, обрабатывал чекпоинты, решал проблемы с тайм-аутом и лимитами контекста и обобщал результаты. Автор вручную проверил всё.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Создание пользовательской системы глоссария хинди с помощью Claude: от 76% до 92% точности за 10 месяцев
Инженер из Бангалора создал собственную систему глоссариев для Claude, повысив точность хинди-лексики с 76% до 92%. Наиболее эффективными оказались термины с примерами в контексте.

Визуализация рабочего процесса Claude Code объясняет иерархию памяти и систему навыков.
Пользователь Reddit поделился визуальной диаграммой, показывающей структуру рабочего процесса Claude Code, включая слои памяти с файлами CLAUDE.md и переиспользуемые навыки, определённые в директориях .claude/skills/. Цикл рабочего процесса предлагает использовать режим Plan, описывать функции, автоматически принимать изменения и часто коммитить.

Клод против GPT для академического письма PhD: Сохранение технического смысла в разделах методов
Докторант сравнивает Claude и GPT при доработке статей по компьютерному зрению/совместному проектированию аппаратного обеспечения, обнаружив, что Claude более надежно сохраняет технический смысл и структуру аргументов, тогда как GPT иногда чрезмерно упрощает утверждения.

Запуск LLM с 1 триллионом параметров локально на кластере AMD Ryzen AI Max+
AMD демонстрирует запуск открытой модели Kimi K2.5 (375 ГБ, 1 триллион параметров) на четырёх системах Framework Desktop с процессорами Ryzen AI Max+ 395 с использованием llama.cpp RPC. Руководство охватывает модификации ядра TTM для выделения 120 ГБ видеопамяти на узел и предлагает два варианта настройки: предварительно собранные бинарные файлы Lemonade SDK или ручную установку ROCm 7.0.2.