Снизьте расходы на Claude в 60 раз, передав механические задачи DeepSeek V4 Flash через MCP

Пользователь Reddit проанализировал свое использование Claude и обнаружил, что большая часть расходов приходилась на механические задачи: классификацию файлов, переформатирование JSON, извлечение полей из текста и саммаризацию документов, которые он все равно просматривал мельком. Никакой из этих задач не требовал Sonnet. Решение: маленькая дешевая модель, работающая как вспомогательный инструмент через MCP, плюс одно правило в CLAUDE.md, запрещающее Claude выполнять эти задачи.
Настройка: MCP-инструмент + deny-list в CLAUDE.md
Настройка использует один MCP-инструмент, который отправляет текст и получает текст в ответ. Модель по умолчанию — DeepSeek V4 Flash (дешевая, 1M контекст). Эндпоинт задается одной строкой конфигурации и работает с любым провайдером, совместимым с OpenAI (локальный ollama, vllm, lm studio). Репозиторий: github.com/arizen-dev/deepseek-mcp (MIT, Python 3.10+).
Критический момент: правило в CLAUDE.md использует негативную формулировку — список запретов, а не разрешений. Пользователь сообщает, что позитивная формулировка («используй DeepSeek для X») игнорировалась примерно в 30% случаев. Подход с списком запретов срабатывает надежно.
# In CLAUDE.md:
# do NOT use Claude for:
# - json formatting
# - field extraction
# - file classification
# - summarization you will review anyway
Результаты: снижение затрат в 60 раз
За 3 недели реального использования: 217 механических вызовов перенесено на DeepSeek V4 Flash, общие расходы составили $0.41. Та же нагрузка на Sonnet обошлась бы примерно в $7. Это множитель примерно в 17 раз только для этих задач, и пользователь сообщает, что общий счет упал в 60 раз с учетом более тяжелых задач, оставшихся на Sonnet.
Как работает вспомогательный инструмент
Вспомогательный инструмент — это контролируемый инструмент, а не агент: никаких вызовов инструментов, доступа к файлам, цепочек. Задержка составляет 3–25 секунд. Вы проверяете результат. Вся схема: отправить текст, получить текст, проверить, двигаться дальше.
Для кого это
Для разработчиков, использующих Claude API или Claude Code, которые хотят сократить расходы на высокообъемные механические задачи, не теряя при этом возможности Sonnet для сложной работы.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Qwen3.5-397B MoE работает на 14 ГБ ОЗУ с помощью постраничной загрузки экспертов на M1 Ultra
Движок Paged MoE держит в памяти только 20 экспертов, а остальные подгружает с SSD, запуская модель 397B размером 209GB на Mac Studio с 64GB памяти, достигая 1,59 ток/с и пикового использования RAM 14GB. Включает бенчмарки меньших моделей.

Как устранить проблемы с настройкой OpenClaw: проблемы с многоагентным взаимодействием и ответами модели
Пытаетесь настроить OpenClaw? Узнайте о распространенных проблемах с многоагентными конфигурациями и неработоспособными моделями, а также о том, как их решить.

Клод против GPT для академического письма PhD: Сохранение технического смысла в разделах методов
Докторант сравнивает Claude и GPT при доработке статей по компьютерному зрению/совместному проектированию аппаратного обеспечения, обнаружив, что Claude более надежно сохраняет технический смысл и структуру аргументов, тогда как GPT иногда чрезмерно упрощает утверждения.

Практические советы по архитектуре многоагентных систем на основе опыта
Разработчик делится пятью конкретными паттернами для создания мультиагентных ИИ-систем на основе опыта работы с ежедневно функционирующей системой из 7 агентов: начать с одного агента, использовать паттерн оркестратора, внедрить общую память с JSON-файлами, маршрутизировать модели по задачам и добавить циклы подтверждения.