Плагин MCP с кэшированием промптов автоматически снижает затраты на API Claude, выявляя стабильный контекст.

Prompt-caching — это плагин MCP, который автоматически снижает стоимость API Claude, используя функцию кэширования Anthropic. При использовании Claude Code или Cursor/Windsurf/Zed с API Anthropic каждый запрос обычно повторно отправляет весь контекст с нуля, что означает, что тысячи токенов оплачиваются по полной ставке многократно во время длительных сессий отладки.
Как это работает
Anthropic предоставляет функцию кэширования, которая делает повторные чтения в 10 раз дешевле (0.1× вместо 1×), но это требует ручного указания, что кэшировать. Плагин prompt-caching работает в фоновом режиме, определяет стабильные части вашего контекста (системные промпты, определения инструментов, чтение больших файлов) и автоматически помечает их перед каждым вызовом API.
Результаты производительности
- Исправление бага за 20 запросов: на 85% дешевле
- Рефакторинг за 15 запросов: на 80% дешевле
- Сессия программирования за 40 запросов: на 92% дешевле
Установка
Для пользователей Claude Code:
/plugin marketplace add https://github.com/flightlesstux/prompt-caching
/plugin install prompt-caching@ercan-ermis
Для Cursor/Windsurf/Zed:
npm install -g prompt-caching-mcp
Затем укажите на него в конфигурации MCP.
Инструмент имеет открытый исходный код под лицензией MIT и доступен бесплатно. Репозиторий находится по адресу https://github.com/flightlesstux/prompt-caching.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Steam City: Карта вашей библиотеки Steam в 3D-пиксель-арте, созданная с помощью Claude Code
Разработчик использовал Claude Code для создания Steam City — 3D-визуализации вашей библиотеки Steam в стиле пиксель-арт. Время игры определяет высоту зданий, непройденные игры остаются тёмными. Уже более 1000 игроков.

Метод квантования JANG повышает производительность MLX для больших моделей
Новый метод квантизации под названием JANG позволяет запускать большие модели, такие как MiniMax-M2.5 и Qwen 3.5, на фреймворке Apple MLX с существенно лучшей производительностью, чем стандартная квантизация MLX, достигая скоростей, близких к нативным, при сохранении точности, сопоставимой с квантизациями более высокого битрейта.

Повторное использование кэша ключей-значений для длинных диалогов на Apple Silicon обеспечивает ускорение в 200 раз
Разработчик реализовал повторное использование кэша KV на основе сессий для локального вывода LLM с использованием фреймворка MLX от Apple, достигнув 200-кратного улучшения времени до первого токена при длине контекста 100K. Подход сохраняет кэш KV в памяти между поворотами разговора, обрабатывая только новые токены.

Argus: Приложение для GitHub, которое проверяет файлы CLAUDE.md и публикует оценки в запросах на слияние (PR)
Argus — это приложение для GitHub, созданное с помощью Claude Code, которое проверяет файлы CLAUDE.md и выставляет оценку для каждого запроса на слияние. После тестирования на нескольких репозиториях наиболее частыми ошибками оказались отсутствие явных ограничений области действия и путей эскалации.