Измерение стека MCP Claude Code: дружественность к кэшу против экономии байтов и двухстрочное исправление для кэша подсказок

При оптимизации стека Claude Code MCP легко сосредоточиться на одном показателе: экономии байтов. Но новый анализ Грега Шевченко показывает, что бенчмарк по одной оси может рекомендовать систему, которая строго хуже в продакшне. Недостающая ось: кэш-дружественность, т.е. создаёт ли один и тот же ввод байтово идентичные данные между запусками, чтобы срабатывал кэш подсказок Anthropic.
Самый эффективный по экономии байтов инструмент Шевченко — MCP для извлечения, сокращающий контекст на 60–70%, — на самом деле нарушал кэш подсказок с TTL 5 минут при каждом вызове. Два запуска одного запроса давали разные байты, потому что порядок вывода rg --files-with-matches просачивался через последовательность вставки в Map в итоговый контекст. Исправление заняло две строки: сортировка результатов rg перед обрезкой и сортировка записей Map по пути. После изменения экономия байтов осталась прежней, но cache_friendly_score вырос с ~0% до 100%.
Что измеряет стенд
Шевченко опубликовал открытый тестовый стенд (Python только со стандартной библиотекой, офлайн), который измеряет:
- Среднее отношение + CV по N≥5 запускам на фикстуру → ось экономии байтов
- Проверка уникальных MD5 == 1 → ось кэш-дружественности (0–100%)
- Аудит 12 антипаттернов в определениях инструментов (ссылка на DSA)
Любой компрессор в виде (str) -> str можно подключить. Стенд использует кластерные бутстрап-доверительные интервалы, интервалы Уилсона, предрегистрацию и каппу Коэна на реальных данных.
Обзор публичных альтернатив
Шевченко изучил публичную документацию: индекс кодовой базы Cursor, Sourcegraph Cody, карта репозитория Aider, Microsoft LLMLingua/LLMLingua-2, Firecrawl/Jina Reader, RouteLLM/Martian (по состоянию на май 2026). Ни один из них не раскрывает метрики кэш-дружественности.
Ограничения
Он выдвинул гипотезу, что слой подготовки вызывает больше последующих попаданий в кэш, но она не достигла статистической значимости (Welch p=0.32, d Коэна≈0.18, N=137). Каппа Коэна для двух судей на корпусе составила 0.5955 (умеренная, ниже порога 0.7), причём 4 из 5 разногласий пришлись на одну неоднозначную задачу — исправление спецификации повысило бы каппу до ~0.83.
Стенд распространяется под лицензией MIT. Если вы используете стек Claude Code MCP, измерение cache_friendly_score — это конкретный и практичный шаг.
📖 Читать полный источник: r/ClaudeAI
👀 Смотрите также

Тестирование локального Qwen 3.6 27B в качестве соагента-валидатора Codex
Разработчик создал воспроизводимый набор тестов для оценки профилей Qwen 3.6 27B GGUF (llama.cpp) в качестве валидатора-компаньона для Codex, обнаружив, что профили с контекстом 128k необходимы для задач с длинным контекстом, а кэш KV q8 даёт минимальную потерю точности.

OpenClaw внедряет сжатие истории агента для сокращения использования контекста.
OpenClaw теперь сжимает историю агента, заменяя логи завершённых подзадач структурированными сводками, сокращая объём с ~1 млн токенов до ~30 тыс. Система использует 4-проходный сканер для определения жизненных циклов задач и генерирует маскированные сводки, сохраняющие совместимость с агентом.

TailClaude: Открытый веб-интерфейс для доступа к сессиям кода Claude с мобильных устройств и браузера
TailClaude — это открытый веб-интерфейс, который позволяет получить доступ к сессиям Claude Code с телефона или любого браузера менее чем за минуту с помощью Tailscale. Проект был создан с помощью Claude Code для каркаса, бэкенда с потоковой передачей SSE, мобильного чат-интерфейса и интеграции QR-кода.

Навык роста Claude: Структурированные планы роста B2B SaaS для AI-агентов программирования
Разработчик создал навык Claude Growth Skill, содержащий 6 проверенных на практике плейбуков, основанных на 5 кейсах SaaS, партнерствах с годовым доходом $90 млн и 1800 интервью с пользователями. Он структурирует работу по росту B2B SaaS от валидации PMF до экосистемы каналов и продаж.