Ограничения скорости запросов в Claude Code могут быть связаны с перегрузкой из-за контекстного окна в 1 миллион токенов.

Расширение контекстного окна вызывает нагрузку на систему
Anthropic недавно выпустила Opus 4.6 с контекстным окном в 1 миллион токенов для всех пользователей. После этого релиза пользователи сообщили о двух значительных проблемах: ухудшении производительности при длительных задачах и увеличении проблем с пропускной способностью. Изначально не было возможности отказаться от модели с 1 млн контекста.
Теория: Неэффективное сжатие контекста
Анализ пользователя Reddit предполагает, что система сжатия контекста Claude Code — которая суммирует старую историю разговоров для экономии токенов — недостаточно агрессивна для расширенного контекстного окна в 1 млн токенов. Это означает, что каждая сессия Claude Code, вероятно, отправляет больше необработанных данных токенов на запрос, чем необходимо. При умножении на всю пользовательскую базу это создает перегрузку серверов, поскольку пользователи непреднамеренно отправляют раздутые контексты, содержащие ненужную информацию.
Влияние на лимиты использования
Теория предполагает, что краткосрочным решением Anthropic было снижение лимитов использования для компенсации возросшей нагрузки на серверы. Это объясняет, почему лимиты, по-видимому, уменьшились — пользователи расходуют токены быстрее на задачу, а не из-за преднамеренного сокращения лимитов со стороны Anthropic.
Найден обходной путь
Вчера Anthropic тихо вернула старую модель без 1 млн контекста в качестве опции. Пользователи, которые переключились на эту модель, сообщили о заметно улучшенной стабильности и более медленном потреблении своих лимитов использования, что подтверждает теорию о неэффективности контекстного окна.
Рекомендуемое действие
Для немедленного облегчения проблем с ограничениями скорости и стабильностью попробуйте отключить модель с 1 млн контекста. Долгосрочное решение, вероятно, требует улучшенных алгоритмов сжатия контекста. После их внедрения это может позволить Anthropic восстановить прежние лимиты использования.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Глубокое погружение в стоимость DeepSeek V4 Flash: объяснение коэффициента попадания в кэш и ценового соотношения
DeepSeek V4 Flash стоит 0,0066x за агентное задание по сравнению с Opus 4,7, благодаря 97% попаданий в кэш и соотношению цены чтения/записи кэша 0,02.

RTX 5080 16GB: Qwen3.6 35B MoE при 128k контексте — 56 tok/s, и почему MTP не помогает
Новые бенчмарки показывают, что Qwen3.6 35B MoE на RTX 5080 16GB выдает 56 ток/с при контексте 128k. MTP (Multi-Token Prediction) замедляет работу на 23% из-за нехватки VRAM, вытесняя экспертные слои на CPU.

Пользователи сообщают о переходе с Gemini Pro на Claude Max для помощи в академических проектах.
Пользователь перешёл с Gemini Pro на Claude Max после разочарования в производительности Gemini при выполнении практических задач. Он сообщает, что Claude успешно провёл рецензирование его академического проекта, задавал уточняющие вопросы и предложил записывать изученную информацию в файл memory.md.

Meta будет отслеживать движения мыши и нажатия клавиш сотрудников для обучения ИИ.
Согласно отчету Reuters, Meta планирует начать сбор данных о движениях мыши и нажатиях клавиш сотрудников для обучения ИИ. Статья вызвала обсуждение на Hacker News с 33 баллами и 7 комментариями.