Cerebras выпускает модели Step-3.5-Flash-REAP с сокращением памяти на 40%.

✍️ OpenClawRadar📅 Опубликовано: 25 февраля 2026 г.🔗 Source
Cerebras выпускает модели Step-3.5-Flash-REAP с сокращением памяти на 40%.
Ad

Что это такое

Cerebras выпустила модели Step-3.5-Flash-REAP, которые представляют собой эффективные по памяти сжатые версии их более крупных моделей. Это уменьшенные версии, предназначенные для того, что источник называет «картофельными настройками», хотя модель с 121B параметрами всё ещё требует значительных ресурсов.

Ключевые детали из источника

Модели доступны на Hugging Face:

Модель Step-3.5-Flash-REAP-121B-A11B сжата с 196B до 121B параметров, что представляет собой сокращение памяти на 40% при сохранении почти идентичной производительности по сравнению с полной моделью.

Сжатие использует REAP (Router-weighted Expert Activation Pruning), описанное как «новый метод обрезки экспертов, который выборочно удаляет избыточных экспертов, сохраняя независимый контроль маршрутизатора над оставшимися экспертами».

Ad

Особенности и возможности

  • Почти без потерь в производительности: Сохраняет почти идентичную точность в задачах генерации кода, агентного кодирования и вызова функций по сравнению с полной моделью на 196B
  • Сокращение памяти на 40%: Сжатие с 196B до 121B параметров снижает затраты на развёртывание и требования к памяти
  • Сохранённые возможности: Сохраняет все основные функции, включая генерацию кода, математику и логику, а также вызов инструментов
  • Полная совместимость: Работает с обычным vLLM — не требуются модификации исходного кода или пользовательские патчи
  • Оптимизировано для реального использования: Особенно эффективно для сред с ограниченными ресурсами, локальных развёртываний и академических исследований

Источник отмечает, что хотя это «уменьшенные версии», модель на 121B всё ещё требует довольно мощной настройки, несмотря на сжатие.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Тест пространственного мышления LLM: бенчмарк Sokoban показывает лидерство ChatGPT, Qwen3.7-max и Gemini 3.5-thinking
Новости

Тест пространственного мышления LLM: бенчмарк Sokoban показывает лидерство ChatGPT, Qwen3.7-max и Gemini 3.5-thinking

Специальный тест Sokoban оценивал пространственное мышление LLM в режиме zero-shot со строгим форматированием. Только ChatGPT, Qwen3.7-max и Gemini 3.5-thinking справились. Такие модели, как Gemini 3.5-flash и Qwen3.7-plus, не прошли из-за недопустимых ходов или тупиков.

OpenClawRadar
Claude Code Opus 4.6 теперь по умолчанию использует контекстное окно в 1 миллион токенов.
Новости

Claude Code Opus 4.6 теперь по умолчанию использует контекстное окно в 1 миллион токенов.

Модель Claude Code Opus 4.6 теперь по умолчанию имеет контекстное окно в 1 миллион токенов, сохраняя при этом ту же цену, что и предыдущие версии. Это изменение, похоже, уже вступило в силу без официального объявления.

OpenClawRadar
Cursor's Composer 2.0, судя по данным конечной точки API, использует модель Kimi 2.5.
Новости

Cursor's Composer 2.0, судя по данным конечной точки API, использует модель Kimi 2.5.

Анализ сетевого трафика показывает, что Cursor's Composer 2.0 отправляет запросы на конечную точку, содержащую 'kimi-k2p5-rl-0317-s515-fast', что указывает на использование Kimi 2.5 в качестве основы. Модифицированная лицензия MIT, согласно сообщениям, требует указания авторства, но налагает минимальные другие обязательства.

OpenClawRadar
🦀
Новости

OpenClaw 2026.8.2:内部上下文块泄露至Telegram文本

Ошибка в OpenClaw 2026.8.2 при опросе Telegram приводит к утечке внутреннего контекстного блока в видимый текст, из-за чего агенты отказываются выполнять легитимные инструкции и сигнализируют о prompt injection.

OpenClawRadar