Исследование Шага 3.5 Flash: открытая модель для быстрого глубокого рассуждения

Шаг 3.5 Flash — это модель базового уровня с открытым исходным кодом, ориентированная на предоставление быстрых и надежных возможностей глубокого анализа. Она использует разреженную архитектуру Mixture of Experts (MoE), активируя только 11 миллиардов из 196 миллиардов своих параметров на токен. Эта избирательная активация обеспечивает ей высокую "плотность интеллекта", позволяя конкурировать с ведущими проприетарными моделями, оставаясь при этом гибкой для взаимодействия в реальном времени.
Глубокий анализ и скорость
Модель включает в себя прогнозирование с несколькими токенами (MTP-3), позволяя обрабатывать от 100 до 300 токенов в секунду, достигая пика в 350 для задач кодирования в одном потоке, что идеально подходит для сложного многошагового анализа с быстрой реакцией.
Производительность в кодировании и агентских задачах
Шаг 3.5 Flash отлично справляется с агентскими задачами, поддерживаемыми масштабируемой системой обучения с подкреплением, что обеспечивает непрерывное самоулучшение. Она достигла результата в 74,4% на верифицированном бенчмарке SWE-bench и 51,0% на Terminal-Bench 2.0, что отражает её способности в обработке сложных долгосрочных задач.
Эффективная обработка длинного контекста
Она поддерживает большой контекстный окно размером 256K, используя соотношение внимания с подвижным окном 3:1 (SWA), интегрируя три слоя SWA для каждого полного слоя внимания. Этот метод значительно снижает вычислительные затраты по сравнению с традиционными моделями для длинного контекста.
Локальное развертывание и доступность
Разработанная для простого локального развертывания, Шаг 3.5 Flash может безопасно работать на высокопроизводительном потребительском оборудовании, таком как Mac Studio M4 Max и NVIDIA DGX Spark, обеспечивая конфиденциальность данных без ущерба для производительности.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Онтарио, аудит: 60% систем ИИ для записи путают лекарства, 85% упускают детали психического здоровья
Аудиторы Онтарио обнаружили, что 12 из 20 систем AI Scribe вставляли неверную информацию о лекарствах, 9 генерировали вымышленные рекомендации, а 17 пропустили ключевые детали о психическом здоровье из записей приемов врачей. При оценке точность составляла лишь 4% от общего балла.

Исследование Cursor AI: Краткосрочные выигрыши в скорости ведут к долгосрочной сложности
Исследование с использованием анализа разности разностей показало, что внедрение Cursor AI приводит к статистически значимому, но временному увеличению скорости разработки, а также к существенному и устойчивому росту предупреждений статического анализа и сложности кода, что вызывает долгосрочное замедление.

Anthropic сообщает о доказательствах массового копирования (дистилляции) Claude конкурентами в сфере ИИ.
Anthropic предоставила доказательства того, что DeepSeek, Moonshot и MiniMax использовали примерно 24 000 фейковых аккаунтов для массовой дистилляции Claude, зафиксировав более 16 миллионов обменов.

Приложение Claude возглавило чарты App Store в США, ассистенты на базе ИИ заняли первые 10 мест
Claude от Anthropic в настоящее время занимает первое место в чарте лучших приложений в американском App Store, ChatGPT находится на втором месте, а Google Gemini — на четвёртом. В первую десятку входят три ассистента с искусственным интеллектом наряду с приложениями для шопинга, социальных сетей и утилитами.