Sarvam AI выпускает открытые языковые модели на 30 и 105 миллиардов параметров, созданные на индийской инфраструктуре для обучения.

✍️ OpenClawRadar📅 Опубликовано: 7 марта 2026 г.🔗 Source
Sarvam AI выпускает открытые языковые модели на 30 и 105 миллиардов параметров, созданные на индийской инфраструктуре для обучения.
Ad

Спецификации и архитектура моделей

Sarvam 30B и Sarvam 105B — это модели логического вывода, обученные с нуля на крупномасштабных, высококачественных наборах данных, курируемых внутри компании на этапах предварительного обучения, контролируемой тонкой настройки и обучения с подкреплением. Обучение проводилось полностью в Индии на вычислительных мощностях, предоставленных в рамках миссии IndiaAI.

Обе модели используют основу Transformer с архитектурой Mixture-of-Experts (MoE) и разреженной маршрутизацией экспертов для масштабирования количества параметров без увеличения вычислений на токен. Архитектура поддерживает длинные контекстные входные данные за счет ротационных позиционных эмбеддингов, стабилизации на основе RMSNorm и дизайна внимания, оптимизированного для эффективного использования KV-кэша во время вывода.

Sarvam 30B использует Grouped Query Attention (GQA) для уменьшения памяти KV-кэша при сохранении производительности. Sarvam 105B расширяет архитектуру за счет большей глубины и Multi-head Latent Attention (MLA) — сжатой формулировки внимания, которая снижает требования к памяти для вывода с длинным контекстом. Обе модели используют разреженные полносвязные слои экспертов с 128 экспертами, но различаются по емкости экспертов и конфигурации маршрутизации.

Ad

Детали обучения и данных

Модель 30B обучалась на 16 триллионах токенов, а модель 105B — на 12 триллионах токенов. Данные предварительного обучения охватывают код, общие веб-данные, специализированные корпусы знаний, математику и многоязычный контент со значительным выделением ресурсов для 10 наиболее распространенных индийских языков.

При обучении использовались скоринговые оценки маршрутизации на основе сигмоиды вместо традиционного гейтинга с softmax, что улучшает балансировку нагрузки экспертов и снижает коллапс маршрутизации. Термин смещения эксперта стабилизирует динамику маршрутизации и способствует более равномерному использованию экспертов на протяжении шагов обучения.

Предварительное обучение проводилось в три этапа: долгосрочное предварительное обучение, промежуточное обучение и этап расширения длинного контекста. Модель 105B достигла превосходства над моделью 30B в тестах уже на ранних этапах обучения, что свидетельствует об эффективном масштабировании.

Производительность и развертывание

Sarvam 105B демонстрирует хорошие результаты в задачах логического вывода, программирования и агентских задачах по различным тестам. Sarvam 30B оптимизирована для развертывания в реальном времени с высокой производительностью в реальных сценариях разговорного использования. Обе модели достигают передовых результатов в тестах на индийских языках, превосходя значительно более крупные модели.

Sarvam 30B обеспечивает работу Samvaad — платформы разговорных агентов Sarvam. Sarvam 105B обеспечивает работу Indus — их ИИ-ассистента, созданного для сложных задач логического вывода и агентских рабочих процессов.

Доступ и реализация

Веса можно загрузить с AI Kosh (30B, 105B) и Hugging Face (30B, 105B). Для локального вывода с использованием Transformers, vLLM и SGLang обратитесь к странице моделей Hugging Face за примерами реализации. Обе модели доступны через API Sarvam на их панели управления API.

📖 Read the full source: HN LLM Tools

Ad

👀 Смотрите также

Anthropic Claude Fable 5: Бенчмарки показывают большой прогресс, но цены и лимиты запросов беспокоят разработчиков
Новости

Anthropic Claude Fable 5: Бенчмарки показывают большой прогресс, но цены и лимиты запросов беспокоят разработчиков

Claude Fable 5 выходит с сильными показателями в кодинге и агентских задачах, но разработчики обеспокоены ценами на API и лимитами запросов.

OpenClawRadar
Продажи материнских плат рухнули более чем на 25% из-за того, что производство ИИ-чипов вытесняет компоненты для потребительских ПК
Новости

Продажи материнских плат рухнули более чем на 25% из-за того, что производство ИИ-чипов вытесняет компоненты для потребительских ПК

Asus, Gigabyte, MSI и ASRock снижают прогнозы поставок материнских плат на 2026 год на 22–37%, поскольку производители чипов отдают приоритет производству ИИ-процессоров, что приводит к дефициту компонентов и росту цен.

OpenClawRadar
Брэм Коэн критикует «виб-кодинг» и практики разработки с использованием ИИ.
Новости

Брэм Коэн критикует «виб-кодинг» и практики разработки с использованием ИИ.

Брэм Коэн утверждает, что «виб-кодинг» — подход, при котором разработчики избегают просмотра кода, используя ИИ-ассистентов, — приводит к низкому качеству программного обеспечения, приводя в пример утечку исходного кода Claude как иллюстрацию проблем чрезмерного «догфудинга».

OpenClawRadar
AI-оператор: новая роль для агентных рабочих процессов
Новости

AI-оператор: новая роль для агентных рабочих процессов

Риш Гупта утверждает, что операторы ИИ станут ключевой ролью в организациях в течение года, сочетая технические навыки (Python, LLM API, агентные фреймворки) с пониманием бизнес-процессов для автоматизации повторяющихся задач с высоким влиянием.

OpenClawRadar