Sarvam AI выпускает открытые языковые модели на 30 и 105 миллиардов параметров, созданные на индийской инфраструктуре для обучения.

Спецификации и архитектура моделей
Sarvam 30B и Sarvam 105B — это модели логического вывода, обученные с нуля на крупномасштабных, высококачественных наборах данных, курируемых внутри компании на этапах предварительного обучения, контролируемой тонкой настройки и обучения с подкреплением. Обучение проводилось полностью в Индии на вычислительных мощностях, предоставленных в рамках миссии IndiaAI.
Обе модели используют основу Transformer с архитектурой Mixture-of-Experts (MoE) и разреженной маршрутизацией экспертов для масштабирования количества параметров без увеличения вычислений на токен. Архитектура поддерживает длинные контекстные входные данные за счет ротационных позиционных эмбеддингов, стабилизации на основе RMSNorm и дизайна внимания, оптимизированного для эффективного использования KV-кэша во время вывода.
Sarvam 30B использует Grouped Query Attention (GQA) для уменьшения памяти KV-кэша при сохранении производительности. Sarvam 105B расширяет архитектуру за счет большей глубины и Multi-head Latent Attention (MLA) — сжатой формулировки внимания, которая снижает требования к памяти для вывода с длинным контекстом. Обе модели используют разреженные полносвязные слои экспертов с 128 экспертами, но различаются по емкости экспертов и конфигурации маршрутизации.
Детали обучения и данных
Модель 30B обучалась на 16 триллионах токенов, а модель 105B — на 12 триллионах токенов. Данные предварительного обучения охватывают код, общие веб-данные, специализированные корпусы знаний, математику и многоязычный контент со значительным выделением ресурсов для 10 наиболее распространенных индийских языков.
При обучении использовались скоринговые оценки маршрутизации на основе сигмоиды вместо традиционного гейтинга с softmax, что улучшает балансировку нагрузки экспертов и снижает коллапс маршрутизации. Термин смещения эксперта стабилизирует динамику маршрутизации и способствует более равномерному использованию экспертов на протяжении шагов обучения.
Предварительное обучение проводилось в три этапа: долгосрочное предварительное обучение, промежуточное обучение и этап расширения длинного контекста. Модель 105B достигла превосходства над моделью 30B в тестах уже на ранних этапах обучения, что свидетельствует об эффективном масштабировании.
Производительность и развертывание
Sarvam 105B демонстрирует хорошие результаты в задачах логического вывода, программирования и агентских задачах по различным тестам. Sarvam 30B оптимизирована для развертывания в реальном времени с высокой производительностью в реальных сценариях разговорного использования. Обе модели достигают передовых результатов в тестах на индийских языках, превосходя значительно более крупные модели.
Sarvam 30B обеспечивает работу Samvaad — платформы разговорных агентов Sarvam. Sarvam 105B обеспечивает работу Indus — их ИИ-ассистента, созданного для сложных задач логического вывода и агентских рабочих процессов.
Доступ и реализация
Веса можно загрузить с AI Kosh (30B, 105B) и Hugging Face (30B, 105B). Для локального вывода с использованием Transformers, vLLM и SGLang обратитесь к странице моделей Hugging Face за примерами реализации. Обе модели доступны через API Sarvam на их панели управления API.
📖 Read the full source: HN LLM Tools
👀 Смотрите также

Anthropic Claude Fable 5: Бенчмарки показывают большой прогресс, но цены и лимиты запросов беспокоят разработчиков
Claude Fable 5 выходит с сильными показателями в кодинге и агентских задачах, но разработчики обеспокоены ценами на API и лимитами запросов.

Продажи материнских плат рухнули более чем на 25% из-за того, что производство ИИ-чипов вытесняет компоненты для потребительских ПК
Asus, Gigabyte, MSI и ASRock снижают прогнозы поставок материнских плат на 2026 год на 22–37%, поскольку производители чипов отдают приоритет производству ИИ-процессоров, что приводит к дефициту компонентов и росту цен.

Брэм Коэн критикует «виб-кодинг» и практики разработки с использованием ИИ.
Брэм Коэн утверждает, что «виб-кодинг» — подход, при котором разработчики избегают просмотра кода, используя ИИ-ассистентов, — приводит к низкому качеству программного обеспечения, приводя в пример утечку исходного кода Claude как иллюстрацию проблем чрезмерного «догфудинга».

AI-оператор: новая роль для агентных рабочих процессов
Риш Гупта утверждает, что операторы ИИ станут ключевой ролью в организациях в течение года, сочетая технические навыки (Python, LLM API, агентные фреймворки) с пониманием бизнес-процессов для автоматизации повторяющихся задач с высоким влиянием.