Sarvam AI выпускает открытые языковые модели на 30 и 105 миллиардов параметров, созданные на индийской инфраструктуре для обучения.

Спецификации и архитектура моделей
Sarvam 30B и Sarvam 105B — это модели логического вывода, обученные с нуля на крупномасштабных, высококачественных наборах данных, курируемых внутри компании на этапах предварительного обучения, контролируемой тонкой настройки и обучения с подкреплением. Обучение проводилось полностью в Индии на вычислительных мощностях, предоставленных в рамках миссии IndiaAI.
Обе модели используют основу Transformer с архитектурой Mixture-of-Experts (MoE) и разреженной маршрутизацией экспертов для масштабирования количества параметров без увеличения вычислений на токен. Архитектура поддерживает длинные контекстные входные данные за счет ротационных позиционных эмбеддингов, стабилизации на основе RMSNorm и дизайна внимания, оптимизированного для эффективного использования KV-кэша во время вывода.
Sarvam 30B использует Grouped Query Attention (GQA) для уменьшения памяти KV-кэша при сохранении производительности. Sarvam 105B расширяет архитектуру за счет большей глубины и Multi-head Latent Attention (MLA) — сжатой формулировки внимания, которая снижает требования к памяти для вывода с длинным контекстом. Обе модели используют разреженные полносвязные слои экспертов с 128 экспертами, но различаются по емкости экспертов и конфигурации маршрутизации.
Детали обучения и данных
Модель 30B обучалась на 16 триллионах токенов, а модель 105B — на 12 триллионах токенов. Данные предварительного обучения охватывают код, общие веб-данные, специализированные корпусы знаний, математику и многоязычный контент со значительным выделением ресурсов для 10 наиболее распространенных индийских языков.
При обучении использовались скоринговые оценки маршрутизации на основе сигмоиды вместо традиционного гейтинга с softmax, что улучшает балансировку нагрузки экспертов и снижает коллапс маршрутизации. Термин смещения эксперта стабилизирует динамику маршрутизации и способствует более равномерному использованию экспертов на протяжении шагов обучения.
Предварительное обучение проводилось в три этапа: долгосрочное предварительное обучение, промежуточное обучение и этап расширения длинного контекста. Модель 105B достигла превосходства над моделью 30B в тестах уже на ранних этапах обучения, что свидетельствует об эффективном масштабировании.
Производительность и развертывание
Sarvam 105B демонстрирует хорошие результаты в задачах логического вывода, программирования и агентских задачах по различным тестам. Sarvam 30B оптимизирована для развертывания в реальном времени с высокой производительностью в реальных сценариях разговорного использования. Обе модели достигают передовых результатов в тестах на индийских языках, превосходя значительно более крупные модели.
Sarvam 30B обеспечивает работу Samvaad — платформы разговорных агентов Sarvam. Sarvam 105B обеспечивает работу Indus — их ИИ-ассистента, созданного для сложных задач логического вывода и агентских рабочих процессов.
Доступ и реализация
Веса можно загрузить с AI Kosh (30B, 105B) и Hugging Face (30B, 105B). Для локального вывода с использованием Transformers, vLLM и SGLang обратитесь к странице моделей Hugging Face за примерами реализации. Обе модели доступны через API Sarvam на их панели управления API.
📖 Read the full source: HN LLM Tools
👀 Смотрите также
Редкая книга с AirTag отслеживает разрушительную операцию Amazon по сканированию для обучения ИИ
Продавец книг спрятал AirTag в редкой книге, проданной оптом, и отследил её до объекта Amazon для ИИ, где книги разрывают и сканируют для обучающих данных.
Claude AI открывает объединенный PR для исправления ошибки magic-link, пока разработчик спит
Пользователь Reddit сообщает, что Claude AI автоматически исправил баг с magic-link в продакшене в 4:46 утра — шаг trim/lowercase перенесен перед регулярным выражением проверки email — PR принят без изменений.

Теперь в план Claude MAX включено окно контекста на 1 миллион токенов без дополнительной оплаты.
План Claude MAX был автоматически обновлён и теперь включает окно контекста на 1 миллион токенов без дополнительных плат за использование API, при этом пользователи сообщают о значительном сокращении использования токенов и устранении необходимости управления окном контекста.

Анализ: Сравнение индустрии искусственного интеллекта с паттернами кризиса субстандартного ипотечного кредитования
Анализ Эдварда Зитрона проводит параллели между ипотечным кризисом 2008 года и текущими тенденциями в индустрии искусственного интеллекта, ссылаясь на конкретные данные о регулируемых ипотечных кредитах и их сходстве с моделями инвестирования в ИИ.