A Sarvam AI lança modelos de LLM de código aberto de 30B e 105B com infraestrutura de treinamento indiana.

Especificações e arquitetura do modelo
Os modelos Sarvam 30B e Sarvam 105B são modelos de raciocínio treinados do zero em conjuntos de dados em larga escala e de alta qualidade, curados internamente ao longo das etapas de pré-treinamento, ajuste fino supervisionado e aprendizado por reforço. O treinamento foi conduzido inteiramente na Índia com recursos computacionais fornecidos no âmbito da missão IndiaAI.
Ambos os modelos utilizam uma estrutura Transformer Mixture-of-Experts (MoE) com roteamento esparso de especialistas para escalar a contagem de parâmetros sem aumentar a computação por token. A arquitetura suporta entradas de contexto longo por meio de embeddings posicionais rotativos, estabilização baseada em RMSNorm e designs de atenção otimizados para uso eficiente do cache KV durante a inferência.
O Sarvam 30B utiliza Grouped Query Attention (GQA) para reduzir a memória do cache KV mantendo o desempenho. O Sarvam 105B estende a arquitetura com maior profundidade e Multi-head Latent Attention (MLA), uma formulação de atenção comprimida que reduz os requisitos de memória para inferência de contexto longo. Ambos os modelos utilizam camadas feedforward de especialistas esparsos com 128 especialistas, mas diferem na capacidade dos especialistas e na configuração de roteamento.
Detalhes de treinamento e dados
O modelo de 30B foi treinado em 16T tokens, enquanto o modelo de 105B foi treinado em 12T tokens. Os dados de pré-treinamento abrangem código, dados gerais da web, corpora de conhecimento especializado, matemática e conteúdo multilíngue com alocação substancial para as 10 línguas indianas mais faladas.
O treinamento utilizou pontuações de roteamento baseadas em sigmoide em vez da portagem softmax tradicional, o que melhora o balanceamento de carga dos especialistas e reduz o colapso do roteamento. Um termo de viés do especialista estabiliza a dinâmica de roteamento e incentiva uma utilização mais uniforme dos especialistas ao longo das etapas de treinamento.
O pré-treinamento foi conduzido em três fases: pré-treinamento de longo horizonte, treinamento intermediário e uma fase de extensão de contexto longo. O modelo de 105B alcançou superioridade em benchmarks sobre o modelo de 30B no início do treinamento, sugerindo um comportamento de escalonamento eficiente.
Desempenho e implantação
O Sarvam 105B tem bom desempenho em tarefas de raciocínio, programação e tarefas agentivas em benchmarks. O Sarvam 30B é otimizado para implantação em tempo real com forte desempenho em casos de uso conversacionais do mundo real. Ambos os modelos alcançam resultados de última geração em benchmarks de línguas indianas, superando modelos significativamente maiores.
O Sarvam 30B alimenta o Samvaad, a plataforma de agentes conversacionais da Sarvam. O Sarvam 105B alimenta o Indus, seu assistente de IA construído para fluxos de trabalho complexos de raciocínio e agentivos.
Acesso e implementação
Os pesos podem ser baixados do AI Kosh (30B, 105B) e do Hugging Face (30B, 105B). Para inferência local com Transformers, vLLM e SGLang, consulte a página de modelos do Hugging Face para implementações de exemplo. Ambos os modelos estão acessíveis via API da Sarvam em seu painel de API.
📖 Leia a fonte completa: HN LLM Tools
👀 See Also

Não Use IA para Escrever Coisas que Você Apresenta como Trabalho Próprio
James Bach argumenta contra o uso de IA para redigir qualquer conteúdo que você reivindique como seu. Ele alerta que admitir ajuda de IA desvaloriza sua reputação e trata todo esse trabalho como porcaria.

Desenvolvedor do FFmpeg acusa OxideAV de lavagem de licença de IA no problema MagicYUV
Um desenvolvedor do FFmpeg abriu uma issue no repositório magicyuv da OxideAV, questionando a licença do projeto e alegando lavagem de licença de código GPL assistida por IA.

Provedor OpenClaw Mistral Quebrado Desde Atualização 2026.3.8, Comunidade Busca Alternativas
Usuários do OpenClaw relatam erros HTTP 422 persistentes com modelos Mistral desde a atualização 2026.3.8, sem correções nas versões subsequentes até a 2026.3.13. O problema afeta toda a funcionalidade relacionada ao Mistral, enquanto chamadas diretas à API funcionam normalmente.

Claude Code v2.1.129: Flag de URL de plugin, saída de sincronização forçada e mais de 20 correções
Adiciona a flag --plugin-url para carregar zips de plugin de URL, CLAUDE_CODE_FORCE_SYNC_OUTPUT para Emacs eat, e corrige desperdício de tokens /context, rebaixamento de cache TTL e race condition no OAuth.