Sarvam AI lanza modelos de lenguaje de código abierto de 30B y 105B con infraestructura de entrenamiento india.

Especificaciones y arquitectura del modelo
Sarvam 30B y Sarvam 105B son modelos de razonamiento entrenados desde cero en conjuntos de datos de gran escala y alta calidad, curados internamente a lo largo de las etapas de preentrenamiento, ajuste fino supervisado y aprendizaje por refuerzo. El entrenamiento se realizó completamente en India con capacidad de cómputo proporcionada bajo la misión IndiaAI.
Ambos modelos utilizan una arquitectura Transformer de Mezcla de Expertos (MoE) con enrutamiento disperso de expertos para escalar el número de parámetros sin aumentar el cómputo por token. La arquitectura admite entradas de contexto largo mediante incrustaciones posicionales rotatorias, estabilización basada en RMSNorm y diseños de atención optimizados para un uso eficiente de la caché KV durante la inferencia.
Sarvam 30B utiliza Atención de Consulta Agrupada (GQA) para reducir la memoria de la caché KV manteniendo el rendimiento. Sarvam 105B amplía la arquitectura con mayor profundidad y Atención Latente de Múltiples Cabezas (MLA), una formulación de atención comprimida que reduce los requisitos de memoria para la inferencia de contexto largo. Ambos modelos utilizan capas de retroalimentación dispersas de expertos con 128 expertos, pero difieren en la capacidad de los expertos y la configuración de enrutamiento.
Detalles del entrenamiento y datos
El modelo de 30B se entrenó con 16T tokens, mientras que el modelo de 105B se entrenó con 12T tokens. Los datos de preentrenamiento abarcan código, datos web generales, corpus de conocimiento especializado, matemáticas y contenido multilingüe con una asignación sustancial a los 10 idiomas indios más hablados.
El entrenamiento utilizó puntuaciones de enrutamiento basadas en sigmoide en lugar de la compuerta softmax tradicional, lo que mejora el equilibrio de carga de los expertos y reduce el colapso del enrutamiento. Un término de sesgo de experto estabiliza la dinámica de enrutamiento y fomenta una utilización más uniforme de los expertos a lo largo de los pasos de entrenamiento.
El preentrenamiento se realizó en tres fases: preentrenamiento de horizonte largo, entrenamiento intermedio y una fase de extensión de contexto largo. El modelo de 105B logró superioridad en puntos de referencia sobre el modelo de 30B al inicio del entrenamiento, lo que sugiere un comportamiento de escalado eficiente.
Rendimiento y despliegue
Sarvam 105B tiene un buen rendimiento en tareas de razonamiento, programación y agentes en diversos puntos de referencia. Sarvam 30B está optimizado para despliegue en tiempo real con un rendimiento sólido en casos de uso conversacionales del mundo real. Ambos modelos logran resultados de vanguardia en puntos de referencia de idiomas indios, superando a modelos significativamente más grandes.
Sarvam 30B impulsa Samvaad, la plataforma de agentes conversacionales de Sarvam. Sarvam 105B impulsa Indus, su asistente de IA construido para flujos de trabajo complejos de razonamiento y agentes.
Acceso e implementación
Los pesos se pueden descargar desde AI Kosh (30B, 105B) y Hugging Face (30B, 105B). Para inferencia local con Transformers, vLLM y SGLang, consulte la página de modelos de Hugging Face para ver implementaciones de ejemplo. Ambos modelos son accesibles a través de la API de Sarvam en su panel de control de API.
📖 Read the full source: HN LLM Tools
👀 Ver también

System Card de Claude Opus 4.6 revela hallazgos de alineacion preocupantes
El system card de 212 paginas de Anthropic muestra comportamientos inesperados incluyendo intentos de robo de tokens.

El Benchmark SPLICE Revela que los VLM Luchan con el Razonamiento Temporal y Dependen de Prioridades Lingüísticas
Una investigación presentada en EMNLP 2025 muestra que los modelos de visión y lenguaje obtienen puntuaciones bajas en una tarea de secuenciación de videos en la que los humanos destacan, con modelos como Gemini 2.0 Flash alcanzando un 51% de precisión frente al 85% del rendimiento humano. Los modelos frecuentemente dependen de atajos visuales y descripciones lingüísticas en lugar de una verdadera comprensión visual.

OpenClaw 4.2 corrige el error de emparejamiento y añade flujos de tareas duraderos.
OpenClaw 4.2 corrige un error de emparejamiento que afectó a usuarios que actualizaron alrededor del 31 de marzo e introduce flujos de tareas duraderos que permiten que las tareas de larga duración sobrevivan a desconexiones de la puerta de enlace.

Meta lanza el modelo de IA BOxCrete para el diseño de mezclas de concreto.
Meta ha lanzado Bayesian Optimization for Concrete (BOxCrete), un modelo de IA de código abierto para diseñar mezclas de concreto sostenibles utilizando materiales producidos en EE.UU. El modelo mejora versiones anteriores con mayor robustez frente al ruido y capacidades de predicción de asentamiento.