Código abierto de AstaBrief, el rápido modelo de generación de informes en Asta
Ai2 ha publicado como código abierto AstaBrief 8B, el modelo de generación de informes que impulsa el modo Fast de su plataforma de investigación científica Asta. Toma como entrada una pregunta de investigación junto con extractos de literatura recuperada y escribe un informe citado completo en una sola pasada, sin generar sección por sección. Tanto los pesos como los datos de entrenamiento se publican.
Está construido sobre Qwen3-8B, y la mayor parte del esfuerzo de ingeniería se destinó a los datos de post-entrenamiento, la evaluación y la infraestructura de generación de informes, más que al modelo base.
Rendimiento y configuración
- En todo el pipeline de Asta, el modo Fast promedia 51,1 segundos por informe, frente a los 178,5 segundos del modo Thinking impulsado por Claude — aproximadamente 3,5× más rápido, descrito como una reducción de casi un orden de magnitud en el tiempo de generación respecto a los modelos propietarios que monitorearon.
- AstaBrief ya está disponible hoy en la función Generate a report de Asta como modo Fast, operando junto al modo Thinking.
- Ai2 también publica un flujo de trabajo de ejemplo que los investigadores pueden adaptar para generar informes a partir de sus propios PDF, orientado a la generación local de informes.
- Los pesos abiertos permiten a las instituciones ejecutarlo en su propia infraestructura, lo cual es importante cuando las preguntas de investigación implican trabajo sensible o no publicado.
Receta de entrenamiento: SFT + DPO, no RL
Ai2 optó explícitamente por una receta más sencilla: ajuste fino supervisado más optimización directa de preferencias. Señalan su trabajo anterior DR Tulu, que mostró que el RL puede mejorar la generación de informes de formato largo en modelos de pesos abiertos, pero afirman que el entrenamiento basado en RL es inestable y costoso. Querían una configuración más barata de ejecutar, más fácil de depurar y más fácil de iterar, lo que trasladó el énfasis a la calidad de los datos de entrenamiento.
Construir AstaBrief requirió decenas de miles de consultas de investigación reales, filtrado centrado en citas, datos de preferencias y un pipeline rediseñado que escribe el informe en una sola pasada. Los objetivos declarados del modelo son la calidad de las respuestas, la relevancia, la estructura y el anclaje de las citas: mantener las respuestas ligadas a lo que la evidencia respalda realmente, en lugar de ampliar silenciosamente las conclusiones de un estudio.
Advertencias
La mayor parte del entrenamiento y la evaluación se completó en 2025, por lo que los modelos propietarios utilizados para generar los datos de entrenamiento y como puntos de comparación reflejan la frontera de ese momento. Ai2 no ha vuelto a ejecutar la evaluación completa contra los modelos frontera actuales, y enmarca los resultados como evidencia sobre las decisiones específicas de entrenamiento y diseño del sistema que probaron. El trabajo también se vincula con NSF OMAI, la iniciativa estadounidense liderada por Ai2 para construir infraestructura y modelos de IA abiertos para el descubrimiento científico.
Si ejecutas modelos locales y quieres síntesis de formato largo con citas sobre tus propios PDF, el flujo de trabajo de ejemplo publicado es el punto de partida.
📖 Read the full source: HN AI Agents
👀 Ver también

Google está comprando silenciosamente código de Play Store para entrenar herramientas de codificación de IA
Google está contactando a desarrolladores de Android ofreciendo pagar por sus bases de código de aplicaciones para entrenar herramientas de IA de codificación, como parte de un programa piloto confidencial.

Estafa de semillas de flores generadas por IA inunda eBay, Amazon y Etsy
Los estafadores utilizan imágenes generadas por IA para vender semillas de plantas inexistentes, como los 'girasoles osito de peluche'. eBay, Amazon y Etsy luchan por contener la avalancha.

EFF: La administración Trump tomó represalias contra Anthropic por negarse a trabajar en armas autónomas
El Pentágono tomó represalias contra Anthropic por negarse a que sus modelos se usaran para armas autónomas o vigilancia masiva, violando la Primera Enmienda según EFF.

Claude Code v2.1.129: Guía de Persistencia de Bucle Autónomo y Clasificador de Estado de Agente en Segundo Plano
Claude Code v2.1.129 añade el mensaje de sistema CLAUDE_CODE_LOOP_PERSISTENT para bucles de trabajo autónomos, elimina el subagente especialista en verificación y expande el clasificador de estados del agente de fondo con límites detallados.