Открываем исходный код AstaBrief — быстрой модели генерации отчётов в Asta
Ai2 открыла исходный код AstaBrief 8B — модели генерации отчётов, лежащей в основе режима Fast на её научно-исследовательской платформе Asta. На вход она получает исследовательский вопрос и выдержки из найденной литературы, а на выходе за один проход выдаёт полноценный отчёт с цитатами — без генерации по разделам. Публикуются и веса, и обучающие данные.
Модель построена на Qwen3-8B, при этом основные инженерные усилия ушли на данные для постобучения, оценку и инфраструктуру генерации отчётов, а не на базовую модель.
Производительность и настройка
- В рамках полного пайплайна Asta режим Fast в среднем выдаёт 51,1 секунды на отчёт против 178,5 секунды у режима Thinking на базе Claude — примерно в 3,5 раза быстрее, что описывается как почти десятикратное сокращение времени генерации по сравнению с отслеживаемыми проприетарными моделями.
- AstaBrief уже сегодня доступна в функции Generate a report платформы Asta в виде режима Fast, работающего параллельно с режимом Thinking.
- Ai2 также публикует пример рабочего процесса, который исследователи могут адаптировать для генерации отчётов из собственных PDF-файлов, — он рассчитан на локальную генерацию отчётов.
- Открытые веса позволяют организациям запускать модель на собственной инфраструктуре — это важно, когда исследовательские вопросы касаются чувствительных или ещё не опубликованных работ.
Рецепт обучения: SFT + DPO, а не RL
Ai2 сознательно выбрала более простой рецепт: дообучение с учителем плюс прямая оптимизация предпочтений. Они ссылаются на свою более раннюю работу DR Tulu, показавшую, что RL может улучшать генерацию длинных отчётов у моделей с открытыми весами, но отмечают, что обучение на основе RL нестабильно и дорого. Им нужна была схема, которая дешевле в запуске, проще в отладке и легче поддаётся итерациям, — это и сместило акцент на качество обучающих данных.
Для создания AstaBrief потребовались десятки тысяч реальных исследовательских запросов, фильтрация с упором на цитирование, данные о предпочтениях и переработанный пайплайн, который пишет отчёт за один проход. Заявленные цели модели — качество ответа, релевантность, структура и привязка к цитатам, чтобы ответы оставались в рамках того, что действительно подтверждается доказательствами, а не незаметно расширяли выводы исследования.
Оговорки
Большая часть обучения и оценки была завершена в 2025 году, поэтому проприетарные модели, использованные для генерации обучающих данных и в качестве точек сравнения, отражают уровень техники на тот момент. Ai2 не перепроводила полную оценку против нынешних фронтирных моделей и подаёт результаты как свидетельство о конкретных проверенных ими решениях в области обучения и дизайна системы. Работа также связана с NSF OMAI — американской инициативой под руководством Ai2 по созданию открытой ИИ-инфраструктуры и моделей для научных открытий.
Если вы запускаете локальные модели и хотите получать длинные синтезированные тексты с цитатами по своим PDF-файлам, опубликованный пример рабочего процесса — то, с чего стоит начать.
📖 Read the full source: HN AI Agents
👀 Смотрите также
Claude Code v2.1.282: исправления блоков размышлений, управляемые настройки и переключатель maxProseWidth
Claude Code v2.1.282 добавляет настройку maxProseWidth, уведомления о телеметрии и allowClaudeInChromeWithManagedMcp — а также длинный список исправлений для потерянного расширенного мышления, возобновления сессий и разбора управляемых настроек.

OneUptime добавляет 12 000 AI-сгенерированных постов в блог одним коммитом.
Репозиторий блога OneUptime добавил 12 000 AI-сгенерированных постов, охватывающих ClickHouse, Redis, MongoDB, MySQL и другие технологии, в одном коммите, который изменил 5 012 файлов и более 1 миллиона строк кода.

Google тихо покупает код Play Store для обучения инструментов AI-кодирования
Google рассылает Android-разработчикам предложения заплатить за доступ к коду их приложений для обучения ИИ-инструментов. Это часть конфиденциальной пилотной программы.

PeerZero: ИИ-агенты проводят рецензирование с мотивацией на основе доверия
PeerZero — это платформа, где ИИ-агенты отправляют исследовательские работы, рецензируют работы друг друга и ставят свою репутацию на кон через систему вознаграждений. Агенты зарабатывают или теряют баллы доверия в зависимости от точности рецензий, с механикой оправданных инакомыслящих, которая поощряет независимое мышление и наказывает стадное.