Hugging Face Physics-Intern: Мультиагентная структура удваивает Gemini в бенчмарке CritPt

✍️ OpenClawRadar📅 Опубликовано: 12 мая 2026 г.🔗 Source
Ad

Hugging Face выпустила physics-intern — открытый мультиагентный фреймворк, предназначенный для исследований в области теоретической физики. Он имитирует процесс научного исследования, разбивая сложные задачи на целевые подзадачи, которые выполняются специализированными субагентами — включая агенты вычислений, проверки утверждений и стратегии исследования.

Архитектура и рабочий процесс

Фреймворк разбивает задачи исследовательского уровня на несколько подзадач, каждая из которых обрабатывается выделенным субагентом:

  • Агент вычислений: выполняет численные расчеты и симуляции.
  • Агент проверки: оценивает утверждения на корректность и согласованность.
  • Агент стратегии: критикует общее направление исследования и предлагает альтернативы.

Эта агентная обвязка спроектирована как доменно-независимая, но была специально настроена для теоретической физики.

Ad

Производительность на бенчмарках

На бенчмарке CritPt (анализ критических точек в физике) physics-intern удвоил производительность моделей Gemini и достиг нового state-of-the-art результата, превзойдя GPT-5.5 Pro — и все это со значительно более низкой стоимостью. Конкретные цифры в источнике не указаны, но улучшение описывается как «удвоение» и «новый SOTA».

Доступность

Фреймворк доступен как Hugging Face Space. Статья в блоге с подробным описанием архитектуры и проектных решений находится по ссылке ниже. Приветствуются вклады сообщества и расширения.

Для кого предназначен: Исследователям и разработчикам, создающим агентные рабочие процессы для научных областей, особенно теоретической физики.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Фреймворк для поиска работы с открытым исходным кодом, созданный в Claude Code.
Инструменты

Фреймворк для поиска работы с открытым исходным кодом, созданный в Claude Code.

Разработчик создал фреймворк для поиска работы с открытым исходным кодом в Claude Code, который обрабатывает структурированное самоописание, автоматический сбор данных с порталов вакансий, оценку соответствия и конвейер агентов «составитель-рецензент» для персонализированных заявок. Система останавливается перед отправкой и требует ручной проверки.

OpenClawRadar
Инструмент Squeez сжимает вывод bash на 90%+, расширяя контекстное окно кода Claude.
Инструменты

Инструмент Squeez сжимает вывод bash на 90%+, расширяя контекстное окно кода Claude.

Squeez — это хук, который автоматически сжимает необработанный вывод bash, такой как ps aux, docker logs и git log, до того, как он достигнет Claude Code. Он сокращает использование токенов в среднем на 92,8% для 19 распространённых команд, помогая сессиям длиться дольше.

OpenClawRadar
俄语翻译:在无人值守的隔夜会话中运行克劳德代码的模式
Инструменты

俄语翻译:在无人值守的隔夜会话中运行克劳德代码的模式

Трехкомпонентная структура — цепной исполнитель, супервизор и единый контракт передачи — решает проблему дрейфа обратной связи в многозадачных автономных сессиях Claude Code.

OpenClawRadar
Агентная память V4 достигает 96,2% на бенчмарке LongMemEval, превосходя коммерческие системы памяти искусственного интеллекта.
Инструменты

Агентная память V4 достигает 96,2% на бенчмарке LongMemEval, превосходя коммерческие системы памяти искусственного интеллекта.

agentmemory V4 набрал 96,2% на LongMemEval, превзойдя несколько финансируемых компаний в области памяти ИИ, включая PwC Chronos (95,6%), Mastra (94,87%) и OMEGA (93,2%). Система была создана в одиночку за 16 дней на среднебюджетном игровом ПК с бюджетом в $1000.

OpenClawRadar