Estagiário de física da Hugging Face: Framework multiagente dobra Gemini no benchmark CritPt

✍️ OpenClawRadar📅 Publicado: May 12, 2026🔗 Source
Ad

Hugging Face lançou physics-intern, um framework multiagente de código aberto projetado para pesquisa em física teórica. Ele imita o processo de pesquisa científica ao decompor problemas complexos em tarefas focadas, distribuídas para subagentes especializados — incluindo agentes de computação, revisão de alegações e desafio de estratégia de pesquisa.

Arquitetura e Fluxo de Trabalho

O framework decompõe problemas de nível de pesquisa em várias subtarefas, cada uma tratada por um subagente dedicado:

  • Agente de computação: Lida com cálculos numéricos e simulações.
  • Agente de revisão: Avalia alegações quanto à correção e consistência.
  • Agente de desafio de estratégia: Critica a direção geral da pesquisa e sugere alternativas.

Este arcabouço agêntico é projetado para ser independente de domínio, mas foi especificamente ajustado para física teórica.

Ad

Desempenho em Benchmarks

No benchmark CritPt (análise de pontos críticos em física), o physics-intern dobrou o desempenho dos modelos Gemini e alcançou um novo resultado de estado da arte, superando o GPT-5.5 Pro — tudo a um custo significativamente menor. Números específicos não foram detalhados na fonte, mas o ganho de desempenho é descrito como "dobro" e "novo SOTA".

Disponibilidade

O framework está disponível como um Hugging Face Space. A postagem do blog detalhando a arquitetura e as decisões de design pode ser encontrada no link abaixo. Contribuições e extensões da comunidade são incentivadas.

Para quem é: Pesquisadores e desenvolvedores que constroem fluxos de trabalho agênticos para domínios científicos, especialmente física teórica.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

ByteRover Plugin de Memória para OpenClaw: Integração Nativa com Hierarquia Semântica
Tools

ByteRover Plugin de Memória para OpenClaw: Integração Nativa com Hierarquia Semântica

O Plugin de Memória ByteRover para OpenClaw oferece memória de longo prazo estruturada e nativa por meio de uma arquitetura de três camadas e hierarquia semântica armazenada em arquivos Markdown. Ele alcança 92,2% de precisão na recuperação e requer OpenClaw v2026.3.22+.

OpenClawRadar
🦀
Tools

ThoughtDAG: Um Grafo de Contexto Editável para Conversas com LLM

O ThoughtDAG transforma o contexto do LLM em um grafo editável, permitindo ramificar, mesclar e podar o que o modelo vê. Um piloto mostra que ele pode corrigir erros removendo ramos desatualizados, reduzindo a contagem de tokens.

OpenClawRadar
Operações de Fundador no Claude: 19 Habilidades Reutilizáveis para Startups em Estágio Inicial
Tools

Operações de Fundador no Claude: 19 Habilidades Reutilizáveis para Startups em Estágio Inicial

Um fundador que recentemente saiu de sua primeira startup publicou 19 prompts de habilidade compatíveis com Claude para funções como posicionamento, precificação, prospecção e copy — baseados em seus próprios SOPs e fluxos de trabalho do Notion.

OpenClawRadar
NervMap: Ferramenta de Descoberta de Serviços e Diagnóstico de Servidor com Comando Único
Tools

NervMap: Ferramenta de Descoberta de Serviços e Diagnóstico de Servidor com Comando Único

NervMap é uma ferramenta Linux que descobre contêineres Docker, serviços systemd e processos diretos em menos de 1 segundo, mapeia dependências entre eles e diagnostica problemas com análise de severidade e sugestões de correção.

OpenClawRadar