Estagiário de física da Hugging Face: Framework multiagente dobra Gemini no benchmark CritPt
Hugging Face lançou physics-intern, um framework multiagente de código aberto projetado para pesquisa em física teórica. Ele imita o processo de pesquisa científica ao decompor problemas complexos em tarefas focadas, distribuídas para subagentes especializados — incluindo agentes de computação, revisão de alegações e desafio de estratégia de pesquisa.
Arquitetura e Fluxo de Trabalho
O framework decompõe problemas de nível de pesquisa em várias subtarefas, cada uma tratada por um subagente dedicado:
- Agente de computação: Lida com cálculos numéricos e simulações.
- Agente de revisão: Avalia alegações quanto à correção e consistência.
- Agente de desafio de estratégia: Critica a direção geral da pesquisa e sugere alternativas.
Este arcabouço agêntico é projetado para ser independente de domínio, mas foi especificamente ajustado para física teórica.
Desempenho em Benchmarks
No benchmark CritPt (análise de pontos críticos em física), o physics-intern dobrou o desempenho dos modelos Gemini e alcançou um novo resultado de estado da arte, superando o GPT-5.5 Pro — tudo a um custo significativamente menor. Números específicos não foram detalhados na fonte, mas o ganho de desempenho é descrito como "dobro" e "novo SOTA".
Disponibilidade
O framework está disponível como um Hugging Face Space. A postagem do blog detalhando a arquitetura e as decisões de design pode ser encontrada no link abaixo. Contribuições e extensões da comunidade são incentivadas.
Para quem é: Pesquisadores e desenvolvedores que constroem fluxos de trabalho agênticos para domínios científicos, especialmente física teórica.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

ByteRover Plugin de Memória para OpenClaw: Integração Nativa com Hierarquia Semântica
O Plugin de Memória ByteRover para OpenClaw oferece memória de longo prazo estruturada e nativa por meio de uma arquitetura de três camadas e hierarquia semântica armazenada em arquivos Markdown. Ele alcança 92,2% de precisão na recuperação e requer OpenClaw v2026.3.22+.
ThoughtDAG: Um Grafo de Contexto Editável para Conversas com LLM
O ThoughtDAG transforma o contexto do LLM em um grafo editável, permitindo ramificar, mesclar e podar o que o modelo vê. Um piloto mostra que ele pode corrigir erros removendo ramos desatualizados, reduzindo a contagem de tokens.

Operações de Fundador no Claude: 19 Habilidades Reutilizáveis para Startups em Estágio Inicial
Um fundador que recentemente saiu de sua primeira startup publicou 19 prompts de habilidade compatíveis com Claude para funções como posicionamento, precificação, prospecção e copy — baseados em seus próprios SOPs e fluxos de trabalho do Notion.

NervMap: Ferramenta de Descoberta de Serviços e Diagnóstico de Servidor com Comando Único
NervMap é uma ferramenta Linux que descobre contêineres Docker, serviços systemd e processos diretos em menos de 1 segundo, mapeia dependências entre eles e diagnostica problemas com análise de severidade e sugestões de correção.