Resumo Semanal de IA Multimodal: Holotron-12B, Nemotron Omni, GlyphPrinter e Mais

Desenvolvimentos em IA Multimodal de Código Aberto
Aqui estão os principais lançamentos e projetos de IA multimodal de código aberto da semana passada, selecionados do r/LocalLLaMA.
Holotron-12B
O Holotron-12B é um modelo de agente de uso em computador de código aberto disponível no Hugging Face. Ele é otimizado para alta produtividade e contextos com múltiplas imagens longas, servindo como uma alternativa aberta para o ecossistema de agentes de uso em computador além das APIs fechadas.
NVIDIA Nemotron Omni + Isaac GR00T N1.7
A NVIDIA lançou modelos abertos Nemotron 3 omni que integram linguagem, visão e voz em uma única pilha. O GR00T N1.7 é um modelo de visão-linguagem-ação projetado especificamente para aplicações em robótica.
GlyphPrinter
O GlyphPrinter aborda a precisão na renderização de texto em geradores de imagens de IA usando Region-Grouped Direct Preference Optimization. Ele equilibra estilo artístico com renderização precisa de texto e fornece pesos abertos. A abordagem corrige erros de ortografia localizados em imagens geradas.
SparkVSR
O modelo de super-resolução de vídeo do Google melhora a qualidade e a clareza do vídeo. Este projeto foca em melhorar a resolução de vídeo através do processamento por IA.
SegviGen
O SegviGen permite a segmentação de objetos 3D via colorização, reutilizando geradores de imagens 3D. O método enquadra a segmentação como uma tarefa de colorização e, segundo relatos, usa menos de 1% dos dados de treinamento exigidos por métodos antigos. O projeto inclui código aberto e uma demonstração.
OpenMAIC
O OpenMAIC (Multi-Agent Interactive Classroom) transforma qualquer tópico ou documento em uma sala de aula interativa com professores e colegas de classe de IA. Ele usa orquestração multiagente para gerar slides, questionários, simulações e discussões.
SkillNet
O SkillNet fornece infraestrutura aberta para criar, avaliar e organizar habilidades de agentes de IA em escala. O sistema permite que os agentes façam a transição de experiência transitória para domínio duradouro.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Modelos de LLM de código aberto superam o Claude Opus 4.6 na geração de estratégias de negociação com custo mais baixo
Um usuário do Reddit testou 10 LLMs na geração de estratégias de trading, descobrindo que modelos de código aberto superaram o Claude Opus 4.6, apesar de serem 10 vezes mais baratos. Minimax 2.5 e Gemini 3.1 lideraram o ranking.

OpenClaw 2026.4.29 Quebrado – Faça o downgrade para 2026.2.6
OpenClaw versão 2026.4.29 está quebrada com erros aleatórios, CLI lenta, respostas duplicadas. Faça downgrade para 2026.2.6 para corrigir.

SubQ: Primeiro LLM Totalmente Subquadrático com Contexto de 12M Tokens e 95% de Precisão no RULER
Subquadratic lança SubQ 1M-Preview, um LLM subquadrático com escalonamento linear de computação, contexto de 12M de tokens, atenção esparsa 52× mais rápida que FlashAttention e 95% no RULER 128K. Disponível via API, agente de código CLI (SubQ Code) e ferramenta de busca (SubQ Search).

A Análise de Preços de Inferência Revela Variação de 4,4x para o Mesmo Modelo entre Provedores
Análise dos preços de inferência para o Llama 3.1 70B Instruct mostra uma diferença de custo de 4,4x entre provedores, com DeepInfra a US$ 0,20/US$ 0,27 por milhão de tokens e Together a US$ 0,88/US$ 0,88. Para modelos de raciocínio, a variação chega a ~30x entre DeepSeek R1 e OpenAI o1.