Resumo Semanal de IA Multimodal: Holotron-12B, Nemotron Omni, GlyphPrinter e Mais

✍️ OpenClawRadar📅 Publicado: March 25, 2026🔗 Source
Resumo Semanal de IA Multimodal: Holotron-12B, Nemotron Omni, GlyphPrinter e Mais
Ad

Desenvolvimentos em IA Multimodal de Código Aberto

Aqui estão os principais lançamentos e projetos de IA multimodal de código aberto da semana passada, selecionados do r/LocalLLaMA.

Holotron-12B

O Holotron-12B é um modelo de agente de uso em computador de código aberto disponível no Hugging Face. Ele é otimizado para alta produtividade e contextos com múltiplas imagens longas, servindo como uma alternativa aberta para o ecossistema de agentes de uso em computador além das APIs fechadas.

NVIDIA Nemotron Omni + Isaac GR00T N1.7

A NVIDIA lançou modelos abertos Nemotron 3 omni que integram linguagem, visão e voz em uma única pilha. O GR00T N1.7 é um modelo de visão-linguagem-ação projetado especificamente para aplicações em robótica.

GlyphPrinter

O GlyphPrinter aborda a precisão na renderização de texto em geradores de imagens de IA usando Region-Grouped Direct Preference Optimization. Ele equilibra estilo artístico com renderização precisa de texto e fornece pesos abertos. A abordagem corrige erros de ortografia localizados em imagens geradas.

Ad

SparkVSR

O modelo de super-resolução de vídeo do Google melhora a qualidade e a clareza do vídeo. Este projeto foca em melhorar a resolução de vídeo através do processamento por IA.

SegviGen

O SegviGen permite a segmentação de objetos 3D via colorização, reutilizando geradores de imagens 3D. O método enquadra a segmentação como uma tarefa de colorização e, segundo relatos, usa menos de 1% dos dados de treinamento exigidos por métodos antigos. O projeto inclui código aberto e uma demonstração.

OpenMAIC

O OpenMAIC (Multi-Agent Interactive Classroom) transforma qualquer tópico ou documento em uma sala de aula interativa com professores e colegas de classe de IA. Ele usa orquestração multiagente para gerar slides, questionários, simulações e discussões.

SkillNet

O SkillNet fornece infraestrutura aberta para criar, avaliar e organizar habilidades de agentes de IA em escala. O sistema permite que os agentes façam a transição de experiência transitória para domínio duradouro.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Estudo de Berkeley: Todos os prompts de revisão de IA deslocam a prosa para a formalidade, mesmo "Preservar a voz"
News

Estudo de Berkeley: Todos os prompts de revisão de IA deslocam a prosa para a formalidade, mesmo "Preservar a voz"

Novo artigo de Berkeley mede 300 narrativas pessoais através do Claude, ChatGPT e Gemini sob três condições de prompt. Todos os modelos e condições reduzem contrações, pronomes em primeira pessoa e proximidade narrativa — o prompt "preserve a voz" apenas reduz a magnitude do desvio, não sua direção.

OpenClawRadar
Repositório de Habilidades do Bird Removido — Faça Backup do Seu Acesso ao X/Twitter Agora
News

Repositório de Habilidades do Bird Removido — Faça Backup do Seu Acesso ao X/Twitter Agora

A popular habilidade bird de @steipete foi removida do GitHub. Os usuários devem fazer backup de suas instalações imediatamente.

A Nvidia investe US$ 26 bilhões em modelos de IA de pesos abertos e lança o Nemotron 3 Super
News

A Nvidia investe US$ 26 bilhões em modelos de IA de pesos abertos e lança o Nemotron 3 Super

A Nvidia investirá US$ 26 bilhões ao longo de cinco anos para construir modelos de IA de código aberto, de acordo com os registros financeiros de 2025. A empresa também lançou o Nemotron 3 Super, um modelo com 128 bilhões de parâmetros que supera o GPT-OSS em benchmarks e ocupa o primeiro lugar no PinchBench para controle do OpenClaw.

OpenClawRadar
SubQ: Primeiro LLM Totalmente Subquadrático com Contexto de 12M Tokens e 95% de Precisão no RULER
News

SubQ: Primeiro LLM Totalmente Subquadrático com Contexto de 12M Tokens e 95% de Precisão no RULER

Subquadratic lança SubQ 1M-Preview, um LLM subquadrático com escalonamento linear de computação, contexto de 12M de tokens, atenção esparsa 52× mais rápida que FlashAttention e 95% no RULER 128K. Disponível via API, agente de código CLI (SubQ Code) e ferramenta de busca (SubQ Search).

OpenClawRadar