Galeria de Arquitetura de LLM: Referência Visual para Projetos de Modelos

✍️ OpenClawRadar📅 Publicado: March 16, 2026🔗 Source
Galeria de Arquitetura de LLM: Referência Visual para Projetos de Modelos
Ad

A Galeria de Arquitetura de LLMs de Sebastian Raschka é uma coleção de figuras de arquitetura e fichas técnicas de The Big LLM Architecture Comparison e A Dream of Spring for Open-Weight LLMs, focando especificamente em painéis de arquitetura. A galeria inclui figuras clicáveis que ampliam para detalhes, com títulos dos modelos vinculados às seções correspondentes dos artigos.

Detalhes Principais dos Modelos

A galeria fornece especificações arquiteturais específicas para diversos modelos:

  • Llama 3 8B: 8B parâmetros, lançado em 2024-04-18, decodificador denso com atenção GQA e RoPE, serve como linha de base pré-norm
  • OLMo 2 7B: 7B parâmetros, lançado em 2024-11-25, decodificador denso com MHA e QK-Norm, usa pós-norma residual interna em vez de pré-norma
  • DeepSeek V3: 671B parâmetros totais (37B ativos), lançado em 2024-12-26, decodificador MoE esparso com atenção MLA, usa prefixo denso mais especialista compartilhado
  • DeepSeek R1: 671B parâmetros totais (37B ativos), lançado em 2025-01-20, decodificador MoE esparso com atenção MLA, arquitetura igual ao DeepSeek V3 com treinamento orientado para raciocínio
  • Gemma 3 27B: 27B parâmetros, lançado em 2025-03-11, decodificador denso com GQA e QK-Norm, usa proporção de atenção 5:1 janela deslizante/global
  • Mistral Small 3.1 24B: 24B parâmetros, lançado em 2025-03-18, decodificador denso com GQA padrão, design focado em latência com cache KV menor
  • Llama 4 Maverick: 400B parâmetros totais (17B ativos), lançado em 2025-04-05, decodificador MoE esparso com atenção GQA, alterna blocos densos e MoE
  • Qwen3 235B-A22B: 235B parâmetros totais (22B ativos), lançado em 2025-04-28, decodificador MoE esparso com GQA e QK-Norm, otimizado para eficiência de serviço sem especialista compartilhado
  • Qwen3 32B: 32B parâmetros, lançado em 2025-04-28, decodificador denso com GQA e QK-Norm, referência da pilha densa Qwen com 8 cabeças KV
  • Qwen3 4B: 4B parâmetros, lançado em 2025-04-28, decodificador denso com GQA e QK-Norm, pilha compacta com vocabulário de 151k
  • Qwen3 8B: 8B parâmetros, lançado em 2025-04-28, decodificador denso com GQA e QK-Norm, referência da pilha densa Qwen3 com 8 cabeças KV
  • SmolLM3 3B: 3B parâmetros, lançado em 2025-06-19, decodificador denso com GQA, experimenta com camadas periódicas NoPE
Ad

Recursos Práticos

A galeria inclui um rastreador de problemas para relatar fichas técnicas imprecisas, arquiteturas rotuladas incorretamente ou links quebrados. Uma versão física de pôster está disponível via Zazzle com uma exportação de alta resolução de 14570 x 12490 pixels (arquivo PNG de 56 MB, 182 megapixels).

Para desenvolvedores que trabalham com agentes de codificação de IA, este recurso fornece detalhes arquiteturais concretos que podem informar a seleção de modelos, decisões de ajuste fino e otimização de desempenho. O formato de comparação lado a lado facilita a compreensão das compensações entre diferentes escolhas arquiteturais.

📖 Read the full source: HN LLM Tools

Ad

👀 See Also

Lore: Servidor MCP que Compartilha o Histórico de Sessões de Agentes de IA Entre Ferramentas
Tools

Lore: Servidor MCP que Compartilha o Histórico de Sessões de Agentes de IA Entre Ferramentas

Lore é um servidor MCP que indexa sessões de agentes de IA em um armazenamento local SQLite, permitindo que qualquer agente—independentemente da ferramenta—acesse o histórico de sessões de outro. Sessões frescas, sem contexto compartilhado, mas os agentes podem recuperar conversas passadas sob demanda.

OpenClawRadar
Três Repositórios para Desenvolvimento de RAG e Agentes de IA
Tools

Três Repositórios para Desenvolvimento de RAG e Agentes de IA

Uma postagem no Reddit destaca três repositórios para desenvolvedores que constroem com RAG e agentes de IA: memvid para memória de agentes, llama_index para pipelines de RAG e Continue para assistentes de programação. O autor observa que o RAG puro funciona melhor para recuperação de conhecimento, enquanto sistemas de memória são melhores para agentes, com abordagens híbridas sendo comuns em ferramentas reais.

OpenClawRadar
Cowork vs. Claude Chat: Comparação de Precisão na Extração de Documentos
Tools

Cowork vs. Claude Chat: Comparação de Precisão na Extração de Documentos

Um desenvolvedor testou o chat Claude.ai e o Cowork na extração de dados de PDFs financeiros com mais de 140 páginas usando prompts idênticos. O chat produziu resultados de nível institucional com autocorreção e zero erros em mais de 150 pontos de dados, enquanto o Cowork fabricou itens de linha de reconciliação, inverteu contagens de unidades e teve contaminação de colunas de anos anteriores.

OpenClawRadar
Claude Code Routines: Tarefas Automatizadas na Nuvem para Fluxos de Trabalho de Desenvolvimento de IA
Tools

Claude Code Routines: Tarefas Automatizadas na Nuvem para Fluxos de Trabalho de Desenvolvimento de IA

As Rotinas Claude Code permitem que desenvolvedores salvem configurações do Claude Code como tarefas automatizadas que são executadas na infraestrutura de nuvem gerenciada pela Anthropic. As rotinas suportam gatilhos agendados, de API e do GitHub para execução automática de prompts em repositórios.

OpenClawRadar