Galeria de Arquitetura de LLM: Referência Visual para Projetos de Modelos

A Galeria de Arquitetura de LLMs de Sebastian Raschka é uma coleção de figuras de arquitetura e fichas técnicas de The Big LLM Architecture Comparison e A Dream of Spring for Open-Weight LLMs, focando especificamente em painéis de arquitetura. A galeria inclui figuras clicáveis que ampliam para detalhes, com títulos dos modelos vinculados às seções correspondentes dos artigos.
Detalhes Principais dos Modelos
A galeria fornece especificações arquiteturais específicas para diversos modelos:
- Llama 3 8B: 8B parâmetros, lançado em 2024-04-18, decodificador denso com atenção GQA e RoPE, serve como linha de base pré-norm
- OLMo 2 7B: 7B parâmetros, lançado em 2024-11-25, decodificador denso com MHA e QK-Norm, usa pós-norma residual interna em vez de pré-norma
- DeepSeek V3: 671B parâmetros totais (37B ativos), lançado em 2024-12-26, decodificador MoE esparso com atenção MLA, usa prefixo denso mais especialista compartilhado
- DeepSeek R1: 671B parâmetros totais (37B ativos), lançado em 2025-01-20, decodificador MoE esparso com atenção MLA, arquitetura igual ao DeepSeek V3 com treinamento orientado para raciocínio
- Gemma 3 27B: 27B parâmetros, lançado em 2025-03-11, decodificador denso com GQA e QK-Norm, usa proporção de atenção 5:1 janela deslizante/global
- Mistral Small 3.1 24B: 24B parâmetros, lançado em 2025-03-18, decodificador denso com GQA padrão, design focado em latência com cache KV menor
- Llama 4 Maverick: 400B parâmetros totais (17B ativos), lançado em 2025-04-05, decodificador MoE esparso com atenção GQA, alterna blocos densos e MoE
- Qwen3 235B-A22B: 235B parâmetros totais (22B ativos), lançado em 2025-04-28, decodificador MoE esparso com GQA e QK-Norm, otimizado para eficiência de serviço sem especialista compartilhado
- Qwen3 32B: 32B parâmetros, lançado em 2025-04-28, decodificador denso com GQA e QK-Norm, referência da pilha densa Qwen com 8 cabeças KV
- Qwen3 4B: 4B parâmetros, lançado em 2025-04-28, decodificador denso com GQA e QK-Norm, pilha compacta com vocabulário de 151k
- Qwen3 8B: 8B parâmetros, lançado em 2025-04-28, decodificador denso com GQA e QK-Norm, referência da pilha densa Qwen3 com 8 cabeças KV
- SmolLM3 3B: 3B parâmetros, lançado em 2025-06-19, decodificador denso com GQA, experimenta com camadas periódicas NoPE
Recursos Práticos
A galeria inclui um rastreador de problemas para relatar fichas técnicas imprecisas, arquiteturas rotuladas incorretamente ou links quebrados. Uma versão física de pôster está disponível via Zazzle com uma exportação de alta resolução de 14570 x 12490 pixels (arquivo PNG de 56 MB, 182 megapixels).
Para desenvolvedores que trabalham com agentes de codificação de IA, este recurso fornece detalhes arquiteturais concretos que podem informar a seleção de modelos, decisões de ajuste fino e otimização de desempenho. O formato de comparação lado a lado facilita a compreensão das compensações entre diferentes escolhas arquiteturais.
📖 Read the full source: HN LLM Tools
👀 See Also

O Modelo Distilled Qwen 3.5 27B Demonstra Forte Desempenho com o Agente de Codificação Cursor AI
Um usuário relata que a versão destilada opus 4.6 do Qwen 27B funciona efetivamente como o modelo que impulsiona o Cursor, com desempenho comparável ao Gemini 3 Flash. A configuração levou cerca de 10 minutos usando o Cursor para configurar o túnel ngrok e o localllama.

oMLX apresenta o cache SSD KV para o Apple Silicon, reduzindo os tempos de resposta do OpenClaw de 30 a 90 segundos para 5 segundos
oMLX é um novo backend que persiste blocos de cache KV no SSD no formato safetensors, evitando a invalidação do cache quando o contexto muda. Isso reduz os tempos de resposta do OpenClaw de 30-90 segundos para 5 segundos nas rodadas subsequentes.

Arquitetura de Chat Paralelo Claude para Desenvolvimento Next.js
Um desenvolvedor criou um sistema para executar múltiplos chats do Claude AI simultaneamente na mesma base de código Next.js usando uma tabela de banco de dados compartilhada e um agente de polling, alcançando 87% de taxa de sucesso de build sem conflitos de merge em uma sessão.

Servidor MCP Local Conecta Claude a Aplicativos Mac Sem Nuvem ou Tokens
Local MCP é um servidor MCP nativo para macOS que dá ao Claude Desktop, Cursor, Windsurf e VS Code acesso aos dados do Mail, Calendar, Teams e OneDrive no seu Mac sem processamento na nuvem ou tokens de API.