Galería de Arquitecturas LLM: Referencia Visual de Diseños de Modelos

La Galería de Arquitectura LLM de Sebastian Raschka es una colección de figuras arquitectónicas y fichas técnicas de The Big LLM Architecture Comparison y A Dream of Spring for Open-Weight LLMs, centrándose específicamente en paneles de arquitectura. La galería incluye figuras clicables que se amplían para ver detalles, con títulos de modelos que enlazan a secciones correspondientes del artículo.
Detalles Clave de los Modelos
La galería proporciona especificaciones arquitectónicas específicas para numerosos modelos:
- Llama 3 8B: 8B parámetros, lanzado 2024-04-18, decodificador denso con atención GQA y RoPE, sirve como línea base pre-norm
- OLMo 2 7B: 7B parámetros, lanzado 2024-11-25, decodificador denso con MHA y QK-Norm, usa post-norm residual interna en lugar de pre-norm
- DeepSeek V3: 671B parámetros totales (37B activos), lanzado 2024-12-26, decodificador MoE disperso con atención MLA, usa prefijo denso más experto compartido
- DeepSeek R1: 671B parámetros totales (37B activos), lanzado 2025-01-20, decodificador MoE disperso con atención MLA, arquitectura coincide con DeepSeek V3 con entrenamiento orientado al razonamiento
- Gemma 3 27B: 27B parámetros, lanzado 2025-03-11, decodificador denso con GQA y QK-Norm, usa proporción de atención 5:1 ventana deslizante/global
- Mistral Small 3.1 24B: 24B parámetros, lanzado 2025-03-18, decodificador denso con GQA estándar, diseño centrado en latencia con caché KV más pequeño
- Llama 4 Maverick: 400B parámetros totales (17B activos), lanzado 2025-04-05, decodificador MoE disperso con atención GQA, alterna bloques densos y MoE
- Qwen3 235B-A22B: 235B parámetros totales (22B activos), lanzado 2025-04-28, decodificador MoE disperso con GQA y QK-Norm, optimizado para eficiencia de servicio sin experto compartido
- Qwen3 32B: 32B parámetros, lanzado 2025-04-28, decodificador denso con GQA y QK-Norm, pila densa de referencia Qwen con 8 cabezas KV
- Qwen3 4B: 4B parámetros, lanzado 2025-04-28, decodificador denso con GQA y QK-Norm, pila compacta con vocabulario de 151k
- Qwen3 8B: 8B parámetros, lanzado 2025-04-28, decodificador denso con GQA y QK-Norm, pila densa de referencia Qwen3 con 8 cabezas KV
- SmolLM3 3B: 3B parámetros, lanzado 2025-06-19, decodificador denso con GQA, experimenta con capas periódicas NoPE
Características Prácticas
La galería incluye un rastreador de problemas para informar fichas técnicas inexactas, arquitecturas mal etiquetadas o enlaces rotos. Una versión de póster físico está disponible a través de Zazzle con una exportación de alta resolución a 14570 x 12490 píxeles (archivo PNG de 56 MB, 182 megapíxeles).
Para desarrolladores que trabajan con agentes de codificación de IA, este recurso proporciona detalles arquitectónicos concretos que pueden informar la selección de modelos, decisiones de ajuste fino y optimización del rendimiento. El formato de comparación lado a lado facilita la comprensión de las compensaciones entre diferentes elecciones arquitectónicas.
📖 Read the full source: HN LLM Tools
👀 Ver también

Arranqué la memoria markdown predeterminada de OpenClaw y construí una capa de API con Node.js/Postgres
Un desarrollador desactivó el plugin 'memory-core' de OpenClaw y construyó un backend tipado con Node.js/Express + PostgreSQL. La deriva de contexto se redujo a cero.

Estados del espacio: Crea aplicaciones web interactivas para agentes OpenClaw con Markdown
Statespace es un framework gratuito y de código abierto para crear y compartir aplicaciones web amigables con IA que los agentes de OpenClaw pueden navegar e interactuar usando solo Markdown. Te permite definir herramientas, componentes e instrucciones en archivos Markdown a los que los agentes acceden a través de HTTP.

El Agente Hermes v0.6.0 ofrece un soporte mejorado para modelos locales con analizadores de llamadas de herramientas por modelo.
Hermes Agent v0.6.0 de Nous Research proporciona analizadores de llamadas a herramientas por modelo que manejan correctamente las llamadas a herramientas en modelos de clase 30B, es compatible con Ollama, vLLM y sglang de forma nativa, e incluye seis backends de terminal, incluidos Modal y Daytona, para implementación sin servidor.

Merlin: Deduplicación de contexto LLM local-primero – mide hasta un 71% de superposición de fragmentos, gratuito y de núcleo abierto
Merlin es una herramienta de deduplicación de contexto local que midió un 22-71% de superposición de chunks en 22 millones de pasajes de sesiones reales de agentes/RAG. Se distribuye como proxy HTTP (Ollama/vLLM/SGLang/llama.cpp), servidor MCP (Claude/Cursor/OpenClaw) o CLI independiente. Código abierto MIT con límites de uso diario.