Galerie d'Architecture LLM : Référence Visuelle pour les Conceptions de Modèles

La Galerie d'Architectures LLM de Sebastian Raschka est une collection de figures d'architecture et de fiches techniques issues de The Big LLM Architecture Comparison et de A Dream of Spring for Open-Weight LLMs, se concentrant spécifiquement sur les panneaux d'architecture. La galerie comprend des figures cliquables qui s'agrandissent pour plus de détails, avec des titres de modèles liés aux sections d'articles correspondantes.
Détails clés des modèles
La galerie fournit des spécifications architecturales précises pour de nombreux modèles :
- Llama 3 8B : 8B paramètres, sorti le 2024-04-18, décodeur dense avec attention GQA et RoPE, sert de référence pré-norme
- OLMo 2 7B : 7B paramètres, sorti le 2024-11-25, décodeur dense avec MHA et QK-Norm, utilise une post-norme résiduelle interne au lieu de la pré-norme
- DeepSeek V3 : 671B paramètres totaux (37B actifs), sorti le 2024-12-26, décodeur MoE épars avec attention MLA, utilise un préfixe dense plus un expert partagé
- DeepSeek R1 : 671B paramètres totaux (37B actifs), sorti le 2025-01-20, décodeur MoE épars avec attention MLA, architecture identique à DeepSeek V3 avec un entraînement orienté raisonnement
- Gemma 3 27B : 27B paramètres, sorti le 2025-03-11, décodeur dense avec GQA et QK-Norm, utilise un ratio d'attention glissante/globale de 5:1
- Mistral Small 3.1 24B : 24B paramètres, sorti le 2025-03-18, décodeur dense avec GQA standard, conception axée sur la latence avec un cache KV plus petit
- Llama 4 Maverick : 400B paramètres totaux (17B actifs), sorti le 2025-04-05, décodeur MoE épars avec attention GQA, alterne blocs denses et MoE
- Qwen3 235B-A22B : 235B paramètres totaux (22B actifs), sorti le 2025-04-28, décodeur MoE épars avec GQA et QK-Norm, optimisé pour l'efficacité de service sans expert partagé
- Qwen3 32B : 32B paramètres, sorti le 2025-04-28, décodeur dense avec GQA et QK-Norm, référence de l'empilement dense Qwen avec 8 têtes KV
- Qwen3 4B : 4B paramètres, sorti le 2025-04-28, décodeur dense avec GQA et QK-Norm, empilement compact avec un vocabulaire de 151k
- Qwen3 8B : 8B paramètres, sorti le 2025-04-28, décodeur dense avec GQA et QK-Norm, référence de l'empilement dense Qwen3 avec 8 têtes KV
- SmolLM3 3B : 3B paramètres, sorti le 2025-06-19, décodeur dense avec GQA, expérimente avec des couches NoPE périodiques
Fonctionnalités pratiques
La galerie comprend un système de suivi des problèmes pour signaler des fiches techniques inexactes, des architectures mal étiquetées ou des liens cassés. Une version physique sous forme d'affiche est disponible via Zazzle avec une exportation haute résolution de 14570 x 12490 pixels (fichier PNG de 56 MB, 182 mégapixels).
Pour les développeurs travaillant avec des agents de codage IA, cette ressource fournit des détails architecturaux concrets qui peuvent éclairer la sélection des modèles, les décisions de fine-tuning et l'optimisation des performances. Le format de comparaison côte à côte facilite la compréhension des compromis entre différents choix architecturaux.
📖 Read the full source: HN LLM Tools
👀 See Also

10.33 t/s sur Qwen 3.5 35B avec un ordinateur portable à 300 $ : Répartition complète de l'optimisation
Un développeur atteint 10,33 t/s sur Qwen 3.5 35B Q4_K_S avec un Lenovo Ideapad Slim 3i à 300 $ en utilisant ik_llama.cpp, le core pinning, le décodage spéculatif MTP et un réglage BIOS des performances.

L'extension Compass pour Chrome ajoute des outils de navigation à Claude et ChatGPT
Un développeur a créé une extension Chrome gratuite appelée Compass qui ajoute une mini-carte de prompts, des en-têtes de défilement fixes, des listes de contrôle de session et des modèles de création de prompts aux interfaces Claude et ChatGPT pour résoudre les problèmes de navigation dans les conversations longues.

OpenClaw .NET : Portage NativeAOT avec Pont JSON-RPC pour les Plugins Existants
OpenClaw .NET est un portage C# d'OpenClaw qui compile en un binaire NativeAOT d'environ 23 Mo, éliminant le préchauffage JIT et la surcharge du runtime Node tout en maintenant la compatibilité avec les plugins TypeScript/JavaScript existants via un pont JSON-RPC intégré.

Serveur MCP pour la Recherche Sémantique dans les Vaults Obsidian
Un développeur a créé un serveur MCP qui indexe les coffres Obsidian dans Qdrant avec des embeddings locaux, permettant une recherche sémantique au lieu d'une correspondance par mots-clés. Il segmente le markdown par titres, utilise les embeddings BAAI/bge-small-en-v1.5, et fonctionne avec Claude Code, Cursor, Windsurf, ou tout client MCP.