Galerie d'Architecture LLM : Référence Visuelle pour les Conceptions de Modèles

✍️ OpenClawRadar📅 Publié: March 16, 2026🔗 Source
Galerie d'Architecture LLM : Référence Visuelle pour les Conceptions de Modèles
Ad

La Galerie d'Architectures LLM de Sebastian Raschka est une collection de figures d'architecture et de fiches techniques issues de The Big LLM Architecture Comparison et de A Dream of Spring for Open-Weight LLMs, se concentrant spécifiquement sur les panneaux d'architecture. La galerie comprend des figures cliquables qui s'agrandissent pour plus de détails, avec des titres de modèles liés aux sections d'articles correspondantes.

Détails clés des modèles

La galerie fournit des spécifications architecturales précises pour de nombreux modèles :

  • Llama 3 8B : 8B paramètres, sorti le 2024-04-18, décodeur dense avec attention GQA et RoPE, sert de référence pré-norme
  • OLMo 2 7B : 7B paramètres, sorti le 2024-11-25, décodeur dense avec MHA et QK-Norm, utilise une post-norme résiduelle interne au lieu de la pré-norme
  • DeepSeek V3 : 671B paramètres totaux (37B actifs), sorti le 2024-12-26, décodeur MoE épars avec attention MLA, utilise un préfixe dense plus un expert partagé
  • DeepSeek R1 : 671B paramètres totaux (37B actifs), sorti le 2025-01-20, décodeur MoE épars avec attention MLA, architecture identique à DeepSeek V3 avec un entraînement orienté raisonnement
  • Gemma 3 27B : 27B paramètres, sorti le 2025-03-11, décodeur dense avec GQA et QK-Norm, utilise un ratio d'attention glissante/globale de 5:1
  • Mistral Small 3.1 24B : 24B paramètres, sorti le 2025-03-18, décodeur dense avec GQA standard, conception axée sur la latence avec un cache KV plus petit
  • Llama 4 Maverick : 400B paramètres totaux (17B actifs), sorti le 2025-04-05, décodeur MoE épars avec attention GQA, alterne blocs denses et MoE
  • Qwen3 235B-A22B : 235B paramètres totaux (22B actifs), sorti le 2025-04-28, décodeur MoE épars avec GQA et QK-Norm, optimisé pour l'efficacité de service sans expert partagé
  • Qwen3 32B : 32B paramètres, sorti le 2025-04-28, décodeur dense avec GQA et QK-Norm, référence de l'empilement dense Qwen avec 8 têtes KV
  • Qwen3 4B : 4B paramètres, sorti le 2025-04-28, décodeur dense avec GQA et QK-Norm, empilement compact avec un vocabulaire de 151k
  • Qwen3 8B : 8B paramètres, sorti le 2025-04-28, décodeur dense avec GQA et QK-Norm, référence de l'empilement dense Qwen3 avec 8 têtes KV
  • SmolLM3 3B : 3B paramètres, sorti le 2025-06-19, décodeur dense avec GQA, expérimente avec des couches NoPE périodiques
Ad

Fonctionnalités pratiques

La galerie comprend un système de suivi des problèmes pour signaler des fiches techniques inexactes, des architectures mal étiquetées ou des liens cassés. Une version physique sous forme d'affiche est disponible via Zazzle avec une exportation haute résolution de 14570 x 12490 pixels (fichier PNG de 56 MB, 182 mégapixels).

Pour les développeurs travaillant avec des agents de codage IA, cette ressource fournit des détails architecturaux concrets qui peuvent éclairer la sélection des modèles, les décisions de fine-tuning et l'optimisation des performances. Le format de comparaison côte à côte facilite la compréhension des compromis entre différents choix architecturaux.

📖 Read the full source: HN LLM Tools

Ad

👀 See Also

SpecLock : Moteur de Contraintes Open Source pour Agents d'IA de Codage
Tools

SpecLock : Moteur de Contraintes Open Source pour Agents d'IA de Codage

SpecLock est un serveur MCP qui applique activement des contraintes aux agents d'IA de codage comme Claude Code. Il bloque les violations avec des avertissements de conflit sémantique en utilisant l'expansion de synonymes, la détection de négation et le marquage d'actions destructrices.

OpenClawRadar
Session Siphon : Un outil open source consolide les conversations des agents d'IA de codage
Tools

Session Siphon : Un outil open source consolide les conversations des agents d'IA de codage

Session Siphon est un outil gratuit et open source qui consolide et indexe l'historique des conversations de plusieurs agents d'IA de codage, provenant de différents fournisseurs et machines. Le développeur l'a créé avec l'aide de Claude pour résoudre le problème du suivi des conversations sur différentes plateformes.

OpenClawRadar
Créer une application de production complète avec Claude : ce qui a fonctionné et ce qui n'a pas fonctionné
Tools

Créer une application de production complète avec Claude : ce qui a fonctionné et ce qui n'a pas fonctionné

Un développeur backend senior sans expérience Flutter a conçu et livré une application de production complète (iOS + Android) en utilisant Claude comme outil principal pendant 2,5 mois. Détails sur le flux de travail, les échecs et pourquoi les tests étaient la porte de la qualité.

OpenClawRadar
Système de bandit contextuel auto-hébergé en Rust : Syntra et Lycan pour des systèmes de décision adaptatifs
Tools

Système de bandit contextuel auto-hébergé en Rust : Syntra et Lycan pour des systèmes de décision adaptatifs

Deux projets open-source : Lycan (langage d'exécution de graphes avec nœuds de stratégie et poids appris) et Syntra (appliance Docker/API servant des capsules Lycan compilées). Des bugs de pipeline de données découverts avant les bugs d'exécution lors d'un dogfooding sur un produit de débat boursier IA.

OpenClawRadar