Moteur d'Inférence Bodega : Optimisation de l'inférence LLM pour la mémoire unifiée d'Apple Silicon

Bodega est un moteur d'inférence conçu spécifiquement pour l'architecture de mémoire unifiée d'Apple Silicon, développé sur 2,5 ans avec des optimisations proches de la couche Metal sur MLX. Il résout les limitations fondamentales de débit auxquelles les développeurs sont confrontés lors de l'exécution de LLM sur le matériel Mac.
Pourquoi Apple Silicon nécessite une optimisation différente
Apple Silicon utilise une mémoire unifiée où le CPU, le GPU et le moteur neuronal partagent un seul pool physique via un bus unique sur puce. Cela diffère fondamentalement des GPU discrets comme ceux de NVIDIA, qui disposent de pools de VRAM et de RAM système séparés connectés par PCIe. La bande passante mémoire varie d'environ 400 Go/s sur le M1 Max à environ 800 Go/s sur le M3 Ultra (avec une pénalité inter-puces réduisant le débit réel à 1,6-1,8 fois les performances d'une seule puce).
Implications architecturales clés :
- Le décodage est limité par la bande passante mémoire - chaque jeton nécessite le chargement des poids du modèle depuis le bus partagé
- Le pré-remplissage est limité par le calcul - dominé par les TFLOPS du GPU pour la multiplication matrice-matrice
- Le bus mémoire est partagé avec tout - le cache KV, les poids du modèle, le système d'exploitation et les applications se disputent tous la même bande passante de 400-800 Go/s
Cette architecture rend les ports directs des implémentations de traitement par lots de vLLM ou llama.cpp inefficaces sur MLX, car elles ont été conçues pour des architectures mémoire différentes.
Ce que Bodega construit
Le développeur a étudié les mécanismes internes de vLLM, y compris le traitement par lots continu, le décodage spéculatif, le pré-remplissage par blocs et la mise en cache des préfixes, puis a reconstruit chaque composant pour MLX et le modèle de mémoire unifiée d'Apple.
L'idée centrale pour le traitement par lots continu : générer un seul jeton pour une seule séquence charge tous les poids du modèle pour une multiplication matrice-vecteur, ce qui est inefficace sur un matériel avec une bande passante de 400+ Go/s. La solution exécute plusieurs séquences simultanément en utilisant poids × matrice de vecteurs au lieu de poids × vecteur unique.
La gestion du cache KV a été repensée pour la mémoire unifiée où l'éviction des blocs de cache a des implications de coût différentes par rapport aux systèmes VRAM isolés.
Implications pratiques
Le développeur rapporte des tests sur plusieurs configurations Apple Silicon, y compris deux M3 Ultra (256 Go et 512 Go), un M4 Max 128 Go et un M1 Max 64 Go. Le plafond commun identifié est le débit utilisateur unique avec une requête à la fois et le GPU principalement inactif.
Le dépôt inclut des benchmarks qui peuvent être vérifiés avec un simple script curl pour la configuration.
📖 Read the full source: r/LocalLLaMA
👀 See Also

AgenticStore MCP : Boîte à outils Python pour Claude Desktop avec 27 outils locaux
AgenticStore MCP est une boîte à outils Python open-source qui remplace plusieurs serveurs MCP par une seule installation, offrant à Claude Desktop 27 outils locaux incluant une mémoire persistante, une recherche web et un audit de dépôt, sans nécessiter de configuration Docker ou Node.js.

Compétence de Traduction Vidéo OpenClaw Disponible sur ClawHub
Une nouvelle compétence de traduction vidéo pour les agents OpenClaw permet aux utilisateurs de télécharger une vidéo ou de fournir une URL pour obtenir un aperçu traduit instantanément. La compétence est hébergée sur ClawHub.

Bot GitHub auto-hébergé exécute Claude Code avec plus de 40 déclencheurs webhook et outils MCP
Un bot GitHub auto-hébergé exploite le SDK Agent Claude avec toutes les fonctionnalités de Claude Code, prenant en charge plus de 40 déclencheurs webhook, 4 serveurs MCP intégrés et des workflows personnalisés basés sur YAML pour la revue de PR, la correction automatique CI et le tri des issues.

L'application iOS ClawTalk permet le chat vocal avec des agents IA OpenClaw auto-hébergés.
ClawTalk est une application iOS native qui offre une discussion vocale par appui pour parler pour les configurations OpenClaw auto-hébergées de LLM. Elle comprend la reconnaissance vocale sur l'appareil via WhisperKit, des réponses en streaming en temps réel avec rendu markdown, et prend en charge plusieurs options de synthèse vocale, notamment ElevenLabs, OpenAI et les voix intégrées d'Apple.