FOMOE Permet l'Inférence du Modèle Qwen3.5 de 397B sur un Matériel de Bureau à 2 100 $

Ce que FOMOE résout
Les grands modèles Mixture of Experts (MoE) nécessitent des centaines de Go de stockage de poids, généralement dans une mémoire flash comme le NVMe. Pendant l'inférence, seule une petite fraction des poids est nécessaire, mais on ne peut pas prédire à l'avance lesquels. Les modèles d'accès aléatoires rendent les latences de la mémoire flash trop élevées pour une inférence pratique sur du matériel grand public.
Comment fonctionne FOMOE
Le système rend la plupart des lectures de poids d'experts inutiles grâce à plusieurs techniques :
- Stocke les experts les plus courants dans la mémoire GPU (VRAM) avec un cache d'experts roulant à jour
- Atteint un taux de succès VRAM de 60% avec un démarrage à chaud, réduisant les lectures NVMe à 28% (12% servis depuis la DRAM)
- Utilise une architecture ping-pong à double GPU pour superposer le chargement des poids et le calcul
- Implémente le Cache-Aware Routing (CAR) - lorsque deux experts ont des scores similaires, le modèle choisit l'expert suivant le mieux noté déjà présent dans le cache VRAM ou DRAM dans un seuil acceptable
Résultats de performance
- Vitesse d'inférence de 5 à 9 tokens/seconde pour le modèle Qwen3.5 à 397 milliards de paramètres
- Lectures NVMe réduites à 7% avec CAR activé
- Seulement 3,5% de baisse de perplexité mesurée sur wikitext
- Configuration matérielle requise : deux GPU à 500$, 32 Go de RAM, un disque NVMe
- Utilise la quantification Q4_K_M
L'implémentation consiste en environ 15 000 lignes de code C/HIP piloté par Claude avec une forte guidance humaine.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Barre d'état personnalisée pour Claude Code : utilisation du contexte, limites de taux et nombre de tokens en un coup d'œil
Un script personnalisé ajoute une ligne d'état persistante à Claude Code, affichant le pourcentage de contexte, la limite de taux sur 5 heures, les lectures du cache KV, les jetons d'entrée/sortie cumulés, le nom du modèle et le répertoire de travail — avec un code couleur pour les terminaux sombres.

ATLAS : Pipeline de calcul en temps de test open-source pour Qwen3-14B atteint des performances de codage de niveau frontière
Un étudiant universitaire a développé ATLAS, un pipeline de calcul en temps de test open-source construit autour de Qwen3-14B qui atteint 74,6 % de réussite au premier essai (pass@1) sur les problèmes LiveCodeBench v5 pour environ 0,004 $ par tâche en coûts d'électricité. Le système est lent pour les problèmes complexes mais offre des performances comparables aux modèles de pointe comme GPT-5 (84,6 %) et Claude 4.5 Sonnet (71,4 %).

Tandem MCP : exécuter et gérer des sessions Claude Code depuis le chat Claude.ai
Tandem est un serveur MCP open source qui relie le chat Claude.ai aux sessions locales de Claude Code, permettant des boucles de codage autonomes sans copier-coller.

23 Compétences d'Agent pour le Développement iOS 26 avec SwiftUI et Swift 6.2
Un développeur a créé 23 compétences d'agent ciblant iOS 26+ et Swift 6.2 pour résoudre les problèmes d'hallucination avec les API obsolètes et les modèles dépassés. Les compétences couvrent SwiftUI, SwiftData, StoreKit 2, les notifications push, la mise en réseau, la concurrence, l'accessibilité, la localisation, WidgetKit, MapKit, et plus encore.