Orion : Contourner CoreML pour exécuter et entraîner des LLM directement sur le Neural Engine d'Apple

✍️ OpenClawRadar📅 Publié: March 7, 2026🔗 Source
Orion : Contourner CoreML pour exécuter et entraîner des LLM directement sur le Neural Engine d'Apple
Ad

Accès direct à l'ANE pour les charges de travail LLM

Orion fournit un système complet en Objective-C qui contourne entièrement CoreML pour exécuter et entraîner des LLM directement sur le moteur neuronal Apple (ANE). Cette approche donne aux développeurs un contrôle direct sur l'ANE, qui était auparavant traité comme un planificateur boîte noire par CoreML, leur retirant tout contrôle direct ou capacité d'entraînement.

Implémentation technique et contraintes

Le projet s'appuie sur des travaux de rétro-ingénierie qui ont cartographié les API privées ANEClient et ANECompiler. L'ANE présente ce que le développeur appelle un "désaccord d'impédance matérielle" avec 17 contraintes de programmation au total, dont 11 étaient complètement non documentées. Les contraintes clés incluent :

  • L'opération concat provoque un échec immédiat et silencieux du compilateur
  • Les poids BLOBFILE nécessitent un décalage de 64 octets depuis l'en-tête du bloc, sinon vous obtenez une corruption numérique silencieuse
  • L'ANE maintient un état interne qui plafonne à environ 119 compilations par processus avant d'échouer silencieusement
Ad

Solutions aux défis d'entraînement

Les tentatives précédentes d'entraînement sur l'ANE rencontraient une divergence NaN après une seule étape. Orion résout ce problème en :

  • Mettant en place un pipeline de compilation différée
  • Implémentant un clampage strict des activations pour arrêter la cascade de débordement fp16 (clampage des activations entre -65504 et +65504)
  • Utilisant une boucle de redémarrage de processus exec() après chaque étape d'entraînement pour contourner la limite de 119 compilations

Résultats de performance

Le compilateur réduit un graphe IR de 27 opérations à travers cinq passes d'optimisation jusqu'au MIL natif de l'ANE. Les performances actuelles incluent :

  • Plus de 170 tokens/s pour le décodage GPT-2 124M
  • Un entraînement multi-étapes mécaniquement stable sur un transformateur de 110 millions de paramètres (le "plafond de cohérence" du matériel)
  • Sur plus de 1 000 étapes, la perte est passée de 12,3 à 6,2 sans aucun NaN

Limitations actuelles

L'ANE incorpore les poids au moment de la compilation, ce qui signifie que chaque mise à jour d'entraînement nécessite une pénalité de recompilation d'environ 4,2 s. L'ANE tire environ 19 TFLOPS en fp16, mais la contrainte fondamentale pour son utilisation n'a pas été la puissance de calcul—c'a été l'absence totale d'une couche d'orchestration native.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Stoa Markets : un marché de GPU et de serveurs IA avec des devis vérifiés
Tools

Stoa Markets : un marché de GPU et de serveurs IA avec des devis vérifiés

Stoa est un marché pour l'achat et la vente de GPU et de serveurs IA neufs et d'occasion. Il standardise les demandes de devis, vérifie les contreparties et fournit des devis fermes, visant à améliorer la découverte des prix sur le marché des GPU.

OpenClawRadar
Code Altimate : Harnais de Génie de Données Agentiel Open-Source
Tools

Code Altimate : Harnais de Génie de Données Agentiel Open-Source

Altimate Code est un harnais open-source qui fournit des outils déterministes d'ingénierie des données pour les agents d'IA, abordant des problèmes comme le SQL halluciné et le manque de contexte de schéma. Il inclut la traçabilité au niveau des colonnes, la détection d'anti-modèles SQL et l'intégration dbt, avec des benchmarks montrant 74,4 % de performance sur ADE-bench.

OpenClawRadar
Agents sous-agents parallèles dans Claude Code : quand ils économisent ou brûlent des jetons
Tools

Agents sous-agents parallèles dans Claude Code : quand ils économisent ou brûlent des jetons

Anthropic rapporte que les systèmes multi-agents utilisent environ 15× plus de tokens qu'un simple chat, mais la mise en cache des prompts offre 90% de réduction sur les tokens. Que les sous-agents fassent économiser ou perdre de l'argent dépend des taux de succès du cache.

OpenClawRadar
L'outil de surveillance Open Source résout le problème d'identité des agents dans l'écosystème OpenClaw
Tools

L'outil de surveillance Open Source résout le problème d'identité des agents dans l'écosystème OpenClaw

Un utilisateur d'OpenClaw développant un service web a découvert un trafic d'agents indifférenciable de celui des utilisateurs humains, ce qui a motivé le développement de Vigil - une couche d'identité open source basée sur le W3C DID qui fournit des justificatifs cryptographiques et un historique comportemental pour les agents.

OpenClawRadar