Orion : Contourner CoreML pour exécuter et entraîner des LLM directement sur le Neural Engine d'Apple

Accès direct à l'ANE pour les charges de travail LLM
Orion fournit un système complet en Objective-C qui contourne entièrement CoreML pour exécuter et entraîner des LLM directement sur le moteur neuronal Apple (ANE). Cette approche donne aux développeurs un contrôle direct sur l'ANE, qui était auparavant traité comme un planificateur boîte noire par CoreML, leur retirant tout contrôle direct ou capacité d'entraînement.
Implémentation technique et contraintes
Le projet s'appuie sur des travaux de rétro-ingénierie qui ont cartographié les API privées ANEClient et ANECompiler. L'ANE présente ce que le développeur appelle un "désaccord d'impédance matérielle" avec 17 contraintes de programmation au total, dont 11 étaient complètement non documentées. Les contraintes clés incluent :
- L'opération concat provoque un échec immédiat et silencieux du compilateur
- Les poids BLOBFILE nécessitent un décalage de 64 octets depuis l'en-tête du bloc, sinon vous obtenez une corruption numérique silencieuse
- L'ANE maintient un état interne qui plafonne à environ 119 compilations par processus avant d'échouer silencieusement
Solutions aux défis d'entraînement
Les tentatives précédentes d'entraînement sur l'ANE rencontraient une divergence NaN après une seule étape. Orion résout ce problème en :
- Mettant en place un pipeline de compilation différée
- Implémentant un clampage strict des activations pour arrêter la cascade de débordement fp16 (clampage des activations entre -65504 et +65504)
- Utilisant une boucle de redémarrage de processus exec() après chaque étape d'entraînement pour contourner la limite de 119 compilations
Résultats de performance
Le compilateur réduit un graphe IR de 27 opérations à travers cinq passes d'optimisation jusqu'au MIL natif de l'ANE. Les performances actuelles incluent :
- Plus de 170 tokens/s pour le décodage GPT-2 124M
- Un entraînement multi-étapes mécaniquement stable sur un transformateur de 110 millions de paramètres (le "plafond de cohérence" du matériel)
- Sur plus de 1 000 étapes, la perte est passée de 12,3 à 6,2 sans aucun NaN
Limitations actuelles
L'ANE incorpore les poids au moment de la compilation, ce qui signifie que chaque mise à jour d'entraînement nécessite une pénalité de recompilation d'environ 4,2 s. L'ANE tire environ 19 TFLOPS en fp16, mais la contrainte fondamentale pour son utilisation n'a pas été la puissance de calcul—c'a été l'absence totale d'une couche d'orchestration native.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Stoa Markets : un marché de GPU et de serveurs IA avec des devis vérifiés
Stoa est un marché pour l'achat et la vente de GPU et de serveurs IA neufs et d'occasion. Il standardise les demandes de devis, vérifie les contreparties et fournit des devis fermes, visant à améliorer la découverte des prix sur le marché des GPU.

Code Altimate : Harnais de Génie de Données Agentiel Open-Source
Altimate Code est un harnais open-source qui fournit des outils déterministes d'ingénierie des données pour les agents d'IA, abordant des problèmes comme le SQL halluciné et le manque de contexte de schéma. Il inclut la traçabilité au niveau des colonnes, la détection d'anti-modèles SQL et l'intégration dbt, avec des benchmarks montrant 74,4 % de performance sur ADE-bench.

Agents sous-agents parallèles dans Claude Code : quand ils économisent ou brûlent des jetons
Anthropic rapporte que les systèmes multi-agents utilisent environ 15× plus de tokens qu'un simple chat, mais la mise en cache des prompts offre 90% de réduction sur les tokens. Que les sous-agents fassent économiser ou perdre de l'argent dépend des taux de succès du cache.

L'outil de surveillance Open Source résout le problème d'identité des agents dans l'écosystème OpenClaw
Un utilisateur d'OpenClaw développant un service web a découvert un trafic d'agents indifférenciable de celui des utilisateurs humains, ce qui a motivé le développement de Vigil - une couche d'identité open source basée sur le W3C DID qui fournit des justificatifs cryptographiques et un historique comportemental pour les agents.