L'optimisation de l'ANE par des expériences d'IA pilotées par téléphone démontre les avantages de la fusion de noyaux

Un développeur a mené 55 expériences d'optimisation sur la branche autoresearch-ane, pilotant principalement le processus depuis son téléphone un samedi. Le travail s'est concentré sur les améliorations de performance du moteur neuronal d'Apple (ANE) grâce à l'optimisation des noyaux et aux changements architecturaux.
Améliorations des performances
Les expériences ont donné des gains mesurables sur plusieurs métriques :
- La perte de validation est passée de 3,75 (un retour en arrière par rapport à l'optimisation 3,2) à 2,49
- Le temps d'étape s'est amélioré de 176 ms à 96 ms
- L'utilisation de l'ANE est passée de 3,6 % à 6,5 %
Changement technique clé
L'amélioration la plus significative est venue de la fusion des noyaux : "Fusionner 3 noyaux ANE en 1 méga-noyau a éliminé 12 allers-retours IOSurface par étape - ce seul changement a surpassé tous les ajustements d'hyperparamètres combinés." Cette optimisation architecturale s'est avérée plus impactante que les ajustements de paramètres.
Détails du flux de travail
Le développeur a utilisé une approche non conventionnelle :
- A exécuté les expériences à distance, pilotant depuis son téléphone en de brefs moments
- A utilisé Claude pour le brainstorming et l'extraction d'informations des sources publiques listées dans le README du dépôt
- A abordé le problème avec "une attention courte et une entrée de jetons minimale" - spéculant sur les directions plutôt que de dicter des étapes précises
- A complété 55 expériences avec "plusieurs cas de saisie réelle"
- A travaillé en mode non destructif uniquement en raison de contraintes d'autorisations ("pas de rm -rf /* et autres")
Apprentissage principal
Au-delà des améliorations techniques, le développeur a noté : "L'apprentissage principal n'est pas l'amélioration elle-même. C'est qu'une attention courte et une entrée de jetons minimale - brainstormer sur la direction, non dicter les étapes - peut produire des gains mesurables réels sur un problème système difficile."
Le travail a été mené sur l'ordinateur portable du développeur, et il mentionne une divergence de taux d'acceptation : "55vs45 ne correspond pas tout à fait" en référence aux résultats des expériences.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

FOMOE Permet l'Inférence du Modèle Qwen3.5 de 397B sur un Matériel de Bureau à 2 100 $
FOMOE (Fast Opportunistic Mixture of Experts) permet d'exécuter le modèle phare de Qwen3.5 avec 397 milliards de paramètres à une vitesse de 5 à 9 tokens/seconde sur du matériel grand public, en utilisant deux GPU à 500$, 32 Go de RAM et un disque NVMe avec une quantification Q4_K_M.

Personnaliser Claude IA pour un retour amélioré
Ajustez les paramètres de Claude IA pour éviter un accord excessif et favoriser une réflexion plus critique et des retours plus pratiques.

SkyClaw : Un environnement d'exécution d'agent ouvert écrit en Rust
SkyClaw est un environnement d'exécution d'agent open-source écrit en Rust avec 34 nouvelles fonctionnalités réparties sur 7 phases de développement. Il inclut la sauvegarde de tâches, des files d'attente persistantes avec SQLite, l'exécution parallèle d'outils et la prise en charge du multi-locataire.

Automatisez les briefings quotidiens en podcasts Spotify personnels avec OpenClaw et l'interface en ligne de commande Save to Spotify
OpenClaw s'exécute chaque jour à 7h, récupère les fils Slack + les notifications GitHub + le calendrier, résume le tout en mp3 et le télécharge sous forme d'épisode privé via l'interface en ligne de commande Save to Spotify. Fonctionne avec les formules Free et Premium.