Orion: Umgehung von CoreML zur direkten Ausführung und Schulung von LLMs auf der Apple Neural Engine

Direkter ANE-Zugriff für LLM-Workloads
Orion bietet ein Ende-zu-Ende-Objective-C-System, das CoreML vollständig umgeht, um LLMs direkt auf der Apple Neural Engine (ANE) auszuführen und zu trainieren. Dieser Ansatz gibt Entwicklern direkte Kontrolle über die ANE, die zuvor von CoreML als Blackbox-Scheduler behandelt wurde, wodurch jegliche direkte Kontrolle oder Trainingsfähigkeit entfiel.
Technische Implementierung und Einschränkungen
Das Projekt baut auf Reverse-Engineering-Arbeiten auf, die die privaten ANEClient- und ANECompiler-APIs kartiert haben. Die ANE weist laut Entwickler eine "Hardware-Impedanz-Fehlanpassung" mit insgesamt 17 Programmierbeschränkungen auf, von denen 11 völlig undokumentiert waren. Zu den wichtigsten Einschränkungen gehören:
- Die Concat-Operation führt zu einem sofortigen, stillen Compiler-Fehler
- BLOBFILE-Gewichte benötigen einen 64-Byte-Offset vom Chunk-Header, sonst kommt es zu stiller numerischer Korruption
- Die ANE behält einen internen Zustand bei, der bei ~119 Kompilierungen pro Prozess hart begrenzt ist, bevor sie still fehlschlägt
Lösungen für Trainingsherausforderungen
Frühere Versuche beim ANE-Training führten nach einem einzigen Schritt zu NaN-Divergenz. Orion löst dies durch:
- Aufbau einer verzögerten Kompilierungspipeline
- Implementierung strenger Aktivierungsbegrenzung, um fp16-Überlaufkaskaden zu stoppen (Begrenzung der Aktivierungen auf -65504 bis +65504)
- Verwendung einer exec()-Prozess-Neustart-Schleife nach jedem Trainingsschritt, um die 119-Kompilierungsgrenze zu umgehen
Leistungsergebnisse
Der Compiler reduziert einen 27-Operationen-Graphen-IR durch fünf Optimierungsdurchläufe auf ANE-natives MIL. Die aktuelle Leistung umfasst:
- 170+ Token/s für GPT-2 124M Decode
- Mechanisch stabiles mehrstufiges Training an einem 110-Millionen-Parameter-Transformer (die "Kohärenzgrenze" der Hardware)
- Über 1.000 Schritte fiel der Verlust von 12,3 auf 6,2 ohne NaNs
Aktuelle Einschränkungen
Die ANE bäckt Gewichte zur Kompilierzeit ein, was bedeutet, dass jedes Trainingsupdate eine ~4,2s Rekompilierungsstrafe erfordert. Die ANE zieht ~19 TFLOPS in fp16, aber die grundlegende Einschränkung für ihre Nutzung war nicht die Rechenleistung – sondern das völlige Fehlen einer nativen Orchestrierungsschicht.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Obsidian-Integration für Persistent Memory in OpenClaw und Claude Code
Ein Reddit-Nutzer demonstriert, wie die Verbindung von OpenClaw und Claude Code mit einem Obsidian-Vault persistente Langzeiterinnerung über Sitzungen hinweg schafft. Das Setup verknüpft automatisch Erinnerungen, Kontext, Projektdateien und Notizen, wobei alle Instanzen bei Bedarf auf den gemeinsamen Speicher zugreifen können.

Rat: Ein strukturierter Dialograhmen für Claude
Rat — Ein Tiegel ist ein strukturierter Dialograhmen, der innerhalb eines einzigen Claude-Kontextfensters läuft und Personendarstellungen nutzt, um vier verschiedene Engagement-Modi zu erzeugen: rigorose Befragung, generatives Handeln, gelebte Erfahrung und ungeformte Intuition.

Corbell: Open Source CLI für architekturübergreifende Analyse und Design-Dokumentation über mehrere Repositories hinweg
Corbell ist ein kostenloses, quelloffenes CLI-Tool, das mehrere Repositorys scannt, um einen Architektur-Graphen zu erstellen und Design-Dokumentation lokal zu generieren. Es funktioniert vollständig offline mit Ollama oder unterstützt verschiedene LLM-Anbieter und sendet niemals Code von Ihrem Rechner.

Beacon: Open-Source-Endpunkt-Telemetrie für lokale KI-Agenten
Beacon erfasst lokale KI-Agent-Aktivitäten (Claude Code, Codex CLI, Cursor usw.) und normalisiert sie in Endpunkt-Ereignisse zur Überprüfung oder SIEM-Weiterleitung über Wazuh, Elastic, Splunk HEC.