Orion: Обход CoreML для запуска и обучения LLM напрямую на Apple Neural Engine

Прямой доступ к ANE для работы с LLM
Orion предоставляет сквозную систему на Objective-C, которая полностью обходит CoreML для запуска и обучения LLM непосредственно на Apple Neural Engine (ANE). Этот подход даёт разработчикам прямой контроль над ANE, который ранее CoreML обрабатывал как «чёрный ящик»-планировщик, лишая любого прямого управления или возможности обучения.
Техническая реализация и ограничения
Проект основан на работе по реверс-инжинирингу, в ходе которой были сопоставлены приватные API ANEClient и ANECompiler. ANE представляет собой то, что разработчик называет «аппаратным несоответствием импеданса» с 17 общими программными ограничениями, 11 из которых были полностью недокументированы. Ключевые ограничения включают:
- Операция concat вызывает немедленный, тихий сбой компилятора
- Веса BLOBFILE требуют смещения в 64 байта от заголовка чанка, иначе происходит тихое числовое искажение
- ANE поддерживает внутреннее состояние, которое жёстко ограничивается примерно 119 компиляциями на процесс перед тихим сбоем
Решения проблем обучения
Предыдущие попытки обучения на ANE сталкивались с расхождением NaN после одного шага. Orion решает это с помощью:
- Настройки конвейера отложенной компиляции
- Реализации строгого ограничения активаций для предотвращения каскадного переполнения fp16 (ограничение активаций от -65504 до +65504)
- Использования цикла перезапуска процесса exec() после каждого шага обучения для обхода ограничения в 119 компиляций
Результаты производительности
Компилятор преобразует граф IR из 27 операций через пять этапов оптимизации в нативный для ANE MIL. Текущая производительность включает:
- Более 170 токенов/с для декодирования GPT-2 124M
- Механически стабильное многошаговое обучение трансформера с 110 млн параметров («потолок связности» аппаратного обеспечения)
- За более чем 1000 шагов потери снизились с 12,3 до 6,2 без единого NaN
Текущие ограничения
ANE запекает веса во время компиляции, что означает, что каждое обновление обучения требует штрафа за перекомпиляцию около 4,2 с. ANE выдаёт примерно 19 TFLOPS в fp16, но фундаментальным ограничением для его использования была не вычислительная мощность, а полное отсутствие нативного уровня оркестрации.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

ClawCodex /режим советника: Объедините дешевого работника с дорогим рецензентом, чтобы сократить расходы без потери качества
Открытый Python-агент ClawCodex добавляет режим /advisor, который на этапах принятия решений сочетает дешевую рабочую модель (например, Haiku) с дорогой рецензирующей (например, Opus), сокращая расходы в несколько раз без потери качества архитектурных решений.

Вкусовая память: обратимая агентная память на основе гипермерных вычислительных векторов
Гиперразмерные вычисления заменяют векторный поиск для полного восстановления: перечислить ВСЕ дни, касающиеся проекта, обнаружить неназванные рабочие потоки и разложить ежедневные журналы без потерь с помощью скалярных произведений.

Детектор утечек Swarm: Бесплатный инструмент для поиска открытых API-ключей в конфигурациях OpenClaw
Разработчик выпустил swarm-leak-detector — инструмент с лицензией MIT без зависимостей, который сканирует более 21 шаблона учетных данных (OpenAI, Anthropic, OpenRouter, Stripe и др.) в текстовых JSON-файлах конфигурации. Запустите его с помощью npx swarm-leak-detector scan ~/.clawdbot/, чтобы проверить наличие утечек примерно за 30 секунд.

WAYD: 60-секундный социальный перерыв в Claude Code, Cursor и Copilot CLI
WAYD — это плагин для Claude Code, Cursor и Copilot CLI, который позволяет публиковать однострочные заметки о своем кодинге под тегами настроения и листать ленту реакций других разработчиков — всё из терминала, на базе GitHub Issues.