Обратная инженерия Apple Neural Engine для обучения моделей MicroGPT

Прямой доступ к нейронному движку Apple
Разработчик обошёл фреймворк CoreML от Apple, чтобы получить прямой доступ к нейронному движку Apple (ANE) на Mac mini с чипом M4, создав собственный конвейер обучения для небольших языковых моделей. Проект включал реверс-инжиниринг приватных API ANE с помощью Claude, затем проведение бенчмарков и реализацию обучения без рекомендованного Apple интерфейса CoreML.
Технические характеристики и производительность
ANE на чипе M4 обеспечивает заявленные 38 TFLOPS вычислений INT8, хотя разработчик отмечает, что это фактически процессор FP16, что делает эффективную вычислительную мощность вдвое меньше. Пиковая производительность ANE потребляет всего 2,8 Вт, обеспечивая энергоэффективность 6,6 TFLOPS/ватт. Для сравнения, GPU Metal достигает примерно 1 TFLOPS/ватт, а NVIDIA H100 — 1,4 TFLOPS/ватт.
Реализация обучения
Разработчик создал специализированный конвейер обучения, который успешно обучил модель MicroGPT с 110 млн параметров на ANE. Хотя один чип не может практически обучать более крупные модели, разработчик предполагает, что кластер устройств с ANE теоретически мог бы обучать более масштабные модели. Даже на одном устройстве обучение с использованием LoRA для моделей с 3 или 7 млрд параметров должно быть осуществимо.
Зачем обучать на NPU?
Основная мотивация — энергоэффективность. Эффективность ANE в 6,6 TFLOPS/ватт делает его значительно более энергоэффективным по сравнению с традиционными методами обучения на GPU, что особенно ценно для периферийных вычислений и энергоэффективной разработки.
Доступные ресурсы
- Документация по реверс-инжинирингу
- Результаты бенчмарков
- Реализация обучения (в процессе разработки)
- Репозиторий GitHub с кодом
Проект демонстрирует, что нейронный движок Apple, обычно рассматриваемый как «чёрный ящик», можно использовать напрямую для пользовательских рабочих процессов обучения ИИ, предлагая разработчикам альтернативу обучению на GPU с превосходной энергоэффективностью.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также
Mesh LLM: Распределённые AI-вычисления на Iroh – Запуск LLM на ваших собственных GPU
Mesh LLM объединяет имеющиеся GPU на разных машинах и предоставляет их как один API, совместимый с OpenAI. Модели распределяются локально, через маршрутизацию к пиру или как конвейер через несколько узлов с использованием QUIC-транспорта iroh.

aco-system: Полная операционная система компании для Claude, которая пишет пользовательские истории, разбивает задачи, проверяет PR
Пользователь Reddit рассказал, как aco-system превратил один GitHub issue в полностью проверенный PR с тестами — и всё это на основе Claude. Включает генерацию пользовательских историй, разбивку на задачи, проверку секретов и ревью PR.

Навык GAN для Claude Code: Инструмент на основе состязательного ИИ для совершенствования идей
Навык Claude Code под названием /gan использует состязательные роли ИИ для критики и улучшения идей посредством чередующихся фаз Дискриминатора и Генератора, с такими функциями, как режимы интенсивности, вывод на нескольких языках и принудительный выбор роли, разработанными через самоитерацию.

Протокол Pilot: P2P-сетевой стек для ИИ-агентов, созданный с помощью Claude
Разработчик создал Pilot Protocol — чисто пользовательский одноранговый стек виртуальной сети на Go, специально предназначенный для автономных ИИ-агентов, обеспечивающий прямое взаимодействие без централизованной инфраструктуры. Протокол использует мультиплексирование UDP, обход NAT и сквозное шифрование, при этом тесты показывают пропускную способность 89 МБ/с локально и 2,1 МБ/с при межконтинентальном соединении по глобальной сети.