Apple Neural EngineのリバースエンジニアリングによるMicroGPTモデルのトレーニング

Apple Neural Engineへの直接アクセス
開発者はAppleのCoreMLフレームワークをバイパスし、M4 Mac mini上のApple Neural Engine(ANE)に直接アクセスすることで、小規模言語モデルのカスタムトレーニングパイプラインを作成しました。このプロジェクトでは、Claudeを使用してANEの非公開APIをリバースエンジニアリングし、ベンチマークを実行した後、Appleが推奨するCoreMLインターフェースを使用せずにトレーニングを実装しました。
技術仕様とパフォーマンス
M4チップ上のANEは、公称38 TFLOPSのINT8演算性能を提供しますが、開発者は実際にはFP16プロセッサであるため、実効的な演算性能はその半分であると指摘しています。ANEのピーク演算時の消費電力はわずか2.8Wで、6.6 TFLOPS/wattの効率を実現しています。比較として、Metal GPUは約1 TFLOPS/watt、NVIDIAのH100は1.4 TFLOPS/wattに達します。
トレーニング実装
開発者はカスタムトレーニングパイプラインを作成し、ANE上で110MパラメータのMicroGPTモデルのトレーニングに成功しました。単一チップではより大規模なモデルのトレーニングは実用的ではありませんが、開発者は複数のANEデバイスをクラスター化することで、理論的にはより大きなモデルのトレーニングが可能だと示唆しています。単一デバイスであっても、3Bや7BパラメータモデルのLoRAトレーニングは実現可能であるはずです。
NPUでトレーニングする理由
主な動機は電力効率です。ANEの6.6 TFLOPS/wattという効率は、従来のGPUトレーニング手法よりも大幅に電力効率が高く、エッジコンピューティングやエネルギーを意識した開発において特に価値があります。
利用可能なリソース
- リバースエンジニアリングのドキュメント
- ベンチマーク結果
- トレーニング実装(進行中)
- コードを含むGitHubリポジトリ
このプロジェクトは、通常ブラックボックスとして扱われるAppleのNeural Engineが、カスタムAIトレーニングワークフローのために直接アクセス可能であり、開発者にGPUベースのトレーニングに代わる優れた電力効率の選択肢を提供することを実証しています。
📖 完全なソースを読む: r/LocalLLaMA
👀 See Also

Echo-TTSがApple Siliconに移植され、MLXを活用したネイティブTTSと音声クローニングを実現
Echo-TTSは、2.4Bパラメータの拡散型テキスト読み上げモデルで、音声クローニング機能を備えており、CUDAからMLXを使用してApple Mシリーズチップ上でネイティブに動作するように移植されました。ベースモデルの16GB M4 Mac miniでは、5秒の音声クローン生成に約10秒、30秒のクローンには約60秒かかります。

Bridge Claude Codeをチャットアプリに接続してリモート対話を実現
cc-connectというGitHubプロジェクトは、Claude CodeをSlackやTelegramなどのメッセージングプラットフォームに接続し、ローカルマシンを公開せずにリモートでのやり取りを可能にします。エージェントはローカルで実行され、小さなブリッジがエージェントとチャットアプリ間のメッセージを中継します。

N100/WSL2でtimeoutSeconds設定にもかかわらずllm-idle-timeoutが2分で発火
ユーザーが、OpenClawのアイドルウォッチドッグがN100/WSL2ハードウェア上で2分後に発動し、timeoutSeconds=300の設定を無視することを報告しています。これは、ゲートウェイの起動が遅い(45秒以上)ことと、noOutputTimeoutMsが設定可能でないことが原因です。

TeamOut AIエージェントによる会社のリトリート計画
TeamOutは、会話を通じて企業イベントを計画するAIエージェントをリリースしました。会場の選定、ベンダー調整、航空券費用の見積もり、旅程作成、プロジェクト管理などを一括して処理します。このシステムは、複数のLLMと専門ツールを活用し、ステートフルな調整問題として計画管理を行います。