Apple Neural Engineの内部構造をリバースエンジニアリング

मूल शीर्षक: Retrospectively Reverse-Engineering Apple's Neural Engine

यह क्यों महत्वपूर्ण है

CNNからTransformerへの移行がNPU設計にどう影響したかを、実チップのリバースエンジニアリングで実証した希少な技術記録。

エンジニアEileen Yoonが、3年前に中断したApple M1チップのNeural Engine(ANE)リバースエンジニアリング作業を再開・完成させた。M5チップでANEコアがGPUコアに統合されたことを受け、ANEのアーキテクチャ全体を記録として残す目的で発表された。

Eileen Yoonは2026年8月10日、M1チップのApple Neural Engine(ANE)を詳細にリバースエンジニアリングした技術記事を公開した。3年前に作業を停止した理由は明確だ。「ANEは汎用アクセラレータとして設計するには制約が多すぎる」という判断からだった。macOSでさえ、ANEの用途はFinderでのプレビュー画像生成に限られていた。

M5(2025年)でANEコアがGPUコアに統合されたことが、今回の記事執筆のきっかけとなった。独立型NPUの終焉が現実となったタイミングで、Yoonはその内部設計を記録として残すことを選んだ。

技術的な中心は計算コアの構造だ。M1のANEは16個の並列コンピュートコアを持ち、各コアにFP16で128本(INT8なら256本)のMAC(Multiply-Accumulate)レーンがある。合計2048本の並列MACレーンが毎サイクル動作する。ANEが2017年のCNN時代のモデルに最適化されていた理由は、MAC演算そのものではなく、その周囲のデータフロー設計にある。予測可能な再利用パターンを前提としたアーキテクチャが、スマートフォン上での効率的な推論を可能にしていた。

Transformerモデル、特に自己回帰的なデコード処理は、この「予測可能な再利用」という前提を崩した。Yoonは、ANEのコンピュートコアはTransformerでも有効だが、データフロー全体が異なる構造を必要とすると指摘する。M5でANEがGPUに吸収されたことは、その分析を裏付けている。記事では計算、データパス、スケジューラ、メモリ、実行モデルの全レイヤーを体系的に解説している。

स्रोत

eiln.github.io — मूल लेख पढ़ें →