Hot Chip 2026解説の第5弾はArmのAGI CPUである。AGI CPUは連載870回で説明しているが、3月の発表の際にArmはAGI CPUの技術的なディテールをほとんど公開しておらず、動作スペックがいくつか示された程度に過ぎない。今回はもう一段踏み込んだ情報が公開された。
初公開されたNeoverse V3の内部スペックと謎のL2帯域
AGI CPUは基本的にNeoverse CSS(Compute Subsystems)をベースに実装されている。Neoverse CSSがそもそもArmの設計によるものだから、言ってみればNeoverse CSSを利用したリファレンスデザインといった実装になるのは当然である。
まず基本であるCPUコア。Armの開発者向けサイトに、Neoverse V3のパイプライン構造が公開されているが、大まかな構成はともかくとして、詳細なスペック(例えばDecode Queueの処理能力)などは明らかにされていなかったのだが、今回これが公開された。
Decode-Queue/Decodeはどちらも10-wideとなっており、これはNVIDIAのOlympusコアに等しい規模である。Dispatchも当然10命令/サイクルで、384を超える命令をIn-Flightで保持できるとする。
またRetireも8命令/サイクルで対応できるあたり、上のパイプライン構造の画像にあるCommon Reorder Bufferは相当なエントリ数がありそうだ(Olympusの1000以上かは不明だが)。
実行ユニットの側はALU×8、BT×3だが、パイプライン構造の画像を見る限りALUとBTは別々のポートが割り当てられているようだ。したがって、これだけで11ポート。さらにLSUはLoad/Store×1、Load×2、Store×1の合計4ポート。FPUはデュアル128bitとなっているが、128bit動作はSIMD(SVE2)動作時だけで通常のFPU命令なら64bitになることを考えると、ここは合計4ポートで、SVE2動作時は2ポート連携して動くような仕組みと考えられる。つまりIssue Portの数は合計19になると考えられる。これは結構な数である。
また前述の通りデュアル128bit SIMDとあるので、SVE2の処理性能は256bit/サイクルで行なえることになる。この点はOlympus(64bit×3)より上である。Load Storeユニットは3 Load+1 Store、ないし2 Load+2 Storeが同時に行なえる構成である。おそらくSIMDユニットに併せてLoad/Storeの幅は128bitであろう(でないと2 Storeで256bitを書き出しできないからだ)。
あとここには記載されていない(搭載されていないから記載されないのだろう)が、SMTのサポートはない。そもそもArmのNeoverseの場合、SMTのサポートがあるのは高効率向けのNeoverse Eシリーズだったが、Neoverse E1はSMTをサポートしていたにも関わらずNeoverse E2ではサポートが落ちている。このあたりもOlympusとの相違点と言える。
ところで、驚異的というか誤植じゃないのか? と思ったのがL2の帯域で、128Bytes/サイクルというのは、なぜそんなに帯域が必要なのか、今1つ理解できない。Load/Storeユニットが128bit幅だとして4つのLoad/Storeユニットが全部同時に動いたとしても64Bytes/サイクルあれば足りる計算だからだ。
これに関しては質疑応答でも特に話題に出なかったのだが、どうしてこんな帯域が必要なのかはかなり謎である。2 Load+2 Saveを同時に実行するには、オーバーヘッドがあるから64Bytes/サイクルのままでは厳しいとは思うが、128Bytes/サイクルは必要ないだろうと思うわけで、少し謎である。
本記事はアフィリエイトプログラムによる収益を得ている場合があります

この連載の記事
-
第895回
PC
IBM ZがArmを取り込む衝撃! 次世代メインフレーム「z18(仮)」のネイティブDual-ISA戦略の狙い -
第894回
PC
AMD「Ryzen AI Embedded X100」のリアルタイムAI制御が、Jetsonの弱点であるCPU性能を突く -
第893回
PC
インテル製GPU「Crescent Island」の正体、容量480GBメモリーでエージェント型AIとKVキャッシュ問題に挑む -
第892回
PC
Hot Chipsで明かされた「Wildcat Lake」の全貌 Foverosを捨てMCPを選んだインテルの舞台裏 -
第891回
PC
謎多き次世代Xeon「Diamond Rapids」を解剖、3D Meshの進化と新命令セットAPXがもたらす変革 -
第890回
PC
Samsung「SF2P」の全貌! GAA最大の弱点であるPMOS性能低下を克服し、TSMC追撃へ準備万端 -
第889回
PC
なぜ巨大チップは歪んで壊れるのか? SK HynixのHBM4「MR-MUF」とTSMCのCoWoS-Lを襲う熱膨張の罠 -
第888回
PC
NVIDIA Rubin Ultra開発中止の真相! 180層CoWoS-Lの歪曲トラブルと、急造ラックNVL576に透ける苦肉の策 -
第887回
PC
AIなしではもはや限界 TSMCが明かすメモリー開発にAIが不可欠となった現実 -
第886回
PC
CFETの足を引っ張るPMOSを救え! imecが提案する新絶縁層と、あえて精度を緩める「Notch Alignment」の妙手 - この連載の一覧へ















