4096 OAMがGaudi 3の最大構成に近い
話を戻すと、イーサネットを利用して大規模システムを構築する場合の構成例も示された。
4枚のHLB-325で1ラックが構成される。ということは、HLB-325を格納するシャーシは6Uでも足りず、8Uかそのくらいの高さになるのかもしれない。7200Wを空冷でなんとかするつもりなら、そのくらいの高さのシャーシが必要になるだろう
おそらくはこの直上の画像にある512ノードが現実的には上限に近く、これ以上になるとスパインの上にもう1つコアスイッチを入れないと収まらないようにも思える。さすがにそうなるとレイテンシーが無視できないところであって、4096 OAMがGaudi 3の最大構成に近いと考えて良さそうだ。
メモリー容量が最大のネック
さて、ここからは性能の話。Gaudi 3はNVIDIAのH100/H200をターゲットとしており、性能もH100/H200との比較という格好になる。まずH100とのトレーニングの性能比較では、1.4~1.7倍高速となっている。平均1.5倍といったところか。
これが推論におけるH200との比較になると、だいぶ旗色が悪くなる。H100はHBMが80GBだったので、トータルで128GBを実装するGaudi 3にアドバンテージがあるが、141GBを搭載するH200には、メモリー量で押し負けるといったあたりだろうか?
LLAMAだと良くてタイ、70Bだと明らかにメモリー不足である。Falcon 180BだともうH200でもメモリー不足になるので、そうなると地力の性能がでるということだろう。しかしこの結果で平均1.3倍高速というのは無理がある
実際H100との推論での比較では、だいぶいい勝負になっているあたりは、やはりメモリー容量が最大のネックということだろう。
もう1つGaudi 3の特徴としては電力効率の良さをアピールしたいようだが、結果を見ると「確かに高効率なものもあるが、そうでないケースも多い」という感じで、もうなにをどう実行するかで変わってくる感じで、そのあたりの見極めが大変そうである。
Gaudi 3の後継はFalcon Shores
最後に今後のロードマップについて。Gaudi 3の後継としてGaudi 4的なものは特に考慮されていないようで、次はFalcon Shoresになることが改めて明らかにされた。
時期的に言えば、B100対抗という形の実装になるのだろうが、その頃にはNVIDIAはX100を、AMDはInstinct MI350あるいはMI400をリリースする頃であり、これらと戦えるのか少し疑問である。そろそろAMD/NVIDIAの最新製品をキャッチアップできないとまずいだろう
Falcon Shoresは連載710回で説明したが、Ponte Vecchioの後継となるAPUである。要するにx86コアとXeベースのGPUから構成され、しかもユニファイド・メモリーが実装される構成である。
XeコアベースのGPUと発表されていることから、GaudiのTPCやMMEが実装されるかどうかはかなり怪しい(普通に考えると実装されない)ことになる。もともとHabana Labsの製品はインテルのoneAPIとソフトウェアの互換性がなく、独自のSynapseAI SDKを利用してアプリケーションを構築することになっており、これはGaudi 3でも同じである。
インテルとしてはGaudiをoneAPIに統合するより、Gaudiのアーキテクチャーを廃してXeベースでAIを処理する方向に舵を切った、と考えるのだが妥当だろう。要するにGaudiは、あくまでXeベースのAIトレーニング向け製品が出るまでのピンチヒッターという役割だったことが、今回の発表で図らずしも明らかになった格好である。

この連載の記事
-
第852回
PC
Google最新TPU「Ironwood」は前世代比4.7倍の性能向上かつ160Wの低消費電力で圧倒的省エネを実現 -
第851回
PC
Instinct MI400/MI500登場でAI/HPC向けGPUはどう変わる? CoWoS-L採用の詳細も判明 AMD GPUロードマップ -
第850回
デジタル
Zen 6+Zen 6c、そしてZen 7へ! EPYCは256コアへ向かう AMD CPUロードマップ -
第849回
PC
d-MatrixのAIプロセッサーCorsairはNVIDIA GB200に匹敵する性能を600Wの消費電力で実現 -
第848回
PC
消えたTofinoの残響 Intel IPU E2200がつなぐイーサネットの未来 -
第847回
PC
国産プロセッサーのPEZY-SC4sが消費電力わずか212Wで高効率99.2%を記録! 次世代省電力チップの決定版に王手 -
第846回
PC
Eコア288基の次世代Xeon「Clearwater Forest」に見る効率設計の極意 インテル CPUロードマップ -
第845回
PC
最大256MB共有キャッシュ対応で大規模処理も快適! Cuzcoが実現する高性能・拡張自在なRISC-Vプロセッサーの秘密 -
第844回
PC
耐量子暗号対応でセキュリティ強化! IBMのPower11が叶えた高信頼性と高速AI推論 -
第843回
PC
NVIDIAとインテルの協業発表によりGB10のCPUをx86に置き換えた新世代AIチップが登場する? -
第842回
PC
双方向8Tbps伝送の次世代光インターコネクト! AyarLabsのTeraPHYがもたらす革新的光通信の詳細 - この連載の一覧へ





















