ロードマップでわかる!当世プロセッサー事情 第893回
インテル製GPU「Crescent Island」の正体、容量480GBメモリーでエージェント型AIとKVキャッシュ問題に挑む
2026年09月14日 12時00分更新
単体480GBメモリーで勝負するエージェント型AIとKVキャッシュの最適化
Crescent Islandのターゲットアプリケーションをまとめたのが下の画像だが、このSoftware Featuresの"KV cache efficiency"がすべてを物語っていると考えていい。
Silicon Featuresの最後には"Prefill optimized"とあり、実際にプリフィルでも活躍できるだろうが、本領はむしろデコードにありそうな気がする。もっとも、使い方はNVIDIAと異なるかもしれない
KVキャッシュの話は連載871回で一度説明しているが、エージェント型AIではプリフィルとデコードで処理を分ける。この際にデコード側では処理の効率化のためにKVキャッシュと呼ばれるものを構築するのが効果的なのだが、問題は昨今のLLMを使うとこのKVキャッシュが肥大化し、GPUのメモリーを食い尽くしてしまうことにある。
NVIDIAが突如としてGroq LPUを採用したのは、デコードの方はKVキャッシュのメモリーアクセスが性能に支配的であり、演算性能そのものは遊びまくっていて、NVIDIAのGPUでは効率が悪すぎたことに起因する。
逆にGroq LPUは演算性能こそ低いがメモリー帯域とメモリー搭載量がNVIDIAのGPUを凌駕しており、プリフィルをNVIDIAのGPU、デコードをGroq LPUと役割分担させることで、実効効率を最大化できるからである。
そしてCrescent Islandは(前ページ最初の画像にある脚注にも書いたが)このGroq LPUにあたる処理をターゲットにしているように見える。もっと正確に言えば、インテルはCrescent Islandでプリフィルとデコードの両方を分離せずに実行させるように見える。
理由は? というと、Crescent Islandには広帯域なスケールアップ・ネットワーク用のI/Fがない。PCIe Gen5 x16経由でKVキャッシュを他のカードと共有するのは帯域的に非現実的である。
そしてエージェント型AIではプリフィルこそ演算性能がモノを言うが、処理時間の大半を占めるデコードはメモリー帯域とメモリー容量がモノを言う。帯域だけならHBMの方が有利だが、ここであふれるとその先が遅くなる。
Crescent Islandは帯域はHBMにおよばないが、480GBの容量はKVキャッシュを丸ごと収めるのに十分であり、そして自分のローカルメモリーにKVキャッシュが全部収まってるなら他のノードにアクセスする必要もない。NVIDIAとはまた別の方法でエージェント型AIに最適化を図ったわけだ。
下の画像がメモリー容量に関する利点をまとめたものだ。同じモデルなら多くのセッションを処理できるし、同じモデルでより長いセッションを実施できる。
最近はKVキャッシュの圧縮などがいろいろ話題になっているが、これもちょっとしたことで精度が猛烈に落ちたりするので、なかなか難しい。FP8のままウエイトとKVキャッシュを収められるというのは確かに大きな売りである
NVIDIAではメモリーがあふれるので複数枚のGPUを連携させる必要があるところを、Crescent Islandでは1枚で実行できる。実行できるというよりも、1枚で実行する事にフォーカスした、というのが正確かもしれない。
今回は性能評価などは当然示されていないが、同じコストあるいは同じ消費電力枠で言えば、NVIDIAやAMDのソリューションよりも効率良くエージェント型AIを実行できる可能性は高い。問題は480GBが本当に将来のモデルでも十分か? というあたりであろう。
ただこうなると、ますますSambaNova SN50とどう棲み分けするのかが謎になってきたというべきか。発表の際にはこのあたりが明確になるとうれしい。
本記事はアフィリエイトプログラムによる収益を得ている場合があります

この連載の記事
-
第892回
PC
Hot Chipsで明かされた「Wildcat Lake」の全貌 Foverosを捨てMCPを選んだインテルの舞台裏 -
第891回
PC
謎多き次世代Xeon「Diamond Rapids」を解剖、3D Meshの進化と新命令セットAPXがもたらす変革 -
第890回
PC
Samsung「SF2P」の全貌! GAA最大の弱点であるPMOS性能低下を克服し、TSMC追撃へ準備万端 -
第889回
PC
なぜ巨大チップは歪んで壊れるのか? SK HynixのHBM4「MR-MUF」とTSMCのCoWoS-Lを襲う熱膨張の罠 -
第888回
PC
NVIDIA Rubin Ultra開発中止の真相! 180層CoWoS-Lの歪曲トラブルと、急造ラックNVL576に透ける苦肉の策 -
第887回
PC
AIなしではもはや限界 TSMCが明かすメモリー開発にAIが不可欠となった現実 -
第886回
PC
CFETの足を引っ張るPMOSを救え! imecが提案する新絶縁層と、あえて精度を緩める「Notch Alignment」の妙手 -
第885回
PC
TSMCも次世代「CFET」の全貌を披露! Forksheetスキップの背景と、世界最小6T SRAM実証で見えた2030年への布石 -
第884回
PC
Samsungが次世代CFETの試作に成功! IBMの10万ドル方式に対抗する、量産重視な「一括形成プロセス」のリアリティ -
第883回
PC
TSMCのA16プロセスの詳細が判明! 性能向上の主因はトランジスタではなく裏面電源供給(SPR)にあり? - この連載の一覧へ











