何が起きたか
NVIDIAは、同社のVera Rubin NVL72システムがMLPerf Inference v6.1でのデビューにおいて業界をリードする性能を発揮したと発表した。
同社はこの結果を、AI推論の経済性を左右するとする3つのレバー、すなわちシステム性能、効率的なインフラのスケーリング、継続的なソフトウェア最適化を軸に位置づけた。
なぜ重要か
NVIDIAのこの位置づけは、推論の経済性が単なる処理速度だけでなく、ハードウェアを追加した際にスループットがどれだけうまくスケールするか、そしてソフトウェアの更新が既存のインフラからどれだけの価値を引き出すかによって判断されることを示唆している。
同社が主張するように、システム性能の向上がより多くのトークン生成につながるのであれば、この種のベンチマーク結果は純粋に技術的な指標ではなく、収益に直接つながる要素として提示されていることになる。
主な事実
NVIDIAのVera Rubin NVL72は、MLPerf Inference v6.1でのデビューで業界をリードする性能を発揮した。
NVIDIAは、システム性能、効率的なインフラのスケーリング、継続的なソフトウェア最適化を、AI推論の経済性の主要なレバーとして挙げている。
NVIDIAによれば、システム性能の向上はより多くのトークン生成、ひいてはより高い収益を意味する。
NVIDIAは、効率的なスケーリングとは、ハードウェアの追加に応じてスループットが比例的に増加し、大規模にユーザーへサービスを提供する際により少ないリソースで済むことを意味すると述べている。
NVIDIAは、継続的な最適化をインフラ投資からより多くの価値を生み出すものと説明している。
今後の注目点
NVIDIAが説明する推論の経済性、すなわち性能、スケーリングの効率、ソフトウェア最適化が、今後のMLPerfの各ラウンドでどのように測定され比較されていくか。
