何が起きたか

AWS Machine Learningは、2つの30B Mixture-of-Expertsモデル(Qwen3-Coder-30BとNVIDIA Nemotron-3-Nano-30B)を、Amazon SageMaker AI上のG5、G6、G6e、G7の各GPUインスタンスにわたって比較するベンチマークを公開した。

このベンチマークはリアルタイムのLLM推論についてスループット、レイテンシ、トークンあたりのコストを測定し、G7のNVIDIA Blackwell GPUが測定可能な価格性能の改善をもたらす様子を明らかにした。

なぜ重要か

組織が大規模言語モデルを展開するにあたり、性能とコストのバランスをとるうえで適切なGPUインスタンスの選択は極めて重要である。このベンチマークは、リアルタイム推論のワークロードを最適化するためのデータに基づく指針を提供する。

この結果は、より新しいBlackwellベースのインスタンス(G7)がより優れた価格性能を提供でき、高スループットなLLMアプリケーションの総所有コスト(TCO)を引き下げる可能性があることを示唆している。

主なポイント

ベンチマークではQwen3-Coder-30BとNVIDIA Nemotron-3-Nano-30Bを比較しており、いずれも30BのMixture-of-Expertsモデルである。

テストされたインスタンスは、Amazon SageMaker AI上のG5、G6、G6e、G7である。

指標はスループット、レイテンシ、トークンあたりのコスト。

G7インスタンスはNVIDIA Blackwell GPUを使用しており、測定可能な価格性能の向上を示している。

今後の注目点

今後のベンチマークは他のモデルサイズやアーキテクチャにも拡大し、インスタンス選択に関するより幅広い指針を提供する可能性がある。

Blackwell GPUがより広く利用可能になるにつれて、さまざまなAIワークロードやデプロイのシナリオにわたる比較が増えると予想される。

出典