发生了什么
AWS 在 SageMaker AI 上对两款 30B 参数的混合专家(MoE)模型——Qwen3-Coder-30B 和 NVIDIA Nemotron-3-Nano-30B——进行了基准测试,比较了 G5、G6、G6e 和 G7 四种 GPU 实例类型。
测试重点衡量了吞吐量、延迟和每 token 成本,以评估不同实例在实时 LLM 推理场景中的表现。
结果显示,搭载 NVIDIA Blackwell GPU 的 G7 实例在价格性能比上具有可衡量的优势。
为什么重要
对于需要实时响应的 AI 应用,推理成本和速度直接影响用户体验和运营开支,因此实例选型至关重要。
G7 实例的 Blackwell GPU 带来的性能提升,可能帮助企业在不增加预算的情况下处理更多请求,或降低每 token 的推理成本。
该基准测试为开发者和架构师在选择 SageMaker AI 实例时提供了数据参考,尤其是在部署中小型 MoE 模型时。
关键事实
测试模型为 Qwen3-Coder-30B 和 NVIDIA Nemotron-3-Nano-30B,均为 30B 参数的 MoE 模型。
实例类型包括 G5、G6、G6e 和 G7,其中 G7 采用 NVIDIA Blackwell GPU。
比较指标包括吞吐量、延迟和每 token 成本。
接下来看什么
后续是否会有更多针对不同规模模型(如 70B 或更大)的基准测试,以验证 G7 的优势是否普遍适用。
G7 实例在真实生产环境中的表现,以及 AWS 是否会推出更多基于 Blackwell 的实例选项。
