发生了什么
谷歌云指出,互联网已经连接了数十亿人和移动设备,如今正进入下一次重大技术转型:部署数百万自主AI智能体,与员工和终端用户协作。为此,谷歌云宣布为Gemini Enterprise新增FinOps控制,帮助组织管理项目级AI支出并消除“token冲击”。
智能体时代的规模给基础设施每一层都带来了新约束。AI工作负载架构难度大、资源密集且具有明显的突发性,容易造成扩展瓶颈以及计算资源的大规模闲置或误用。谷歌云在博客中提出了动态容量管理的最佳实践,即通过调度和利用策略,在单一灵活的基础上以可预测的成本和性能运行企业应用与AI应用。
动态容量管理有三种实现方式:使用Dynamic Workload Scheduler为计划事件调度容量;通过托管实例组(MIGs)为每个应用建立自动化的硬件回退清单;以及利用Google Kubernetes Engine(GKE)作为智能体原生环境,在单一自适应控制平面上自动化整个容量管理生命周期。
为什么重要
企业部署智能体的意愿强烈,但现有基础设施准备不足。数据显示,90%的企业希望在三年内部署智能体,而只有17%的IT领导者对当前IT设置能否承受负载有信心。智能体访问企业应用和数据库的规模往往远超人类用户的典型用量,这要求基础设施具备动态响应能力。
仅靠定制硬件如Axion处理器并不够,基础设施团队还需要更智慧地利用这些资源,解决执行效率问题,从而在整个技术栈中释放更多灵活性。将可预测需求的资源预留与不可预测需求的自动化响应结合起来,是克服基础设施约束的关键路径。
关键事实
谷歌云宣布为Gemini Enterprise推出新的FinOps控制,用于管理项目级AI支出并消除token冲击。
动态容量管理包括三种做法:计划事件容量调度、基于MIGs的回退计划,以及通过GKE自动化容量管理生命周期。
90%的企业希望在三年内部署智能体,但只有17%的IT领导者对当前基础设施应对负载有信心。
这些能力是对按需、Spot和承诺使用折扣(CUD)消费模式的补充。
接下来看什么
随着智能体规模持续扩大,企业将需要更精细的容量调度和自动化能力。谷歌云通过Dynamic Workload Scheduler、MIGs和GKE等工具,帮助组织在计划内需求与突发事件之间取得平衡。
未来,企业应审视自身基础设施是否具备动态调整能力,并将容量管理纳入整体AI战略,以避免资源浪费和性能瓶颈。
