무슨 일이 있었나
Google Cloud는 조직이 프로젝트 수준의 AI 지출을 추적하고 토큰 쇼크를 방지할 수 있도록 Gemini Enterprise용 새로운 FinOps 제어 기능을 발표했습니다.
또한 예약 용량, 자동화된 장애 조치 계획, Google Kubernetes Engine을 통한 오케스트레이션을 포함한 동적 용량 관리 모범 사례를 자세히 설명했습니다.
이 지침은 예측 가능한 수요를 위한 리소스 예약과 예상치 못한 수요 급증을 처리하는 자동화를 결합하는 것을 강조합니다.
왜 중요한가
에이전트 워크로드는 리소스를 많이 사용하고 수요가 급증하는 특성이 있으므로 정적 인프라로는 확장 병목이나 컴퓨팅 과소 활용이 빠르게 발생할 수 있습니다.
현재 인프라로 에이전트 배포를 처리할 수 있다고 확신하는 IT 리더는 17%에 불과하며, 동적 용량 관리는 기업 도입에 필수 요소가 되고 있습니다.
하드웨어만으로는 충분하지 않기 때문에 팀은 인프라 투자에서 더 많은 가치를 얻기 위한 스케줄링 및 자동화 전략이 필요합니다.
핵심 사실
90%의 기업이 향후 3년 내에 에이전트를 배포하기를 원합니다.
Dynamic Workload Scheduler는 예정된 이벤트를 위한 캘린더 모드와 시작 시간이 유연한 배치 작업을 위한 flex-start 모드를 제공합니다.
관리형 인스턴스 그룹은 서비스 연속성을 위해 자동화된 우선순위별 하드웨어 대체 목록을 지원합니다.
Google Kubernetes Engine은 Custom ComputeClasses와 동적 리소스 할당을 사용하여 에이전트 네이티브 환경을 제공합니다.
다음에 주목할 점
조직이 AI 지출을 관리하고 토큰 쇼크를 없애기 위해 노력함에 따라 Gemini Enterprise용 새로운 FinOps 제어 기능의 채택이 주목됩니다.
기업이 에이전트 배포 확장에 따라 성능을 유지하기 위해 사전 예약 용량과 적응형 자동화를 결합할지 여부가 관건입니다.
