무슨 일이 있었나

AWS가 Amazon Bedrock AgentCore Evaluations를 발표했다. 이 새로운 기능은 에이전트 평가를 에이전트가 구축된 프레임워크로부터 분리한다.

이 서비스는 에이전트가 LangGraph, LlamaIndex, OpenAI Agents SDK, Google ADK, Claude Agent SDK, 또는 Strands Agents를 사용하는지와 관계없이, OpenTelemetry 텔레메트리를 내보내는 모든 에이전트를 평가할 수 있다.

이번 발표는 이러한 프레임워크 비종속 계약이 어떻게 작동하는지 설명하며, 팀이 특정 에이전트 프레임워크에 묶이지 않고도 평가를 할 수 있게 해준다.

왜 중요한가

오늘날 에이전트 개발은 많은 프레임워크에 걸쳐 있으며, 평가 도구는 종종 단일 스택에 결합되어 있다. 표준 텔레메트리 계약에 의존함으로써 AgentCore Evaluations는 팀이 평가 파이프라인을 재구축하지 않고도 프레임워크를 비교하거나 전환할 수 있게 한다.

이 접근 방식은 평가를 에이전트 인프라의 보다 보편적인 계층으로 만들어, 평가를 단일 생태계에 고정하지 않고 프레임워크 전반에 걸쳐 모범 사례를 장려할 수 있다.

주요 사실

Amazon Bedrock AgentCore Evaluations는 에이전트 평가를 에이전트를 구축하는 데 사용된 프레임워크에서 분리한다.

이 서비스는 OpenTelemetry 텔레메트리를 내보내는 모든 에이전트를 평가할 수 있다.

지원되는 프레임워크에는 LangGraph, LlamaIndex, OpenAI Agents SDK, Google ADK, Claude Agent SDK, Strands Agents가 포함된다.

공식 게시물은 프레임워크 비종속 계약이 어떻게 작동하는지 설명한다.

다음에 주목할 점

OpenTelemetry 기반 평가 계약이 도구 공급업체 전반에 걸쳐 에이전트 관찰 가능성과 평가의 공통 표준이 될지 여부.

현재 프레임워크별 평가 유틸리티에 의존하는 팀들이 AgentCore Evaluations를 얼마나 폭넓게 채택할지.

출처