제품 · 평가 및 샌드박스
에이전트 품질을 측정하고 게이팅하는 곳
평가(Evals)는 에이전트 출력 품질, 회귀, 드리프트를 채점하고 배포 전에 릴리스를 게이팅할 수 있는 영역입니다. 프레임워크, 스코어카드, 콘솔은 존재하며 연결되어 있고, 실제 트래픽에서 이를 유의미하게 만드는 부분도 마찬가지입니다. 샘플링을 뒷받침하는 세션 소스와 순서 기반 세션 리플레이를 뒷받침하는 히스토리 소스의 두 어댑터는 운영자 설정 없이 프로세스 내에 항상 연결되어 있습니다. 단, 리플레이가 입력을 지어내지는 않습니다. 재구성 가능한 타임라인이 없는 세션에서는 입력을 만들어 내는 대신 리플레이를 저하 상태로 보고합니다.
기능 개요
에이전트 품질을 위한 프레임워크
출력 품질 모니터링, 회귀 테스트, 격리된 샌드박스 — 변경 전후로 에이전트 동작을 채점하는 공간입니다.
스코어카드 및 출력 품질 모니터링
직접 정의한 검사 기준에 따라 에이전트 출력을 채점하고 시간 경과에 따른 품질을 관찰합니다. 프레임워크, 스코어카드, 콘솔은 연결되어 있으며, 세션 소스가 연결되면 측정되는 내용이 실제 데이터에 반영되기 시작합니다.
회귀 테스트 및 프롬프트 A/B
변경 사항에 대해 테스트 스위트를 재실행하여 배포 전에 회귀를 포착하고, 동일한 입력에서 프롬프트 변형 A와 B를 비교합니다 — 변경을 직관이 아닌 근거로 판단하기 위함입니다.
드리프트 감지
에이전트 출력이 시간 경과에 따라 예상 기준선에서 벗어나는 시점을 감지하여, 품질 저하를 프로덕션에서 발견하는 대신 사전에 드러냅니다.
격리된 샌드박스
세션 리플레이를 지원하는, 배포 전후 비교를 위한 격리된 테스트 환경입니다. 환경과 리플레이가 세션을 재구성할 때 사용하는 순서 기반 히스토리 소스 모두 연결되어 있습니다.
실제로 구현된 것
프레임워크, 콘솔, 라이브 샘플링, 순서 기반 리플레이가 모두 연결되어 있습니다
이 영역은 제품에서 가장 이음새가 많은 부분이므로, 솔직하게 말씀드립니다 — 이 정직함은 변명이 아니라 하나의 기능입니다:
- 라이브: 평가 프레임워크, 스코어카드, 콘솔, 회귀 실행, 프롬프트 A/B, 드리프트 감지가 구축되어 연결되어 있으며, 샌드박스는 배포 전후 비교를 위한 격리된 환경입니다.
- 라이브(명시된 제한 있음): 평가 샘플링은 연결된 세션 소스를 통해 설정 가능한 최근 시간 범위에 속하는 실제 세션을 읽고, 샌드박스 리플레이는 히스토리에서 세션의 순서 기반 액션 시퀀스를 재구성합니다. 제한은 읽을 내용이 없을 때의 동작입니다. 재구성 가능한 타임라인이 없는 세션은 리플레이 결과가 0단계의 저하 상태로 보고되며, 리플레이 허용 한도를 넘는 타임라인은 일부만 리플레이하지 않고 전체가 거부됩니다. 두 경우 모두 꾸며 낸 입력으로 채우지 않습니다.
- 보안 태세: 적응형 레드티밍 엔진은 v1 이후 단계입니다. v1에서는 아직 존재하지 않는 엔진을 과장하기보다, 보완 통제를 통해 보안 태세를 문서화합니다.
평가 및 샌드박스 — 자주 묻는 질문
현재 실제 에이전트 트래픽에 대해 평가를 실행할 수 있나요?
예. 샘플링을 뒷받침하는 세션 소스는 운영자 설정 없이 프로세스 내에 항상 연결되어 있으므로, 모니터링 실행은 시드 데이터가 아니라 실제 세션을 설정 가능한 최근 시간 범위 내에서 샘플링하여 샘플을 최신 상태로 유지하고 범위를 제한합니다. 이 페이지의 스크린샷은 실제 운영 중인 tenant 화면이 아닌 캡처이므로 여전히 시드된 예시 데이터를 보여 줍니다.
샌드박스에서 세션 리플레이가 작동하나요?
예. 또한 결정론적으로 작동합니다. 리플레이는 히스토리에서 세션의 순서 기반 도구 및 MCP 액션 시퀀스를 재구성하고 사용자가 제공한 모의 객체(mock)에 대해 다시 실행하므로, 동일한 세션과 동일한 mock은 항상 동일한 출력을 냅니다. 두 가지 제한도 숨기지 않고 명시합니다. 재구성 가능한 타임라인이 없는 세션은 리플레이 결과가 0단계의 저하 상태로 보고되며, 리플레이 허용 한도를 넘는 타임라인은 일부만 리플레이하지 않고 전체가 거부됩니다.
자동화된 레드티밍 엔진이 있나요?
v1에는 없습니다. 적응형 레드티밍 엔진은 v1 이후 단계입니다. v1에서는 아직 구축되지 않은 적응형 엔진을 암시하기보다, 보완 통제를 통해 보안 태세를 문서화합니다.
그렇다면 지금 실제로 사용할 수 있는 것은 무엇인가요?
평가 프레임워크와 콘솔 — 스코어카드, 회귀 실행, 프롬프트 A/B, 드리프트 감지 — 에 더해, 배포 전후 비교용 격리 샌드박스, 실제 세션을 샘플링하는 연결된 세션 소스, 세션 히스토리에서 재구성하는 순서 기반 리플레이를 지금 사용할 수 있습니다. 이곳에서 에이전트 품질과 회귀를 측정하고 게이팅합니다. 아직 v1 이후 단계인 것은 적응형 레드티밍 엔진뿐이며, 이 페이지는 해당 섹션에서 이를 분명히 밝힙니다.