跳至正文

机器翻译。英文版本为权威来源,母语审校尚未完成。

产品 · 评估与沙盒

在此衡量并把关 Agent 质量

评估是对 Agent 输出质量、回归与漂移进行评分的界面——也是在版本发布前对其把关的地方。框架、评分卡与控制台均已存在且已接入,使其在真实流量上真正生效的部分也已接入。负责采样的会话来源适配器,以及为沙盒有序会话回放提供历史的适配器,均无需操作员配置,始终在进程内接入。不过,回放绝不会伪造输入:若会话没有可重建的时间线,系统会报告回放降级,而不会虚构输入。

它能做什么

一套 Agent 质量框架

输出质量监控、回归测试与隔离沙盒——在变更前后对 Agent 行为进行评分的地方。

评分卡与输出质量监控

依据您定义的检查项对 Agent 输出评分,并持续观察质量变化。框架、评分卡与控制台均已接入;一旦连接会话来源,它们所衡量的内容便会真正生效。

回归测试与提示词 A/B

针对一次变更重新运行测试套件,在其上线前捕获回归;并在相同输入上对比提示词变体 A 与 B——让变更基于证据而非直觉来判断。

漂移检测

检测 Agent 输出随时间偏离其预期基线的情况,让质量下滑被主动暴露,而非在生产环境中才被发现。

隔离沙盒

一个用于部署前后对比并支持会话回放的隔离测试环境。两部分均已接入:该环境,以及回放据以重建会话的有序历史来源。

真实现状

框架、控制台、实时采样与有序回放均已接入

这个界面是产品中接缝最多的部分,因此我们直言不讳——这份坦诚本身就是一项特性,而非一句致歉:

  • 已上线:评估框架、评分卡、控制台、回归运行、提示词 A/B 与漂移检测均已构建并接入,沙盒则是用于部署前后对比的隔离环境。
  • 已上线,但有明确限制:评估采样通过已接入的会话来源读取可配置时效窗口内的真实会话;沙盒回放则从会话历史中重建其有序操作序列。限制在于无内容可读时的处理方式——没有可重建时间线的会话会产生步骤数为 0 的降级回放;超过可回放上限的时间线会被整段拒绝,而不是只回放一部分。两种情况都不会用虚构输入来填补。
  • 安全态势:自适应红队引擎属于 v1 之后的版本。对于 v1,我们以补偿性控制措施记录安全态势,而不夸大一个尚未到位的引擎。

评估与沙盒——常见问题

我今天能针对自己的真实 Agent 流量运行评估吗?

可以。负责采样的会话来源无需操作员配置,始终在进程内接入,因此监控运行会采样真实会话而非预置数据,并限定在可配置的时效窗口内,以保持样本新鲜且有界。本页截图仍展示预置示例数据,因为它们只是静态捕获,并非某个 tenant 的实时画面。

沙盒中的会话回放可用吗?

可以,而且它是确定性的:回放从历史中重建会话的有序工具与 MCP 操作序列,并针对您提供的 mock 重新执行,因此同一会话配合同一组 mock 始终产生相同输出。两项限制也会如实说明:没有可重建时间线的会话会被报告为步骤数为 0 的降级回放;超过可回放上限的时间线会被整段拒绝,而不是只回放一部分。

是否有自动化红队引擎?

v1 中没有。自适应红队引擎属于 v1 之后的版本。对于 v1,我们以补偿性控制措施记录安全态势,而不暗示一个尚未构建的自适应引擎。

那么眼下究竟有哪些是真正可用的?

目前可用的是评估框架与控制台——评分卡、回归运行、提示词 A/B 与漂移检测——以及用于部署前后对比的隔离沙盒、采样真实会话的已接入会话来源,还有从会话历史中重建的有序回放。这里衡量并把关 Agent 质量与回归。仍属于 v1 之后的只有自适应红队引擎,本页已在相应位置如实说明。

看看 Agent 质量在哪里被把关

在您自己的基础设施上部署 Olivares,探索评估框架与沙盒——评分卡、回归测试、部署前后对比、实时会话采样,以及从会话历史中重建的有序回放。