Продукт · Evals и песочница
Где измеряется и контролируется качество агентов
Evals — это раздел, где оцениваются качество вывода агентов, регрессии и дрейф и где релиз можно заблокировать до выхода. Фреймворк, оценочные карты и консоль существуют и подключены; оба адаптера — источник сессий для выборки и источник истории для упорядоченного воспроизведения в песочнице — всегда подключены внутри процесса без настройки со стороны оператора. Воспроизведение НЕ выдумывает входные данные: сессия без восстанавливаемой временной шкалы даёт деградированное воспроизведение; входные данные не фабрикуются.
Что это даёт
Фреймворк для качества агентов
Мониторинг качества вывода, регрессионное тестирование и изолированная песочница — место, где поведение агента оценивается до и после изменения.
Оценочные карты и мониторинг качества вывода
Оценивайте вывод агента по заданным вами проверкам и наблюдайте за качеством во времени. Фреймворк, оценочные карты и консоль подключены; то, что они измеряют, станет реальным, как только будет подключён источник сессий.
Регрессионное тестирование и A/B-сравнение промптов
Перезапускайте набор тестов на изменении, чтобы поймать регрессии до выхода релиза, и сравнивайте варианты промптов A и B на одних и тех же входных данных — так изменение оценивается по фактам, а не по интуиции.
Обнаружение дрейфа
Определяйте, когда вывод агента со временем отклоняется от ожидаемого базового уровня, чтобы деградация качества выявлялась, а не обнаруживалась уже в продакшене.
Изолированная песочница
Изолированная тестовая среда для сравнения до и после развёртывания, с воспроизведением сессий. Подключено и то и другое: среда и источник упорядоченной истории, из которого воспроизведение реконструирует сессию.
Что реально
Фреймворк, консоль, выборка реальных сессий и упорядоченное воспроизведение — всё подключено
Эта поверхность — самая «швовая» в продукте, поэтому мы говорим о ней без обиняков: честность здесь и есть функция, а не оправдание:
- Работает: фреймворк evals, оценочные карты, консоль, прогоны регрессий, A/B-сравнение промптов и обнаружение дрейфа созданы и подключены, а песочница — это изолированная среда для сравнения до и после развёртывания.
- Работает, с явно указанным ограничением: выборка evals читает реальные сессии через подключённый источник сессий в пределах настраиваемого окна актуальности, а воспроизведение в песочнице реконструирует из истории упорядоченную последовательность действий сессии. Ограничение проявляется, когда читать нечего: сессия без восстанавливаемой временной шкалы даёт деградированное воспроизведение с нулём шагов, а временная шкала длиннее допустимого предела отклоняется целиком, а не воспроизводится частично. Ни в одном случае входные данные не выдумываются.
- Безопасность: движок адаптивного red-teaming появится после v1. Для v1 мы описываем позицию по безопасности с компенсирующими мерами контроля, а не преувеличиваем возможности движка, которого пока нет.
Evals и песочница — вопросы
Можно ли сегодня запускать evals на реальном трафике моего агента?
Да. Источник сессий для выборки подключён внутри процесса без настройки со стороны оператора, поэтому прогоны мониторинга отбирают реальные сессии, а не подготовленные демонстрационные данные, — в пределах настраиваемого окна актуальности, которое сохраняет выборку свежей и ограниченной. Снимки экрана на этой странице по-прежнему заполнены подготовленными демонстрационными данными, поскольку это снимки, а не экран работающего tenant.
Работает ли воспроизведение сессий в песочнице?
Да, и воспроизведение детерминировано: оно реконструирует из истории упорядоченную последовательность действий инструментов и MCP в сессии и повторно выполняет её на предоставленных вами моках, поэтому одна и та же сессия с теми же моками всегда даёт одинаковые результаты. Два ограничения заявлены явно: сессия без восстанавливаемой временной шкалы помечается как деградированная с нулём шагов, а временная шкала выше допустимого предела отклоняется целиком, а не воспроизводится частично.
Есть ли автоматизированный движок red-teaming?
В v1 нет. Движок адаптивного red-teaming появится после v1. Для v1 мы описываем подход к безопасности с компенсирующими мерами контроля, а не заявляем о наличии адаптивного движка, который ещё не создан.
Так что же реально можно использовать прямо сейчас?
Фреймворк evals и консоль — оценочные карты, прогоны регрессий, A/B-сравнение промптов и обнаружение дрейфа — плюс изолированная песочница для сравнения до и после развёртывания, подключённый источник сессий, который делает выборку реальных сессий, и упорядоченное воспроизведение, реконструированное из истории сессий. Здесь измеряются и контролируются качество агентов и регрессии. После v1 появится только движок адаптивного red-teaming, и эта страница прямо говорит об этом в соответствующем месте.
Посмотрите, где контролируется качество агентов
Разверните Olivares на собственной инфраструктуре и изучите фреймворк evals и песочницу — оценочные карты, регрессионное тестирование, сравнение до и после развёртывания, живую выборку сессий и упорядоченное воспроизведение, реконструированное из истории сессий.