Перейти к содержимому

Машинный перевод. Авторитетным источником является английская версия; проверка носителем языка ещё не выполнена.

Продукт · Evals и песочница

Где измеряется и контролируется качество агентов

Evals — это раздел, где оцениваются качество вывода агентов, регрессии и дрейф и где релиз можно заблокировать до выхода. Фреймворк, оценочные карты и консоль существуют и подключены; оба адаптера — источник сессий для выборки и источник истории для упорядоченного воспроизведения в песочнице — всегда подключены внутри процесса без настройки со стороны оператора. Воспроизведение НЕ выдумывает входные данные: сессия без восстанавливаемой временной шкалы даёт деградированное воспроизведение; входные данные не фабрикуются.

Что это даёт

Фреймворк для качества агентов

Мониторинг качества вывода, регрессионное тестирование и изолированная песочница — место, где поведение агента оценивается до и после изменения.

Оценочные карты и мониторинг качества вывода

Оценивайте вывод агента по заданным вами проверкам и наблюдайте за качеством во времени. Фреймворк, оценочные карты и консоль подключены; то, что они измеряют, станет реальным, как только будет подключён источник сессий.

Регрессионное тестирование и A/B-сравнение промптов

Перезапускайте набор тестов на изменении, чтобы поймать регрессии до выхода релиза, и сравнивайте варианты промптов A и B на одних и тех же входных данных — так изменение оценивается по фактам, а не по интуиции.

Обнаружение дрейфа

Определяйте, когда вывод агента со временем отклоняется от ожидаемого базового уровня, чтобы деградация качества выявлялась, а не обнаруживалась уже в продакшене.

Изолированная песочница

Изолированная тестовая среда для сравнения до и после развёртывания, с воспроизведением сессий. Подключено и то и другое: среда и источник упорядоченной истории, из которого воспроизведение реконструирует сессию.

Что реально

Фреймворк, консоль, выборка реальных сессий и упорядоченное воспроизведение — всё подключено

Эта поверхность — самая «швовая» в продукте, поэтому мы говорим о ней без обиняков: честность здесь и есть функция, а не оправдание:

  • Работает: фреймворк evals, оценочные карты, консоль, прогоны регрессий, A/B-сравнение промптов и обнаружение дрейфа созданы и подключены, а песочница — это изолированная среда для сравнения до и после развёртывания.
  • Работает, с явно указанным ограничением: выборка evals читает реальные сессии через подключённый источник сессий в пределах настраиваемого окна актуальности, а воспроизведение в песочнице реконструирует из истории упорядоченную последовательность действий сессии. Ограничение проявляется, когда читать нечего: сессия без восстанавливаемой временной шкалы даёт деградированное воспроизведение с нулём шагов, а временная шкала длиннее допустимого предела отклоняется целиком, а не воспроизводится частично. Ни в одном случае входные данные не выдумываются.
  • Безопасность: движок адаптивного red-teaming появится после v1. Для v1 мы описываем позицию по безопасности с компенсирующими мерами контроля, а не преувеличиваем возможности движка, которого пока нет.

Evals и песочница — вопросы

Можно ли сегодня запускать evals на реальном трафике моего агента?

Да. Источник сессий для выборки подключён внутри процесса без настройки со стороны оператора, поэтому прогоны мониторинга отбирают реальные сессии, а не подготовленные демонстрационные данные, — в пределах настраиваемого окна актуальности, которое сохраняет выборку свежей и ограниченной. Снимки экрана на этой странице по-прежнему заполнены подготовленными демонстрационными данными, поскольку это снимки, а не экран работающего tenant.

Работает ли воспроизведение сессий в песочнице?

Да, и воспроизведение детерминировано: оно реконструирует из истории упорядоченную последовательность действий инструментов и MCP в сессии и повторно выполняет её на предоставленных вами моках, поэтому одна и та же сессия с теми же моками всегда даёт одинаковые результаты. Два ограничения заявлены явно: сессия без восстанавливаемой временной шкалы помечается как деградированная с нулём шагов, а временная шкала выше допустимого предела отклоняется целиком, а не воспроизводится частично.

Есть ли автоматизированный движок red-teaming?

В v1 нет. Движок адаптивного red-teaming появится после v1. Для v1 мы описываем подход к безопасности с компенсирующими мерами контроля, а не заявляем о наличии адаптивного движка, который ещё не создан.

Так что же реально можно использовать прямо сейчас?

Фреймворк evals и консоль — оценочные карты, прогоны регрессий, A/B-сравнение промптов и обнаружение дрейфа — плюс изолированная песочница для сравнения до и после развёртывания, подключённый источник сессий, который делает выборку реальных сессий, и упорядоченное воспроизведение, реконструированное из истории сессий. Здесь измеряются и контролируются качество агентов и регрессии. После v1 появится только движок адаптивного red-teaming, и эта страница прямо говорит об этом в соответствующем месте.

Посмотрите, где контролируется качество агентов

Разверните Olivares на собственной инфраструктуре и изучите фреймворк evals и песочницу — оценочные карты, регрессионное тестирование, сравнение до и после развёртывания, живую выборку сессий и упорядоченное воспроизведение, реконструированное из истории сессий.