Перейти до вмісту

Машинний переклад. Авторитетним джерелом є англійська версія; перевірка носієм мови ще не виконана.

Продукт · Оцінювання та пісочниця

Де якість агентів вимірюється й проходить контроль перед релізом

Оцінювання — це розділ, де якість виводу агентів, регресії та дрейф отримують оцінку і де реліз можна заблокувати ще до випуску. Фреймворк, оціночні картки та консоль існують і під’єднані; обидва адаптери — джерело сесій для відбору та джерело історії для впорядкованого відтворення в пісочниці — завжди під’єднані всередині процесу без налаштування оператором. Відтворення НЕ вигадує вхідні дані: сесія без часової шкали, яку можна реконструювати, дає деградоване відтворення; вхідні дані не фабрикуються.

Що це робить

Фреймворк для якості агентів

Моніторинг якості виводу, регресійне тестування та ізольована пісочниця — місце, де поведінка агентів оцінюється до й після зміни.

Оціночні картки та моніторинг якості виводу

Оцінюйте вивід агентів за визначеними вами перевірками та спостерігайте за якістю в часі. Фреймворк, оціночні картки та консоль під’єднані; те, що вони вимірюють, стане реальним, щойно буде підключено джерело сесій.

Регресійне тестування та A/B-тестування промптів

Повторно прогоняйте набір тестів проти зміни, щоб виявити регресії ще до релізу, та порівнюйте варіанти промптів A і B на тих самих вхідних даних — щоб зміна оцінювалася за доказами, а не за інтуїцією.

Виявлення дрейфу

Виявляйте, коли вивід агентів із часом дрейфує від очікуваної базової лінії, щоб ерозія якості виявлялася завчасно, а не виявлялась у продакшені.

Ізольована пісочниця

Ізольоване тестове середовище для порівняння до й після розгортання, з відтворенням сесій. Під’єднано обидва компоненти: середовище та джерело впорядкованої історії, з якого відтворення реконструює сесію.

Що реальне

Фреймворк, консоль, відбір реальних сесій і впорядковане відтворення — усе під’єднано

Ця поверхня має найбільше «швів» у продукті, тож ми говоримо про неї прямо — чесність тут є особливістю, а не вибаченням:

  • Працює: фреймворк оцінювання, оціночні картки, консоль, регресійні прогони, A/B-тестування промптів і виявлення дрейфу побудовані й під’єднані, а пісочниця є ізольованим середовищем для порівняння до й після розгортання.
  • Працює, із чітко вказаним обмеженням: відбір для оцінювання читає реальні сесії через під’єднане джерело сесій у межах налаштовуваного вікна актуальності, а відтворення в пісочниці реконструює з історії впорядковану послідовність дій сесії. Обмеження проявляється, коли читати нічого: сесія без часової шкали, яку можна реконструювати, дає деградоване відтворення з нулем кроків, а часова шкала, довша за допустиму межу, відхиляється цілком, а не відтворюється частково. У жодному разі вхідні дані не вигадуються.
  • Позиція: адаптивна система red-teaming — це після v1. Для v1 ми документуємо позицію з компенсаційними засобами контролю, а не перебільшуємо систему, якої ще немає.

Оцінювання та пісочниця — запитання

Чи можу я запускати оцінювання проти реального трафіку моїх агентів уже сьогодні?

Так. Джерело сесій для відбору під’єднане всередині процесу без налаштування оператором, тому прогони моніторингу відбирають реальні сесії, а не засіяні дані, — у межах налаштовуваного вікна актуальності, яке зберігає вибірку свіжою та обмеженою. Знімки екрана на цій сторінці й далі показують засіяні приклади даних, адже це знімки, а не екран активного tenant.

Чи працює відтворення сесій у пісочниці?

Так, і відтворення детерміноване: воно реконструює з історії впорядковану послідовність дій інструментів і MCP у сесії та повторно виконує її на наданих вами моках, тому та сама сесія з тими самими моками завжди дає однакові результати. Два обмеження вказано прямо: сесія без часової шкали, яку можна реконструювати, позначається як деградована з нулем кроків, а часова шкала понад допустиму межу відхиляється цілком, а не відтворюється частково.

Чи є автоматизована система red-teaming?

У v1 немає. Адаптивна система red-teaming — це після v1. Для v1 ми документуємо безпекову позицію з компенсаційними засобами контролю, а не натякаємо на адаптивну систему, яку ще не побудовано.

То що ж насправді придатне до використання просто зараз?

Фреймворк і консоль оцінювання — оціночні картки, регресійні прогони, A/B-тестування промптів і виявлення дрейфу — а також ізольована пісочниця для порівняння до й після розгортання, під’єднане джерело сесій, що відбирає реальні сесії, і впорядковане відтворення, реконструйоване з історії сесій. Тут якість агентів і регресії вимірюються й проходять контроль перед релізом. Після v1 залишається лише адаптивна система red-teaming, і ця сторінка прямо зазначає це там, де належить.

Подивіться, де якість агентів проходить контроль перед релізом

Розгорніть Olivares на власній інфраструктурі та дослідіть фреймворк оцінювання й пісочницю — оціночні картки, регресійне тестування, порівняння до й після розгортання, живий відбір сесій і впорядковане відтворення, реконструйоване з історії сесій.