Продукт · Оцінювання та пісочниця
Де якість агентів вимірюється й проходить контроль перед релізом
Оцінювання — це розділ, де якість виводу агентів, регресії та дрейф отримують оцінку і де реліз можна заблокувати ще до випуску. Фреймворк, оціночні картки та консоль існують і під’єднані; обидва адаптери — джерело сесій для відбору та джерело історії для впорядкованого відтворення в пісочниці — завжди під’єднані всередині процесу без налаштування оператором. Відтворення НЕ вигадує вхідні дані: сесія без часової шкали, яку можна реконструювати, дає деградоване відтворення; вхідні дані не фабрикуються.
Що це робить
Фреймворк для якості агентів
Моніторинг якості виводу, регресійне тестування та ізольована пісочниця — місце, де поведінка агентів оцінюється до й після зміни.
Оціночні картки та моніторинг якості виводу
Оцінюйте вивід агентів за визначеними вами перевірками та спостерігайте за якістю в часі. Фреймворк, оціночні картки та консоль під’єднані; те, що вони вимірюють, стане реальним, щойно буде підключено джерело сесій.
Регресійне тестування та A/B-тестування промптів
Повторно прогоняйте набір тестів проти зміни, щоб виявити регресії ще до релізу, та порівнюйте варіанти промптів A і B на тих самих вхідних даних — щоб зміна оцінювалася за доказами, а не за інтуїцією.
Виявлення дрейфу
Виявляйте, коли вивід агентів із часом дрейфує від очікуваної базової лінії, щоб ерозія якості виявлялася завчасно, а не виявлялась у продакшені.
Ізольована пісочниця
Ізольоване тестове середовище для порівняння до й після розгортання, з відтворенням сесій. Під’єднано обидва компоненти: середовище та джерело впорядкованої історії, з якого відтворення реконструює сесію.
Що реальне
Фреймворк, консоль, відбір реальних сесій і впорядковане відтворення — усе під’єднано
Ця поверхня має найбільше «швів» у продукті, тож ми говоримо про неї прямо — чесність тут є особливістю, а не вибаченням:
- Працює: фреймворк оцінювання, оціночні картки, консоль, регресійні прогони, A/B-тестування промптів і виявлення дрейфу побудовані й під’єднані, а пісочниця є ізольованим середовищем для порівняння до й після розгортання.
- Працює, із чітко вказаним обмеженням: відбір для оцінювання читає реальні сесії через під’єднане джерело сесій у межах налаштовуваного вікна актуальності, а відтворення в пісочниці реконструює з історії впорядковану послідовність дій сесії. Обмеження проявляється, коли читати нічого: сесія без часової шкали, яку можна реконструювати, дає деградоване відтворення з нулем кроків, а часова шкала, довша за допустиму межу, відхиляється цілком, а не відтворюється частково. У жодному разі вхідні дані не вигадуються.
- Позиція: адаптивна система red-teaming — це після v1. Для v1 ми документуємо позицію з компенсаційними засобами контролю, а не перебільшуємо систему, якої ще немає.
Оцінювання та пісочниця — запитання
Чи можу я запускати оцінювання проти реального трафіку моїх агентів уже сьогодні?
Так. Джерело сесій для відбору під’єднане всередині процесу без налаштування оператором, тому прогони моніторингу відбирають реальні сесії, а не засіяні дані, — у межах налаштовуваного вікна актуальності, яке зберігає вибірку свіжою та обмеженою. Знімки екрана на цій сторінці й далі показують засіяні приклади даних, адже це знімки, а не екран активного tenant.
Чи працює відтворення сесій у пісочниці?
Так, і відтворення детерміноване: воно реконструює з історії впорядковану послідовність дій інструментів і MCP у сесії та повторно виконує її на наданих вами моках, тому та сама сесія з тими самими моками завжди дає однакові результати. Два обмеження вказано прямо: сесія без часової шкали, яку можна реконструювати, позначається як деградована з нулем кроків, а часова шкала понад допустиму межу відхиляється цілком, а не відтворюється частково.
Чи є автоматизована система red-teaming?
У v1 немає. Адаптивна система red-teaming — це після v1. Для v1 ми документуємо безпекову позицію з компенсаційними засобами контролю, а не натякаємо на адаптивну систему, яку ще не побудовано.
То що ж насправді придатне до використання просто зараз?
Фреймворк і консоль оцінювання — оціночні картки, регресійні прогони, A/B-тестування промптів і виявлення дрейфу — а також ізольована пісочниця для порівняння до й після розгортання, під’єднане джерело сесій, що відбирає реальні сесії, і впорядковане відтворення, реконструйоване з історії сесій. Тут якість агентів і регресії вимірюються й проходять контроль перед релізом. Після v1 залишається лише адаптивна система red-teaming, і ця сторінка прямо зазначає це там, де належить.
Подивіться, де якість агентів проходить контроль перед релізом
Розгорніть Olivares на власній інфраструктурі та дослідіть фреймворк оцінювання й пісочницю — оціночні картки, регресійне тестування, порівняння до й після розгортання, живий відбір сесій і впорядковане відтворення, реконструйоване з історії сесій.