Przejdź do treści

Tłumaczenie maszynowe. Wersja angielska jest wiążąca; weryfikacja przez native speakera jeszcze nie nastąpiła.

Produkt · Ewaluacje i piaskownica

Tu jakość agentów jest mierzona i bramkowana

Ewaluacje to powierzchnia, na której jakość, regresje i dryf wyników agentów są oceniane — i na której wydanie można zatrzymać na bramce jakości, zanim trafi na produkcję. Framework, karty wyników i konsola istnieją oraz są podłączone; podłączona jest też część, która nadaje temu znaczenie na rzeczywistym ruchu. Adapter źródła sesji obsługujący próbkowanie oraz adapter źródła historii obsługujący uporządkowane odtwarzanie w piaskownicy są zawsze podłączone wewnątrz procesu i nie wymagają konfiguracji operatora. Odtwarzanie NIE fabrykuje jednak danych wejściowych — gdy sesja nie ma osi czasu możliwej do zrekonstruowania, jej odtwarzanie jest raportowane jako zdegradowane, a dane nigdy nie są zmyślane.

Co robi

Framework dla jakości agentów

Monitorowanie jakości wyników, testy regresyjne i izolowana piaskownica — miejsce, w którym zachowanie agenta jest oceniane przed zmianą i po niej.

Karty wyników i monitorowanie jakości wyników

Oceniaj wyniki agenta względem zdefiniowanych przez Ciebie kontroli i obserwuj jakość w czasie. Framework, karty wyników i konsola są podłączone; to, co mierzą, staje się realne po podłączeniu źródła sesji.

Testy regresyjne i A/B promptów

Uruchom ponownie zestaw testów względem zmiany, aby wychwycić regresje, zanim trafią na produkcję, i porównaj warianty promptów A i B na tych samych danych wejściowych — tak aby zmiana była oceniana na podstawie dowodów, a nie intuicji.

Wykrywanie dryfu

Wykrywaj, kiedy wyniki agenta odchodzą od oczekiwanej wartości bazowej w czasie, tak aby erozja jakości była ujawniana, a nie odkrywana na produkcji.

Izolowana piaskownica

Izolowane środowisko testowe do porównania przed i po wdrożeniu, z odtwarzaniem sesji. Oba elementy są podłączone: środowisko oraz źródło uporządkowanej historii, z którego odtwarzanie rekonstruuje sesję.

Co jest realne

Framework, konsola, próbkowanie na żywo i uporządkowane odtwarzanie są podłączone

Ta powierzchnia jest najbardziej naszpikowana szwami w całym produkcie, dlatego mówimy o tym bez ogródek — szczerość jest funkcją, a nie przeprosinami:

  • Na żywo: framework ewaluacji, karty wyników, konsola, przebiegi regresyjne, testy A/B promptów i wykrywanie dryfu są zbudowane i podłączone, a piaskownica jest izolowanym środowiskiem do porównania przed i po wdrożeniu.
  • Na żywo, ze wskazanym ograniczeniem: próbkowanie ewaluacji odczytuje rzeczywiste sesje przez podłączone źródło sesji, w ramach konfigurowalnego okna świeżości, a odtwarzanie w piaskownicy rekonstruuje z historii uporządkowaną sekwencję akcji sesji. Ograniczenie dotyczy sytuacji, w której nie ma czego odczytać — sesja bez osi czasu możliwej do zrekonstruowania daje zdegradowane odtwarzanie z 0 kroków, a oś czasu dłuższa niż dopuszczalny limit jest odrzucana w całości zamiast odtwarzana częściowo. W żadnym z tych przypadków braków nie uzupełnia się zmyślonymi danymi wejściowymi.
  • Postawa: adaptacyjny silnik red-teamingu jest planowany po wersji v1. W wersji v1 dokumentujemy postawę za pomocą kontroli kompensujących, zamiast przeceniać silnik, którego jeszcze tu nie ma.

Ewaluacje i piaskownica — pytania

Czy mogę dzisiaj uruchamiać ewaluacje na rzeczywistym ruchu mojego agenta?

Tak. Źródło sesji obsługujące próbkowanie jest zawsze podłączone wewnątrz procesu i nie wymaga konfiguracji operatora, dlatego przebiegi monitorowania próbkują rzeczywiste sesje zamiast wstępnie wygenerowanych danych — w ramach konfigurowalnego okna świeżości, które utrzymuje aktualność i ograniczony zakres próbek. Zrzuty ekranu na tej stronie nadal pokazują wstępnie wygenerowane dane przykładowe, ponieważ są statycznymi ujęciami, a nie widokiem danych z działającego tenanta.

Czy odtwarzanie sesji w piaskownicy działa?

Tak, i jest deterministyczne: odtwarzanie rekonstruuje z historii uporządkowaną sekwencję akcji narzędzi i MCP w sesji, po czym wykonuje ją ponownie na dostarczonych przez Ciebie mockach, więc ta sama sesja i te same mocki zawsze dają te same wyniki. Dwa ograniczenia są jawne: sesja bez osi czasu możliwej do zrekonstruowania jest raportowana jako zdegradowane odtwarzanie z 0 kroków, a oś czasu przekraczająca dopuszczalny limit jest odrzucana w całości zamiast odtwarzana częściowo.

Czy istnieje zautomatyzowany silnik red-teamingu?

Nie w wersji v1. Adaptacyjny silnik red-teamingu jest planowany po wersji v1. W wersji v1 dokumentujemy postawę bezpieczeństwa za pomocą kontroli kompensujących, zamiast sugerować adaptacyjny silnik, który nie został jeszcze zbudowany.

Co zatem jest faktycznie użyteczne już teraz?

Dostępne są framework ewaluacji i konsola — karty wyników, przebiegi regresyjne, testy A/B promptów i wykrywanie dryfu — a także izolowana piaskownica do porównania przed i po wdrożeniu, podłączone źródło sesji próbkujące rzeczywiste sesje oraz uporządkowane odtwarzanie rekonstruowane z historii sesji. To tutaj mierzy się jakość agentów i regresje, a wynik decyduje o dopuszczeniu wydania. Jedynym elementem nadal planowanym dopiero po wersji v1 jest adaptacyjny silnik red-teamingu, co ta strona wyraźnie zaznacza we właściwym miejscu.

Zobacz, gdzie jakość agentów jest bramkowana

Wdróż Olivares na własnej infrastrukturze i poznaj framework ewaluacji oraz piaskownicę — karty wyników, testy regresyjne, porównanie przed i po wdrożeniu, próbkowanie sesji na żywo oraz uporządkowane odtwarzanie rekonstruowane z historii sesji.