Zum Inhalt springen

Produkt · Evals & Sandbox

Wo Agentenqualität gemessen und kontrolliert freigegeben wird

Evals ist die Oberfläche, auf der die Qualität von Agenten-Ausgaben, Regressionen und Drift bewertet werden — und auf der ein Release vor der Auslieferung kontrolliert freigegeben werden kann. Das Framework, die Scorecards und die Konsole existieren und sind angebunden, ebenso wie der Teil, der sie für echten Traffic relevant macht: die Session-Quelle für das Sampling und die Quelle mit geordnetem Verlauf für das Session-Replay in der Sandbox. Beide Adapter sind stets prozessintern angebunden, ohne Konfiguration durch den Betreiber. Replay erfindet KEINE Eingaben: Eine Session ohne rekonstruierbare Timeline führt zu einem als eingeschränkt gemeldeten Replay; Eingaben werden niemals erfunden.

Was es leistet

Ein Framework für Agentenqualität

Überwachung der Ausgabequalität, Regressionstests und eine isolierte Sandbox — der Ort, an dem das Verhalten von Agenten vor und nach einer Änderung bewertet wird.

Scorecards und Überwachung der Ausgabequalität

Bewerten Sie Agenten-Ausgaben anhand der von Ihnen definierten Prüfungen und verfolgen Sie die Qualität über die Zeit. Das Framework, die Scorecards und die Konsole sind angebunden; was sie messen, wird real, sobald eine Session-Quelle verbunden ist.

Regressionstests und Prompt-A/B-Tests

Lassen Sie eine Suite gegen eine Änderung erneut laufen, um Regressionen vor der Auslieferung zu erkennen, und vergleichen Sie Prompt-Varianten A gegen B auf denselben Eingaben — damit eine Änderung anhand von Belegen beurteilt wird, nicht nach Bauchgefühl.

Drift-Erkennung

Erkennen Sie, wenn Agenten-Ausgaben im Laufe der Zeit von ihrer erwarteten Baseline abweichen, sodass eine Qualitätserosion sichtbar wird, statt erst in der Produktion entdeckt zu werden.

Isolierte Sandbox

Eine isolierte Testumgebung für den Vergleich vor und nach dem Deploy, mit Session-Replay. Beides ist angebunden: die Umgebung und die Quelle mit geordnetem Verlauf, aus der das Replay eine Session rekonstruiert.

Was real ist

Framework, Konsole, Live-Sampling und geordnetes Replay sind alle angebunden

Diese Oberfläche weist im Produkt die meisten Nahtstellen auf, daher sind wir hier unmissverständlich — die Ehrlichkeit ist das Feature, keine Entschuldigung:

  • Live: das Evals-Framework, die Scorecards, die Konsole, Regressionsläufe, Prompt-A/B-Tests und die Drift-Erkennung sind gebaut und angebunden, und die Sandbox ist eine isolierte Umgebung für den Vergleich vor und nach dem Deploy.
  • Live, mit einer ausdrücklich benannten Grenze: Das Eval-Sampling liest über die angebundene Session-Quelle echte Sessions innerhalb eines konfigurierbaren Aktualitätsfensters, und das Sandbox-Replay rekonstruiert aus ihrem Verlauf die geordnete Aktionsfolge einer Session. Die Grenze greift, wenn nichts lesbar ist: Eine Session ohne rekonstruierbare Timeline ergibt ein eingeschränktes Replay mit null Schritten, und eine Timeline oberhalb der Replay-Obergrenze wird vollständig abgelehnt, statt teilweise wiedergegeben zu werden. In keinem der beiden Fälle werden erfundene Eingaben ergänzt.
  • Sicherheitslage: die adaptive Red-Teaming-Engine kommt nach v1. Für v1 dokumentieren wir die Sicherheitslage mit kompensierenden Kontrollen, statt eine Engine zu überzeichnen, die es noch nicht gibt.

Evals & Sandbox — Fragen

Kann ich Evals heute gegen meinen echten Agenten-Traffic laufen lassen?

Ja. Die Session-Quelle für das Sampling ist stets prozessintern angebunden, ohne Konfiguration durch den Betreiber. Monitoring-Läufe sampeln daher echte Sessions statt eingespielter Daten — innerhalb eines konfigurierbaren Aktualitätsfensters, das die Samples aktuell und begrenzt hält. Die Screenshots auf dieser Seite zeigen weiterhin eingespielte Beispieldaten, denn sie sind Aufnahmen und kein Live-Tenant.

Funktioniert das Session-Replay in der Sandbox?

Ja, und es ist deterministisch: Das Replay rekonstruiert aus dem Verlauf die geordnete Folge der Tool- und MCP-Aktionen einer Session und führt sie gegen die von Ihnen bereitgestellten Mocks erneut aus. Dieselbe Session mit denselben Mocks erzeugt daher stets dieselben Ausgaben. Zwei Grenzen werden ausdrücklich benannt: Eine Session ohne rekonstruierbare Timeline wird mit null Schritten als eingeschränkt gemeldet, und eine Timeline oberhalb der Replay-Obergrenze wird vollständig abgelehnt, statt teilweise wiedergegeben zu werden.

Gibt es eine automatisierte Red-Teaming-Engine?

In v1 nicht. Die adaptive Red-Teaming-Engine kommt nach v1. Für v1 dokumentieren wir die Sicherheitslage mit kompensierenden Kontrollen, statt eine adaptive Engine anzudeuten, die noch nicht gebaut ist.

Was ist also gerade tatsächlich nutzbar?

Das Evals-Framework und die Konsole — Scorecards, Regressionsläufe, Prompt-A/B-Tests und Drift-Erkennung — sowie die isolierte Sandbox für den Vergleich vor und nach dem Deploy, die angebundene Session-Quelle, die echte Sessions sampelt, und das aus dem Session-Verlauf rekonstruierte geordnete Replay. Hier werden Agentenqualität und Regressionen gemessen und kontrolliert freigegeben. Nur die adaptive Red-Teaming-Engine kommt erst nach v1, und diese Seite weist an der passenden Stelle darauf hin.

Sehen Sie, wo Agentenqualität kontrolliert freigegeben wird

Deployen Sie Olivares auf Ihrer eigenen Infrastruktur und erkunden Sie das Evals-Framework und die Sandbox — Scorecards, Regressionstests, Vergleiche vor und nach dem Deploy, Live-Session-Sampling und aus dem Session-Verlauf rekonstruiertes geordnetes Replay.