Product · Evals & sandbox
Waar agentkwaliteit wordt gemeten en afgeschermd
Evals is het vlak waar de outputkwaliteit, regressies en drift van agents worden gescoord — en waar een release kan worden afgeschermd voordat hij live gaat. Het framework, de scorecards en de console bestaan en zijn aangesloten; beide adapters — de sessiebron achter sampling en de historiebron achter geordende replay in de sandbox — zijn altijd in-process aangesloten, zonder operatorconfiguratie. Replay verzint GEEN input: als een sessie geen reconstrueerbare tijdlijn heeft, wordt de replay als gedegradeerd gemeld en wordt geen input gefabriceerd.
Wat het doet
Een framework voor agentkwaliteit
Bewaking van de outputkwaliteit, regressietests en een geïsoleerde sandbox — de plek waar het gedrag van agents wordt gescoord vóór en na een wijziging.
Scorecards en bewaking van outputkwaliteit
Scoor agentoutput tegen de checks die u zelf definieert en volg de kwaliteit in de tijd. Het framework, de scorecards en de console zijn aangesloten; wat ze meten wordt echt zodra er een sessiebron is gekoppeld.
Regressietests en prompt-A/B
Voer een suite opnieuw uit tegen een wijziging om regressies te onderscheppen voordat ze live gaan, en vergelijk promptvarianten A tegen B op dezelfde inputs — zodat een wijziging wordt beoordeeld op bewijs, niet op intuïtie.
Driftdetectie
Detecteer wanneer agentoutput in de tijd afdrijft van zijn verwachte baseline, zodat kwaliteitsverlies aan het licht komt in plaats van pas in productie te worden ontdekt.
Geïsoleerde sandbox
Een geïsoleerde testomgeving voor vergelijking vóór en na deploy, met sessie-replay. Beide zijn aangesloten: de omgeving en de bron met geordende historie waaruit replay een sessie reconstrueert.
Wat echt is
Het framework, de console, live sampling en geordende replay zijn allemaal aangesloten
Dit vlak kent de meeste naden in het product, dus zijn we er onomwonden over — de eerlijkheid is de feature, geen excuus:
- Live: het evals-framework, de scorecards, de console, regressieruns, prompt-A/B en driftdetectie zijn gebouwd en aangesloten, en de sandbox is een geïsoleerde omgeving voor vergelijking vóór en na deploy.
- Live, met een expliciete grens: eval-sampling leest echte sessies via de aangesloten sessiebron, binnen een configureerbaar recentheidsvenster, en sandbox-replay reconstrueert de geordende actiereeks van een sessie uit de historie. De grens geldt wanneer er niets te lezen is: een sessie zonder reconstrueerbare tijdlijn levert een gedegradeerde replay van nul stappen op, en een tijdlijn die langer is dan de replaylimiet wordt volledig geweigerd in plaats van gedeeltelijk gereplayed. In geen van beide gevallen wordt input verzonnen.
- Houding: de adaptieve red-teaming-engine komt na v1. Voor v1 documenteren we de houding met compenserende maatregelen in plaats van een engine te overdrijven die er nog niet is.
Evals & sandbox — vragen
Kan ik vandaag evals draaien tegen mijn echte agentverkeer?
Ja. De sessiebron achter sampling is in-process aangesloten zonder operatorconfiguratie, zodat monitoringruns echte sessies samplen in plaats van geseede data — binnen een configureerbaar recentheidsvenster, waardoor samples actueel en begrensd blijven. Schermafbeeldingen op deze pagina tonen nog steeds geseede voorbeelddata, omdat het opnamen zijn en geen live tenant.
Werkt sessie-replay in de sandbox?
Ja, en replay is deterministisch: uit de historie wordt de geordende reeks tool- en MCP-acties van de sessie gereconstrueerd en opnieuw uitgevoerd tegen de mocks die u aanlevert, zodat dezelfde sessie en mocks altijd dezelfde uitvoer opleveren. Twee grenzen worden benoemd, niet verborgen: een sessie zonder reconstrueerbare tijdlijn wordt als gedegradeerd gemeld met nul stappen, en een tijdlijn boven de replaylimiet wordt volledig geweigerd in plaats van gedeeltelijk gereplayed.
Is er een geautomatiseerde red-teaming-engine?
Niet in v1. De adaptieve red-teaming-engine komt na v1. Voor v1 documenteren we de beveiligingshouding met compenserende maatregelen in plaats van een adaptieve engine te suggereren die nog niet is gebouwd.
Wat is op dit moment dan daadwerkelijk bruikbaar?
Het evals-framework en de console — scorecards, regressieruns, prompt-A/B en driftdetectie — plus de geïsoleerde sandbox voor vergelijking vóór en na deploy, de aangesloten sessiebron die echte sessies samplet en geordende replay die uit de sessiehistorie wordt gereconstrueerd. Hier worden agentkwaliteit en regressies gemeten en afgeschermd. Alleen de adaptieve red-teaming-engine komt nog na v1, en deze pagina vermeldt dat waar het hoort.
Zie waar agentkwaliteit wordt afgeschermd
Deploy Olivares op uw eigen infrastructuur en verken het evals-framework en de sandbox — scorecards, regressietests, vergelijking vóór en na deploy, live sessiesampling en geordende replay die uit de sessiehistorie wordt gereconstrueerd.