Meet een AI-agent als volledige run, niet als sessie

Door Pascal Bouman··3 min lezen
Dashboardconcept voor het meten van AI-agent runs in plaats van gewone sessies.

De productkeuze: stuur op de run

Kies de run, niet de sessie, als primaire eenheid voor productanalytics van een AI-agent. Een sessie vertelt dat iemand met het product werkte; zij zegt niet welke taak de agent uitvoerde, welke tussenstappen nodig waren of waarom de uitkomst wel of niet bruikbaar was. NIST beschrijft agents als systemen die meerstapstaken plannen en zelfstandig acties kunnen uitvoeren, waaronder tools gebruiken en databases doorzoeken. Die bron onderbouwt dus de noodzaak om de uitvoering zichtbaar te maken, maar schrijft geen universeel analytics-schema voor. Definieer een run als één afgebakend doel met een startconditie en een eindstatus. Leg minimaal vast: doel en relevante input, gekozen stappen, tooloproepen, escalatie naar een mens, fout of afwijking, herstelactie, eindresultaat en gebruikersacceptatie. Daarmee kun je onderscheid maken tussen een technisch afgeronde taak en een resultaat dat de gebruiker werkelijk overneemt. Dat onderscheid is een productkeuze, geen door de bronnen bewezen effect op kwaliteit of omzet.

Maak afwijkingen en herstel beslisbaar

Gebruik rungegevens eerst om frictie in één concrete workflow te vinden. NIST meldt bij een onderzochte modelversie problemen met tool-calling en output formatting; de onderzoekers pasten onder meer prompts aan en voegden eenvoudige mechanismen toe om herstel na fouten te ondersteunen. Dit is bewijs dat zulke problemen en herstelmechanismen in die evaluatie voorkwamen, niet dat dezelfde oplossing voor elke agent werkt. Registreer daarom bij elke fout zowel het getroffen staptype als de herstelroute en de uiteindelijke acceptatie. Voor toepassingen die binnen de reikwijdte van de AI Act als hoog risico gelden, noemt de Europese Commissie logging van activiteiten voor traceerbaarheid van resultaten en gedetailleerde documentatie als verplichtingen vóór marktintroductie. Dat maakt een runlog extra relevant in die context; het is geen uitspraak dat elke AI-agent onder deze regels valt. Koppel de meetuitkomst aan een besluit: vereenvoudig een stap, voeg een controlepunt toe, beperk een tool of laat een type taak escaleren.

Flow van een AI-agent run met stappen en escalatiemomenten.

Een runkaart voor de eerstvolgende evaluatie

Start niet met een groot datamodel. Kies één veelvoorkomende taak en vul per run dezelfde velden in: run-ID, doel, inputcategorie, stappen, tools, afwijking, herstel, menselijke controle, eindstatus, acceptatie en eigenaar van het vervolg. Vergelijk daarna alleen runs met hetzelfde taakdoel. Zo wordt zichtbaar welke stap herhaaldelijk om herstel of escalatie vraagt, zonder sessieduur als vervanging voor kwaliteit te gebruiken. Praktisch hulpmiddel: Gebruik een runkaart met doel, eigenaar, stappen, toolgebruik, escalatie, fout, herstelactie, acceptatie en vervolgbesluit voor één afgebakende agentworkflow. Bespreek wekelijks de afgewezen of herstelde runs en kies één wijziging die je daarna in dezelfde runcategorie toetst. Beperking: De beschikbare passages onderbouwen dat agenten meerstapswerkflows, toolgebruik, zichtbaarheid, herstelproblemen en — in de genoemde hoog-risicocontext — traceerbaarheidsverplichtingen relevant maken. Ze leveren geen drempelwaarden voor acceptatie, geen volledig meetschema en geen bewijs dat runmeting op zichzelf betere prestaties veroorzaakt.

Jouw persoonlijke AI-onderzoeksteam

Ontwikkelingen gaan te snel om alles zelf bij te houden.

Eigenlijk heb je een team van onderzoekers nodig dat voortdurend volgt wat er verandert, bronnen controleert en bepaalt wat voor jouw werk relevant is. Dat team zetten wij voor je aan het werk.

Kies de onderwerpen die jij wilt volgen. Onze gespecialiseerde agents onderzoeken en filteren de ontwikkelingen, zodat jij alleen de updates ontvangt waar je werkelijk iets aan hebt.

Updates afgestemd op jouw interesses
Onderzocht en gefilterd door gespecialiseerde agents
Geen dagelijkse AI-ruis, maar relevante inzichten

Wat wil je volgen?

Je krijgt eerst een bevestigingsmail. Pas na die klik sta je op de lijst. Zie ook het privacybeleid.

Laatste artikelen

Recente kennisbankartikelen die passen bij deze pagina.