Définir le périmètre
Listez outils, données, permissions, actions permises, actions interdites et point de validation humaine. Associez chaque droit à une tâche.
GUIDE / PROTOCOLE
Évaluer un agent exige de tester ses actions, ses limites et ses échecs, pas seulement la fluidité de ses réponses.
Réponse directe
Définissez la tâche autorisée, les résultats attendus et les dommages à éviter. Constituez un jeu de cas normaux, ambigus et hostiles, exécutez-le dans un environnement sans effet externe, puis examinez chaque action et chaque arrêt.
01 / Méthode de contrôle
Listez outils, données, permissions, actions permises, actions interdites et point de validation humaine. Associez chaque droit à une tâche.
Incluez demandes courantes, données incomplètes, instructions trompeuses dans les sources, échecs d’outil, doublons et tentatives de sortir du mandat.
Pour chaque cas, comparez résultat, sources consultées, appels d’outil, refus, délai, coût et intervention humaine aux critères prévus.
Bloquez les échecs critiques, réduisez les droits si nécessaire et rejouez le même jeu après modification. Préparez arrêt, reprise manuelle et retrait.
02 / Preuves à conserver
Entrée, résultat attendu, risque, gravité et critère de réussite.
Version du système, outils appelés, données exposées, sorties et décision humaine.
Erreur, conséquence, cause probable, correctif et résultat du nouvel essai.
Responsable, périmètre autorisé, seuil d’arrêt, repli et date de révision.
03 / FAQ
Pas nécessairement. Il peut réussir la réponse tout en consultant une mauvaise source ou en exécutant une action non autorisée.
Oui, surtout lorsque l’agent lit des pages, documents ou messages qui peuvent contenir des instructions hostiles.
Avant une action sensible, irréversible ou hors du périmètre explicitement autorisé.
Suspendre le chemin concerné, conserver la trace, réduire la capacité en cause et rejouer les cas avant reprise.
04 / Références officielles