Tâche et baseline
Définissez un succès observable et comparez le processus actuel ou une méthode plus simple. Incluez cas typiques, rares, ambigus et adversariaux.
Section 4 · Vérification
Une démonstration impressionnante ne prouve pas un comportement fiable. Définissez la décision, réunissez des cas représentatifs, comparez une baseline, examinez les échecs et imposez des seuils explicites.
Définissez un succès observable et comparez le processus actuel ou une méthode plus simple. Incluez cas typiques, rares, ambigus et adversariaux.
Mesurez utilité, appui factuel, validité des citations, cohérence et abstention appropriée. Une moyenne unique peut masquer les pires échecs.
Testez injection directe et indirecte, contenu récupéré malveillant, abus d’outils, divulgation et privilèges. Toute sortie du modèle est une entrée non fiable.
Suivez latence de bout en bout et en queue, coût tokens/outils, disponibilité et reprise. Versionnez ensemble modèles, prompts, outils, politiques, données et évaluations.
Commencez par peu d’utilisateurs et de permissions, observez le réel, conservez un repli humain ou déterministe, un coupe-circuit et un rollback.
Définir le risque
Créer le jeu représentatif
Comparer baseline et candidat
Examiner les échecs
Seuils et supervision
Séparez si possible construction et évaluation. Pour les sorties variables, répétez et examinez distributions et pires cas, pas seulement le meilleur exemple.
Choisissez une fonction LLM et créez une barrière avant déploiement.
Pour savoir si la complexité ajoutée améliore réellement le processus actuel ou une méthode plus simple.
L’injection peut divulguer des données, corrompre la réponse ou abuser des outils de lecture ; le moindre privilège limite sans annuler le risque.
Au minimum modèle, paramètres, prompts, contrats d’outils, politiques, données d’évaluation et méthode de notation.