Prostir

Article documenté

Comment évaluer un Agent IA avant lancement

Pour évaluer un Agent IA avant lancement, définissez le travail, réunissez des cas représentatifs et adversariaux, notez réponse et parcours des tools, puis bloquez la publication si le seuil convenu n'est pas atteint.

Avant de lire

Ce que tu publies

Une scorecard de lancement couvrant réussite, groundedness, justesse des tools, sécurité, coût, reprise et revue humaine.

Idéal pour

Owners d'Agents et équipes produit qui veulent des preuves répétables plutôt que la confiance d'une démo.

Où se passe le travail

Évaluation Agent IA · Test Agent · Gate de lancement · Microsoft.Extensions.AI.Evaluation

01

Évaluez le travail, pas la démo

Définissez résultat, tools autorisés, actions interdites, preuves, coût, latence, approbations et condition d'arrêt avant la métrique. Une réponse fluide peut accompagner une écriture erronée.

Incluez tâches courantes, cas limites, échecs passés, refus, contenu hostile, timeouts, retrieval vide et reprise ; rattachez chaque cas à une révision exacte.

Utilisez des checks déterministes pour les règles exactes et des évaluateurs calibrés pour la qualité. Une personne décide des critères ambigus, changements sensibles et du lancement.

02

Une boucle d'évaluation répétable

  1. 01
    Créez un dataset borné

    Sélectionnez explicitement les preuves, retirez secrets et données inutiles, définissez les résultats attendus et séparez abus et reprise.

  2. 02
    Notez réponse et trajectoire

    Mesurez groundedness, complétude, respect du task, intent, choix et arguments des tools, effets, retries, latence et coût par travail réussi.

  3. 03
    Revoyez, améliorez, relancez

    Analysez les échecs, proposez un changement borné, faites-le décider par une personne et comparez les mêmes cas avant publication.

03

Les fausses assurances

Quelques chats réussis sont des exemples, pas un dataset. Une moyenne peut masquer une action irréversible ; les opérations critiques exigent des cas précis de refus et d'approbation.

Un LLM judge n'est pas la vérité terrain. Calibrez-le avec des labels humains, gardez des checks exacts et ne transformez jamais une erreur de modèle, billing ou infrastructure en pass.

Evaluation ne remplace ni audit de sécurité, ni monitoring, ni validation client. Gardez ces preuves séparées.

04

Définissez la décision de lancement

La sortie utile n'est pas un score coloré, mais une règle de décision réutilisable après chaque changement.

  1. 01
    Fixez les seuils

    Définissez précision minimale, cas zéro tolérance, coût, latence, variance et personne autorisée à accepter le risque résiduel.

  2. 02
    Exécutez sur une révision exacte

    Consignez Agent, prompt, model, tools, Knowledge, profil, cas et répétitions afin de comparer des résultats équivalents.

  3. 03
    Transformez les échecs en régressions

    Ajoutez chaque échec matériel de pilote ou production et exigez son succès avant la publication suivante.

05

Evaluations dans Prostir

Prostir dispose d'un module Evaluations implémenté et partagé par Agent, Skill et Team, avec cas typés, profils, runs, résultats, signaux et propositions sous le produit exact.

Les preuves n'entrent qu'après sélection et consentement explicites. Les checks déterministes n'ont pas besoin de judge ; Microsoft.Extensions.AI.Evaluation exige une autorisation de crédits et un budget positif.

Un run ne modifie ni ne publie le produit. La proposition attend une revue humaine et ne peut mettre à jour que le draft dont la révision exacte est encore valide.

Solutions

Créateur d’agents IA pour un produit que tu contrôles

Publie un Agent privé sous ton contrôle, avec sa propre adresse HTTPS et son endpoint MCP, sans céder sa configuration aux utilisateurs.

Solutions

Transforme la démo en Agent propriétaire

Décris le travail, les personnes autorisées et les connaissances ou outils nécessaires.