Prostir

調査記事

リリース前にAI Agentを評価する方法

リリース前のAI Agent評価では、business jobを定義し、代表caseとadversarial caseを作り、answerとtool trajectoryの両方を採点し、合意したthresholdに届かなければpublicationを止めます。

読む前に

公開内容

task success、groundedness、tool correctness、安全性、cost、recovery、人のreviewを含むlaunch scorecard。

に最適

demoへの期待ではなく、繰り返せるrelease evidenceを必要とするAgent ownerとproduct team。

作業が行われる場所

AI Agent評価 · Agentテスト · release gate · Microsoft.Extensions.AI.Evaluation

01

demoではなくjobを評価する

metricを選ぶ前にoutcome、許可tools、禁止action、evidence、cost、latency、approval、stop conditionを定義します。流暢なanswerでも誤ったwriteを伴うことがあります。

通常task、edge case、過去failure、拒否すべきaction、hostile content、timeout、empty retrieval、recoveryを含め、各caseを正確なproduct revisionへ結びます。

正確なruleにはdeterministic checks、品質判断にはcalibrated evaluatorを使います。曖昧な基準、高影響のchange、releaseは人が決めます。

02

再現可能なevaluation loop

  1. 01
    限定datasetを作る

    evidenceを明示的に選び、secretと不要なpersonal dataを除き、expected outcomeを定義し、abuseとrecoveryのcaseを分けます。

  2. 02
    answerとtrajectoryを測る

    groundedness、completeness、task adherence、intent resolution、tool choiceとarguments、side effects、retry、latency、成功job当たりのcostを確認します。

  3. 03
    review、改善、再実行

    failureを調査し、bounded changeを提案し、人がacceptまたはrejectして、publication前に同じcaseで比較します。

03

避けるべき誤った安心

成功した数件のchatはdatasetではありません。average scoreは一度の不可逆actionを隠すため、高影響writeには正確なdenyとapproval caseが必要です。

LLM judgeはground truthではありません。human labelで校正し、正確なcheckを残し、model、billing、infrastructureのerrorをpassに変換しません。

Evaluationはsecurity test、production monitoring、customer validationの代替ではありません。evidence laneを分けます。

04

release decisionを定義する

役立つoutputは色付きscoreではなく、次の変更後にも使えるdecision ruleです。

  1. 01
    thresholdを決める

    minimum accuracy、zero-tolerance case、cost、latency、variance、residual riskを承認できる人を決めます。

  2. 02
    正確なrevisionで実行する

    Agent、prompt、model、tools、Knowledge、evaluator profile、cases、反復方針を記録して比較可能にします。

  3. 03
    failureをregressionにする

    pilotまたはproductionの重要failureをsuiteへ追加し、次のpublication前にpassを要求します。

05

ProstirのEvaluations

ProstirにはAgent、Skill、Teamで共有する実装済みEvaluations moduleがあり、typed cases、profiles、bounded runs、results、failure signals、proposalsを正確なproduct ownerの下に保持します。

evidenceは明示的なselectionとconsent後にのみ入ります。deterministic checksはjudge不要で、Microsoft.Extensions.AI.Evaluationを使う場合はmodel creditの明示承認と正のbudgetが必要です。

runはproductを変更もpublishもしません。proposalはhuman reviewを待ち、正確なdraft revisionが現行の場合だけそのdraftを変更できます。

ソリューション

自分で所有し続けられるAIエージェント作成ツール

Prompt Agentまたは所有するAgentをまとめるWorkflow Agentを作り、初期状態は非公開のまま、専用HTTPSアドレスとMCPエンドポイントで提供できます。

ソリューション

デモを自分のAgentにする

誰のどの仕事を扱い、どの知識や操作が必要かを教えてください。最初の現実的な範囲を一緒に決めます。