Prostir

조사 아티클

출시 전에 AI Agent를 평가하는 방법

출시 전 AI Agent 평가는 business job을 정의하고, 대표 case와 adversarial case를 만들고, answer와 tool trajectory를 함께 채점하며, 합의한 threshold를 넘지 못하면 publication을 막는 과정입니다.

읽기 전에

게시 내용

task success, groundedness, tool correctness, safety, cost, recovery, human review를 포함한 launch scorecard.

다음 용도에 적합

demo에 대한 신뢰 대신 반복 가능한 release evidence가 필요한 Agent owner와 product team.

작업이 이루어지는 곳

AI Agent 평가 · Agent 테스트 · release gate · Microsoft.Extensions.AI.Evaluation

01

demo가 아니라 job을 평가하기

metric을 고르기 전에 outcome, 허용 tools, 금지 action, evidence, cost, latency, approval, stop condition을 정의합니다. 유창한 answer에도 잘못된 write가 동반될 수 있습니다.

일반 task, edge case, 과거 failure, 거부해야 할 action, hostile content, timeout, empty retrieval, recovery를 포함하고 각 case를 정확한 product revision에 연결합니다.

정확한 rule은 deterministic checks, 품질 판단은 calibrated evaluator를 사용합니다. 모호한 기준, 영향이 큰 change, release는 사람이 결정합니다.

02

반복 가능한 evaluation loop

  1. 01
    제한된 dataset 만들기

    evidence를 명시적으로 선택하고 secret과 불필요한 personal data를 제거하며 expected outcome을 정의하고 abuse와 recovery case를 분리합니다.

  2. 02
    answer와 trajectory 채점하기

    groundedness, completeness, task adherence, intent resolution, tool choice와 arguments, side effects, retry, latency, 성공 job당 cost를 측정합니다.

  3. 03
    review하고 개선해 다시 실행하기

    failure를 조사하고 bounded change를 제안하며 사람이 accept 또는 reject한 뒤 publication 전에 같은 case로 비교합니다.

03

잘못된 확신 피하기

성공한 chat 몇 개는 dataset이 아닙니다. average score는 단 한 번의 비가역 action을 숨길 수 있으므로 중요한 write에는 정확한 deny와 approval case가 필요합니다.

LLM judge는 ground truth가 아닙니다. human label로 보정하고 정확한 check를 유지하며 model, billing, infrastructure error를 pass로 바꾸지 않습니다.

Evaluation은 security test, production monitoring, customer validation을 대체하지 않습니다. evidence lane을 분리합니다.

04

release decision 정의하기

유용한 결과는 색깔 있는 score가 아니라 다음 변경 뒤에도 적용할 decision rule입니다.

  1. 01
    threshold 정하기

    minimum accuracy, zero-tolerance case, cost, latency, variance, residual risk를 승인할 사람을 정합니다.

  2. 02
    정확한 revision으로 실행하기

    Agent, prompt, model, tools, Knowledge, evaluator profile, cases, 반복 정책을 기록해 비교 가능하게 합니다.

  3. 03
    failure를 regression으로 만들기

    pilot 또는 production의 중요한 failure를 suite에 추가하고 다음 publication 전에 pass를 요구합니다.

05

Prostir의 Evaluations

Prostir에는 Agent, Skill, Team이 공유하는 구현된 Evaluations module이 있으며 typed cases, profiles, bounded runs, results, failure signals, proposals를 정확한 product owner 아래 둡니다.

evidence는 명시적 selection과 consent 뒤에만 들어옵니다. deterministic checks는 judge가 필요 없고 Microsoft.Extensions.AI.Evaluation은 model credit의 명시적 승인과 양수 budget이 필요합니다.

run은 product를 변경하거나 publish하지 않습니다. proposal은 human review를 기다리고 정확한 draft revision이 여전히 현재일 때 그 draft만 변경할 수 있습니다.

솔루션

내가 계속 소유하고 운영하는 AI 에이전트 빌더

Prompt Agent 또는 내가 소유한 Agents를 조율하는 Workflow Agent를 만들고, 기본 비공개 상태에서 전용 HTTPS 주소와 MCP 엔드포인트로 제공할 수 있습니다.

솔루션

데모를 내가 소유한 Agent로 만들기

누가 어떤 일을 맡기고 어떤 지식과 도구가 필요한지 알려 주세요. 첫 버전의 현실적인 범위를 함께 정합니다.