Prostir

Artículo investigado

Cómo evaluar Agents de IA antes del lanzamiento

Para evaluar Agents de IA antes del lanzamiento, define el trabajo, reúne casos normales y adversos, puntúa la respuesta y el recorrido de tools, y bloquea la publicación si no supera el umbral acordado.

Antes de leer

Qué publicas

Una scorecard de lanzamiento para éxito, groundedness, tools, seguridad, coste, recuperación y revisión humana.

Mejor para

Propietarios de Agents y equipos de producto que necesitan pruebas repetibles en lugar de confianza basada en demos.

Dónde ocurre el trabajo

Evaluación de Agents · Pruebas de IA · Release gate · Microsoft.Extensions.AI.Evaluation

01

Evalúa el trabajo, no la demo

Define resultado, tools permitidas, acciones prohibidas, fuente de evidencia, coste, latencia, aprobaciones y condición de parada antes de elegir métricas. Una respuesta fluida puede acompañar una escritura incorrecta.

Incluye tareas habituales, bordes difíciles, fallos previos, denegaciones, contenido hostil, timeouts, recuperación y búsqueda vacía; vincula cada caso a una revisión exacta.

Usa comprobaciones deterministas para reglas exactas y evaluadores calibrados para calidad. Una persona sigue decidiendo criterios ambiguos, cambios de alto impacto y el lanzamiento.

02

Un ciclo de evaluación repetible

  1. 01
    Crea un dataset acotado

    Selecciona evidencia de forma explícita, elimina secretos y datos innecesarios, define resultados esperados y separa casos de abuso y recuperación.

  2. 02
    Puntúa respuesta y trayectoria

    Mide groundedness, completitud, task adherence, intent resolution, elección y argumentos de tools, efectos, retries, latencia y coste por trabajo correcto.

  3. 03
    Revisa, mejora y repite

    Investiga fallos, redacta un cambio limitado, somételo a decisión humana y compara los mismos casos con la revisión anterior antes de publicar.

03

Falsas señales de confianza

Unos chats correctos son ejemplos, no un dataset. La media puede ocultar una acción irreversible, por lo que los writes importantes necesitan casos exactos de denegación y aprobación.

Un LLM judge no es verdad absoluta: calíbralo con etiquetas humanas, conserva checks deterministas y no conviertas errores de modelo, billing o infraestructura en aprobados.

Evaluación no sustituye pentest, monitorización ni validación de clientes. Mantén cada evidencia en su carril.

04

Define la decisión de publicación

El resultado útil es una regla que el equipo puede repetir tras cada cambio.

  1. 01
    Fija umbrales

    Define precisión mínima, casos de tolerancia cero, coste, latencia, variación y quién acepta el riesgo residual.

  2. 02
    Ejecuta una revisión exacta

    Registra Agent, prompt, modelo, tools, Knowledge, perfil, casos y repeticiones para poder comparar.

  3. 03
    Convierte fallos en regresiones

    Añade cada fallo material del piloto o producción y exige que pase antes de la siguiente publicación.

05

Evaluations en Prostir

Prostir tiene un módulo Evaluations implementado y compartido por Agent, Skill y Team, con casos tipados, perfiles, runs, resultados, señales y propuestas bajo el producto exacto.

La evidencia entra solo con selección y consentimiento explícitos. Los checks deterministas no requieren judge; Microsoft.Extensions.AI.Evaluation exige autorización expresa de créditos y presupuesto positivo.

Un run no cambia ni publica el producto. La propuesta espera revisión humana y solo puede modificar el draft con su revisión exacta todavía vigente.

Soluciones

Constructor de agentes de IA para un producto que controlas

Publica un Agent privado bajo tu control, con su propia dirección HTTPS y endpoint MCP, sin entregar su configuración a quienes lo usan.

Soluciones

Convierte la demo en un Agent propio

Cuéntanos el trabajo, quién debe usarlo y qué conocimiento o herramientas necesita.