Prostir

Artículo investigado

Cómo evaluar Agents de IA antes del lanzamiento

Para evaluar Agents de IA antes del lanzamiento, define el trabajo, reúne casos normales y adversos, puntúa la respuesta y el recorrido de herramientas, y bloquea la publicación si no supera el umbral acordado.

Antes de leer

Qué publicas

Una tabla de evaluación de lanzamiento para éxito, fundamentación, herramientas, seguridad, coste, recuperación y revisión humana.

Mejor para

Propietarios de Agents y equipos de producto que necesitan pruebas repetibles en lugar de confianza basada en demos.

Dónde ocurre el trabajo

Evaluación de Agents · Pruebas de IA · Versión gate · Microsoft.Extensions.AI.Evaluation

01

Evalúa el trabajo, no la demo

Define resultado, herramientas permitidas, acciones prohibidas, fuente de evidencia, coste, latencia, aprobaciones y condición de parada antes de elegir métricas. Una respuesta fluida puede acompañar una escritura incorrecta.

Incluye tareas habituales, bordes difíciles, fallos previos, denegaciones, contenido hostil, timeouts, recuperación y búsqueda vacía; vincula cada caso a una revisión exacta.

Usa comprobaciones deterministas para reglas exactas y evaluadores calibrados para calidad. Una persona sigue decidiendo criterios ambiguos, cambios de alto impacto y el lanzamiento.

02

Un ciclo de evaluación repetible

  1. 01
    Crea un conjunto de datos acotado

    Selecciona evidencia de forma explícita, elimina secretos y datos innecesarios, define resultados esperados y separa casos de abuso y recuperación.

  2. 02
    Puntúa respuesta y trayectoria

    Mide fundamentación, completitud, tarea adherence, intent resolution, elección y argumentos de herramientas, efectos, reintentos, latencia y coste por trabajo correcto.

  3. 03
    Revisa, mejora y repite

    Investiga fallos, redacta un cambio limitado, somételo a decisión humana y compara los mismos casos con la revisión anterior antes de publicar.

03

Falsas señales de confianza

Unos chats correctos son ejemplos, no un conjunto de datos. La media puede ocultar una acción irreversible, por lo que los writes importantes necesitan casos exactos de denegación y aprobación.

Un LLM evaluador no es verdad absoluta: calíbralo con etiquetas humanas, conserva comprobaciones deterministas y no conviertas errores de modelo, billing o infraestructura en aprobados.

Evaluación no sustituye pentest, monitorización ni validación de clientes. Mantén cada evidencia en su carril.

04

Define la decisión de publicación

El resultado útil es una regla que el equipo puede repetir tras cada cambio.

  1. 01
    Fija umbrales

    Define precisión mínima, casos de tolerancia cero, coste, latencia, variación y quién acepta el riesgo residual.

  2. 02
    Ejecuta una revisión exacta

    Registra Agent, instrucción, modelo, herramientas, Knowledge, perfil, casos y repeticiones para poder comparar.

  3. 03
    Convierte fallos en regresiones

    Añade cada fallo material del piloto o producción y exige que pase antes de la siguiente publicación.

05

Evaluations en Prostir

Prostir tiene un módulo Evaluations implementado y compartido por Agent, Skill y Company, con casos tipados, perfiles, runs, resultados, señales y propuestas bajo el producto exacto.

La evidencia entra solo con selección y consentimiento explícitos. Los comprobaciones deterministas no requieren evaluador; Microsoft.Extensions.AI.Evaluation exige autorización expresa de créditos y presupuesto positivo.

Un run no cambia ni publica el producto. La propuesta espera revisión humana y solo puede modificar el borrador con su revisión exacta todavía vigente.

Soluciones

Constructor de agentes de IA para un producto que controlas

Crea un Agent gestionado, pruébalo con preguntas reales, conecta únicamente el conocimiento y las acciones que necesita y publícalo en privado o elige el acceso público de forma expresa. Prostir aporta alojamiento, identidad, acceso protegido y entrega en clientes de IA compatibles.

Soluciones

Convierte la demo útil en un Agent propio

Cuéntanos el trabajo, quién debe usarlo, qué fuentes necesita y qué nunca debe hacer. Te ayudaremos a delimitar una primera versión que puedas probar con honestidad.