Lección 4.3 · 30 min

Evaluar y monitorear: decide cambios de prompt y de modelo con datos

Arma un conjunto de casos de prueba, registra cada llamada a la API con su costo y latencia, mide calidad con calificadores de código y de modelo, y compara Opus 5.5, Sonnet 5.5 y Haiku 5.5 con tus propios datos.

En la lección anterior quedó una pregunta abierta: ¿puede Haiku 5.5 clasificar las reseñas de Viajes Kukulcán igual de bien que Opus 5.5 por una fracción del costo? También hay otras en la fila: ¿mejoró el asistente después de cambiar el prompt de sistema?, ¿cuánto cuesta en realidad cada conversación?, ¿por qué el martes hubo respuestas cortadas? Ninguna se contesta probando tres ejemplos a mano. Se contestan con casos de prueba y registros.

Qué verás en esta lección

  1. Por qué no basta con probar a mano
  2. Paso 1: casos de prueba
  3. Paso 2: un registro para cada llamada
  4. Paso 3: correr la evaluación con varios modelos
  5. Cuando no hay una respuesta exacta
  6. Monitorear en producción
  7. Práctica
  8. Resumen
  9. Quiz

El resto de la lección es para alumnos. Se abre al comprar el curso o con la Membresía de IA con Clase.

Ver precios Ya compré: acceder o empieza con una lección gratis