Evaluar y monitorear: decide cambios de prompt y de modelo con datos
Arma un conjunto de casos de prueba, registra cada llamada a la API con su costo y latencia, mide calidad con calificadores de código y de modelo, y compara Opus 5.5, Sonnet 5.5 y Haiku 5.5 con tus propios datos.
En la lección anterior quedó una pregunta abierta: ¿puede Haiku 5.5 clasificar las reseñas de Viajes Kukulcán igual de bien que Opus 5.5 por una fracción del costo? También hay otras en la fila: ¿mejoró el asistente después de cambiar el prompt de sistema?, ¿cuánto cuesta en realidad cada conversación?, ¿por qué el martes hubo respuestas cortadas? Ninguna se contesta probando tres ejemplos a mano. Se contestan con casos de prueba y registros.
Qué verás en esta lección
- Por qué no basta con probar a mano
- Paso 1: casos de prueba
- Paso 2: un registro para cada llamada
- Paso 3: correr la evaluación con varios modelos
- Cuando no hay una respuesta exacta
- Monitorear en producción
- Práctica
- Resumen
- Quiz
El resto de la lección es para alumnos. Se abre al comprar el curso o con la Membresía de IA con Clase.
Ver precios Ya compré: acceder o empieza con una lección gratis