Qué es un eval: cómo saber si tu IA hace bien su trabajo
Cambias las instrucciones de tu asistente y parece que responde mejor. ¿Mejor en todo, o solo en las tres preguntas que probaste? Sin un eval no lo sabes: lo adivinas. Un eval es un examen con las respuestas buenas ya escritas, que le pasas a tu IA antes de que se equivoque delante de un cliente. Aquí va qué es, con qué se pone la nota, cómo armar el primero y por qué un aprobado no lo dice todo.
- 01Qué esQué es un eval
- 02Qué esLas piezas de un eval
- 03DecidirQuién pone la nota
- 04Paso a pasoCómo armar tu primer eval
- 05CuidadoPor qué un aprobado no lo dice todo
- 06PromptsUn prompt para sacar casos de tus errores
- 07CuidadoLo honesto
Qué es un eval (evaluación de IA)
Anthropic lo define así: un eval es una prueba para un sistema de IA. Le das una entrada y aplicas una lógica de corrección a su respuesta para medir si acertó. (Anthropic Engineering · evals)
La misma guía describe qué pasa sin ellos: los usuarios dicen que el asistente «está peor» después de un cambio y el equipo va a ciegas, probando a mano y esperando que no se haya roto otra cosa. Con un eval, cada cambio se prueba contra todos los casos antes de salir.
Piensa en un examen con la hoja de respuestas. No preguntas «¿estudiaste?»: le pones las preguntas y corriges con la hoja. Lo que cuenta es la nota, no lo que dice el alumno.
Las piezas de un eval
La guía de Anthropic usa estos nombres; aquí, en simple: (Anthropic Engineering · evals)
| Pieza | Qué es | Ejemplo con un bot de reservas |
|---|---|---|
| Caso (task) | Una prueba con su entrada y su criterio de éxito | «Quiero cita el viernes a las 5» |
| Intento (trial) | Cada vez que se corre un caso; la IA no responde igual siempre, por eso se repite | El mismo mensaje, tres veces |
| Calificador (grader) | Lo que pone la nota | Un programa que mira la agenda |
| Resultado (outcome) | Cómo quedó el sistema de verdad al terminar | ¿Existe la cita en la agenda? |
La última fila es la más importante. El ejemplo de Anthropic: un agente de vuelos puede decir «tu vuelo está reservado», pero el resultado es si la reserva existe en la base de datos. Se corrige lo que quedó hecho, no lo que la IA dice que hizo.
Quién pone la nota: un programa, otra IA o una persona
| Quién corrige | A favor | En contra |
|---|---|---|
| Un programa (¿dice tal frase? ¿existe la cita?) | Rápido, barato, da siempre la misma nota | Rígido: marca mal una respuesta buena escrita distinto |
| Otra IA con una pauta | Entiende matices y respuestas abiertas | Puede variar; hay que compararla antes con lo que diría una persona |
| Una persona | La mejor calidad | Lenta y cara |
La recomendación oficial: el método más rápido y fiable que sirva. Un programa cuando se pueda, otra IA cuando haga falta juicio, y personas de vez en cuando para comprobar. Y más casos con una corrección algo menos fina es mejor que pocos casos corregidos a mano. (Claude Docs · criterios y evaluaciones)
Cómo armar tu primer eval
- Define qué es «bien», en concreto. «Que responda bien» no se puede medir. «Que dé el precio correcto del servicio que le preguntan» sí. La documentación pide criterios específicos y medibles.
- Empieza con 20 a 50 casos sacados de errores reales. Es la cifra que da Anthropic para empezar. Los mejores casos son las quejas de clientes y lo que ya revisas a mano antes de cada cambio.
- Prueba los dos lados. Lo que debe hacer y lo que no debe hacer. Si solo pruebas que busca en internet cuando debe, acabarás con un asistente que busca casi para todo.
- Escribe una respuesta de referencia que apruebe. Demuestra que el caso tiene solución y que tu corrección funciona. Si ni con la respuesta ideal se aprueba, casi seguro el caso está mal escrito.
- Córrelo antes de cada cambio y lee las respuestas. Cuando algo falla, mira si la IA se equivocó o si tu eval rechazó una respuesta válida.
Nuestro ejemplo real: antes de tocar el bot que contesta los mensajes de Instagram de IActn, corremos sus 13 comprobaciones; la última vez, el 30-09-2026, pasaron las 13. Y una regla nuestra: cuando algo falla en vivo, el caso entra al eval antes de arreglarlo. Si lo arreglas primero, el caso ya no se añade nunca.
Por qué un aprobado no lo dice todo
- El eval también se equivoca. Anthropic cuenta que Opus 4.5 sacó un 42% en una prueba pública hasta que alguien revisó la corrección: penalizaba «96.12» cuando esperaba «96.124991…», entre otros fallos. Arreglada la corrección y con menos restricciones, sacó un 95%.
- Un 100% ya no enseña a mejorar. Los evals que protegen de retrocesos deben estar casi siempre al 100%. Los que miden lo que aún no hace bien deben empezar bajos, o no te dicen nada nuevo.
- Acertar una vez no es acertar siempre. Si tu asistente acierta un caso el 75% de las veces y el cliente pregunta tres veces, la probabilidad de que acierte las tres es de un 42%. En un bot que atiende clientes, lo que importa es la constancia.
Por eso la guía de Anthropic insiste en leer las respuestas: cuando falla un caso, tiene que quedar claro qué hizo mal la IA. Y la pregunta siguiente es la del canario: ¿viste alguna vez a tu eval ponerse en rojo? (Anthropic Engineering · evals)
Un prompt para sacar casos de tus errores
Es nuestro, no de Anthropic. La documentación sugiere pedirle a Claude que te ayude a generar más casos a partir de unos pocos.
De las quejas a los casos de prueba
Cuándo usarlo: cuando tu asistente ya se equivocó alguna vez y quieres que no vuelva a pasar sin que te enteres.
Lo honesto
- «Eval» es la palabra que se usa en inglés, incluso en equipos que hablan español. En castellano también se dice «evaluación» o «prueba».
- Las cifras de esta guía son de Anthropic (los 20 a 50 casos, el 42% que pasó a 95%). Son su experiencia, no una ley: tu caso puede pedir más.
- Un eval prueba lo que escribiste. Lo que no se te ocurrió preguntar, no lo vigila. Por eso se van sumando casos cada vez que aparece un error nuevo.
- El nuestro también tuvo huecos. Que pasen todas las comprobaciones no nos ha librado de todos los fallos del bot: por eso la regla de meter cada fallo nuevo como caso.
No cambies las instrucciones de tu IA sin unos casos que te digan si mejoró o empeoró. Empieza con 20 errores reales, prueba lo que debe y lo que no debe hacer, y corrige lo que quedó hecho, no lo que la IA dice que hizo.
¿Y ahora qué?
Tres formas de seguir, según lo que prefieras.
El mensaje para tu grupo
¿Le sirve a alguien de tu equipo o de tu grupo? Cópialo tal cual o ábrelo directo en WhatsApp.
Te paso esta guía: Qué es un eval. Saber si tu IA mejoró, en vez de adivinarlo. https://iactn.com/arsenal/que-es-un-eval/Fuentes, leídas el 30-09-2026
- Demystifying evals for AI agents · Anthropic Engineering, 9 de enero de 2026. La definición, las piezas (caso, intento, calificador, resultado), el ejemplo del vuelo, los tres tipos de calificador, empezar con 20 a 50 casos de errores reales, probar los dos lados, la respuesta de referencia, leer las respuestas, el 42% → 95%, evals de retroceso y de capacidad, y la cuenta del 75% en tres intentos.
- Define success criteria and build evaluations · Claude Platform Docs. Criterios específicos y medibles, el método de corrección más rápido y fiable, más casos antes que corrección a mano y pedirle a Claude más casos a partir de unos pocos.