Teoría17 de agosto de 20265 min de lectura

Tu IA dice que acierta: la pregunta que casi nadie le hace después

Cualquier proveedor te va a decir que su IA 'acierta'. Casi ninguno te explica sobre qué se midió eso. Tres preguntas concretas para comprobarlo antes de confiar tu dato a un modelo, con ejemplos reales de AutoBoost.

Pol

Fundador de AutoBoost

IA aplicadaValidación
Tu IA dice que acierta: la pregunta que casi nadie le hace después

Tu IA dice que acierta, pero acierta ¿sobre qué exactamente? Es la pregunta que nos hacemos con cada proyecto antes de dejar que un modelo toque un dato real, y es la que casi nunca se hace un comprador cuando un proveedor le enseña una demo. "Acierta el 95%" suena a garantía. En realidad no dice nada hasta que sabes sobre qué muestra se midió, qué tipo de error se está contando y qué pasa con los casos que no son el típico.

Esto no es un matiz académico. Es la diferencia entre una IA que de verdad puedes poner a trabajar con datos reales y una que solo parece que funciona hasta el día que falla en silencio, con la confianza de siempre.

La trampa del total que cuadra

El error más común, y el más difícil de detectar, es medir el acierto por el resultado final en vez de por cada paso que llevó hasta él. Un resultado correcto no garantiza que las partes que lo componen también lo sean. Dos errores que se cancelan entre sí producen exactamente el mismo total que cero errores: por fuera no se distingue nada, el número final parece impecable y nadie tiene motivo para mirar más abajo.

Es la misma lógica por la que un examen con nota final de 8 no te dice si el alumno falló las preguntas fáciles y acertó las difíciles por suerte, o al revés. El total esconde la distribución del error, y la distribución es justo lo que importa cuando la IA va a actuar sola sobre tu negocio.

Tres preguntas para comprobarlo de verdad

Antes de aceptar que una IA "acierta", estas tres preguntas separan una cifra de marketing de una cifra que puedes defender:

1. ¿Se mide el total o cada paso intermedio?

En un proyecto real que hicimos para un grupo veterinario, la IA no se conforma con que el total de una factura cuadre. Recalcula el impuesto de cada línea por separado y comprueba que la suma exacta coincide con el documento. Si un proveedor mete un descuento raro o una línea exenta, el sistema lo detecta ahí, no al final. Y si algo no cuadra, no se contabiliza a ciegas: se borra el intento y queda para revisión humana, porque preferimos una factura pendiente a una mal contabilizada que nadie ve hasta el cierre. Puedes ver el detalle completo en el caso de facturas automáticas.

Esa es la diferencia entre "acierta el total" y "acierta cada línea que compone el total". Solo la segunda es una garantía real.

2. ¿Sobre qué muestra se midió, y contra qué fuente se comparó?

Un "97% de acierto" calculado contra tus propios datos, sin cruzarlo con nada externo, solo demuestra que el modelo es coherente consigo mismo, no que acierte de verdad. En una plataforma de datos que construimos para un grupo de farmacias, la IA razona sobre más de un millón de líneas para reconstruir una cifra de ventas que el ERP del cliente calculaba mal. La validación no se quedó en "el modelo dice que está bien": se comparó al céntimo contra la fuente autoritativa, con una desviación final de 0,0004%. Ese número solo significa algo porque hay una fuente externa contra la que se contrastó. Sin eso, es una opinión con decimales. Lo contamos con más detalle en el caso de la plataforma de datos con IA.

3. ¿Qué pasa con los casos raros, no con los típicos?

Un modelo puede acertar el 99% de los casos normales y fallar sistemáticamente en el 1% que más importa, y esa cifra global lo esconde perfectamente. Ya nos pasó con un informe de movimientos bancarios que decía estar completo: al compararlo contra el extracto oficial del banco, faltaban 492 de 1.298 movimientos reales solo en una cuenta. El informe no daba ningún error, no faltaba nada visible en pantalla. La única forma de descubrirlo fue dejar de fiarse de que un informe está completo porque no avisa de lo contrario, y comprobarlo contra la fuente que sí manda. Lo contamos entero en el post sobre esos 492 movimientos.

Tabla: la pregunta que engaña frente a la que sirve

Pregunta que suena bien pero no sirvePregunta que de verdad comprueba el acierto
"¿Qué porcentaje de acierto tiene tu IA?""¿Ese porcentaje se mide por línea o por el total final?"
"¿Está validado?""¿Contra qué fuente externa se contrastó, y quién la controla?"
"¿Cuántas veces se ha probado?""¿Se ha probado con los casos raros, o solo con los típicos?"
"Funciona en la demo""¿Qué hace el sistema cuando algo no cuadra: avisa, o sigue como si nada?"
"El resultado final es correcto""¿Cada paso que llevó a ese resultado también lo es?"

Qué hacemos distinto en AutoBoost

No integramos un modelo y confiamos en su palabra. Diseñamos el sistema para que valide cada paso contra una fuente real, no solo contra sí mismo, y para que se detenga y avise cuando algo no cuadra en vez de seguir adelante con una respuesta segura pero equivocada. Es la diferencia entre una IA que "parece que acierta" y una IA a la que le puedes confiar trabajo real: cotizaciones, facturas, pedidos, decisiones de compra. Si quieres ver cómo lo montamos según el sistema que ya tienes (ERP, CRM, contabilidad), puedes revisar nuestros servicios.

La próxima vez que alguien te enseñe un porcentaje de acierto, no le preguntes si es alto. Pregúntale sobre qué se midió, contra qué se comparó, y qué pasa cuando algo se sale de lo normal. Si no tiene una respuesta clara a las tres, todavía no lo sabe, y tú tampoco deberías darlo por bueno.

¿Quieres que revisemos cómo mide de verdad tu IA (o la de tu proveedor) antes de confiarle más trabajo? Escríbenos y lo miramos juntos.

Compartir artículo
Tu IA dice que acierta: qué preguntar antes de creerla | AutoBoost