Nuestra primera medición de precisión dio un 99,5 %. Era falsa
Una métrica que no puede salir mal no mide nada. Mide que quien la escribió eligió bien las palabras.
De las 107 comprobaciones que producían aquel 99,5 %, 106 no podían salir mal por construcción. Al exigir que cada dato pudiera ser contradicho por la respuesta, la cifra real quedó en un 64,2 % sobre 53 comprobaciones.
- Muestra
- 107 comprobaciones iniciales · 53 tras exigir que cada dato pudiera fallar
- Periodo
- Agosto – septiembre de 2026
- Método
- Cada afirmación de la IA sobre un dato verificado de la marca se puntúa 2 (acierta), 1 (a medias) o 0 (contradice). El silencio no puntúa.
- Idioma
- Español (España)
Qué estaba mal
El Accuracy Score mide, de las veces que una IA afirma un dato tuyo, cuántas acierta. La primera versión puntuaba dos tipos de afirmación: las de valor (un año, una ciudad, una cifra) y las de texto (que la respuesta contenga o no cierta expresión). Las de texto solo declaraban qué debía aparecer, nunca qué no debía aparecer.
Una afirmación que solo puede acertar o no aplicar nunca puede fallar. Solo puede subir el porcentaje.
El caso extremo era tautológico: una comprobación se activaba cuando la frase contenía la palabra «geo» y acto seguido comprobaba si la frase contenía la palabra «geo». Cien por cien garantizado, y 63 de las 107 comprobaciones eran esa.
El arreglo
Se arregló en el módulo y no solo en el fichero de datos, que era la tentación fácil. Ahora un dato solo entra en la puntuación si es falsable: los de valor lo son por naturaleza; los de texto, solo si declaran también qué expresión los contradice. Los descartados se reportan aparte, con el motivo y con cuántas veces habrían puntuado — que es el dato que convence de arreglarlos.
Con el filtro puesto, la muestra cayó de 107 a 1. Un 50 % sobre una comprobación tampoco es publicable, así que se añadió un mínimo de 10 observaciones por debajo del cual la métrica se enseña pero no da veredicto.
Lo que apareció cuando el número fue de verdad
Con datos verificados por el dueño de la marca, el Accuracy quedó en 64,2 % sobre 53 comprobaciones, con 9 errores reales. Y ahí estaba el hallazgo que ninguna otra vista habría dado:
- 8 de los 9 errores eran el mismo dato: los años de experiencia.
- 7 de esas respuestas citaban la propia web de la marca. La web decía «10+ años» y el dato real eran más de quince. El error no lo estaba inventando la IA: se lo estábamos dando nosotros.
Dos falsos positivos que solo se ven revisando a mano
- Homónimos. Un nombre corto cabe entero dentro de uno más largo, así que las frases sobre otra persona con el mismo nombre y un apellido más se contaban como errores del motor. Eran 36 frases: el peor falso positivo posible, porque castigaba al motor justo cuando estaba desambiguando bien.
- Una exclusión demasiado amplia. Se declaró «fundaciones» como algo que la marca no hace, y sí trabaja con fundaciones. La regla que salió de ahí: lo que se declara ajeno es el oficio que no es tuyo, nunca el sector de tus clientes. Sin exclusiones el porcentaje sube solo; con exclusiones demasiado amplias marca como error algo que es verdad. Los dos extremos mienten.
Lo que este hallazgo NO prueba
- Es una sola marca y 53 comprobaciones. El 64,2 % describe ese caso, no el estado general de la precisión de la IA.
- No mide alucinaciones en general, solo contradicciones con datos que el dueño de la marca ha verificado por escrito.
- El silencio no puntúa: que un modelo no mencione un dato tuyo no cuenta ni a favor ni en contra. Contarlo convertiría la métrica en ruido.
- No dice que otras herramientas tengan este fallo. Dice que lo tuvimos nosotros y cómo se detecta.
Preguntas frecuentes
¿Qué es el Accuracy Score?
Es el porcentaje de acierto de la IA cuando afirma un dato concreto de tu marca: se puntúa 2 si acierta, 1 si acierta a medias y 0 si contradice un dato verificado. El silencio no puntúa, y el porcentaje se publica siempre con su número de observaciones y su intervalo.
¿Por qué un 99,5 % de precisión es sospechoso?
Porque casi siempre significa que las comprobaciones no podían fallar. Antes de creerse una cifra de precisión conviene preguntar qué respuesta la habría hecho bajar: si no existe ninguna, el número no mide precisión, mide cómo se redactó la comprobación.
¿Puede la IA equivocarse por culpa de mi propia web?
Sí, y es más habitual de lo que parece. En este caso, 7 de las respuestas equivocadas citaban la web de la marca como fuente: el dato desactualizado estaba en su propia página. Corregir la fuente es más barato que intentar corregir al modelo.