vilnux English Auditoría gratis →
Hallazgo 02 · Método

El mismo motor, la misma pregunta, tres veces seguidas: en 12 de 27 casos no dio la misma respuesta

Medir una vez no da una medición. Da un número.

De 269 preguntas lanzadas tres veces seguidas al mismo motor, la marca apareció alguna vez en 27. En 12 de esas 27 no apareció las tres veces: un 44,4 %, con un intervalo de confianza del 95 % entre el 27,6 % y el 62,7 %.

Muestra
269 preguntas lanzadas tres veces seguidas al mismo motor · 27 de ellas con la marca presente al menos una vez
Periodo
Junio – septiembre de 2026
Método
Tres repeticiones de cada pregunta en la misma sesión, mismo motor y mismo transporte. Se compara si la marca apareció las tres veces.
Idioma
Español (España)

Por qué el denominador son 27 y no 269

Porque en la mayoría de preguntas la marca no sale ninguna de las tres veces, y esas concuerdan por no haber pasado nada.

Si se contaran las 269, la discrepancia saldría del 4,5 % y sonaría tranquilizadora. Sería mentira: la estaría diluyendo con las preguntas donde no había nada que decidir. La pregunta relevante es «de las veces en que el motor pudo nombrarte, ¿lo hizo siempre?», y la respuesta es que no, casi la mitad de las veces.

El intervalo es ancho —del 27,6 % al 62,7 %— porque 27 casos son pocos, y eso también se dice. Pero incluso el extremo optimista deja el desacuerdo por encima de una de cada cuatro preguntas.

El motor tampoco se apoya en las mismas fuentes

Sobre esas mismas 269 preguntas repetidas, las fuentes que el motor cita al responder dos veces a la misma pregunta coinciden solo en un 70,9 %. Casi un tercio de la bibliografía cambia entre una ejecución y la siguiente, sin que cambie ni la pregunta ni el momento.

Qué no podemos decir de ChatGPT

En ChatGPT solo tenemos 8 preguntas repetidas en las que la marca llegara a aparecer. Con ocho casos no se puede afirmar nada, así que no lo afirmamos — aunque el dato bruto sea llamativo. Publicar ese porcentaje sería exactamente el error que este hallazgo denuncia.

Qué se hace con esto

Lo que este hallazgo NO prueba

Preguntas frecuentes

¿Cuántas veces hay que repetir una pregunta para medir bien?

No lo sabemos con precisión y no lo vamos a inventar. Lo que estos datos demuestran es que una sola pasada no basta: en casi la mitad de las preguntas donde la marca podía salir, el resultado dependía de qué ejecución mirases. Nosotros usamos tres y publicamos el intervalo.

¿Por qué un buscador de IA no da siempre la misma respuesta?

Porque genera el texto en cada consulta en lugar de devolver una lista guardada. Dos ejecuciones de la misma pregunta pueden recuperar fuentes distintas y redactar la respuesta de otra manera, y con ello nombrar o no nombrar a una marca.

¿Eso invalida las métricas de visibilidad en IA?

No, siempre que se publiquen con su muestra y su intervalo. Lo que invalida es el número pelado: un porcentaje de una sola pasada, sin n y sin intervalo, no permite distinguir un cambio real del ruido del propio motor.

Otros hallazgos Google AI Mode citó un 67 % menos · Cada motor lee un internet distinto · Una métrica que no puede fallar · ¿Convierte mejor el tráfico de ChatGPT?

← Todos los hallazgos

Publicado el 1 de septiembre de 2026
Inicio · Metodología · Planes y precios