El mismo motor, la misma pregunta, tres veces seguidas: en 12 de 27 casos no dio la misma respuesta
Medir una vez no da una medición. Da un número.
De 269 preguntas lanzadas tres veces seguidas al mismo motor, la marca apareció alguna vez en 27. En 12 de esas 27 no apareció las tres veces: un 44,4 %, con un intervalo de confianza del 95 % entre el 27,6 % y el 62,7 %.
- Muestra
- 269 preguntas lanzadas tres veces seguidas al mismo motor · 27 de ellas con la marca presente al menos una vez
- Periodo
- Junio – septiembre de 2026
- Método
- Tres repeticiones de cada pregunta en la misma sesión, mismo motor y mismo transporte. Se compara si la marca apareció las tres veces.
- Idioma
- Español (España)
Por qué el denominador son 27 y no 269
Porque en la mayoría de preguntas la marca no sale ninguna de las tres veces, y esas concuerdan por no haber pasado nada.
Si se contaran las 269, la discrepancia saldría del 4,5 % y sonaría tranquilizadora. Sería mentira: la estaría diluyendo con las preguntas donde no había nada que decidir. La pregunta relevante es «de las veces en que el motor pudo nombrarte, ¿lo hizo siempre?», y la respuesta es que no, casi la mitad de las veces.
El intervalo es ancho —del 27,6 % al 62,7 %— porque 27 casos son pocos, y eso también se dice. Pero incluso el extremo optimista deja el desacuerdo por encima de una de cada cuatro preguntas.
El motor tampoco se apoya en las mismas fuentes
Sobre esas mismas 269 preguntas repetidas, las fuentes que el motor cita al responder dos veces a la misma pregunta coinciden solo en un 70,9 %. Casi un tercio de la bibliografía cambia entre una ejecución y la siguiente, sin que cambie ni la pregunta ni el momento.
Qué no podemos decir de ChatGPT
En ChatGPT solo tenemos 8 preguntas repetidas en las que la marca llegara a aparecer. Con ocho casos no se puede afirmar nada, así que no lo afirmamos — aunque el dato bruto sea llamativo. Publicar ese porcentaje sería exactamente el error que este hallazgo denuncia.
Qué se hace con esto
- Tres repeticiones por pregunta en la medición semanal, y la métrica es la media de las tres. Una sola pasada es una tirada de moneda con formato de informe.
- Intervalo de Wilson y n junto a cada porcentaje. Un 23 % sin intervalo parece firme y no lo es.
- Un movimiento pequeño entre semanas no es una noticia. Si dos semanas tienen intervalos que se solapan, lo honesto es decir que no se distinguen, no dibujar una flecha.
Lo que este hallazgo NO prueba
- No dice que el motor esté roto. Un modelo generativo produce texto distinto en cada ejecución por diseño; la variabilidad no es un defecto, es la naturaleza de lo que se mide.
- Veintisiete casos son pocos. El punto central (44,4 %) es mucho menos fiable que la conclusión de que el desacuerdo existe y no es marginal.
- No se extrapola a otros motores. La cifra de Perplexity no dice nada sobre Google AI Mode ni sobre ChatGPT.
- No mide si tres repeticiones bastan. Solo demuestra que una no basta.
Preguntas frecuentes
¿Cuántas veces hay que repetir una pregunta para medir bien?
No lo sabemos con precisión y no lo vamos a inventar. Lo que estos datos demuestran es que una sola pasada no basta: en casi la mitad de las preguntas donde la marca podía salir, el resultado dependía de qué ejecución mirases. Nosotros usamos tres y publicamos el intervalo.
¿Por qué un buscador de IA no da siempre la misma respuesta?
Porque genera el texto en cada consulta en lugar de devolver una lista guardada. Dos ejecuciones de la misma pregunta pueden recuperar fuentes distintas y redactar la respuesta de otra manera, y con ello nombrar o no nombrar a una marca.
¿Eso invalida las métricas de visibilidad en IA?
No, siempre que se publiquen con su muestra y su intervalo. Lo que invalida es el número pelado: un porcentaje de una sola pasada, sin n y sin intervalo, no permite distinguir un cambio real del ruido del propio motor.