Le preguntamos lo mismo a 4 IA 1.200 veces y coinciden en menos del 10%.

  • Autor Autor sap323
  • Fecha de inicio Fecha de inicio
sap323

sap323

VIP
Beta
Verificado
Verificación en dos pasos activada
¡Usuario con pocos negocios! ¡Utiliza siempre saldo de Forobeta!
Suscripción a IA
Le preguntamos lo mismo a 4 IA 1.200 veces y coinciden en menos del 10%.

Hace un tiempo venía leyendo estudios sobre visibilidad en IA y algo empezó a incomodarme. Están todos hechos en inglés, sobre marcas de Estados Unidos, y después los citamos como si sirvieran para un negocio en Bogotá o Valencia.

Busqué el equivalente en español y no encontré nada, así que decidimos hacerlo nosotros. Elegimos un mercado con muchos competidores reales, agencias de marketing en Argentina, y armamos 100 búsquedas escritas como las escribiría cualquier persona.

Las lanzamos en cuatro motores, ChatGPT, Gemini, Google AI Overview y Perplexity. Y aquí está la parte que casi nadie hace, repetimos las mismas 100 búsquedas tres veces, el mismo día, sin cambiar una sola palabra.

Fueron 1.200 consultas en total. Lo primero que apareció ya me pareció fuerte. Dos IA coinciden en promedio en apenas el 9,6% de las marcas que recomiendan. O sea, de cada diez marcas que aparecen, nueve no se repiten en el otro modelo. Y cuando junté todo quedaron 932 agencias distintas, de las cuales el 81% apareció en un solo motor y en ninguno de los otros tres.

Pero esperá, porque eso todavía no fue lo que más me sorprendió.

Antes de comparar los modelos entre sí me hice la pregunta obvia. Si le hago la misma búsqueda a ChatGPT tres veces seguidas, el mismo día, ¿me devuelve las mismas marcas?
Y la respuesta es que no.

ChatGPT coincide consigo mismo apenas el 26% de las veces. El más estable, AI Overview, llega al 39% y ni así pasa la mitad. Es decir, tres de cada cuatro marcas que menciona cambian de una respuesta a la siguiente. Y ese dato rompe medio estudio, incluido el mío. Porque dos modelos no pueden coincidir entre sí más de lo que cada uno coincide consigo mismo.

Ese 9,6% no significa que las IA piensen distinto, significa que buena parte de lo que parece desacuerdo en realidad es ruido. Una última cosa que no esperaba. Perplexity juega otro juego, recomienda redes globales como VML, Ogilvy o Dentsu, mientras los otros tres premian a las agencias locales.

Un ejemplo claro, la misma agencia que para Gemini aparece en 70 de las 100 búsquedas, para Perplexity aparece en 9. Lo que me llevo es simple. Hay que medir los cuatro motores por separado, porque uno no predice a los otros. Nunca hay que fiarse de una sola consulta.

Y si tu marca es local, conviene empezar por Google, que AI Overview y Gemini son los que más se parecen entre sí.

Aclaración necesaria, trabajo en CreceRank y todo esto lo hicimos con nuestra propia herramienta, así que puede haber sesgo. Y lo peor es que no tengo con qué compararlo, porque no existe nada parecido hecho para el mercado hispanohablante.

Si alguien tiene datos que me contradigan o quiere revisar a fondo la metodología, adelante, es justo lo que más me sirve.
 
Es un dato muy obvio en cierto modo: demuestra que la visibilidad en IA no es uniforme ni estable entre modelos.

Cada sistema utiliza fuentes, mecanismos de recuperación y criterios de respuesta diferentes.

Por eso, el SEO para LLM debe medirse en varias IA, con distintos prompts y de forma recurrente, no mediante una única consulta.

No soy nada fan de trackear prompts y cosas así porque no vale para nada, suelo usar plantillas en Google Studio para trackear visitas y Semrush las menciones totales e intentar que haya crecimiento.
 
Como es de suponer te indica la logica que fueron creadas y se alimentan para dar repuestas de fuentes y metodos completamente diferentes.
 
Es un dato muy obvio en cierto modo: demuestra que la visibilidad en IA no es uniforme ni estable entre modelos.

Cada sistema utiliza fuentes, mecanismos de recuperación y criterios de respuesta diferentes.

Por eso, el SEO para LLM debe medirse en varias IA, con distintos prompts y de forma recurrente, no mediante una única consulta.

No soy nada fan de trackear prompts y cosas así porque no vale para nada, suelo usar plantillas en Google Studio para trackear visitas y Semrush las menciones totales e intentar que haya crecimiento.
Gracias por tu comentario! Claro, ya sabemos que no es uniforme... pero cuánto? No es lo mismo un 0% que un 10% o un 25%.


Comparto con tu punto de vista, por eso lo medimos en 4 LLM distintos con 150 prompts distintos: https://crecerank.com/overlap-ia-llm-experimento-3/

El problema con Google Studio, es que no mide de forma precisa el tráfico de las IA, ya que no siempre hay un link directo. Mismo puede tomar como fuente tráfico directo u orgánico, si luego el usuario fue a Google y puso la recomendación de ChatGPT. Qué opinás?
 
Gracias por tu comentario! Claro, ya sabemos que no es uniforme... pero cuánto? No es lo mismo un 0% que un 10% o un 25%.


Comparto con tu punto de vista, por eso lo medimos en 4 LLM distintos con 150 prompts distintos: https://crecerank.com/overlap-ia-llm-experimento-3/

El problema con Google Studio, es que no mide de forma precisa el tráfico de las IA, ya que no siempre hay un link directo. Mismo puede tomar como fuente tráfico directo u orgánico, si luego el usuario fue a Google y puso la recomendación de ChatGPT. Qué opinás?
No deberían ser uniforme en ningún caso, creo que no hace falta un estudio la verdad.

Como te dije Studio para visitas y Semrush para menciones con eso basta ahora mismo.
 
Por mi experiencia la IA intenta complacerte con sus respuestas y dependiendo de la conversacion cambia una respuesta de una IA a otra
 
Atrás
Arriba