«Esto… ¿lo decimos nosotros en algún sitio?»
Le pides a la IA que investigue a fondo tu propia empresa y te devuelve un informe con su lista de fuentes. Entre esas fuentes están tus propias páginas.
En el cuerpo del informe, sin embargo, hay cosas sobre tu empresa que en tu web no aparecen por ningún lado. Y el enlace pegado como respaldo apunta a una página tuya.
Seguro que abriste uno. La página cargó bien y hablaba de lo que tenía que hablar.
El segundo ya no lo abriste. La comprobación suele acabarse ahí.
Hex-ko leyó una medición y se puso a recontar las columnas que le faltaban a su informe de visibilidad.
¿Cuánto respaldan esos enlaces lo que dice el informe?
Los enlaces abren en más del 94 % de los casos y el tema de la página encaja con la frase en más del 80 %. El respaldo factual (que esa página sostenga como hecho lo que el informe afirma) se queda entre el 39 % y el 77 % en los modelos punteros.
Abrir y encajar son dos comprobaciones. Sostener es una tercera.
Lo midieron seis personas de PricewaterhouseCoopers y lo publicaron el 7 de mayo de 2026 (estudio).
Pusieron a 14 modelos de IA a resolver 130 peticiones de investigación y luego abrieron, una a una, las citas que cada informe llevaba pegadas. Las peticiones salen de dos bancos de pruebas públicos en inglés.
Un agente de investigación profunda (deep research) es la función que manda a la IA recorrerse por su cuenta decenas o cientos de páginas y escribirte un informe con enlaces a las fuentes. Es el modo «investigar a fondo» de ChatGPT o de Gemini.
La coincidencia no la juzgó una persona caso por caso. La juzgó una IA que puntúa siguiendo una rúbrica, calibrada con entre 50 y 100 revisiones hechas a mano.
Tu informe cuenta la capa de fuera
Una frase del informe, una cita pegada debajo. Esta medición mira esa misma cita en tres sitios distintos:
- Si el enlace abre de verdad.
- Si el tema de la página citada encaja con la frase.
- Si el contenido de esa página sostiene la frase como un hecho.
Piénsalo como un número de teléfono impreso en una ficha. Que dé señal es la primera capa. Que conteste la empresa correcta, la segunda. Que quien contesta confirme lo que la ficha decía de ella, la tercera.
El «citas: tantas» de tu informe de visibilidad suele ser el recuento de la primera. Si llegas a la segunda, ya sabes que la IA trató tu página como fundamento de algo.
Solo la tercera capa mira qué se dijo de ti dentro de la respuesta. Es otra capa y mide otra cosa. De hecho, puedes apilar recuentos de la primera todo lo que quieras: la tercera sigue sin aparecer.
¿Hasta qué capa llegó la última cita que anotaste?
Con 150 búsquedas, los enlaces seguían abriendo
La misma medición dejó a dos modelos buscar entre 2 y 150 veces mientras preparaban cada informe.
El respaldo factual bajó, de media entre esos dos, alrededor de 42 puntos porcentuales. GPT-5.4 pasó del 79 % al 17 %, y Claude Opus 4.6, del 80 % al 58 %.
«Cuanto más a fondo mire, mejor me entiende.» ¿No lo dabas por hecho? Hex-ko lo daba.
En ese mismo experimento, los enlaces y la relevancia del tema no bajaron: a cualquier profundidad se quedaron por encima del 92 %. Cayó la tercera capa y solo la tercera.
La profundidad con la que te lee la IA la decide ella. De tu lado queda otra cosa: la forma en la que una frase tuya se deja leer suelta, fuera de su párrafo.
El estudio no midió si escribir así cambia el resultado. Pero una frase aguanta mejor sola cuando lleva estas tres cosas dentro:
- La cifra: «un 32 % más».
- De cuándo es: «en agosto de 2026».
- Con qué se compara: «frente al mismo mes del año anterior».
«En agosto de 2026 los envíos crecieron un 32 % frente al mismo mes del año anterior.» Sácala de su párrafo y sigue significando lo mismo.
«Este año hemos crecido mucho» no sobrevive a esa operación: sin los párrafos de alrededor, nadie sabe con qué se está comparando.
Dónde parar cuando te lleves este número
Lo medido son las citas de los informes que escribe la función de investigación profunda. La respuesta que te suelta ChatGPT cuando le preguntas de forma corriente se queda fuera.
Las 130 peticiones salen de dos bancos de pruebas públicos en inglés. En español no se midió nada, así que qué pasa cuando la pregunta va en tu idioma es terreno que este estudio no pisa.
Quien lo publica es PricewaterhouseCoopers, una firma de auditoría y consultoría que, entre otras cosas, vende acompañamiento en la adopción de IA. Es también un preprint: todavía no ha pasado revisión por pares.
Los 14 modelos son versiones concretas, las del momento de la evaluación. Además, los propios autores apuntan otro límite: las citas de la web se caen o cambian de contenido con el tiempo.
Descontado todo eso, lo que se puede traer a casa no es la cifra. Es el marco: contar las tres capas por separado.
abre diez citas al azar y anota cuántas cuadran
Si vas abriendo las que te llaman la atención, lo que se te junta es una colección de citas favorables. De ahí que las diez se saquen al azar, de entre las veces que la IA te citó este mes.
Entra en cada una, compara lo que ahí se dice de tu empresa con lo que dice tu propia página y apunta en cuántas coincide. No hace falta, por supuesto, abrirlas todas.
Ese número no es el de enlaces que abren ni el de temas que encajan. Es la tercera capa, medida por tu mano una vez.
El mes que suben las citas, ¿sube con ellas la parte que está bien contada? Con la columna del recuento como único dato, esa diferencia no aparece por ningún lado y la inversión se aprueba igual.
Si ya llevas la cuenta partida en dos columnas, citas por un lado y menciones por otro, esta es la tercera de al lado (vamos a separar citas y menciones).
Fuentes
- Onweller, H. et al. (Commercial Technology and Innovation Office, PricewaterhouseCoopers, U.S.), “Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents”, arXiv:2605.06635, 7 de mayo de 2026 (límites: preprint sin revisión por pares. Lo publica PricewaterhouseCoopers, firma de auditoría y consultoría con negocio de acompañamiento en la adopción de IA. Lo medido son las citas de los informes que escribe la función de investigación profunda, no las respuestas de chat corrientes. Las 130 peticiones salen de dos bancos de pruebas públicos en inglés. La coincidencia la juzga una IA con rúbrica calibrada con entre 50 y 100 revisiones hechas a mano, no una revisión humana completa. Los 14 modelos son las versiones del momento de la evaluación)