Estudio: un tercio de las nuevas páginas web fueron escritas por inteligencia artificial desde el lanzamiento de ChatGPT
Por Admin
Internet ya no es un espacio escrito únicamente por seres humanos. Con la amplia difusión de las herramientas de inteligencia artificial generativa, una proporción considerable del contenido web ha comenzado a producirse de forma automática sin intervención humana directa. En este contexto, un estudio reciente publicado por el Centro Pew de Investigación aporta cifras concretas a un fenómeno del que siempre se ha hablado de manera aproximada.
El estudio concluyó que más de un tercio de las páginas web publicadas tras el lanzamiento del chatbot ChatGPT presentan claros indicios de haber sido escritas o sometidas a una edición sustancial mediante inteligencia artificial, lo que refuerza los resultados de investigaciones anteriores que constataron la rápida expansión del contenido generado automáticamente.
¿Cómo se realizó el estudio?
Los investigadores recurrieron al archivo «Common Crawl» para reunir cerca de medio millón de páginas en inglés a lo largo de unos cinco años, comenzando aproximadamente dos años antes del lanzamiento de ChatGPT en noviembre de 2022. Posteriormente, el centro utilizó una tecnología de la empresa «Open Pangram», especializada en la detección de textos automáticos, con el objetivo de estimar el volumen de contenido escrito o editado en gran medida mediante inteligencia artificial.
Dentro de una muestra aleatoria de diez mil páginas recopiladas en julio de 2026, alrededor del 10 % de ellas mostraron señales claras de autoría automática. No obstante, los investigadores aclararon que esta muestra aleatoria incluye inevitablemente páginas antiguas publicadas antes de la aparición de las herramientas de escritura con inteligencia artificial, lo que hace imposible que su origen sea automático.
El verdadero salto tras excluir las páginas antiguas
Para captar una imagen más precisa, el centro filtró las páginas antiguas y se centró exclusivamente en las publicadas tras el lanzamiento de ChatGPT. Y aquí el resultado cambió radicalmente, pues la proporción de páginas con indicios de autoría automática se elevó a más de un tercio, alcanzando el 35 %.
Esta cifra refleja una transformación estructural en la naturaleza del contenido publicado recientemente, y coincide con un informe emitido por la empresa «Cloudflare» de servicios de infraestructura de internet, en el que señalaba que el tráfico de bots había superado al de usuarios humanos en la web, y ello antes de la fecha que la empresa había previsto. Así, nos encontramos ante un panorama en el que los robots leen páginas escritas por otros robots.
Una notable disparidad entre tipos de dominios
Las proporciones de contenido automático no fueron iguales en los distintos dominios web, sino que el estudio mostró diferencias claras según el tipo de dominio:
- Los dominios .com registraron indicios de autoría automática a un ritmo cercano a diez veces el que apareció en los dominios educativos y gubernamentales.
- Los dominios .edu y .gov fueron los más bajos, con una proporción cercana al 1 % cada uno.
- Los dominios .org se situaron en un punto intermedio, con una proporción cercana al 4,6 %.
Esta disparidad indica que los sitios comerciales dependen del contenido automático con mucha mayor intensidad que las instituciones académicas y gubernamentales, que suelen estar sujetas a controles de edición más estrictos.
Indicios lingüísticos que revelan la mano automática
Además de las herramientas de detección, el estudio observó un aumento en algunos rasgos lingüísticos que a menudo se consideran señales de escritura automática, entre los más destacados el uso excesivo de guiones largos y comas de Oxford, además de fórmulas retóricas recurrentes del tipo «no es esto, sino aquello».
Límites del estudio y su fiabilidad
El centro reconoce que este análisis no es perfecto, ya que las herramientas de detección de textos automáticos —incluida «Pangram»— pueden a veces clasificar por error páginas escritas por humanos como automáticas. Sin embargo, el gran volumen de datos hace que los resultados sean válidos al menos en cuanto a la tendencia general, y confirma que la web está experimentando una profunda reconfiguración de sus fuentes de contenido.
Estos datos plantean preguntas fundamentales sobre el futuro de la calidad de la información y su credibilidad en internet, especialmente con el crecimiento de un ciclo en el que la inteligencia artificial produce contenido consumido por otros sistemas de inteligencia artificial, lo que podría repercutir en el entrenamiento de los modelos futuros y en la fiabilidad de lo que llega al usuario final.
✦ بقلم فريق دروب أيديا
DROPIDEA
Esperamos que este artículo te haya aportado valor real. En DROPIDEA, siempre nos esforzamos por ofrecer contenido de alta calidad que te ayude a crecer y evolucionar en el espacio digital. Síguenos para más artículos y guías útiles.
Etiquetas
Admin
DROPIDEA
Últimos artículos
La película de terror independiente «We're All Going to the World's Fair» y una dolorosa madurez en un mundo digital
¿Es legal entrenar la inteligencia artificial con libros protegidos? La cuestión es compleja
La empresa de vigilancia Flock enfrenta crecientes críticas y su presidente aboga por una «solución intermedia»
Un extraño fallo hace que el robot Grok envíe respuestas incomprensibles a los usuarios
Una startup británica supera a los modelos de «OpenAI» y «Anthropic» con un modelo más pequeño
Artículos relacionados
La película de terror independiente «We're All Going to the World's Fair» y una dolorosa madurez en un mundo digital
¿Es legal entrenar la inteligencia artificial con libros protegidos? La cuestión es compleja