Tecnología & Cultura Digital

¿De qué páginas web extrae su información ChatGPT?

El conjunto visitado para generar respuestas a las consultas de internet y está compuesto por alrededor de 15.1 millones de sitios web de diferentes temas y orígenes.

2023-04-21

Por estrategiaynegocios.net

Los programas de inteligencia artificial como ChatGPT requieren grandes cantidades de información para ejecutar sus procesos y ofrecer la mejor calidad y cantidad de datos posibles, en el caso de OpenAI, se conoce que la data, en su mayoría, proviene de millones de páginas web.

Una investigación realizada por The Washington Post indica cuáles serían las páginas web que utiliza esta inteligencia artificial para “alimentarse” y generar las respuestas de las consultas realizadas por los usuarios.

Si bien no es posible identificar las páginas web exactas que se utilizan como fuente en el caso de ChatGPT pues solo OpenAI tiene la lista completa, sí es posible identificar de qué conjunto de datos extrae la información, no solo esta, sino la gran mayoría de inteligencias artificiales.

La información en internet está organizada en grandes conjuntos que actúan como pozos que son visitados para extraer lo que se necesite de ellos.

El llamado C4 es el conjunto visitado por ChatGPT y otros modelos similares para generar respuestas a las consultas de internet y está compuesto por alrededor de 15.1 millones de sitios web de diferentes temas y orígenes.

La investigación realizada indica que en este conjunto de datos se encuentran sitios web relacionados con los negocios (16 %), tecnología (15 %), noticias (13 %), arte (11 %), ciencia (9 %), entre otras especialidades.

Muchos contenidos extraídos de estos sitios están protegidos por derechos de autor, por lo que cada chatbot que utilice el conjunto C4 como fuente, podría estar infringiendo esta normativa en el proceso, ya sea para una consulta eventual o en caso de que un estudiante pida que la inteligencia artificial haga su tarea.

ChatGPT podría volver a estar disponible en Italia a finales de abril

Según el Instituto Allen para la Inteligencia Artificial, que también participó en la investigación, el símbolo de copyright “©” aparece más de 200 millones de veces en el conjunto de datos C4.

Algunas de las páginas web de las que se extraen datos son Fool.com, Kickstarter.com, Patreon.com en lo que respecta a contenido relacionado con negocios, aunque muchos de ellos estén protegidos por derechos de autor.

El contenido buscado por las inteligencias artificiales también comprende algunos medios de comunicación y sitios web de recopilación de información; pero aunque muchos de ellos puedan ser fuentes fiables de producción de contenido que es útil para los usuarios, esto no implica que no se hayan incluido fuentes que aportan datos falsos, sesgados y en muchos casos incompleto.

Con información de Infobae