La IA diluye nuestra identidad cuando escribimos con su ayuda: “Nadie quiere parecer inculto”

    Los textos creados con IA generativa tienden a sonar planos o predecibles, pese a que poco a poco mejoran para ser menos distinguibles de un producto humano y, a veces, lo consiguen.

     El motor detrás de esa “inteligencia” son los modelos de lenguaje grandes o LLM (por las siglas en inglés de large language models), a los que se entrena con enormes cantidades de textos para que aprendan a poner una palabra detrás de otra por probabilidad estadística hasta parecer, casi, escritos por una persona.

     Sin embargo, cuando se analizan, se encuentran sesgos de sobrerrepresentación de ciertas palabras, signos de puntuación e incluso rasgos distintivos de grupos sociales mayoritarios.

     El resultado, tan parecido a lo humano, es sorprendente, pero la pérdida de riqueza lingüística también es un hecho y los posibles riesgos son tema de debate e investigación.

    Antes de que la IA llegase a nuestras vidas, la homogeneización del lenguaje ya era una amenaza para la diversidad, las democracias y el pensamiento libre. En 1984, George Orwell planteó un futuro distópico en el que la neolengua, impuesta por El Partido en el poder, conseguía anular el pensamiento crítico de la ciudadanía. 

    Al margen de su uso como herramienta de control, la pérdida de matices distintivos en el lenguaje puede diluir los rasgos que nos identifican incluso individualmente, algo que un nuevo estudio sobre el uso extendido de los LLM ha explorado y publica hoy en Nature Human Behaviour.

    Las personas expresamos ideas similares de diferentes maneras y esto ofrece información sobre nuestro contexto social, personalidad e incluso salud.

     Esta es la premisa bajo la que un grupo de investigadores de la Universidad del Sur de California (Estados Unidos) han hecho una serie de experimentos con los que han hallado que, desde que empezamos a usar ChatGPT en 2022, la complejidad lingüística de lo que escribimos en internet se ha reducido entre un 21% y un 50%.

     Para ello analizaron más de 800.000 textos de distintas plataformas como Reddit, el foro con una sección donde se escriben historias creativas, un repositorio de artículos científicos en abierto o Patch News, un portal de noticias comunitarias, todos en inglés.

    Como explican los autores en el artículo, “la diversidad transforma el lenguaje, de mero medio de intercambio de información a expresión única de individuos y sociedades, lo que permite analizar los productos culturales y las tendencias sociales”. 

    Calcularon que, en un 87% de los casos, el significado de los textos se mantenía cuando le pedían a varias IAs generativas (GPT-3.5, Llama 3 70B y Gemini Pro) que reescribieran los textos recopilados de internet.

     Cuando les ordenaron reformularlos, mejorar su claridad o fluidez, o hacerlos más académicos, naturales o concisos, varios índices estimaron una pérdida en la complejidad de las nuevas versiones.

     “En nuestros experimentos, el significado permaneció casi intacto, pero cada persona expresa la misma idea de distintas maneras y eso es lo que vimos que se perdía”, explica el primer autor del estudio, Zhivar Sourati.

    ARTICULO COMPLETO


    Sin comentarios