Un equipo de científicos de la Universidad del Sur de California (USC) ha documentado que los chatbots basados en modelos de lenguaje de gran escala (LLM) están haciendo que la escritura sea cada vez más uniforme, sin alterar de manera significativa el contenido. Este fenómeno podría complicar la identificación de rasgos de identidad, personalidad y salud mental, según reportó el portal científico Phys.org.
La investigación, difundida en la revista Nature Human Behaviour, analizó más de 880.000 textos y reveló que, en el 87% de los casos, las versiones originales y las reescritas por inteligencia artificial mostraban una similitud semántica superior al 95%. Esto indica que, aunque el contenido se mantuvo prácticamente intacto, la forma de expresarlo se estandarizó.
El contexto es relevante: casi uno de cada tres estudiantes universitarios admitió haber utilizado ChatGPT en sus trabajos escritos, y el uso de IA en redacción se disparó tras el lanzamiento de esta herramienta en noviembre de 2022. Esto llevó a los investigadores a cuestionarse qué sucede con la diversidad lingüística cuando millones de personas recurren a los mismos sistemas para plasmar sus ideas.
Liderados por Zhivar Sourati, del Centro de Ciencias del Lenguaje Computacional de la USC, los expertos examinaron textos de diversas fuentes: relatos de Reddit, artículos periodísticos, trabajos académicos, ensayos, publicaciones en redes sociales y discursos políticos. Además, solicitaron a tres herramientas de inteligencia artificial generativa —GPT-3.5, Llama 3 70B y Gemini Pro— que reescribieran miles de textos originalmente redactados por personas.

Reducción de variedad estilística con IA
Para rastrear esta tendencia a lo largo del tiempo, el equipo analizó la evolución de los textos publicados en ArXiv, Reddit y Patch News antes y después de la llegada de ChatGPT. Los datos evidenciaron una caída sostenida en la diversidad lingüística a partir de noviembre de 2022, una tendencia que se mantuvo en los meses posteriores.
Al cuantificar el fenómeno, los investigadores determinaron que la reescritura con modelos de lenguaje redujo la variación en la complejidad de la escritura entre un 21% y un 50%. El estudio parte de la premisa de que dos personas pueden comunicar ideas similares con elecciones lingüísticas distintas, y esas diferencias contienen información sobre quiénes son.
Esos patrones lingüísticos permiten a los científicos estudiar tanto a individuos como a sociedades. La advertencia de los autores es que los LLM pueden achicar esa diversidad al privilegiar formulaciones más comunes.
El efecto también tiene una dimensión cultural. Según la publicación original, los LLM tienden a orientar la escritura hacia estilos propios de culturas occidentales, suprimiendo matices de otras tradiciones lingüísticas. Los autores advierten que esto podría afectar la preservación de la diversidad cultural expresada a través del lenguaje.
El impacto no se limitó al estilo. Tras la reescritura, los modelos informáticos empleados para analizar los textos fueron, en promedio, seis puntos porcentuales menos precisos al identificar características personales de los autores.

Huellas personales: unas se debilitan, otras permanecen
El fenómeno no es neutral: los investigadores descubrieron que los LLM no solo uniforman la escritura, sino que además amplifican los patrones lingüísticos asociados a características predominantes mientras suprimen los de grupos minoritarios. Esto plantea un problema de representación, ya que el lenguaje resultante tiende a reflejar perfiles más comunes en detrimento de voces menos frecuentes.
El trabajo detectó que los LLM atenuaron ciertos patrones lingüísticos vinculados con rasgos personales. Entre ellos, las asociaciones entre el uso de pronombres y la extraversión —la tendencia a ser sociable y comunicativo—, entre las palabras relacionadas con amigos y la lealtad, y entre las referencias al futuro y la edad.
Otras asociaciones, en cambio, resistieron la reescritura: las vinculadas con palabras de emoción negativa y neuroticismo —la tendencia a experimentar emociones negativas con frecuencia—, con términos asociados a la religión y pureza, y con palabras sociales y género.
Los investigadores concluyeron que la escritura asistida por modelos de lenguaje podría volver menos fiables las evaluaciones basadas en el lenguaje en áreas como la psicología, la atención de la salud mental, la selección de personal y los servicios personalizados. De acuerdo con el portal científico, se requieren más investigaciones para entender por qué algunas marcas personales del lenguaje se conservan y otras se debilitan.
Fuente: Infobae