De la pluma al algoritmo: la revolución digital en los estudios lingüísticos



Durante casi toda su historia, la lingüística vivió en bibliotecas y aulas. Hoy también vive en servidores. Cada vez que le pedimos a Siri que nos despierte temprano, que el chatbot del banco nos cierre una cuenta o que ChatGPT nos resuelva la vida, estamos usando tecnologías que se apoyan, sepan o no sus creadores, en más de un siglo de investigación lingüística. Esta entrada es un recorrido breve por ese camino y una reflexión sobre lo que falta: que las máquinas entiendan no solo la lengua, sino a todos sus hablantes.

De la estructura a la sociedad

A finales del siglo XIX, los estudios de geografía lingüística de Hugo Schuchardt y Jean-Pierre Rousselot mostraron algo que hoy parece obvio: los miembros de una misma comunidad, incluso de una misma familia, pronuncian distinto según la generación a la que pertenecen (Blecua, 1973). La idea chocó con los neogramáticos, que sostenían que los cambios fonéticos eran regulares, sin excepciones y condicionados solo por el contexto lingüístico (De Oliveira, 1991).

El siglo XX consolidó la lingüística moderna. Saussure (1916) propuso el estructuralismo y el concepto de signo lingüístico, y Chomsky (1957) planteó que nacemos con una predisposición innata para adquirir cualquier lengua. En unos cuantos meses, los bebés adquieren el repertorio fonológico de su lengua y en un par de años son capaces de producir y entender oraciones que nunca han escuchado.

Pero conocer la gramática no basta para comunicarse. Dell Hymes (1972) cuestionó la perspectiva chomskiana y propuso la competencia comunicativa: saber hablar una lengua implica dominar también sus normas sociolingüísticas y socioculturales. Poco después, Uriel Weinreich y William Labov demostraron que ciertos rasgos lingüísticos varían sistemáticamente según factores sociales como el estrato socioeconómico, la edad, el género o el estilo o registro. Nacía la sociolingüística, y con ella una idea que será clave para esta entrada: la variación no es ruido, es parte de la estructura de la lengua.

Una contribución de esa época tendría consecuencias inesperadas. John Rupert Firth (1957) insistió en estudiar las palabras por la compañía que tienen, por sus colocaciones. Esa intuición es la base de los word embeddings y, por extensión, del procesamiento del lenguaje natural moderno.

Cuando las máquinas (más o menos) aprendieron a hablar 

La lingüística computacional tiene una tarea central, hacer explícito el conocimiento lingüístico que los humanos poseemos de forma implícita, para que una computadora pueda comprenderlo y generarlo. Su gran obstáculo es la ambigüedad. A nosotros el contexto y nuestra teoría del mundo nos permiten resolverla sin esfuerzo; a una máquina, no.

Los primeros pasos fueron en traducción automática. SYSTRAN nació durante la Guerra Fría con financiamiento de agencias de defensa estadounidenses para traducir documentos científicos del ruso al inglés, y años después llegó al gran público como Babel Fish. En 1950, Alan Turing había planteado la pregunta fundacional de la inteligencia artificial: ¿podría considerarse inteligente una máquina capaz de sostener una conversación indistinguible de la de un humano?

En los años sesenta y setenta aparecieron los primeros programas conversacionales. ELIZA, de Joseph Weizenbaum, imitaba a un psiquiatra que respondía todo con preguntas ("¿y cómo te sientes con eso?"). Su contemporáneo PARRY fue más convincente: recordaba lo que se le decía y distinguía temas con connotaciones positivas o negativas. Como los chatbots actuales, sostenía conversaciones sin entender del todo lo que se decía, una característica irónicamente humana.

El giro decisivo vino con los métodos estadísticos. Frederick Jelinek y su equipo desarrollaron en los noventa CANDIDE, un sistema que aprendía a traducir entre inglés y francés a partir de enormes cantidades de corpora paralela. La apuesta era radical: las estructuras del lenguaje debían aprenderse de datos reales y no de reglas abstractas escritas por lingüistas y llenas de excepciones (Wilks, 2022). Ese principio, llevado al extremo con redes neuronales y cantidades masivas de texto, es el que sostiene a los grandes modelos de lenguaje de hoy.

El ratón vaquero

¿Qué necesita saber una computadora para entender una oración? Tomemos "el ratón vaquero sacó sus pistolas".

Primero debe identificar que está en español. Luego, que ratón vaquero es una entidad nombrada (un personaje, aunque no humano), que sacó es la tercera persona del singular del pretérito perfecto simple, y que pistolas se refiere a armas de fuego y no a barras de pan, como podría ser en Madrid. Y si además tuviera competencia sociocultural, sabría que la frase viene de una canción de Cri-Cri que cualquier mexicano reconoce en seguida.

Ahí está la diferencia de fondo. Los modelos actuales no adquieren el lenguaje por experiencia e interacción, como nosotros, sino como lectores pasivos de corpus inmensos. Aprenden correlaciones estadísticas entre palabras; nosotros asociamos sonidos a conceptos. Y aunque los modelos procesan cantidades de texto muy superiores a lo que un humano podría leer en toda su vida, siguen careciendo de algo que un niño de cinco años tiene: una representación del mundo.

El problema del acento

Donde esta brecha se nota más es en el reconocimiento automático del habla (ASR, por sus siglas en inglés), la tecnología que convierte la voz en texto, desde los subtítulos automáticos de YouTube hasta Alexa.

En condiciones ideales (un entorno silencioso, ritmo pausado, pronunciación estándar), los asistentes de voz nos entienden bien. Pero el habla real no es así. El español se habla rápido, con un promedio de 7.82 sílabas por segundo (Pellegrino et al., 2011), y está lleno de muletillas, pausas, reformulaciones y referencias culturales. El habla espontánea, con sus dudas y estructuras "incorrectas", supera ampliamente la capacidad de estos sistemas (Smith, 1991).

El repertorio fonológico del español es relativamente pequeño: cinco vocales y unas diecinueve consonantes. Eso no hace más fácil reconocerlo. La riqueza está en los alófonos: vocales que se nasalizan en el Caribe, consonantes que se debilitan al otro lado del Atlántico, sonidos que simplemente desaparecen. A esto se suman el ruido ambiental, el "efecto cóctel" de varias voces simultáneas y las características de cada hablante (Klavans y Stent, 2009).

El resultado es que solo una pequeña parte de los hablantes produce los sonidos que un asistente virtual espera. Las redes neuronales profundas han mejorado mucho el reconocimiento al incorporar factores fonotácticos, semánticos y situacionales (Misnikov, 2019), pero la representación sigue siendo desigual: hay muchos más transcriptores disponibles para el inglés, el español o el chino que para lenguas como el náhuatl, el guaraní o el quechua (Jyothi, 2017).

¿Qué español?

Aquí entra mi experiencia personal. Como lingüista en la industria tecnológica, participo con frecuencia en proyectos de localización de datos para productos de inteligencia artificial. Y hay una pregunta que siempre hago primero: ¿para qué mercado? ¿Quién es el usuario al otro lado de la pantalla?

Con frecuencia me piden un "español estándar". Es cierto que existe una variedad formal escrita que todos los hispanohablantes entendemos, pero cuando el objetivo es que una máquina se comporte como un hablante, el factor sociolingüístico se vuelve central. No es lo mismo un asistente que trata de usted para el mercado mexicano que uno que tutea y usa vosotros para el español peninsular. Como hablantes nativos estamos programados para detectar la falta de naturalidad, y un asistente que habla "neutro" suena, precisamente, a máquina.

Mis sugerencias no siempre se toman en cuenta: el mundo corporativo suele preferir una solución rápida a una acertada. Parte del problema es que los lingüistas con formación en humanidades apenas están entrando en gran número a la industria, y las empresas no siempre saben aprovechar su conocimiento. Parecen olvidar que, en un mundo que busca automatizarlo todo, alguien tiene que enseñarles a las computadoras cómo funcionamos los humanos.

Sociolingüística computacional

De esta tensión surge un campo emergente: la sociolingüística computacional. La sociolingüística tradicional trabaja con datos orales y muestras relativamente pequeñas; la lingüística computacional, con corpus masivos. Juntarlas permite estudiar la variación a gran escala, por ejemplo, infiriendo variables sociales como la edad, el género o la región a partir del uso del lenguaje (Nguyen et al., 2016).

Aplicado al reconocimiento del habla, esto significa modelar con precisión los alófonos y variantes regionales, adaptar los modelos a la prosodia de cada zona y recolectar sistemáticamente datos del habla vernácula, especialmente de los dialectos menos documentados. Un asistente de voz que entienda igual de bien a una hablante de Ciudad Juárez que a uno de Buenos Aires o de Barcelona no es solo un mejor producto: es una tecnología más justa.

Hacia dónde vamos

La lingüística ya no cabe solo en el aula. Las nuevas generaciones de lingüistas necesitan competencias tecnológicas (ciencia de datos, aprendizaje automático, inteligencia artificial) para llevar su conocimiento a donde hoy se toman las decisiones sobre cómo hablan las máquinas. Y la industria necesita a los lingüistas para algo que ningún corpus le va a dar por sí solo: entender que detrás de cada lengua hay comunidades, variaciones e identidades que merecen ser representadas en el algoritmo.

Referencias

Blecua, J. M. (1973). Revolución en la lingüística. Salvat Editores.

Chomsky, N. (1957). Syntactic structures. Mouton.

De Oliveira, M. A. (1991). The neogrammarian controversy revisited. International Journal of the Sociology of Language, 1991(89), 93–106. https://doi.org/10.1515/ijsl.1991.89.93

Firth, J. R. (1957). Studies in linguistic analysis. Wiley-Blackwell.

Hymes, D. (1972). On communicative competence. En J. B. Pride y J. Holmes (Eds.), Sociolinguistics. Penguin.

Jyothi, P. (2017, junio). Automatic speech recognition: An overview [Video]. Microsoft Research. https://www.microsoft.com/en-us/research/video/automatic-speech-recognition-overview/

Klavans, J. y Stent, A. (2009). Computational linguistics. En W. O'Grady, J. Archibald, M. Aronoff y J. Rees-Miller (Eds.), Contemporary linguistics: An introduction (6.ª ed., pp. 587–626). Bedford/St. Martin's.

Misnikov, E. (2019). Sociophonetic factors in automatic speech recognition: A study on American English [Tesis]. Universitätsbibliothek Freiburg.

Nguyen, D., Doğruöz, A. S., Rosé, C. P. y de Jong, F. (2016). Computational sociolinguistics: A survey. Computational Linguistics, 42(3), 537–593. https://doi.org/10.1162/COLI_a_00258

Pellegrino, F., Coupé, C. y Marsico, E. (2011). A cross-language perspective on speech information rate. Language, 87(3), 539–559. https://doi.org/10.1353/lan.2011.0057

Saussure, F. de (1916). Cours de linguistique générale. Payot.

Smith, G. W. (1991). Computers and human language. Oxford University Press.

Wilks, Y. (2022). Artificial intelligence: Modern magic or dangerous future? Icon Books.

Comentarios