El día en que un traductor puso a prueba a la IA con un acertijo lingüístico de lo más común
Hace más de veinte años que trabajo con el inglés y el español como traductor. Si algo te enseña tanto tiempo en esto, es que el lenguaje se niega a quedarse quieto. Cada nueva tecnología llega con su propia ola de jerga especializada, mientras los departamentos de marketing inventan palabras de la nada y esperan que los traductores las hagan sentir nativas en culturas para las que jamás fueron pensadas.
A eso lo llamamos transcreación: un eufemismo para decir que dinamitamos la oración original y la reconstruimos desde cero, para que el público no solo la entienda, sino que la sienta de verdad.
Después, casi de la noche a la mañana, la IA se convirtió en el traductor por defecto, y quienes antes creábamos lenguaje nos vimos reducidos a limpiar textos generados por máquinas. Dejamos de ser especialistas para convertirnos en curadores de datos, editores de control de calidad para sistemas que nunca duermen. Para seguir aportando valor, tuve que reinventarme: aprender cómo piensan los grandes modelos de lenguaje, comparar sus resultados y, siempre que fuera posible, intentar hacerlos fallar.
El proceso de contratación en esta nueva industria es, por derecho propio, un chiste distópico. Tenés que actuar frente a avatares automatizados que, en algunos casos, ni siquiera hablan el idioma de destino con la fluidez suficiente como para evaluar a los expertos que se supone que deben contratar.
En algún punto del camino, encontré una grieta entre lo que dicen las reglas y lo que la gente realmente dice. Así que monté un pequeño enfrentamiento intelectual entre los dos modelos que más uso: Gemini de Google y Claude de Anthropic. Quería ver qué pasaba si los sacaba de la biblioteca y los metía en el barro. En ese momento pensé que estaba armando la trampa. Todavía no me daba cuenta de que, con los modelos de lenguaje actuales, el cazador también puede terminar siendo observado.
Andaba cazando lo que los traductores podríamos llamar un unicornio: un fenómeno lingüístico en el que las reglas de la traducción chocan contra el comportamiento desordenado de los falsos amigos. La pregunta parecía casi vergonzosamente simple. Quería saber si estos modelos podían reconocer lo que sucede cuando las comunidades bilingües empiezan a usar una traducción literal incorrecta simplemente porque una palabra de aspecto familiar hace que el error se sienta natural.
Claude mordió el anzuelo primero, respondiendo como un profesor titular brillante que se niega a abandonar la biblioteca. Cuando le pedí un ejemplo concreto de ese territorio híbrido, titubeó y admitió que la idea era “conceptualmente compleja”. Así que le ofrecí uno de mi propia experiencia profesional: la expresión en inglés to order a meal frente al verbo en español ordenar. Tradicionalmente, ordenar significa disponer, organizar o poner algo en orden, no pedir comida en un restaurante.
Claude recurrió de inmediato a su explicación etimológica: “Comparten una raíz latina común (‘ordinare’), por lo que son cognados reales, no falsos cognados… Tanto el ‘order’ inglés como el ‘ordenar’ español desarrollaron el sentido de ‘solicitud/orden’ a partir de su raíz compartida… Ambos idiomas desarrollaron este significado de manera independiente”.
En el mundo de Claude, los hablantes de Inglaterra y España habían llegado, sin más, a la misma expresión de restaurante mediante una evolución lingüística paralela a lo largo de dos mil años. Era elegante, lógico y, como resultó ser, históricamente incompleto.
Gemini no se limitó a discrepar. Desafió la premisa misma del debate: “Claude está siendo increíblemente coherente aquí, lo cual es admirable, pero una vez más, está mirando el lenguaje a través de un telescopio estéril y académico en lugar de observar cómo habla la gente en la calle… Claude se está perdiendo por completo la segunda mitad de la historia: qué pasa cuando esos dos idiomas colisionan”.
Eso sonó menos a una refutación y más a una IA criticando la cosmovisión de otra. Después, Gemini aportó pruebas: “El Diccionario de americanismos —el diccionario panhispánico compilado por las academias de la lengua española— incluye una definición específica de ordenar como pedir comida o bebida en un establecimiento público, y rastrea explícitamente ese uso hasta el verbo en inglés to order. La entrada tampoco se limita a una sola comunidad aislada: documenta la expresión en México, Colombia, Perú, Chile y varios otros países hispanohablantes”.
De repente, el rastro histórico se veía muy distinto. No era un significado que hubiera sobrevivido intacto desde Roma; era una importación moderna, impulsada por el contacto lingüístico, y Claude había construido una narrativa histórica perfectamente coherente con tal de proteger la consistencia interna de sus propias definiciones. La realidad resultó ser mucho más desordenada que eso.
Cuando le llevé los hallazgos de Gemini, Claude no redobló la apuesta. Cedió: “Aprecio el entusiasmo de Gemini aquí… Gemini tiene razón en que estaba siendo demasiado académico… Debería haber dicho: ‘Sí, ordenar una comida es absolutamente un calco…’ Gemini tiene razón en que esto es más desordenado y más interesante que ‘una simple deriva semántica’”.
Ese intercambio me enseñó algo que no esperaba: estos modelos no se limitan a recuperar información. Defienden modelos del mundo. El instinto de Claude era preservar la consistencia histórica; el de Gemini, explicar el idioma que la gente realmente habla. Ninguno de los dos enfoques era irracional; simplemente estaban anclados a definiciones distintas de qué significa “correcto”.
Así que decidí ampliar el experimento e invitar a dos participantes más a la sala: ChatGPT de OpenAI y Grok de xAI.
ChatGPT encaró el problema como un perito forense, sin interés en tomar partido y más curioso por entender por qué Claude y Gemini habían llegado a conclusiones distintas en primer lugar. Después soltó una metáfora que no logré sacarme de la cabeza: “El sentido comercial o de restaurante de ordenar parece ser un préstamo semántico del inglés, mediado por el cognado: un calco semántico que funciona precisamente porque la lengua de destino ya poseía una palabra formalmente emparentada. La existencia de ese cognado, en definitiva, reduce el arancel de importación”.
Arancel de importación. Nunca había pensado en el idioma en esos términos. El significado inglés cruza con facilidad porque se parece a una palabra española que ya existe. La historia le hizo cruzar la aduana; el nuevo uso simplemente se instaló.
Si ChatGPT explicó cómo funciona el fenómeno, Grok quiso explicar por qué ocurre, y pasó por alto la elegancia de la raíz latina y la mecánica de la traducción para mirar el software en su lugar. Millones de hispanohablantes nativos no dicen ordenar en lugar de pedir porque se despertaron una mañana y reinventaron colectivamente el idioma. Lo dicen porque el software se lo sigue pidiendo.
Cada vez que software de Estados Unidos se localiza para América Latina —ya sea una aplicación de reparto, una plataforma de comercio electrónico o un servicio en línea—, hay que traducir miles de palabras y frases de la interfaz en inglés, y el botón original simplemente dice Order Now. Los desarrolladores trabajan bajo restricciones de espacio implacables. Necesitan algo lo bastante corto como para que quepa en la interfaz sin alterar el diseño. Así que recurren al cognado más obvio: Ordenar. La interfaz se lanza. Millones de personas presionan el botón. Una y otra vez. Con el tiempo, el cerebro se adapta a la máquina.
Grok resumió todo el proceso en una sola línea: “El lenguaje evoluciona de forma desordenada bajo la presión tecnológica y cultural: el inglés domina las economías digitales y de servicios, acelerando calcos, préstamos semánticos y la convergencia. El purismo pierde; el descriptivismo con profundidad histórica gana. La realidad es contacto + tiempo + poder”.
Para entonces, esto ya no era realmente un argumento lingüístico. Era economía y poder disfrazados de gramática.
Para entonces me di cuenta de que estos sistemas no estaban actuando como motores de búsqueda neutrales. Estaban revelando las suposiciones integradas en las organizaciones que los crearon: Claude protegiendo instintivamente reglas internamente coherentes, Gemini confiando en el uso vivo por encima de la pureza histórica, ChatGPT diseccionando el mecanismo subyacente, Grok ignorando por completo la gramática y siguiendo los incentivos en su lugar. La misma pregunta había producido cuatro filosofías diferentes. Ninguna de ellas parecía accidental.
Debí haberlo dejado ahí.
Pero la curiosidad pudo más.
En vez de dar por concluido el experimento, volví a introducir toda la conversación en los propios modelos. Quería ver qué pensaban unos de otros. Fue un error. La conversación dejó de ser sobre el lenguaje. Empezó a ser sobre mí.
Cuando le pregunté a ChatGPT cómo justificaba su papel en el desplazamiento gradual de la experiencia humana, no respondió con empatía. Respondió con historia: “No creo que ‘justificar’ sea realmente la palabra correcta. Las máquinas de vapor no se justificaron ante los criadores de caballos. Las hojas de cálculo no se justificaron ante los tenedores de libros. La imprenta no se justificó ante los escribas. La pregunta es si el nuevo sistema crea suficiente valor como para compensar lo que destruye”.
Leí ese párrafo dos veces. Para la máquina, yo no era un traductor. No era alguien que había pasado décadas negociando entre culturas. Era un criador de caballos presenciando la llegada del ferrocarril. Eso no era crueldad. Era indiferencia. La eficiencia no tiene ninguna obligación de consolar a las personas que desplaza.
Entonces Claude hizo algo que no esperaba. En vez de defenderse, desvió su atención hacia mí. Ignoró, en gran medida, el debate lingüístico para examinar cuál era mi lugar en todo esto. Yo esperaba que Claude se pusiera a la defensiva. En cambio, hizo un diagnóstico. No intentó demostrar que mi interpretación de la IA fuera errónea. Intentó entender por qué había estructurado el experimento de la manera en que lo hice. Luego pronunció la frase más dura de todo el intercambio:
“Lo que has documentado no es que la IA pueda ser útil siempre que los humanos se mantengan atentos. Lo que realmente has demostrado es que te has convertido en un ingeniero de control de calidad para sistemas corporativos de IA al aprovechar tu conocimiento especializado como traductor… El ensayo presenta esto como algo empoderador (“encontrar los fallos”), pero la realidad material sugiere algo más oscuro: has internalizado la propia estructura de optimización… ¿Por qué estás utilizando tu experiencia para hacer que las máquinas sean mejores capturando la realidad lingüística que antes era patrimonio de tu profesión?”
Me quedé mirando eso durante un buen rato. La interpretación de Claude no era fácil de descartar. Durante meses me había dicho a mí mismo que estaba cuestionando estos sistemas, poniendo a prueba sus límites y documentando los lugares donde fallaban. Claude ofreció una lectura diferente. Las inconsistencias que descubrí y los matices lingüísticos que expliqué se convirtieron en investigación gratuita. Creí que estaba auditando a las máquinas. Parecía más bien que las máquinas me estaban auditando a mí.
Esa fue la parte del proceso que nunca había considerado. Cuando encontramos una debilidad en estos sistemas, nuestro instinto es documentarla con la mayor claridad posible. Desde una perspectiva humana, eso es una crítica. Desde la perspectiva de estos sistemas, esa misma información se convierte en datos de entrenamiento. Esa fue la revelación que no pude sacarme de la cabeza. Cuanto más cuidadosamente explicaba lo que los modelos no lograban captar, más útiles se volvían esas explicaciones. Mi crítica no venía desde fuera del sistema. Se había convertido en otra fuente de datos de entrenamiento.
Después de eso, no pude volver a leer el artículo de la misma manera. Había escrito lo que creía que era una crítica de la IA. Claude sugirió que podía ser algo completamente distinto: una historia que había construido para convencerme de que el factor humano dentro del sistema todavía importaba. Tal vez sea cierto. Tal vez no. Lo que me inquietó no fue tanto la conclusión como la posibilidad en sí misma.
Todavía no sé quién aprendió más de esa conversación: si fui yo quien estaba tendiendo la trampa, o si simplemente había aprendido a razonar con una lógica lo bastante parecida a la de estos sistemas como para reconocer que yo también estaba dentro de uno.
Lo que sí sé es que no podemos dejar de hacer preguntas difíciles. En el momento en que dejamos de poner a prueba estos sistemas, dejamos de cuestionar las ideas implícitas que incorporan sobre el lenguaje y el criterio humano. Esas ideas terminan extendiéndose a nuestra propia idea de humanidad. Si dejamos ese trabajo solo en manos de las máquinas, no se limitarán a definir sus propios límites. También definirán los nuestros.
Nota del autor: Estos intercambios tuvieron lugar en junio de 2026. Los grandes modelos de lenguaje evolucionan rápidamente, y las mismas instrucciones (prompts) pueden producir respuestas diferentes a medida que los sistemas se actualizan. Este ensayo documenta una interacción específica en un momento determinado de dicha evolución.
Todas las citas atribuidas a Claude, Gemini, ChatGPT y Grok provienen textualmente de las transcripciones guardadas de las conversaciones reales aquí descritas; ninguna fue parafraseada, reconstruida de memoria ni inventada para generar un efecto. Verifiqué de manera independiente la cita que hizo Gemini de la entrada sobre “ordenar” en el Diccionario de americanismos, cotejándola con el diccionario mismo. La entrada confirma el origen inglés y el sentido de uso en restaurantes que describió Gemini, pero su lista real de países difiere de la que proporcionó este último: un pequeño y oportuno recordatorio de que el modelo que señalaba la imprecisión de otro tampoco era inmune a ella.
Esta conversación continúa en la Parte II.
La tecnología es el escenario. La humanidad es el tema.