Telonic

Investigación30 SEP 2026Anthony Ombrore

Cómo probar agentes de IA en conversaciones que cambian de idioma a mitad de frase

Los clientes del Golfo intercalan palabras en inglés en frases en árabe con total naturalidad, y la evidencia publicada indica que los sistemas de voz fallan en esas conversaciones por motivos que la puntuación de precisión habitual no puede ver. Este artículo expone lo que se sabe sobre el cambio de idioma, dónde fallan los sistemas y cómo debe construirse una prueba para que aporte información útil.

En esta página
  1. La situación
  2. Lo que muestra la evidencia
  3. Qué significa
  4. Cómo lo abordamos en el diseño
  5. Lo que aún no sabemos
  6. Fuentes

La situación

Un comprador escribe a la línea de atención al cliente de una promotora inmobiliaria un jueves por la tarde:

هلا، بغيت أعرف الـ next instalment حق الـ unit، متى الـ due date؟

Hola, quiero saber la next instalment de la unit, ¿cuándo es la due date? La frase está en árabe del Golfo. Las tres palabras que contienen la petición están en inglés. En un plan de pagos vinculado a la construcción, la respuesta depende del hito que haya alcanzado el proyecto, no de una fecha del calendario, de modo que el agente de IA tiene que identificar la unidad, consultar el hito y responder de forma que el comprador pueda actuar.

El mensaje no tiene nada de inusual. Lo inusual es probarlo. La mayoría de las mediciones publicadas sobre lo bien que un sistema maneja el árabe se hacen solo en árabe, solo en inglés o en un árabe formal que nadie utiliza en una línea de atención. Así que las preguntas para cualquiera que compre o construya un agente para los Emiratos Árabes Unidos o Arabia Saudí son con qué frecuencia se produce esta mezcla, por qué hace fallar a los sistemas de voz y de lenguaje, y cómo probarla para que quede cubierta en lugar de darse por supuesta.

Lo que muestra la evidencia

Con qué frecuencia ocurre y qué forma adopta

Los lingüistas distinguen dos tipos de cambio de idioma. En el cambio intersentencial, el hablante cambia de idioma entre una frase y otra. En el cambio intrasentencial, cambia de idioma dentro de una misma frase, como en el mensaje anterior. La distinción procede de un trabajo fundacional de 1980 [24], y aquí importa porque los dos tipos someten a un sistema a exigencias distintas.

La evidencia del Golfo apunta con claridad al segundo tipo. Mixat, el mayor corpus público de habla emiratí con inglés intercalado, transcribió 14.9 horas de dos pódcasts. El 36 % de las frases (1947 de 5316) contenía un cambio de idioma, el 61 % estaba solo en árabe y el 2 % solo en inglés. Su índice de mezcla de códigos, una puntuación de 0 a 1 que aumenta a medida que una frase se reparte de forma más equilibrada entre los idiomas, tuvo una media de 0.11 en las frases con cambio: frases en árabe con unas pocas palabras en inglés [1]. Un segundo corpus emiratí, de 12 horas de juegos de rol por Zoom a cargo de 16 estudiantes universitarios, halló que el 19 % de los enunciados contenía un cambio, y que los sustantivos en inglés eran un 56.9 % más frecuentes en los enunciados con cambio que en los monolingües [2]. El corpus egipcio comparable, de 12 horas de entrevistas con 38 estudiantes de El Cairo, halló que el 63.2 % de las frases eran mixtas, el 88.9 % de ellas en árabe con inglés insertado, y que el 66.3 % de los fragmentos en inglés tenían una sola palabra. La palabra que con más frecuencia aparecía justo antes de un cambio era el artículo definido árabe [3], que es exactamente el patrón del mensaje anterior. El único corpus saudí, de 4.45 horas de un único pódcast con cuatro hablantes varones, muestra la misma forma, con el inglés en aproximadamente una de cada cinco unidades léxicas [4].

Estos corpus son pódcasts, entrevistas y juegos de rol de hablantes jóvenes y con estudios, de modo que muestran cómo es el cambio de idioma, no con qué frecuencia lo practica el conjunto de la población. Una encuesta de 2019 a 100 estudiantes universitarios emiratíes halló que el 78 % afirmaba mezclar los dos idiomas dentro de una misma frase [6]. Una encuesta de 2024 a 566 usuarios de cajeros automáticos en Dubái muestra la otra cara: el 99.7 % de los usuarios no árabes eligió el inglés, los emiratíes eligieron el inglés solo el 19.7 % de las veces, y los expatriados árabes con empleos mejor remunerados eligieron el inglés el 69 % de las veces, mientras que los de empleos peor remunerados eligieron el árabe el 84.3 % de las veces [5]. En Arabia Saudí, el censo de 2022 contabilizó como ciudadanos saudíes al 58.4 % de sus 32.2 millones de residentes [7]. Un agente que atienda a la región se encontrará con conversaciones solo en inglés, solo en árabe y mixtas, y cuál de ellas llega depende de quién sea el cliente.

Bajo el cambio de idioma hay dos capas. La primera es el dialecto. El árabe es diglósico: la variedad formal, el árabe estándar moderno, se escribe y se usa en el habla formal, mientras que el habla cotidiana se produce en un dialecto regional [23]. Quien llama desde el Golfo habla árabe del Golfo, buena parte de la mano de obra de la región habla árabe egipcio o levantino, y ninguno de ellos habla árabe estándar moderno con una línea de atención. La segunda es el arabizi, árabe escrito con letras latinas en el que algunos números representan los sonidos para los que el alfabeto latino no tiene letra, como el 3 para ع y el 7 para ح. Se documentó entre estudiantes de la Universidad Zayed en 2003 [25]. En la encuesta de 2019, el 45 % de los estudiantes afirmó no usarlo nunca y el 16 % afirmó usarlo siempre [6], de modo que un hilo de WhatsApp puede contener escritura árabe, escritura latina y ambas.

Dónde fallan los sistemas

La suposición de partida de esta investigación era que los fallos se concentran en el punto del cambio. La evidencia indica que el cambio es uno de tres fallos, y no el mayor.

El mayor es el dialecto. El reconocimiento del habla se mide con la tasa de error de palabras: la proporción de palabras de una transcripción que son erróneas, faltan o se han insertado en comparación con lo que se dijo. Cuanto más baja, mejor, y una cifra superior al 100 % significa que el sistema produjo más palabras erróneas que palabras había. En un conjunto de prueba de radiodifusión saudí, un modelo de voz abierto de uso muy extendido obtuvo un 27.95 % en árabe estándar moderno y un 59.92 % en dialecto del Golfo, con el egipcio en un 59.28 % [8]. Esa diferencia no tiene nada que ver con el inglés. Es el precio de que un modelo entrenado sobre todo con árabe formal se encuentre con un cliente que no lo habla.

El segundo fallo es realizar la tarea equivocada. Cuando los autores de Mixat aplicaron un modelo de voz de uso general a sus grabaciones emiratíes, obtuvo un 12.06 % en las frases solo en inglés y un 195.98 % en las frases solo en árabe. El modelo «traduce las frases al árabe estándar moderno, y las traducciones suelen ser correctas. Esto demuestra que Whisper en realidad reconoce el dialecto y el cambio de código, pero realiza la tarea equivocada» [1]. Un estudio sobre ocho dialectos observó lo mismo en sus segmentos mixtos: «Whisper no produjo ninguna palabra con cambio de código en ninguno de los escenarios. Cabe destacar que, incluso cuando el idioma de decodificación se fijó en inglés, Whisper realizó una tarea de traducción aun cuando se especificaba la tarea como "transcription"» [9]. El mismo comportamiento está documentado en habla mixta de mandarín e inglés [26]. Un cliente dice «claim» y la transcripción recoge la palabra árabe equivalente, o la frase entera aparece transcrita en un árabe formal que el cliente nunca pronunció.

El tercer fallo es el propio cambio. Es real, pero en gran medida invisible en la puntuación principal. Un estudio de 2025 introdujo una medida que puntúa solo las palabras en las que se cambia de idioma. Entrenar un modelo con más árabe e inglés monolingües mejoró su tasa global de error de palabras en conjuntos de prueba mixtos «mientras que el reconocimiento de los casos reales de cambio de código empeora» [10]. Un modelo puede mejorar de media y empeorar en los nombres de productos, los números de referencia y los términos técnicos que contienen la petición, y la prueba habitual informa de una mejora.

Los principales servicios de voz en la nube lo reconocen. Uno indica que su detección continua del idioma «no admite cambios de idioma dentro de la misma frase. Por ejemplo, si habla principalmente en español e introduce algunas palabras en inglés, no detecta el cambio de idioma palabra por palabra» [15]. Otro admite hasta tres idiomas candidatos, transcribe «utilizando el idioma de la lista que mejor se ajuste» y describe la función como «ideal para aplicaciones que necesitan transcribir enunciados breves, como comandos de voz o búsquedas» [16]. Son descripciones honestas de sistemas diseñados para elegir un solo idioma por enunciado.

Por qué la puntuación habitual induce a error

La tasa de error de palabras tiene un problema concreto con el habla mixta. Si un cliente dice «booking» y el sistema lo escribe con letras árabes, un lector lo entiende y la métrica lo cuenta como error. Un estudio de 2022 pidió a cuatro anotadores bilingües que posteditaran 3903 transcripciones de habla mixta egipcia, y después analizó qué puntuación automática reflejaba mejor cuánta edición necesitaba una persona. La tasa de error de palabras sin ajustes tuvo una correlación de 0.55. La tasa de error de caracteres, tras transliterar las palabras en inglés a escritura árabe y normalizar la ortografía, tuvo una correlación de 0.80 [11]. Un método de 2024 construido con datos emiratíes acepta como correcta una coincidencia exacta, una transliteración o una traducción de una palabra en la que se cambia de idioma [12]. Sin un ajuste de este tipo, un conjunto de prueba de conversaciones del Golfo penaliza el comportamiento correcto y premia el fallo de la tarea equivocada siempre que coincida con la escritura de la referencia.

La cuestión de fondo es que la transcripción no es el resultado. Un estudio de 2021 construyó pares de conjuntos de transcripciones con tasas de error de palabras idénticas, del 6.16 % en ambos, y halló que el conjunto cuyos errores conservaban el significado alcanzaba un 96.22 % de precisión de intención, la proporción de peticiones en las que el sistema entendió lo que se quería, frente al 94.63 % del conjunto cuyos errores no lo conservaban [13]. En una batería de referencia en inglés de 58 horas de peticiones habladas a un dispositivo doméstico, la precisión de intención del mejor sistema con audio real, con una tasa de error de palabras del 16 %, era solo unos 5 puntos inferior a la obtenida con transcripciones perfectas, pero su precisión en los detalles de la petición, nombres, fechas y lugares, cayó de 78.19 a 69.53 según la medida propia de esa batería [14]. La intención resiste los errores de transcripción. Los detalles, no. En una llamada sobre un siniestro, la intención es «dónde está mi siniestro»; el detalle es el número de matrícula. Ambas cosas deben probarse, por separado. Los dos estudios son en inglés; ningún estudio publicado mide la precisión de intención en habla mixta de árabe e inglés, lo cual es una laguna, no un motivo de tranquilidad.

Decir la respuesta en voz alta

Un agente de voz tiene que decir una frase mixta además de oírla. La síntesis de voz, el sistema que convierte la respuesta escrita en audio, tiene su propio problema con el cambio de idioma. Un importante proveedor indica que su etiqueta para marcar un fragmento en otro idioma dentro de una frase «no es compatible» con las «lenguas semíticas, como el árabe, el hebreo y el persa» y «producirá silencio» [17]. El primer trabajo publicado sobre síntesis de voz en árabe que aborda el dialecto y la mezcla apareció en 2025, con una hora de habla en egipcio e inglés de un único hablante, y resolvía la mezcla dividiendo cada frase en sintagmas monolingües y sintetizándolos por separado [18]. No existe nada equivalente para el árabe del Golfo. Los números añaden otra capa: los numerales árabes tienen flexión de género, y los dialectos prescinden de esas marcas pero leen los números a su manera, de modo que un número de referencia o un importe en dírhams puede ser correcto en pantalla y erróneo en voz alta [19].

La detección automática del idioma también está menos resuelta de lo que parece. Una plataforma de agentes de voz advierte de que «las conversaciones de fondo o un acento poco habitual pueden provocar ocasionalmente un cambio que la persona que llama no pretendía», y ofrece una opción que limita los cambios a los dos primeros turnos [27]. La detección debe probarse para comprobar los cambios erróneos, no solo los correctos.

Lo que no se está probando

Una revisión de 2025 encontró tasas de error de palabras de entre el 24.8 % y el 53.8 % en los corpus de habla árabe mixta existentes y afirma que «el árabe con cambio de código sigue estando infrarrepresentado en las baterías de referencia actuales» [20]. Otra revisión de 2025, de más de 40 baterías de referencia de modelos de lenguaje en árabe, señala la evaluación del cambio de código y el diálogo de varios turnos como carencias críticas [21]. El material público del Golfo para probar habla mixta suma unas pocas decenas de horas de pódcasts, televisión y juegos de rol de estudiantes, en su mayoría con licencias que prohíben el uso comercial, y nada de él se grabó en una línea telefónica de una empresa. No existe ningún conjunto de prueba público del Golfo con peticiones de clientes con mezcla de idiomas etiquetadas con lo que el cliente quería.

Un hallazgo apunta en sentido contrario. En texto escrito, un estudio de 2025 sobre modelos de lenguaje de gran tamaño halló que insertar palabras en inglés en una frase en otro idioma «a menudo mejora la comprensión, especialmente en los modelos con un dominio limitado del idioma matriz», mientras que insertar palabras extranjeras en inglés la empeoraba [22]. La palabra en inglés dentro de un mensaje de WhatsApp en árabe puede ayudar al modelo. Es en la versión hablada de esa misma palabra donde se concentra la dificultad.

Qué significa

La hipótesis de partida era que los fallos se concentran en los puntos de cambio. La evidencia la corrige. Los fallos se concentran primero en el dialecto, en segundo lugar en que el modelo realiza una tarea distinta de la solicitada, y solo en tercer lugar en las palabras en las que se cambia de idioma, que la puntuación habitual oculta. Una prueba construida solo en torno a los puntos de cambio pasaría por alto los dos fallos mayores. Una prueba basada en la precisión en un solo idioma pasaría por alto los tres.

Conviene conocer las disyuntivas. Limitar un servicio de voz a un solo idioma aumenta su precisión en ese idioma y elimina su capacidad de seguir un cambio. Forzar un modelo general a trabajar en árabe hace que traduzca. Aceptar como correctas las palabras transliteradas hace que la puntuación sea honesta y que no pueda compararse con la cifra de un proveedor que no lo hizo. Y una mejor precisión media puede coexistir con una peor precisión en las palabras que importan.

Por tanto, una prueba de un agente para esta región tiene que evaluar cuatro cosas por separado: si se entendió el marco árabe en el dialecto que usó el cliente; si las inserciones en inglés se reconocieron correctamente; si se captaron la intención y los detalles, puntuados como comprensión y no como transcripción; y si la respuesta se pronunció correctamente, números incluidos. Tiene que usar una métrica que acepte una palabra correcta en cualquiera de las dos escrituras. Y tiene que construirse a partir de las conversaciones que la empresa recibe realmente, porque ningún conjunto de datos público puede sustituirlas.

Cómo lo abordamos en el diseño

Nuestros agentes siguen a un hablante que mezcla árabe e inglés en la misma frase, y deducen qué idioma está usando el cliente a partir de las primeras palabras en lugar de pedirle que elija. Entienden y responden en árabe del Golfo, egipcio y levantino, en árabe estándar moderno y en inglés, porque la base de clientes de Dubái o de Riad los incluye a todos, y la respuesta sigue el dialecto que usó el cliente.

Cuando el agente no está seguro, hace una pregunta aclaratoria en lugar de suponer, y una conversación que no puede resolver se transfiere a una persona. Como los modelos de voz y de lenguaje subyacentes varían tanto según el dialecto, los modelos se seleccionan para cada despliegue y pueden cambiarse, de modo que un cliente puede ver el efecto de un cambio antes que sus clientes.

El diseño de prueba descrito arriba es la forma en que se construyen nuestros conjuntos de evaluación: conversaciones de prueba basadas en patrones reales de cada sector, puntuadas según si el agente entendió lo que quería el cliente y captó correctamente los detalles (el número de unidad, la referencia del siniestro, el vuelo), y no solo según la transcripción, y contrastadas con lo que significa un resultado resuelto en un siniestro o en una entrega. La memoria de preferencia de idioma hace que un cliente que eligió el inglés la última vez sea recibido en inglés esta vez, y que a uno que escribió en árabe del Golfo no se le responda en árabe formal.

No publicamos cifras de precisión de nuestros propios agentes. Cuando lo hagamos, irán acompañadas del conjunto de prueba, la combinación de dialectos y el método de puntuación, porque sin ellos una cifra sobre habla con mezcla de idiomas no significa nada.

Lo que aún no sabemos

Nadie ha medido con qué frecuencia los clientes cambian de idioma en las líneas de atención del Golfo, ni qué proporción de esas conversaciones son en árabe, en inglés o mixtas. Los corpus mencionados son los mejores disponibles, y ninguno se grabó en una línea telefónica de una empresa.

Ningún estudio publicado sobre el árabe mide el error en el propio punto del cambio, ni en nombres de productos en inglés, números de referencia y dígitos pronunciados dentro de frases en árabe. El mecanismo está documentado; su magnitud en una conversación con un cliente, no.

No existe ninguna evaluación independiente de cómo manejan las voces comerciales de síntesis de voz una frase en árabe del Golfo con inglés en su interior. La documentación de los proveedores describe límites; nadie ajeno a los proveedores los ha medido.

No hay evidencia en ningún sentido sobre si el uso del arabizi está disminuyendo a medida que los teclados árabes se generalizan, ni ningún estudio sobre si los oyentes del Golfo consideran aceptables respuestas en árabe egipcio o levantino en una llamada de atención al cliente.

Cada una de estas es una pregunta que un conjunto de prueba construido a partir de las propias conversaciones de una empresa puede empezar a responder. Esa es la razón para construirlo antes del despliegue y no después.

Fuentes

  1. 1.Al Ali, M. K. and Aldarmaki, H. Mixat: A Data Set of Bilingual Emirati-English Speech. SIGUL workshop at LREC-COLING, 2024.⁠https://aclanthology.org/2024.sigul-1.26/
  2. 2.Hamed, I., Eryani, F., Palfreyman, D. and Habash, N. ZAEBUC-Spoken: A Multilingual Multidialectal Arabic-English Speech Corpus. LREC-COLING, 2024.⁠https://aclanthology.org/2024.lrec-main.1546/
  3. 3.Hamed, I., Vu, N. T. and Abdennadher, S. ArzEn: A Speech Corpus for Code-switched Egyptian Arabic-English. LREC, 2020.⁠https://aclanthology.org/2020.lrec-1.523/
  4. 4.Alharbi, S. et al. (SDAIA National Center for AI). Saudilang Code-Switch Corpus, 2024.⁠https://huggingface.co/datasets/SDAIANCAI/Saudilang-Code-Switch-Corpus
  5. 5.Al-Issa and Sulieman. Language choice at ATMs in Dubai. Frontiers in Communication 9:1355632, 2024.⁠https://www.frontiersin.org/journals/communication/articles/10.3389/fcomm.2024.1355632/full
  6. 6.Hopkyns, Zoghbor and Hassall. The use of English and linguistic hybridity among Emirati millennials. World Englishes, 2020.⁠https://doi.org/10.1111/weng.12506
  7. 7.General Authority for Statistics, Saudi Arabia. Saudi Census 2022 results, via Saudi Press Agency, 31 May 2023.⁠https://www.spa.gov.sa/w1911463
  8. 8.Wang, Alhmoud and Alqurishi (Elm). Open Universal Arabic ASR Leaderboard. Interspeech, 2025.⁠https://www.isca-archive.org/interspeech_2025/wang25_interspeech.pdf
  9. 9.Talafha et al. Casablanca: Data and Models for Multidialectal Arabic Speech Recognition. EMNLP, 2024.⁠https://aclanthology.org/2024.emnlp-main.1211/
  10. 10.Ugan, E. Y., Pham, N. Q., Bärmann, L. and Waibel, A. PIER: A Novel Metric for Evaluating What Matters in Code-Switching. ICASSP, 2025.⁠https://arxiv.org/abs/2501.09512
  11. 11.Hamed, I., Hussein, A., Chellah, O., Chowdhury, S., Mubarak, H., Sitaram, S., Habash, N. and Ali, A. Benchmarking Evaluation Metrics for Code-Switching Automatic Speech Recognition. IEEE SLT, 2022.⁠https://arxiv.org/abs/2211.16319
  12. 12.Kadaoui, K., Al Ali, M., Toyin, H., Mohammed, I. and Aldarmaki, H. PolyWER: A Holistic Evaluation Framework for Code-Switched Speech Recognition. Findings of EMNLP, 2024.⁠https://aclanthology.org/2024.findings-emnlp.356/
  13. 13.Kim, S., Arora, A., Le, D., Yeh, C.-F., Fuegen, C., Kalinli, O. and Seltzer, M. L. Semantic Distance: A New Metric for ASR Performance Analysis Towards Spoken Language Understanding. Interspeech, 2021.⁠https://www.isca-archive.org/interspeech_2021/kim21e_interspeech.pdf
  14. 14.Bastianelli, E., Vanzo, A., Swietojanski, P. and Rieser, V. SLURP: A Spoken Language Understanding Resource Package. EMNLP, 2020.⁠https://aclanthology.org/2020.emnlp-main.588/
  15. 15.Microsoft. Language identification with the Speech service. Azure AI documentation, updated 4 March 2026.⁠https://learn.microsoft.com/en-us/azure/ai-services/speech-service/language-identification
  16. 16.Google Cloud. Detect language in audio (multiple languages). Speech-to-Text documentation, updated 24 September 2026.⁠https://docs.cloud.google.com/speech-to-text/docs/multiple-languages
  17. 17.Google Cloud. Speech Synthesis Markup Language (SSML). Text-to-Speech documentation, updated 24 September 2026.⁠https://docs.cloud.google.com/text-to-speech/docs/ssml
  18. 18.Lodagala, V. S., Alkanhal, M., Izham, M., Mehta, S., Chowdhury, S. A., Makki, M., Hussein, A., Henter, G. E. and Ali, A. SawtArabi: A Benchmark Corpus for Arabic TTS. Standard, Dialectal and Code-Switching. Interspeech, 2025.⁠https://www.isca-archive.org/interspeech_2025/lodagala25_interspeech.pdf
  19. 19.Albasiri, E., Kim, M., Ferchichi, N. and Olabiyi, O. Inverse Text Normalization for Arabic Numbers in Streaming ASR. CAWL workshop at LREC, 2026.⁠https://aclanthology.org/2026.cawl-1.11/
  20. 20.Hamed, I., Sabty, C., Abdennadher, S., Vu, N. T., Solorio, T. and Habash, N. A Survey of Code-switched Arabic NLP: Progress, Challenges, and Future Directions. COLING, 2025.⁠https://aclanthology.org/2025.coling-main.307/
  21. 21.Alzubaidi et al. A survey of Arabic large language model benchmarks, 2025 (preprint).⁠https://arxiv.org/abs/2510.13430
  22. 22.Mohamed, A., Zhang, Y., Vazirgiannis, M. and Shang, G. Lost in the Mix: Evaluating LLM Understanding of Code-Switched Text, 2025 (preprint).⁠https://arxiv.org/abs/2506.14012
  23. 23.Ferguson, C. A. Diglossia. Word 15(2), 1959.⁠https://doi.org/10.1080/00437956.1959.11659702
  24. 24.Poplack, S. Sometimes I'll start a sentence in Spanish y termino en español: toward a typology of code-switching. Linguistics 18(7-8), 1980.⁠https://doi.org/10.1515/ling.1980.18.7-8.581
  25. 25.Palfreyman, D. and Al Khalil, M. "A Funky Language for Teenzz to Use": Representing Gulf Arabic in Instant Messaging. Journal of Computer-Mediated Communication 9(1), 2003.⁠https://doi.org/10.1111/j.1083-6101.2003.tb00355.x
  26. 26.Peng, P., Yan, B., Watanabe, S. and Harwath, D. Prompting the Hidden Talent of Web-Scale Speech Models for Zero-Shot Task Generalization. Interspeech, 2023.⁠https://par.nsf.gov/servlets/purl/10478271
  27. 27.ElevenLabs. Language detection (Agents platform documentation).⁠https://elevenlabs.io/docs/agents-platform/customization/tools/system-tools/language-detection

Reciba las nuevas investigaciones en cuanto se publiquen

Correos electrónicos ocasionales cuando publicamos.

Suscribirse

Siga leyendo