Telonic

研究2026 年 9 月 30 日Anthony Ombrore

用句中切换语言的对话测试 AI 智能体

海湾地区的客户习惯在阿拉伯语句子中夹杂英语单词,而已发表的证据表明,语音系统在这类对话上出错的原因,是标准准确率得分无法发现的。本文阐述目前对这种语言切换的了解、系统在哪些地方出错,以及测试必须如何构建,才能真正说明问题。

本页内容
  1. 情境
  2. 证据表明什么
  3. 这意味着什么
  4. 我们如何据此设计
  5. 我们尚不了解的
  6. 参考来源

情境

一位购房者在周四晚上给开发商的客户服务渠道发来消息:

هلا، بغيت أعرف الـ next instalment حق الـ unit، متى الـ due date؟

您好,我想知道这个 unit 的 next instalment,due date 是什么时候?这句话是海湾阿拉伯语。承载请求内容的三个词是英语。对于与工程进度挂钩的付款计划,答案取决于项目已经达到哪个工程节点,而不是某个日历日期,因此 AI 智能体必须识别出是哪套房屋,查询工程节点,并以购房者能够据此采取行动的方式回复。

这条消息没有任何不寻常之处。不寻常的是针对它进行测试。大多数已发表的、衡量系统处理阿拉伯语能力的指标,都是仅在阿拉伯语上、仅在英语上,或者在没有人会在客服渠道上使用的正式阿拉伯语上测得的。因此,对于任何为阿联酋或沙特阿拉伯采购或构建智能体的人来说,需要回答的问题是:这种混用有多普遍,它为什么会让语音系统和语言系统出错,以及应如何测试,才能真正覆盖这种情况,而不是假定已经覆盖。

证据表明什么

有多普遍,呈现什么形态

语言学家区分两种语言切换。句间切换是在句与句之间切换语言。句内切换是在一个句子内部切换语言,就像上面那条消息。这一区分源于 1980 年的奠基性研究 [24]。它在这里很重要,因为两种切换给系统带来的压力不同。

海湾地区的证据明确指向第二种。Mixat 是收录夹杂英语的阿联酋人口语的公开语料库中规模最大的一个,转录了两档播客共 14.9 小时的内容。其中 36% 的句子(5,316 句中的 1,947 句)包含语言切换,61% 只有阿拉伯语,2% 只有英语。它的语码混合指数(code-mixing index)是一个从 0 到 1 的分数,句子中两种语言的比例越均衡,分数越高;在发生切换的句子中,该指数的平均值为 0.11,也就是夹杂少量英语单词的阿拉伯语句子 [1]。另一个阿联酋语料库包含 16 名大学生在 Zoom 上进行的 12 小时角色扮演,发现 19% 的话语发生了切换,而且英语名词在切换话语中的出现频率比在单语话语中高 56.9% [2]。可资比较的埃及语料库包含对 38 名开罗学生的 12 小时访谈,发现 63.2% 的句子是混合语言的,其中 88.9% 是嵌入了英语的阿拉伯语,66.3% 的英语片段只有一个单词长。紧接在切换之前出现最多的词是阿拉伯语定冠词 [3],这正是上面那条消息中的模式。唯一的沙特语料库来自一档有四位男性说话者的播客,共 4.45 小时,呈现出相同的形态,约每五个词元中就有一个是英语 [4]。

这些语料库都是年轻、受过教育的说话者录制的播客、访谈和角色扮演,因此它们展示的是语言切换是什么样子,而不是整个人群切换的频率。2019 年一项针对 100 名阿联酋籍大学生的调查发现,78% 的人表示他们会在句子内部混用两种语言 [6]。2024 年一项针对迪拜 566 名自动取款机用户的调查则呈现了另一面:99.7% 的非阿拉伯裔用户选择英语;阿联酋本国人选择英语的比例只有 19.7%;从事高薪工作的阿拉伯裔外籍人士选择英语的比例为 69%,而从事低薪工作的阿拉伯裔外籍人士选择阿拉伯语的比例为 84.3% [5]。在沙特阿拉伯,2022 年人口普查显示,3220 万居民中有 58.4% 是沙特国民 [7]。服务该地区的智能体会遇到纯英语、纯阿拉伯语和混合语言的对话,而具体遇到哪一种,取决于客户是谁。

语言切换之下还有两个层面。第一是方言。阿拉伯语存在双层语言现象(diglossia):正式变体,即现代标准阿拉伯语,用于书面和正式讲话,而日常口语使用地区方言 [23]。海湾地区的来电者说海湾阿拉伯语,该地区的大量劳动者说埃及阿拉伯语或黎凡特阿拉伯语,而他们都不会在客服渠道上说现代标准阿拉伯语。第二是 Arabizi,即用拉丁字母书写的阿拉伯语,用数字代替拉丁字母中没有对应字母的发音,例如用 3 代表 ع,用 7 代表 ح。2003 年已有研究记录了扎耶德大学(Zayed University)学生使用 Arabizi 的情况 [25]。在 2019 年的那项调查中,45% 的学生表示从不使用它,16% 表示一直使用 [6],因此一个 WhatsApp 对话中可能出现阿拉伯文字、拉丁文字,或者两者兼有。

系统在哪里出错

本研究的工作假设是:错误集中在切换点。证据表明,切换只是三类错误之一,而且不是最主要的一类。

最主要的是方言。语音识别用词错误率来衡量:与实际所说的内容相比,转录文本中错误、缺失或多出的词所占的比例。数值越低越好;超过 100% 意味着系统产生的错误词比实际的词还多。在一个沙特广播测试集上,一个被广泛使用的开放语音模型在现代标准阿拉伯语上的得分为 27.95%,在海湾方言上为 59.92%,在埃及阿拉伯语上为 59.28% [8]。这一差距与英语毫无关系。它是一个主要用正式阿拉伯语训练的模型,遇到不说正式阿拉伯语的客户时所付出的代价。

第二类错误是执行了错误的任务。Mixat 的作者用一个通用语音模型处理他们的阿联酋录音时,该模型在纯英语句子上的得分为 12.06%,在纯阿拉伯语句子上的得分却为 195.98%。该模型“把句子翻译成了现代标准阿拉伯语(MSA),而且译文往往是正确的。这表明 Whisper 实际上能识别方言和语码转换,但执行了错误的任务”[1]。一项涵盖八种方言的研究在其混合语言片段上也观察到同样的情况:“在所有场景中,Whisper 都没有输出任何语码转换的词。值得注意的是,即使将解码语言设置为英语,即使将任务指定为‘转录’,Whisper 仍然执行了翻译任务”[9]。在普通话与英语混合的语音上,也记录到了同样的行为 [26]。客户说的是“claim”,转录文本中却是表示理赔的阿拉伯语单词;或者整句话以客户从未说过的正式阿拉伯语返回。

第三类错误是切换本身。这类错误确实存在,但在总体得分中大多看不出来。2025 年的一项研究提出了一种只对切换词评分的指标。用更多单语阿拉伯语和英语数据训练模型,改善了模型在混合语言测试集上的总体词错误率,“而对实际语码转换实例的识别却在恶化”[10]。一个模型可能在平均水平上变得更好,却在承载请求内容的产品名称、参考编号和专业术语上变得更差,而常规测试给出的结果是有所改进。

主要的云语音服务也承认这一点。其中一家表示,其连续语言检测“不支持在同一句话中切换语言。例如,如果您主要说西班牙语,中间插入一些英语单词,它不会逐词检测语言的变化”[15]。另一家最多允许指定三种候选语言,“使用列表中最匹配的语言”进行转录,并称该功能“非常适合需要转录语音命令或搜索等简短语句的应用”[16]。这些都是对“每段话语只选一种语言”的系统的如实描述。

常用得分为何会误导

词错误率在混合语言语音上有一个特定的问题。如果客户说“booking”,而系统用阿拉伯字母写出这个词,读者能看懂,指标却把它算作错误。2022 年的一项研究请四名双语标注员对 3,903 份埃及混合语言语音的转录文本进行后期修订,然后考察哪一种自动评分最能反映人工所需的修订量。普通词错误率的相关系数为 0.55。先把英语单词音译为阿拉伯文字并统一拼写之后计算的字符错误率,相关系数为 0.80 [11]。2024 年一种基于阿联酋数据构建的方法,把切换词的完全匹配、音译或翻译都视为正确 [12]。如果不作此类调整,由海湾地区对话构成的测试集就会惩罚正确的行为;而只要错误任务的输出与参考文本使用同一种文字,测试集就会奖励这种错误。

更深层的问题在于,转录本身并不是最终结果。2021 年的一项研究构建了成对的转录文本集,每对的词错误率相同,均为 6.16%,结果发现,错误不影响语义的那一组意图准确率(系统理解了客户想要什么的请求所占的比例)为 96.22%,而错误影响语义的那一组为 94.63% [13]。在一个包含 58 小时、面向家用设备的英语语音请求基准上,表现最好的系统在词错误率为 16% 的真实音频上理解意图的比例,仅比在完美转录文本上低约 5 个百分点;但它对请求中细节信息(姓名、日期和地点)的准确率,按该基准自己的衡量标准,从 78.19 降至 69.53 [14]。意图对转录错误有较强的承受力。细节则不然。在一通理赔电话中,意图是“我的理赔到哪一步了”;细节是车牌号。两者都需要测试,而且要分开测试。这两项研究都基于英语;目前没有已发表的研究衡量阿拉伯语与英语混合语音的意图准确率,这是一个空白,而不是可以放心的理由。

用语音说出回复

语音智能体不仅要听懂混合语言的句子,还要能说出来。语音合成,即把书面回复转为音频的系统,有它自己的切换问题。一家主要服务商表示,其用于标记句中外语片段的标签对“阿拉伯语、希伯来语和波斯语等闪米特语言”“不受支持”,并且“会导致静音”[17]。首个能处理方言和语言混合的阿拉伯语语音合成研究成果于 2025 年发表,使用的是单一说话者一小时的埃及阿拉伯语与英语混合语音,其处理混合的方式是把每个句子拆成单语短语,再分别合成 [18]。海湾阿拉伯语还没有同类成果。数字又增加了一层难度:阿拉伯语数词会随性别变化,方言虽然省去了这些标记,却有各自的数字读法,因此一个参考编号或一笔迪拉姆金额可能在屏幕上是对的,读出来却是错的 [19]。

自动语言检测也不像听起来那么成熟。一个语音智能体平台提醒,“背景人声或不常见的口音偶尔会触发来电者并不想要的语言切换”,并提供了一项设置,把语言切换限制在前两轮对话之内 [27]。语言检测必须测试误切换,而不只是测试正确的切换。

哪些情况没有得到测试

2025 年的一项综述发现,在现有的阿拉伯语混合语音语料库上,词错误率在 24.8% 至 53.8% 之间,并指出“语码转换阿拉伯语(CSW Arabic)在现有基准中的代表性仍然不足”[20]。另一项 2025 年的综述考察了 40 多个阿拉伯语语言模型基准,将语码转换评估和多轮对话列为关键空白 [21]。可用于测试混合语言语音的海湾地区公开材料,总共只有几十小时的播客、电视节目和学生角色扮演,其中大部分的许可协议禁止商业使用,而且没有一份是在打给企业的电话线路上录制的。目前没有公开的海湾地区测试集收录标注了客户需求的混合语言客户请求。

有一项发现方向相反。在书面文本上,2025 年一项针对大语言模型的研究发现,在非英语句子中插入英语单词“往往能提高理解能力,对基础语言(matrix language)水平有限的模型尤其如此”,而在英语中插入外语单词则会降低理解能力 [22]。阿拉伯语 WhatsApp 消息中的英语单词可能对模型有帮助。困难集中在同一个词的口语形式上。

这意味着什么

我们最初的假设是错误集中在切换点。证据修正了这一假设。错误首先集中在方言上,其次是模型执行了与要求不同的任务,第三才是切换词,而标准得分会掩盖这一类错误。只围绕切换点构建的测试会漏掉两类更主要的错误。基于单语准确率构建的测试则会漏掉全部三类。

其中的取舍值得了解。把语音服务限定为一种语言,会提高它在该语言上的准确率,同时使它失去跟随语言切换的能力。强制通用模型使用阿拉伯语,会让它去翻译。把音译词视为正确,会让得分如实反映情况,同时也使它无法与未作此处理的供应商数据相比较。而且,平均准确率更高,也可能与关键词准确率更低同时存在。

因此,针对该地区的智能体测试必须分别考察四件事:阿拉伯语的句子主体是否按客户所用的方言被理解;夹杂的英语词是否被正确识别;意图和细节是否被捕捉到,并按理解程度而非转录结果评分;以及回复是否被正确说出,包括其中的数字。测试必须采用一种指标,使正确的词无论以哪种文字书写都算正确。而且,测试必须用企业实际收到的对话来构建,因为没有任何公开数据集可以替代它们。

我们如何据此设计

我们的智能体会跟上在同一句话中混用阿拉伯语和英语的说话者,并根据最初的几个词判断客户使用的是哪种语言,而不是请客户自己选择。它们能理解海湾阿拉伯语、埃及阿拉伯语、黎凡特阿拉伯语、现代标准阿拉伯语和英语,并用这些语言回复,因为迪拜或利雅得的客户群体涵盖所有这些语言;回复会采用客户所用的方言。

当智能体没有把握时,它会提出澄清问题,而不是猜测;它无法解决的对话会转交给人。由于底层的语音模型和语言模型在不同方言上的表现差异很大,模型按每个部署分别选择,并且可以更换,因此企业客户可以先于其客户看到某项更换带来的效果。

上述测试设计正是我们构建评估集的方式:测试对话取自各行业的真实模式;评分依据的是智能体是否理解了客户想要什么,并正确捕捉了细节(房屋编号、理赔编号、航班),而不只是看转录文本;同时对照“已解决”的结果在理赔或交房中意味着什么进行核查。借助语言偏好记忆,对于上次选择英语的客户,这次会用英语接待;而用海湾阿拉伯语书写的客户,不会收到正式阿拉伯语的回复。

我们不公布自己智能体的准确率数据。等到我们公布时,会同时提供测试集、方言构成和评分方法,因为没有这些信息,混合语言语音的任何数字都毫无意义。

我们尚不了解的

还没有人测量过海湾地区的客户在客服渠道上切换语言的频率,也没有人测量过这些对话中阿拉伯语、英语和混合语言各占多大比例。上述语料库是目前能找到的最好资料,而且没有一个是在打给企业的电话线路上录制的。

没有已发表的阿拉伯语研究测量切换点本身的错误,或者阿拉伯语句子中英语产品名称、参考编号和口述数字的错误。其机制已有记录;它在客户对话中的影响有多大,则尚无记录。

对于商用语音合成音色如何处理夹杂英语的海湾阿拉伯语句子,目前没有独立评估。供应商文档描述了其局限;供应商以外,还没有人对这些局限进行过测量。

随着阿拉伯语键盘的普及,Arabizi 的使用是否在减少,目前没有任何方向的证据;也没有研究考察海湾地区的听者能否在服务通话中接受埃及阿拉伯语或黎凡特阿拉伯语的回复。

这些问题,用企业自身对话构建的测试集都可以着手解答。这正是要在部署之前、而不是之后构建测试集的原因。

参考来源

  1. 1.Al Ali, M. K. and Aldarmaki, H. Mixat: A Data Set of Bilingual Emirati-English Speech. SIGUL workshop at LREC-COLING, 2024.⁠https://aclanthology.org/2024.sigul-1.26/
  2. 2.Hamed, I., Eryani, F., Palfreyman, D. and Habash, N. ZAEBUC-Spoken: A Multilingual Multidialectal Arabic-English Speech Corpus. LREC-COLING, 2024.⁠https://aclanthology.org/2024.lrec-main.1546/
  3. 3.Hamed, I., Vu, N. T. and Abdennadher, S. ArzEn: A Speech Corpus for Code-switched Egyptian Arabic-English. LREC, 2020.⁠https://aclanthology.org/2020.lrec-1.523/
  4. 4.Alharbi, S. et al. (SDAIA National Center for AI). Saudilang Code-Switch Corpus, 2024.⁠https://huggingface.co/datasets/SDAIANCAI/Saudilang-Code-Switch-Corpus
  5. 5.Al-Issa and Sulieman. Language choice at ATMs in Dubai. Frontiers in Communication 9:1355632, 2024.⁠https://www.frontiersin.org/journals/communication/articles/10.3389/fcomm.2024.1355632/full
  6. 6.Hopkyns, Zoghbor and Hassall. The use of English and linguistic hybridity among Emirati millennials. World Englishes, 2020.⁠https://doi.org/10.1111/weng.12506
  7. 7.General Authority for Statistics, Saudi Arabia. Saudi Census 2022 results, via Saudi Press Agency, 31 May 2023.⁠https://www.spa.gov.sa/w1911463
  8. 8.Wang, Alhmoud and Alqurishi (Elm). Open Universal Arabic ASR Leaderboard. Interspeech, 2025.⁠https://www.isca-archive.org/interspeech_2025/wang25_interspeech.pdf
  9. 9.Talafha et al. Casablanca: Data and Models for Multidialectal Arabic Speech Recognition. EMNLP, 2024.⁠https://aclanthology.org/2024.emnlp-main.1211/
  10. 10.Ugan, E. Y., Pham, N. Q., Bärmann, L. and Waibel, A. PIER: A Novel Metric for Evaluating What Matters in Code-Switching. ICASSP, 2025.⁠https://arxiv.org/abs/2501.09512
  11. 11.Hamed, I., Hussein, A., Chellah, O., Chowdhury, S., Mubarak, H., Sitaram, S., Habash, N. and Ali, A. Benchmarking Evaluation Metrics for Code-Switching Automatic Speech Recognition. IEEE SLT, 2022.⁠https://arxiv.org/abs/2211.16319
  12. 12.Kadaoui, K., Al Ali, M., Toyin, H., Mohammed, I. and Aldarmaki, H. PolyWER: A Holistic Evaluation Framework for Code-Switched Speech Recognition. Findings of EMNLP, 2024.⁠https://aclanthology.org/2024.findings-emnlp.356/
  13. 13.Kim, S., Arora, A., Le, D., Yeh, C.-F., Fuegen, C., Kalinli, O. and Seltzer, M. L. Semantic Distance: A New Metric for ASR Performance Analysis Towards Spoken Language Understanding. Interspeech, 2021.⁠https://www.isca-archive.org/interspeech_2021/kim21e_interspeech.pdf
  14. 14.Bastianelli, E., Vanzo, A., Swietojanski, P. and Rieser, V. SLURP: A Spoken Language Understanding Resource Package. EMNLP, 2020.⁠https://aclanthology.org/2020.emnlp-main.588/
  15. 15.Microsoft. Language identification with the Speech service. Azure AI documentation, updated 4 March 2026.⁠https://learn.microsoft.com/en-us/azure/ai-services/speech-service/language-identification
  16. 16.Google Cloud. Detect language in audio (multiple languages). Speech-to-Text documentation, updated 24 September 2026.⁠https://docs.cloud.google.com/speech-to-text/docs/multiple-languages
  17. 17.Google Cloud. Speech Synthesis Markup Language (SSML). Text-to-Speech documentation, updated 24 September 2026.⁠https://docs.cloud.google.com/text-to-speech/docs/ssml
  18. 18.Lodagala, V. S., Alkanhal, M., Izham, M., Mehta, S., Chowdhury, S. A., Makki, M., Hussein, A., Henter, G. E. and Ali, A. SawtArabi: A Benchmark Corpus for Arabic TTS. Standard, Dialectal and Code-Switching. Interspeech, 2025.⁠https://www.isca-archive.org/interspeech_2025/lodagala25_interspeech.pdf
  19. 19.Albasiri, E., Kim, M., Ferchichi, N. and Olabiyi, O. Inverse Text Normalization for Arabic Numbers in Streaming ASR. CAWL workshop at LREC, 2026.⁠https://aclanthology.org/2026.cawl-1.11/
  20. 20.Hamed, I., Sabty, C., Abdennadher, S., Vu, N. T., Solorio, T. and Habash, N. A Survey of Code-switched Arabic NLP: Progress, Challenges, and Future Directions. COLING, 2025.⁠https://aclanthology.org/2025.coling-main.307/
  21. 21.Alzubaidi et al. A survey of Arabic large language model benchmarks, 2025 (preprint).⁠https://arxiv.org/abs/2510.13430
  22. 22.Mohamed, A., Zhang, Y., Vazirgiannis, M. and Shang, G. Lost in the Mix: Evaluating LLM Understanding of Code-Switched Text, 2025 (preprint).⁠https://arxiv.org/abs/2506.14012
  23. 23.Ferguson, C. A. Diglossia. Word 15(2), 1959.⁠https://doi.org/10.1080/00437956.1959.11659702
  24. 24.Poplack, S. Sometimes I'll start a sentence in Spanish y termino en español: toward a typology of code-switching. Linguistics 18(7-8), 1980.⁠https://doi.org/10.1515/ling.1980.18.7-8.581
  25. 25.Palfreyman, D. and Al Khalil, M. "A Funky Language for Teenzz to Use": Representing Gulf Arabic in Instant Messaging. Journal of Computer-Mediated Communication 9(1), 2003.⁠https://doi.org/10.1111/j.1083-6101.2003.tb00355.x
  26. 26.Peng, P., Yan, B., Watanabe, S. and Harwath, D. Prompting the Hidden Talent of Web-Scale Speech Models for Zero-Shot Task Generalization. Interspeech, 2023.⁠https://par.nsf.gov/servlets/purl/10478271
  27. 27.ElevenLabs. Language detection (Agents platform documentation).⁠https://elevenlabs.io/docs/agents-platform/customization/tools/system-tools/language-detection

新研究发布时即可收到

我们发布研究时,会不定期发送电子邮件。

订阅

继续阅读