Тестирование ИИ-агентов на диалогах, в которых язык меняется посреди фразы
Клиенты в странах Залива привычно вставляют английские слова в арабские фразы, и опубликованные данные показывают, что речевые системы ошибаются в таких диалогах по причинам, которых стандартный показатель точности не видит. В этом материале изложено, что известно о смене языка, где системы дают сбой и как нужно построить тест, чтобы он вообще о чём-то говорил.
На этой странице
Ситуация
Покупатель пишет в службу по работе с клиентами застройщика в четверг вечером:
هلا، بغيت أعرف الـ next instalment حق الـ unit، متى الـ due date؟
Здравствуйте, хочу узнать next instalment по unit, когда due date? Фраза написана на диалекте стран Залива (халиджи). Три слова, в которых заключён запрос, английские. При плане платежей, привязанном к ходу строительства, ответ зависит от того, какого этапа достиг проект, а не от календарной даты, поэтому ИИ-агент должен определить объект, получить данные об этапе и ответить так, чтобы покупатель понял, что ему делать.
В этом сообщении нет ничего необычного. Необычно другое: тестировать на таких сообщениях. Большинство опубликованных измерений того, насколько хорошо система справляется с арабским языком, проводится только на арабском, только на английском или на литературном арабском, которым никто не пользуется, обращаясь на линию обслуживания. Поэтому всем, кто покупает или создаёт ИИ-агента для ОАЭ или Саудовской Аравии, нужно ответить на три вопроса: насколько распространено такое смешение, почему оно ломает речевые и языковые системы и как тестировать, чтобы этот случай был действительно покрыт, а не просто предполагался.
Что показывают данные
Насколько это распространено и какую форму принимает
Лингвисты различают два вида смены языка. При межфразовом переключении говорящий меняет язык между предложениями. При внутрифразовом переключении он меняет язык внутри одного предложения, как в сообщении выше. Это различие восходит к основополагающей работе 1980 года [24], и здесь оно важно потому, что эти два вида создают для системы разную нагрузку.
Данные по странам Залива уверенно указывают на второй вид. Mixat, крупнейший открытый корпус эмиратской речи с вкраплениями английского, содержит расшифровку 14,9 часа двух подкастов. В 36% предложений (1947 из 5316) язык менялся, 61% были только на арабском и 2% только на английском. Его индекс смешения кодов (code-mixing index), показатель от 0 до 1, который растёт по мере того, как предложение всё равномернее делится между языками, в среднем составил 0,11 по предложениям со сменой языка: это арабские предложения с несколькими английскими словами [1]. Во втором эмиратском корпусе, 12 часах ролевых игр в Zoom с участием 16 студентов университета, язык менялся в 19% высказываний, а английские существительные встречались в высказываниях со сменой языка на 56,9% чаще, чем в одноязычных [2]. В сопоставимом египетском корпусе, 12 часах интервью с 38 студентами из Каира, смешанными оказались 63,2% предложений, из них в 88,9% английский был встроен в арабский, а 66,3% английских фрагментов состояли из одного слова. Чаще всего непосредственно перед сменой языка стоял арабский определённый артикль [3], и это в точности схема сообщения выше. Единственный саудовский корпус, 4,45 часа одного подкаста с участием четырёх мужчин, показывает ту же картину: на английский приходится примерно один токен из пяти [4].
Эти корпуса состоят из подкастов, интервью и ролевых игр молодых образованных людей, поэтому они показывают, как выглядит смена языка, но не то, как часто к ней прибегает всё население. В опросе 2019 года среди 100 эмиратских студентов 78% ответили, что смешивают два языка внутри предложений [6]. Опрос 2024 года среди 566 пользователей банкоматов в Дубае показывает другую сторону: 99,7% пользователей, не являющихся арабами, выбирали английский, эмиратцы выбирали английский лишь в 19,7% случаев, а арабские экспаты на высокооплачиваемых должностях выбирали английский в 69% случаев, тогда как работающие на низкооплачиваемых должностях выбирали арабский в 84,3% случаев [5]. В Саудовской Аравии, по данным переписи 2022 года, 58,4% из 32,2 млн жителей были гражданами страны [7]. Агент, работающий в регионе, будет встречать диалоги только на английском, только на арабском и смешанные, и то, какой из них придёт, зависит от того, кто клиент.
Под сменой языка лежат ещё два слоя. Первый из них: диалект. Для арабского языка характерна диглоссия: литературная разновидность, современный литературный арабский язык, используется на письме и в официальной речи, а повседневная речь звучит на региональном диалекте [23]. Звонящий из стран Залива говорит на диалекте халиджи, значительная часть работников региона говорит на египетском или левантийском диалекте, и никто из них не говорит на современном литературном арабском, обращаясь на линию обслуживания. Второй слой: арабизи (Arabizi), арабский текст, набранный латиницей, где цифры обозначают звуки, для которых в латинице нет букв, например 3 вместо ع и 7 вместо ح. Это явление было задокументировано среди студентов Университета имени Заида (Zayed University) в 2003 году [25]. В опросе 2019 года 45% студентов ответили, что никогда им не пользуются, а 16% ответили, что пользуются всегда [6], поэтому переписка в WhatsApp может содержать арабскую графику, латиницу и обе сразу.
Где системы дают сбой
Рабочее предположение этого исследования состояло в том, что сбои сосредоточены в точке смены языка. Данные показывают, что смена языка вызывает лишь один из трёх видов сбоев, и не самый крупный.
Самый крупный связан с диалектом. Качество распознавания речи измеряют показателем ошибок по словам (word error rate): долей слов в расшифровке, которые неверны, пропущены или вставлены по сравнению со сказанным. Чем он ниже, тем лучше, а значение выше 100% означает, что система выдала больше ошибочных слов, чем было сказано слов. На саудовском тестовом наборе из вещательных программ одна широко используемая открытая речевая модель показала 27,95% на современном литературном арабском и 59,92% на диалекте стран Залива, а на египетском диалекте 59,28% [8]. Этот разрыв никак не связан с английским. Это цена того, что модель, обученная в основном на литературном арабском, встречается с клиентом, который на нём не говорит.
Второй сбой: модель выполняет не ту задачу. Когда авторы Mixat пропустили свои эмиратские записи через универсальную речевую модель, она показала 12,06% на предложениях только на английском и 195,98% на предложениях только на арабском. Модель «переводит предложения на MSA (современный литературный арабский), и переводы часто верны. Это показывает, что Whisper на самом деле распознаёт диалект и переключение кодов, но выполняет не ту задачу» [1]. Исследование восьми диалектов выявило то же на смешанных фрагментах: «Whisper не выдал ни одного слова с переключением кодов ни в одном сценарии. Примечательно, что даже когда язык декодирования был задан как английский, Whisper выполнял перевод, даже если задача была указана как „транскрибирование“» [9]. Такое же поведение задокументировано на речи, смешивающей путунхуа и английский [26]. Клиент говорит «claim», а в расшифровке оказывается арабский эквивалент слова claim, или вся фраза оказывается записанной на литературном арабском, на котором клиент её не произносил.
Третий сбой связан с самой сменой языка. Он реален, но в основном не виден в итоговом показателе. В исследовании 2025 года предложили метрику, которая учитывает только слова со сменой языка. Обучение модели на большем объёме одноязычных арабских и английских данных улучшило её общий показатель ошибок по словам на смешанных тестовых наборах, «в то время как распознавание собственно фрагментов с переключением кодов ухудшается» [10]. Модель может стать лучше в среднем и хуже на названиях продуктов, идентификационных номерах и технических терминах, в которых и заключён запрос, а обычный тест покажет улучшение.
Крупные облачные речевые сервисы прямо говорят об этом. Один из них указывает, что его непрерывное определение языка «не поддерживает смену языка в пределах одного предложения. Например, если вы говорите в основном по-испански и вставляете несколько английских слов, смена языка не определяется для каждого слова» [15]. Другой допускает до трёх языков-кандидатов, транскрибирует, «используя наиболее подходящий язык из списка», и называет эту функцию «идеальной для приложений, которым нужно транскрибировать короткие высказывания, такие как голосовые команды или поисковые запросы» [16]. Это честные описания систем, созданных для того, чтобы выбирать один язык для каждого высказывания.
Почему обычный показатель вводит в заблуждение
У показателя ошибок по словам есть особая проблема со смешанной речью. Если клиент говорит «booking», а система записывает это слово арабскими буквами, читатель его поймёт, а метрика засчитает ошибку. В исследовании 2022 года четыре двуязычных разметчика вручную отредактировали 3903 расшифровки египетской смешанной речи, после чего исследователи выяснили, какой автоматический показатель точнее всего отражает объём правки, нужной человеку. Обычный показатель ошибок по словам коррелировал на уровне 0,55. Показатель ошибок по символам после транслитерации английских слов арабской графикой и нормализации написания коррелировал на уровне 0,80 [11]. Метод 2024 года, построенный на эмиратских данных, засчитывает как верные точное совпадение, транслитерацию или перевод слова со сменой языка [12]. Без подобной поправки тестовый набор диалогов из стран Залива штрафует правильное поведение и вознаграждает сбой, при котором модель выполняет не ту задачу, всякий раз, когда её результат совпадает с графикой эталона.
Важнее другое: расшифровка не является конечным результатом. В исследовании 2021 года составили пары наборов расшифровок с одинаковым показателем ошибок по словам, 6,16% в обоих, и выяснили, что набор, ошибки в котором сохраняли смысл, дал точность определения намерения (долю запросов, в которых система поняла, что нужно) 96,22% против 94,63% для набора, ошибки в котором смысл не сохраняли [13]. На 58-часовом английском бенчмарке голосовых запросов к домашнему устройству точность определения намерения у лучшей системы на реальном аудио при показателе ошибок по словам 16% была лишь примерно на 5 пунктов ниже, чем на безупречных расшифровках, но её точность распознавания деталей запроса (имён, дат и мест) упала с 78,19 до 69,53 по собственной метрике бенчмарка [14]. Определение намерения устойчиво к ошибкам расшифровки. Распознавание деталей не устойчиво. В звонке по убытку намерение звучит так: «что с моим страховым случаем»; деталь: номер автомобиля. Тестировать нужно и то, и другое, по отдельности. Оба исследования проведены на английском; ни одно опубликованное исследование не измеряет точность определения намерения на смешанной арабско-английской речи, и это пробел, а не повод для спокойствия.
Озвучивание ответа
Голосовой агент должен не только услышать смешанную фразу, но и произнести её. У синтеза речи, системы, которая превращает письменный ответ в звук, своя проблема со сменой языка. Один крупный поставщик указывает, что его тег для разметки иноязычного фрагмента внутри предложения «не поддерживается» для «семитских языков, таких как арабский, иврит и персидский», и его использование «приведёт к тишине» [17]. Первая опубликованная работа о синтезе арабской речи с поддержкой диалекта и смешения языков появилась в 2025 году; она была выполнена на одном часе египетско-английской речи одного диктора и справлялась со смешением, разбивая каждое предложение на одноязычные фразы и синтезируя их по отдельности [18]. Для диалекта стран Залива ничего подобного нет. Числа добавляют ещё один слой: арабские числительные изменяются по родам, а диалекты эти показатели отбрасывают, но читают числа по-своему, поэтому идентификационный номер или сумма в дирхамах могут быть верны на экране и неверны вслух [19].
Автоматическое определение языка тоже менее отработано, чем кажется. Одна платформа голосовых агентов предупреждает, что «фоновая речь или необычный акцент иногда могут вызвать смену языка, которой звонящий не хотел», и предлагает настройку, которая ограничивает смену языка первыми двумя репликами [27]. Определение языка нужно тестировать на ложные срабатывания, а не только на верные.
Что не тестируется
Обзор 2025 года выявил показатели ошибок по словам от 24,8 до 53,8% на существующих корпусах смешанной арабской речи и констатировал, что «арабская речь с переключением кодов (CSW) по-прежнему недостаточно представлена в современных бенчмарках» [20]. Другой обзор 2025 года, охвативший более 40 бенчмарков для языковых моделей на арабском, называет оценку переключения кодов и многоходовые диалоги критическими пробелами [21]. Открытые материалы из стран Залива для тестирования смешанной речи в сумме составляют несколько десятков часов подкастов, телепередач и студенческих ролевых игр, в основном под лицензиями, запрещающими коммерческое использование, и ничего из этого не записано во время телефонного звонка в компанию. Не существует открытого тестового набора из стран Залива с запросами клиентов, в которых смешаны языки, размеченными по тому, чего хотел клиент.
Один результат указывает в обратную сторону. На письменном тексте исследование 2025 года, посвящённое большим языковым моделям, показало, что вставка английских слов в неанглийское предложение «часто улучшает понимание, особенно для моделей с ограниченным владением матричным языком», а вставка иностранных слов в английский текст его ухудшала [22]. Английское слово в арабском сообщении в WhatsApp может помогать модели. Трудность сосредоточена в устной версии того же слова.
Что это значит
Мы исходили из гипотезы, что сбои сосредоточены в точках смены языка. Данные её корректируют. Сбои сосредоточены прежде всего на диалекте, во вторую очередь на том, что модель выполняет не ту задачу, которую её просили выполнить, и лишь в третью очередь на словах со сменой языка, которые стандартный показатель скрывает. Тест, построенный только вокруг точек смены языка, пропустил бы два более крупных сбоя. Тест, построенный на точности для одного языка, пропустил бы все три.
Стоит знать, на какие компромиссы приходится идти. Если ограничить речевой сервис одним языком, точность на этом языке растёт, но сервис теряет способность следовать за сменой языка. Если заставить универсальную модель работать на арабском, она начинает переводить. Если засчитывать транслитерированные слова как верные, показатель становится честным, но перестаёт быть сопоставимым с цифрой поставщика, который так не делал. А более высокая средняя точность может сочетаться с более низкой точностью на тех словах, которые важны.
Поэтому тест ИИ-агента для этого региона должен по отдельности проверять четыре вещи: понята ли арабская основа фразы на том диалекте, на котором говорил клиент; сохранились ли английские вставки; правильно ли зафиксированы намерение и детали, причём оценивается понимание, а не расшифровка; и правильно ли произнесён ответ, включая числа. В нём должна использоваться метрика, которая засчитывает верное слово в любой графике. И он должен строиться на диалогах, которые компания действительно получает, потому что никакой открытый набор данных их не заменит.
Как мы учитываем это при проектировании
Наши ИИ-агенты понимают собеседника, который смешивает арабский и английский в одной фразе, и определяют язык клиента по первым нескольким словам, а не просят его выбрать язык. Они понимают диалект стран Залива, египетский и левантийский диалекты, современный литературный арабский язык и английский и отвечают на них, потому что среди клиентов в Дубае или Эр-Рияде есть носители всех этих вариантов, и ответ следует диалекту, на котором говорил клиент.
Если агент не уверен, он задаёт уточняющий вопрос, а не угадывает; диалог, в котором агент не может решить вопрос, передаётся сотруднику. Поскольку базовые речевые и языковые модели сильно различаются в зависимости от диалекта, модели выбираются для каждого развёртывания и могут быть заменены, благодаря чему заказчик может увидеть, к чему приводит замена, раньше, чем это увидят клиенты.
Описанный выше подход к тестированию лежит в основе наших оценочных наборов: тестовые диалоги строятся на реальных закономерностях каждой отрасли, оцениваются по тому, понял ли агент, чего хотел клиент, и правильно ли зафиксировал детали (номер объекта, номер убытка, рейс), а не только по расшифровке, и проверяются на соответствие тому, что считается решённым вопросом в случае убытка или передачи объекта. Благодаря тому, что предпочтительный язык запоминается, клиента, который в прошлый раз выбрал английский, в этот раз приветствуют на английском, а тому, кто писал на диалекте стран Залива, не отвечают на литературном арабском.
Мы не публикуем показатели точности наших собственных ИИ-агентов. Когда мы начнём их публиковать, они будут сопровождаться тестовым набором, составом диалектов и методом оценки, потому что без этого цифра для речи со смешением языков ничего не значит.
Чего мы пока не знаем
Никто не измерял, как часто клиенты меняют язык на линиях обслуживания в странах Залива и какая доля таких диалогов ведётся на арабском, на английском или на смеси языков. Перечисленные выше корпуса являются лучшими из доступных, и ни один из них не записан во время телефонного звонка в компанию.
Ни одно опубликованное исследование по арабскому языку не измеряет ошибки в самой точке смены языка или на английских названиях продуктов, идентификационных номерах и произнесённых цифрах внутри арабских предложений. Механизм задокументирован, а его масштаб в диалоге с клиентом не задокументирован.
Нет независимой оценки того, как коммерческие голоса синтеза речи справляются с фразой на диалекте стран Залива с английскими вставками. Документация поставщиков описывает ограничения; никто за пределами компаний-поставщиков их не измерял.
Нет данных ни в пользу, ни против того, что арабизи используют всё реже по мере того, как арабские клавиатуры становятся повсеместными, и нет исследований о том, считают ли слушатели из стран Залива приемлемыми ответы на египетском или левантийском диалекте в звонке в службу обслуживания.
На каждый из этих вопросов может начать отвечать тестовый набор, построенный на собственных диалогах компании. Именно поэтому его стоит построить до развёртывания, а не после.
Источники
- 1.Al Ali, M. K. and Aldarmaki, H. Mixat: A Data Set of Bilingual Emirati-English Speech. SIGUL workshop at LREC-COLING, 2024.https://aclanthology.org/2024.sigul-1.26/
- 2.Hamed, I., Eryani, F., Palfreyman, D. and Habash, N. ZAEBUC-Spoken: A Multilingual Multidialectal Arabic-English Speech Corpus. LREC-COLING, 2024.https://aclanthology.org/2024.lrec-main.1546/
- 3.Hamed, I., Vu, N. T. and Abdennadher, S. ArzEn: A Speech Corpus for Code-switched Egyptian Arabic-English. LREC, 2020.https://aclanthology.org/2020.lrec-1.523/
- 4.Alharbi, S. et al. (SDAIA National Center for AI). Saudilang Code-Switch Corpus, 2024.https://huggingface.co/datasets/SDAIANCAI/Saudilang-Code-Switch-Corpus
- 5.Al-Issa and Sulieman. Language choice at ATMs in Dubai. Frontiers in Communication 9:1355632, 2024.https://www.frontiersin.org/journals/communication/articles/10.3389/fcomm.2024.1355632/full
- 6.Hopkyns, Zoghbor and Hassall. The use of English and linguistic hybridity among Emirati millennials. World Englishes, 2020.https://doi.org/10.1111/weng.12506
- 7.General Authority for Statistics, Saudi Arabia. Saudi Census 2022 results, via Saudi Press Agency, 31 May 2023.https://www.spa.gov.sa/w1911463
- 8.Wang, Alhmoud and Alqurishi (Elm). Open Universal Arabic ASR Leaderboard. Interspeech, 2025.https://www.isca-archive.org/interspeech_2025/wang25_interspeech.pdf
- 9.Talafha et al. Casablanca: Data and Models for Multidialectal Arabic Speech Recognition. EMNLP, 2024.https://aclanthology.org/2024.emnlp-main.1211/
- 10.Ugan, E. Y., Pham, N. Q., Bärmann, L. and Waibel, A. PIER: A Novel Metric for Evaluating What Matters in Code-Switching. ICASSP, 2025.https://arxiv.org/abs/2501.09512
- 11.Hamed, I., Hussein, A., Chellah, O., Chowdhury, S., Mubarak, H., Sitaram, S., Habash, N. and Ali, A. Benchmarking Evaluation Metrics for Code-Switching Automatic Speech Recognition. IEEE SLT, 2022.https://arxiv.org/abs/2211.16319
- 12.Kadaoui, K., Al Ali, M., Toyin, H., Mohammed, I. and Aldarmaki, H. PolyWER: A Holistic Evaluation Framework for Code-Switched Speech Recognition. Findings of EMNLP, 2024.https://aclanthology.org/2024.findings-emnlp.356/
- 13.Kim, S., Arora, A., Le, D., Yeh, C.-F., Fuegen, C., Kalinli, O. and Seltzer, M. L. Semantic Distance: A New Metric for ASR Performance Analysis Towards Spoken Language Understanding. Interspeech, 2021.https://www.isca-archive.org/interspeech_2021/kim21e_interspeech.pdf
- 14.Bastianelli, E., Vanzo, A., Swietojanski, P. and Rieser, V. SLURP: A Spoken Language Understanding Resource Package. EMNLP, 2020.https://aclanthology.org/2020.emnlp-main.588/
- 15.Microsoft. Language identification with the Speech service. Azure AI documentation, updated 4 March 2026.https://learn.microsoft.com/en-us/azure/ai-services/speech-service/language-identification
- 16.Google Cloud. Detect language in audio (multiple languages). Speech-to-Text documentation, updated 24 September 2026.https://docs.cloud.google.com/speech-to-text/docs/multiple-languages
- 17.Google Cloud. Speech Synthesis Markup Language (SSML). Text-to-Speech documentation, updated 24 September 2026.https://docs.cloud.google.com/text-to-speech/docs/ssml
- 18.Lodagala, V. S., Alkanhal, M., Izham, M., Mehta, S., Chowdhury, S. A., Makki, M., Hussein, A., Henter, G. E. and Ali, A. SawtArabi: A Benchmark Corpus for Arabic TTS. Standard, Dialectal and Code-Switching. Interspeech, 2025.https://www.isca-archive.org/interspeech_2025/lodagala25_interspeech.pdf
- 19.Albasiri, E., Kim, M., Ferchichi, N. and Olabiyi, O. Inverse Text Normalization for Arabic Numbers in Streaming ASR. CAWL workshop at LREC, 2026.https://aclanthology.org/2026.cawl-1.11/
- 20.Hamed, I., Sabty, C., Abdennadher, S., Vu, N. T., Solorio, T. and Habash, N. A Survey of Code-switched Arabic NLP: Progress, Challenges, and Future Directions. COLING, 2025.https://aclanthology.org/2025.coling-main.307/
- 21.Alzubaidi et al. A survey of Arabic large language model benchmarks, 2025 (preprint).https://arxiv.org/abs/2510.13430
- 22.Mohamed, A., Zhang, Y., Vazirgiannis, M. and Shang, G. Lost in the Mix: Evaluating LLM Understanding of Code-Switched Text, 2025 (preprint).https://arxiv.org/abs/2506.14012
- 23.Ferguson, C. A. Diglossia. Word 15(2), 1959.https://doi.org/10.1080/00437956.1959.11659702
- 24.Poplack, S. Sometimes I'll start a sentence in Spanish y termino en español: toward a typology of code-switching. Linguistics 18(7-8), 1980.https://doi.org/10.1515/ling.1980.18.7-8.581
- 25.Palfreyman, D. and Al Khalil, M. "A Funky Language for Teenzz to Use": Representing Gulf Arabic in Instant Messaging. Journal of Computer-Mediated Communication 9(1), 2003.https://doi.org/10.1111/j.1083-6101.2003.tb00355.x
- 26.Peng, P., Yan, B., Watanabe, S. and Harwath, D. Prompting the Hidden Talent of Web-Scale Speech Models for Zero-Shot Task Generalization. Interspeech, 2023.https://par.nsf.gov/servlets/purl/10478271
- 27.ElevenLabs. Language detection (Agents platform documentation).https://elevenlabs.io/docs/agents-platform/customization/tools/system-tools/language-detection
Получайте новые исследования сразу после публикации
Нечастые письма о новых публикациях.