Telonic

Управление30 СЕН 2026Anthony Ombrore

Оценка каждого диалога по стандарту, который составила сама компания

Большинство контакт-центров судят о качестве, ежемесячно прослушивая несколько диалогов на каждого оператора, и мы не нашли ни одной измеренной цифры, показывающей, насколько мала эта выборка. В этом материале изложено, что говорят данные об альтернативе, то есть об оценке каждого диалога: где автоматической оценке можно доверять, где нельзя и каким должен быть стандарт, чтобы оценка по нему что-то значила.

На этой странице
  1. Ситуация
  2. Что показывают данные
  3. Что это значит
  4. Как мы учитываем это при проектировании
  5. Чего мы пока не знаем
  6. Источники

Ситуация

Руководитель отдела урегулирования убытков автостраховщика возглавляет команду, которая ведёт десятки тысяч диалогов в месяц. Шесть специалистов по контролю качества прослушивают несколько звонков каждого оператора, оценивают их по оценочной форме и раз в квартал проводят калибровочное совещание. Оценка качества составляет 84%, и так уже целый год.

Затем жалоба доходит до регулятора. Клиент утверждает, что никто не сказал ему, что по полицейскому протоколу виновником признан другой водитель, и поэтому он три недели добивался своего не от той страховой компании. Регулятор спрашивает, что именно ему сказали и когда. Подготовка ответа занимает два дня, потому что кому-то нужно найти запись и прослушать её. Никто не может сказать, случалось ли такое с кем-то ещё, потому что остальные 99 диалогов этого оператора за ту неделю так никто и не проверил.

Оценка настоящая. Но она описывает выборку, которую никто тщательно не составлял, по форме, которую никто не тестировал, и сведена к среднему значению, которое скрывает диалоги, доходящие до регулятора.

Что показывают данные

Никто не знает, насколько мала выборка

В отрасли повсеместно повторяют, что контакт-центры проверяют от одного до двух процентов диалогов. Мы не смогли найти источник, в котором эта цифра была бы измерена. Самое раннее её появление, которое удалось отследить, относится к аналитическому документу отраслевой организации примерно 2008 года, где она приведена без ссылки на источник [1]. В крупных опросах практиков, проведённых с тех пор, в том числе в опросе более чем 900 руководителей в 2022 году, ни разу не спрашивали, какая доля диалогов проверяется [2].

Измеряется другое: число проверок на одного оператора. Опрос 115 специалистов контакт-центров в 2013 году показал, что две трети из них проверяли шесть или меньше звонков на оператора в месяц [3]. Рецензируемые кейс-стади 2002 года по четырём шотландским центрам выявили от двух до примерно восьми проверок в месяц [4]. Эти данные вторичны и устарели, но уже двадцать лет указывают в одну сторону.

Дальнейшие расчёты наши. Если оператор ведёт 400 диалогов в месяц и проверяется пять из них, охват составляет чуть больше одного процента. Если серьёзный сбой, скажем, пропущенная проверка личности, происходит один раз на 200 диалогов, вероятность того, что в выборку из пяти звонков попадёт хотя бы один такой случай, составляет около 2,5%. Четыре успешные проверки из пяти дают 95-процентный доверительный интервал (метод Уилсона) примерно от 38 до 96%. Среднее по всему центру при этом может быть вполне надёжным: около 385 случайных диалогов позволяют оценить долю с точностью до пяти пунктов при доверительной вероятности 95%, независимо от объёма. А оценка отдельного оператора и редкое событие почти неотличимы от шума.

К тому же выборка часто не случайна. В опросе 2022 года 63% руководителей сообщили, что взаимодействия для проверки отбираются случайным образом, а 75% сообщили, что их организация пыталась связать оценки качества с удовлетворённостью клиентов, то есть четверть этого не делала [2].

Проверяющие-люди сходятся в оценке действий, а не впечатлений

Межэкспертная согласованность показывает, насколько совпадают оценки двух людей, оценивающих одно и то же. Обычно её выражают коэффициентом каппа, который изменяется от 0 (совпадение не лучше случайного) до 1 (полное совпадение). Согласно одному широко цитируемому анализу, любое значение каппы ниже 0,60 недостаточно для принятия решений [5]; стандартный справочник по контент-анализу требует 0,80, чтобы полагаться на данные, и 0,67 для предварительных выводов [6].

Согласованность гораздо больше зависит от того, что оценивают проверяющие, чем от того, кто они. В исследовании 2026 года, где 38 экзаменаторов оценивали 90 студентов сестринского дела, каппа по пункту «выполняет аускультацию грудной клетки» составила 0,95. По пункту «проявляет эмпатию» она составила 0,30, или 0,62 по варианту статистики, скорректированному с учётом того, как редко это поведение отмечалось как отсутствующее [7]. Метаанализ, охвативший 14 650 сотрудников, показал, что оценки общей результативности одного и того же человека, выставленные двумя руководителями, коррелировали на уровне 0,52, то есть совпадала примерно половина дисперсии их суждений [8]. В кейс-стади 2002 года один оператор получил три разные оценки за одно и то же начало разговора [4].

Калибровочные совещания, возможно, дают меньше, чем принято считать. В исследовании с участием 52 преподавателей медицины, 31 из которых были распределены случайным образом, тренинг для оценщиков не улучшил ни согласованность, ни точность; он повысил уверенность оценщиков [9]. Метаанализы действительно показывают, что обучение единой системе отсчёта (frame-of-reference training), при котором на общих примерах объясняют, как выглядит каждый уровень оценки, повышает точность [10]. Но двухлетнее исследование оценщиков, наблюдавших за работой 458 учителей, показало, что дрейф оценок, то есть склонность стандарта проверяющего со временем смещаться, был значительным с самого начала, а оценки так и не сошлись; разброс между оценщиками увеличивался [11]. Эти данные указывают на ответ: постоянное измерение по фиксированному эталонному набору, хотя сам этот подход в контролируемом исследовании не проверялся.

Эти данные получены в медицине, образовании и организационной психологии. Мы не нашли ни одного рецензируемого исследования, в котором приводилась бы каппа для коммерческих оценочных форм контакт-центров. Этот пробел сам по себе является выводом.

Языковые модели в роли проверяющих: сильны на простых случаях, слабы там, где это важно

Языковую модель, которая оценивает расшифровки, часто называют «LLM-судьёй» (LLM judge). В самом цитируемом исследовании сообщалось, что GPT-4 соглашалась с оценщиками-людьми в 85% случаев, чаще, чем люди соглашались друг с другом (81%) [12]. Эта цифра нуждается в оговорке. 85% не включают ничьи и случаи, когда модель меняла вердикт, если два ответа меняли местами. С их учётом согласие модели с людьми составляло от 64 до 66% против показателя от 63 до 67% у пар людей. На намеренно сложном наборе из 80 пар почти одинаковых ответов модель 2023 года в 35% случаев выносила вердикт, зависящий от порядка ответов; это смещение уменьшается, когда два ответа явно различаются по качеству [12].

Эти смещения задокументированы и поддаются измерению:

  • Позиция. Изменение порядка двух ответов позволило более слабой модели «победить» более сильную в 66 из 80 тестовых случаев [13].
  • Длина. Доля побед одной модели на стандартном бенчмарке колебалась от 22,9 до 64,3% в зависимости лишь от того, насколько многословной ей велели быть, пока длину не стали контролировать статистически [14].
  • Предпочтение себя. Модели, которые узнают собственные ответы, оценивают их выше [15], а судья из того же семейства моделей, что и оцениваемая система, завышает результаты этой системы [16].
  • Подача рубрики. Обратный порядок уровней оценочной рубрики изменил примерно четверть оценок одной из ведущих моделей; добавление эталонного ответа с высшей оценкой изменило почти половину [17].
  • Тип критерия. На 11 задачах классификации согласие одной модели с людьми варьировалось по коэффициенту каппа от 0,84 до минус 0,24, причём слабее всего были результаты в оценках токсичности и безопасности [18]. Согласованность является свойством критерия, а не судьи.

Ближайшие к оценке соблюдения требований данные дал бенчмарк 2026 года из 318 синтетических диалогов в сферах авиаперевозок, здравоохранения и страхования со специально внесёнными нарушениями правил. Сильнейшие современные модели обнаружили от 78 до 95% нарушений на уровне отдельных реплик, тогда как более старая модель обнаружила лишь от 51 до 57%. Все они излишне штрафовали реплики, соответствующие правилам, и при этом пропускали реальные нарушения, а доля диалогов, в которых модель, дообученная для этой задачи, правильно оценила все реплики, составила лишь от 39 до 51% [19].

Меры по снижению этих эффектов дают измеримый результат. Перестановка ответов местами с усреднением повысила согласие одного оценщика с большинством людей с 53 до 63%; передача людям самых сложных 20% случаев повысила его до 74% [13]. Разбиение рубрики на вопросы с ответом «да» или «нет» повысило согласованность между разными судьями с 0,09 до 0,48 [20]. Оценка только в тех случаях, когда модель уверена, с эскалацией остальных, обеспечила согласие с людьми выше 80% примерно на 80% случаев [22].

Бинарные проверки дают согласованность, но кое-что теряется

Многие оценочные формы исходят из того, что пункты с ответом «да» или «нет» надёжнее шкал от 1 до 5. Для оценщиков-людей систематический обзор 2015 года, охвативший 45 исследований, показал межэкспертную согласованность 0,81 для чек-листов и 0,78 для глобальных рейтинговых шкал: значимой разницы нет. Глобальные оценки лучше переносились с одного задания на другое: 0,80 против 0,69 [23]. Исследование 1999 года показало, что опытные клиницисты получали по бинарным чек-листам более низкие баллы, чем обучающиеся, а по глобальным оценкам самые высокие [24]; вероятная причина в том, что эксперты пропускают ненужные им шаги. Чек-листы измеряют тщательность. Они могут наказывать за мастерство.

Для автоматических судей картина иная. Разбиение рубрики на вопросы с ответом «да» или «нет» повысило согласованность между двенадцатью разными моделями-судьями с 0,09 до 0,48 и увеличило корреляцию их оценок с суждениями людей на величину от 0,01 до 0,27 в зависимости от модели [20]. В смежном исследовании чек-листы повысили и согласованность между разметчиками-людьми, с 0,19 до 0,26 [21]. Собственное руководство ведущего стандарта для контакт-центров предусматривает бинарную оценку и учёт критических ошибок отдельно от общей оценки [25].

Почему среднее значение вводит в заблуждение

Две команды получили по 82 балла. В первой каждый диалог оценён в диапазоне от 78 до 86. Во второй девять диалогов из десяти получают 88, а один из десяти получает 28, потому что в нём пропущена проверка личности. Среднее одинаковое, но у одной из команд каждый десятый диалог содержит сбой, который грозит дойти до регулятора. Это наша иллюстрация, а не данные, но сам принцип является классикой статистики: четыре набора данных с одинаковыми средними, дисперсиями и корреляциями могут выглядеть совершенно по-разному на графике [26], а в статье 2017 года таких наборов было двенадцать, и один из них имел форму динозавра [27].

Хвосты распределения важнее середины и для того, как клиенты запоминают диалог. Люди судят об опыте в основном по его худшему моменту и по его концу [28], а негативные события весят больше позитивных почти во всех изученных областях [29]. Регуляторы мыслят так же. Британские правила ведения бизнеса требуют от компаний отслеживать результаты своих коммуникаций и поддержки и выявлять, «получает ли какая-либо группа розничных клиентов иные результаты по сравнению с другой группой» [30]. В обзоре страховщиков регулятор раскритиковал пороговые значения, «установленные на основе средних по отрасли без обоснования» [31], а в обзоре 2026 года отметил, что «агрегированная управленческая информация (MI) может затруднять выявление того, имеют ли разные группы клиентов с признаками уязвимости разные потребности или сталкиваются ли они с разными барьерами и результатами» [32].

Автоматическая оценка слабее всего на арабском

Большинство приведённых выше данных относится к английскому языку. Для работы в странах Залива важны ещё три факта.

Оценить звонок означает оценить расшифровку, а готовые системы распознавания речи справляются с диалектом стран Залива гораздо хуже, чем с современным литературным арабским (MSA). На саудовском речевом бенчмарке показатель ошибок по словам у крупнейшей открытой универсальной модели составил 28% на MSA и 60% на диалекте халиджи; модели, настроенные под арабский, справлялись лучше, но на диалекте всё равно хуже, чем на MSA [33]. На эмиратско-английской речи с переключением кодов модели того же семейства выдавали больше ошибок, чем было слов, при показателе 12% на фрагментах только на английском [34]. Расшифровку, в которой ошибочно каждое второе слово, невозможно оценить ни по эмпатии, ни по обязательному раскрытию информации.

Кроме того, языковые модели оценивают арабские тексты хуже, чем английские. В бенчмарке оценки предпочтений на 23 языках арабский оказался языком с самым низким результатом: 62,8% в среднем по протестированным моделям [35]. Команда, стоящая за одним арабским рейтингом моделей, установила, что лучший из рассмотренных кандидатов на роль судьи соглашался с одним оценщиком-человеком на уровне каппа 0,46, и написала, что это «относительно низкий показатель, чтобы основывать на нём решение» [36].

И наконец, оценщики-люди расходятся тем сильнее, чем более диалектной становится речь, в том числе в оценке тональности [37]. Эталон, полученный от людей и используемый для калибровки автоматической системы оценки, на диалекте сам по себе более зашумлён.

Чего требуют регуляторы стран Залива

В ОАЭ Стандарты защиты прав потребителей (Consumer Protection Standards) Центрального банка (Central Bank) требуют от лицензированных финансовых организаций документировать ежемесячные обратные звонки выборке потребителей для выявления ненадлежащего поведения сотрудников, регулярно проводить проверки методом «тайный покупатель» и отслеживать, насколько справедливо сотрудники обращаются с клиентами [38]. Эти Стандарты адресованы финансовым организациям, лицензированным в соответствии с законом о Центральном банке, поэтому для страховщика их лучше рассматривать как ориентир, а не как прямое обязательство. Кодекс поведения в страховании 2010 года, который по-прежнему действует под надзором Центрального банка, требует принимать решение по каждой жалобе в течение 15 дней и держать реестр жалоб открытым для инспекторов [39]. Методические рекомендации Центрального банка по ИИ 2026 года, которые прямо распространяются на страховщиков, предусматривают периодическое тестирование на предвзятость, непрерывный мониторинг, содержательный контроль со стороны человека и возможность для клиентов запросить пересмотр человеком [40]. В Саудовской Аравии Управление по страхованию (Insurance Authority) начало работу в ноябре 2023 года, а прежние правила действуют до их замены [41]; мы не смогли проверить действующие нормативные акты о ведении бизнеса на сайте регулятора и поэтому их здесь не описываем.

За пределами региона Закон ЕС об искусственном интеллекте (AI Act) с февраля 2025 года запрещает распознавание эмоций людей «на рабочем месте и в образовательных учреждениях» [42]: это граница между анализом тональности клиента и анализом тональности сотрудника, которую стоит учитывать.

Что это значит

Выборочная проверка не упускает закономерностей на уровне всего центра: несколько сотен случайных диалогов дают хорошую оценку среднего. Чего она не видит, так это отдельного оператора, редкого сбоя и группы клиентов, получающих иной результат. Именно об этом и спрашивают регуляторы.

Оценка каждого диалога решает проблему охвата. Проблему стандарта она не решает. Автоматическая система оценки наследует все слабые места переданной ей формы, добавляет собственные смещения, а на арабском наследует ещё и ошибки лежащей в основе расшифровки. Гипотеза, из которой мы исходили (критерии должны быть наблюдаемыми, откалиброванными по оценкам людей и представленными в виде распределения), подтверждается с тремя поправками.

Наблюдаемые критерии необходимы, но недостаточны. Бинарные проверки делают автоматические оценки согласованными и проверяемыми, и это правильная форма для обязательных требований: личность подтверждена, обязательная информация раскрыта, нет никакого намёка на решение по убытку. Для экспертного суждения это неправильная форма: ему нужно несколько пунктов шкалы с чётко описанными уровнями, которые учитываются отдельно от проверок, а не смешиваются с ними в одно число.

У калибровки по оценкам людей есть потолок. Если опытные проверяющие сами согласуются по какому-либо критерию на уровне каппа ниже 0,6, то на основании автоматической оценки по этому критерию не следует принимать решений, имеющих последствия для человека. Полезно сравнивать не «модель против человека», а «модель против фиксированного набора диалогов, оценённых несколькими проверяющими, с постоянным измерением».

Распределения нужно разбивать по языкам и каналам. Звонок на арабском диалекте и письмо на английском оцениваются с разной надёжностью, и единая рейтинговая таблица наказывает тех, кто обслуживает клиентов на более сложном языке.

Компромисс здесь есть. Оценка всех диалогов повышает интенсивность мониторинга, а опрос 347 операторов двух британских центров в 2002 году показал, что воспринимаемая интенсивность мониторинга тесно связана с более низким уровнем благополучия, причём сила этой связи зависела от степени контроля над собственной работой и поддержки руководителя [43]. Охват следует выстраивать так, чтобы он служил команде.

Как мы учитываем это при проектировании

Оценивается каждый диалог, независимо от того, вёл его ИИ-агент или сотрудник вашей команды, и критерии задаёте вы. Стандарт составляется во время внедрения в виде двух отдельных списков: бинарные проверки наблюдаемых требований и небольшой набор пунктов экспертной оценки с описанием того, как выглядит каждый уровень. Эти два списка никогда не сводятся в один процент.

Система оценки видит стандарт в одной фиксированной форме: критерии, их порядок и описания уровней не меняются от диалога к диалогу, и ей никогда не показывают эталонный ответ с проставленной оценкой. Каждая оценка сопровождается фрагментом расшифровки, на котором она основана, поэтому проверяющий видит обоснование, не прослушивая звонок заново. Оценка без обоснования считается дефектом.

Оценки представляются в виде распределения относительно вашего стандарта, причём первой указывается доля диалогов ниже стандарта, и разбиваются по языку, каналу и причине обращения. Классификация причин обращений относит каждый диалог к одной из заданных вами категорий, поэтому хвост распределения можно связать с тем, о чём спрашивали клиенты. Классификация результатов фиксирует, был ли каждый диалог решён, не решён или передан на эскалацию, и это даёт независимую проверку оценки: высокая оценка нерешённого диалога является поводом для вопроса, а не результатом.

Функция отметок о нарушениях правил комплаенса проверяет диалоги по настроенным вами правилам и отмечает те, в которых было сказано то, чего говорить не следовало. Отметка ставит диалог в очередь на проверку сотрудником и не является вердиктом. Поскольку модели часто излишне штрафуют реплики, соответствующие правилам, и пропускают реальные нарушения, эта очередь рассчитана на проверку, а результаты проверки используются для уточнения критериев.

Анализ тональности оценивает, как клиент воспринял взаимодействие. Он применяется к клиенту, а не к вашей команде, и отражается в отчётах отдельно от качества, потому что клиент может быть недоволен ответом, который был верным и полным.

Аналитика для коучинга показывает руководителям групп вашей команды закономерности в диалогах с высокими и низкими оценками: где сотрудникам трудно вести диалоги и как выглядит хорошая работа именно в вашей компании, если судить по составленному вами стандарту. Она нужна, чтобы поддерживать людей, ведущих диалоги, в которых нужен сотрудник.

Оценка калибруется по фиксированному набору ваших диалогов, оценённых вашими специалистами по контролю качества, отдельно для арабского и английского языков. Мы сообщаем уровень согласованности по каждому критерию, а не по оценочной форме в целом, и прямо говорим, какие критерии не достигают порога для автоматической оценки. Если уверенность распознавания речи в звонке низкая, оценка не выставляется, а звонок передаётся сотруднику.

Чего мы пока не знаем

Ни одно опубликованное исследование не измеряет, насколько ошибки расшифровки снижают согласие языковой модели с проверяющими-людьми на одних и тех же диалогах. Оба эффекта задокументированы по отдельности, а их сочетание не задокументировано.

Ни одно опубликованное исследование не измеряет согласованность между языковыми моделями и оценщиками-людьми на диалогах обслуживания клиентов на арабском языке. Ближайшие данные получены на универсальных бенчмарках.

Ни одно опубликованное исследование не приводит каппу для коммерческих оценочных форм контакт-центров. Данные о согласованности людей заимствованы из медицины, образования и организационной психологии, и мы указывали на это везде, где они приводятся.

Предотвращает ли постоянное измерение по эталонному набору дрейф оценок в рабочей среде, а не только выявляет его, в контролируемом исследовании не проверялось.

И наконец, цифра охвата, которую отрасль повторяет почти двадцать лет, насколько нам удалось выяснить, ни разу не была измерена. Если вы приводите такую цифру, рассчитайте её по собственным объёмам.

Источники

  1. 1.ICMI, Discover why contact center quality doesn't measure up, and what you can do about it, whitepaper, c. 2008. Unsourced industry estimate.⁠https://www.icmi.com/~/media/files/resources/whitepapers/quality-whitepaper.ashx
  2. 2.COPC Inc., Global Benchmarking Series 2022: Contact Center Quality Assurance, survey of more than 900 executives, fieldwork September to December 2021, pp. 11, 21 and 37. Secondary, self-reported.⁠https://cx.copc.com/hubfs/Global%20Benchmarking%20Series%202022_Contact%20Center%20Quality%20Assurance.pdf
  3. 3.Call Centre Helper, Poll: how many calls do you monitor per agent per month?, webinar poll, n=115, March 2013. Secondary.⁠https://www.callcentrehelper.com/poll-how-many-calls-do-you-monitor-per-agent-per-month-43247.htm
  4. 4.Bain, P., Watson, A., Mulvey, G., Taylor, P. and Gall, G., Taylorism, targets and the pursuit of quantity and quality by call centre management, New Technology, Work and Employment 17(3), 2002 (page references are to the open-access manuscript, pp. 10 to 15).⁠https://strathprints.strath.ac.uk/4165/6/strathprints004165.pdf
  5. 5.McHugh, M.L., Interrater reliability: the kappa statistic, Biochemia Medica 22(3), 2012.⁠https://biochemia-medica.com/en/journal/22/3/10.11613/BM.2012.031/fullArticle
  6. 6.Krippendorff, K., Reliability in content analysis: some common misconceptions and recommendations, Human Communication Research 30(3), 2004. Foundational.⁠https://www.academia.edu/21851693/
  7. 7.Yayama et al., inter-rater agreement in a nursing OSCE, Sage Open Nursing, 2026 (90 students, 38 examiners).⁠https://journals.sagepub.com/doi/10.1177/23779608261417794
  8. 8.Viswesvaran, C., Ones, D.S. and Schmidt, F.L., Comparative analysis of the reliability of job performance ratings, Journal of Applied Psychology 81(5), 1996 (N=14,650). Foundational.⁠https://www.academia.edu/20224570/
  9. 9.Cook, D.A. et al., Effect of rater training on reliability and accuracy of mini-CEX scores: a randomized, controlled trial, Journal of General Internal Medicine, 2009 (52 preceptors, 31 randomised).⁠https://link.springer.com/article/10.1007/s11606-008-0842-3
  10. 10.Roch, S.G., Woehr, D.J., Mishra, V. and Kieszczynska, U., Rater training revisited: an updated meta-analytic review of frame-of-reference training, Journal of Occupational and Organizational Psychology 85(2), 2012.⁠https://researchconnect.suny.edu/en/publications/rater-training-revisited-an-updated-meta-analytic-review-of-frame/
  11. 11.Casabianca, J.M., Lockwood, J.R. and McCaffrey, D.F., Trends in classroom observation scores, Educational and Psychological Measurement, 2015 (observations of 458 teachers over two years).⁠https://journals.sagepub.com/doi/10.1177/0013164414539163
  12. 12.Zheng, L. et al., Judging LLM-as-a-judge with MT-Bench and Chatbot Arena, NeurIPS 2023, Tables 2, 5 and 6.⁠https://arxiv.org/abs/2306.05685
  13. 13.Wang, P. et al., Large language models are not fair evaluators, 2023, abstract and Table 4.⁠https://arxiv.org/abs/2305.17926
  14. 14.Dubois, Y. et al., Length-controlled AlpacaEval: a simple way to debias automatic evaluators, 2024, Figure 3.⁠https://arxiv.org/abs/2404.04475
  15. 15.Panickssery, A., Bowman, S.R. and Feng, S., LLM evaluators recognize and favor their own generations, 2024.⁠https://arxiv.org/abs/2404.13076
  16. 16.Li, D. et al., Preference leakage: a contamination problem in LLM-as-a-judge, ICLR 2026.⁠https://arxiv.org/abs/2502.01534
  17. 17.Li et al. (Ant Group), Evaluating scoring bias in LLM-as-a-judge, 2025, Table 3.⁠https://arxiv.org/abs/2506.22316
  18. 18.Bavaresco, A. et al., LLMs instead of human judges? A large scale empirical study across 20 NLP evaluation tasks, ACL 2025, Table 1 (Cohen's kappa for GPT-4o on the 11 categorical datasets).⁠https://arxiv.org/abs/2406.18403
  19. 19.Yang et al., CompliBench: benchmarking LLM judges for compliance violation detection in dialogue systems, 2026, Table 1 and Figure 6.⁠https://arxiv.org/abs/2604.12312
  20. 20.Lee et al., CheckEval, EMNLP 2025, Tables 1 and 2.⁠https://arxiv.org/abs/2403.18771
  21. 21.Cook, J. et al., TICK: targeted instruct-evaluation with checklists, 2024, Tables 4 and 6.⁠https://arxiv.org/abs/2410.03608
  22. 22.Jung, J., Brahman, F. and Choi, Y., Trust or escalate: LLM judges with provable guarantees for human agreement, 2024.⁠https://arxiv.org/abs/2407.18370
  23. 23.Ilgen, J.S. et al., A systematic review of validity evidence for checklists versus global rating scales in simulation-based assessment, Medical Education 49(2), 2015 (45 studies).⁠https://pubmed.ncbi.nlm.nih.gov/25626747/
  24. 24.Hodges, B., Regehr, G., McNaughton, N., Tiberius, R. and Hanson, M., OSCE checklists do not capture increasing levels of expertise, Academic Medicine, 1999. Foundational.⁠https://pubmed.ncbi.nlm.nih.gov/10536636/
  25. 25.COPC Inc., What are the guidelines for QA form design and attributes?, 2024, and Measure quality using three metrics instead of one overall score, 2016. Secondary, practitioner guidance.⁠https://www.copc.com/clearly-cx/what-are-the-guidelines-for-qa-form-design-and-attributes/
  26. 26.Anscombe, F.J., Graphs in statistical analysis, The American Statistician 27(1), 1973. Foundational.⁠https://www.tandfonline.com/doi/abs/10.1080/00031305.1973.10478966
  27. 27.Matejka, J. and Fitzmaurice, G., Same stats, different graphs, CHI 2017.⁠https://www.research.autodesk.com/publications/same-stats-different-graphs/
  28. 28.Kahneman, D., Fredrickson, B.L., Schreiber, C.A. and Redelmeier, D.A., When more pain is preferred to less, Psychological Science 4(6), 1993. Foundational.⁠https://journals.sagepub.com/doi/10.1111/j.1467-9280.1993.tb00589.x
  29. 29.Baumeister, R.F., Bratslavsky, E., Finkenauer, C. and Vohs, K.D., Bad is stronger than good, Review of General Psychology 5(4), 2001. Foundational.⁠https://journals.sagepub.com/doi/abs/10.1037/1089-2680.5.4.323
  30. 30.Financial Conduct Authority, Handbook PRIN 2A.9.8R, 2A.9.10R and 2A.9.11R, in force from 31 July 2023.⁠https://handbook.fca.org.uk/handbook/prin2a/prin2as9
  31. 31.Financial Conduct Authority, Insurance multi-firm review of outcomes monitoring under the Consumer Duty, 26 June 2024.⁠https://www.fca.org.uk/publications/multi-firm-reviews/insurance-multi-firm-review-outcomes-monitoring-under-consumer-duty
  32. 32.Financial Conduct Authority, Outcomes monitoring: good practice and areas for improvement, 2026.⁠https://www.fca.org.uk/publications/good-and-poor-practice/outcomes-monitoring-good-practice-and-areas-improvement
  33. 33.ELM Company, Open universal Arabic ASR leaderboard, 2024, Tables 1 and 3 (Whisper-large-v3, zero-shot, on the SADA dataset). Industry technical report.⁠https://arxiv.org/abs/2412.13788
  34. 34.Al Ali, M. and Aldarmaki, H., Mixat: a data set of bilingual Emirati-English speech, SIGUL 2024, Table 3 (Whisper medium, zero-shot).⁠https://arxiv.org/abs/2405.02578
  35. 35.Gureja, S. et al., M-RewardBench: evaluating reward models in multilingual settings, ACL 2025.⁠https://arxiv.org/abs/2410.15522
  36. 36.Inception and MBZUAI, AraGen leaderboard and 3C3H, Hugging Face, December 2024. Lab technical write-up, sample size not disclosed.⁠https://huggingface.co/blog/leaderboard-3c3h-aragen
  37. 37.Keleg, A. and Magdy, W., on annotator agreement and Arabic level of dialectness, 2024.⁠https://arxiv.org/abs/2405.11282
  38. 38.Central Bank of the UAE, Consumer Protection Standards, Notice 1158/2021, Articles 4.1.1.8, 4.1.1.9 and 5.2.2.4.⁠https://rulebook.centralbank.ae/en/rulebook/consumer-protection-standards
  39. 39.Insurance Authority Board Resolution No. 3 of 2010, Instructions concerning the code of conduct and ethics, Article 10, in force under the Central Bank of the UAE.⁠https://rulebook.centralbank.ae/en/rulebook/insurance-authority-board-resolution-no-3-2010-instructions-concerning-code-conduct-and
  40. 40.Central Bank of the UAE, Guidance note on the consumer protection and responsible adoption and use of AI and ML by licensed financial institutions, 2026.⁠https://rulebook.centralbank.ae/en/rulebook/guidance-note-consumer-protection-and-responsible-adoption-and-use-artificial-intelligence
  41. 41.Saudi Press Agency, The Insurance Authority officially commences its operations, 23 November 2023.⁠https://www.spa.gov.sa/en/N2002759
  42. 42.Regulation (EU) 2024/1689 (AI Act), Article 5(1)(f) and Recital 44.⁠https://ai-act-service-desk.ec.europa.eu/en/ai-act/article-5
  43. 43.Holman, D., Chissick, C. and Totterdell, P., The effects of performance monitoring on emotional labor and well-being in call centers, Motivation and Emotion, 2002 (n=347).⁠https://link.springer.com/article/10.1023/A:1015194108376

Получайте новые исследования сразу после публикации

Нечастые письма о новых публикациях.

Подписаться

Читайте также