按照 企业 自己 制定的 标准为 每一次 对话评分
大多数联络中心评判质量的方式,是每月为每名坐席人员抽听少量对话,而我们找不到任何关于这个样本到底有多小的实测数据。本文阐述,对于改为对每一次对话评分的做法,证据说明了什么:自动评分在哪些方面可以信赖,在哪些方面不能,以及一项标准必须是什么样子,依据它得出的分数才有意义。
情境
一家车险公司的理赔负责人所带领的团队,每月要进行数万次对话。六名质检员为每名坐席人员抽听几通电话,在评分表上打分,并且每季度召开一次校准会议。质量得分是 84%,而且一年来一直如此。
后来,一起投诉被提交到了监管机构。一位客户说,没有人告诉他警方报告认定对方司机负有责任,因此他花了三周时间向错误的保险公司追讨。监管机构询问他当时被告知了什么,以及是在什么时候。回答这个问题花了两天时间,因为必须有人找到录音并听一遍。没有人能说清是否还有其他人遇到过同样的情况,因为这名坐席人员那一周的其他 99 次对话从未被审查过。
这个分数是真实的。但它描述的是一个没有人认真挑选过的样本,依据的是一份没有人检验过的评分表,并被汇总成一个平均值,而这个平均值掩盖了那些最终被提交到监管机构的对话。
证据表明什么
没有人 知道 样本 到底有多小
业内反复引用的数字是:联络中心会审查百分之一至百分之二的对话。我们找不到这个数字的实测来源。能追溯到的最早出处,是一家行业机构约 2008 年发布的白皮书中一句没有注明来源的话 [1]。此后的大型从业者调查,包括 2022 年一项针对 900 多名高管的调查,都从未问过有多大比例的对话会被审查 [2]。
有实测数据的是每名坐席人员的评估次数。2013 年一项针对 115 名联络中心从业者的调查发现,三分之二的人每月为每名坐席人员审查的电话不超过六通 [3]。2002 年针对苏格兰四家联络中心的同行评审案例研究发现,每月审查的数量在两通到大约八通之间 [4]。这些证据是二手的,也已经过时,但二十年来一直指向同一个方向。
以下的推算由我们完成。如果一名坐席人员每月处理 400 次对话,其中五次被审查,覆盖率就略高于百分之一。如果一种严重失误(例如跳过身份核验)每 200 次对话出现一次,那么五通电话的样本中包含这种失误的概率约为 2.5%。五次中通过四次,得出的 95% 置信区间(Wilson 法)大约为 38% 至 96%。整个中心的平均值仍然可以是准确的:无论总量多大,约 385 次随机抽取的对话,就能以 95% 的置信度把某一比例的估计误差控制在五个百分点以内。而每名坐席人员的得分,以及罕见事件,都接近于噪声。
抽样往往也不是随机的。在 2022 年的那项调查中,63% 的高管表示交易是随机抽取的;75% 的高管表示,他们的组织尝试把质量得分与客户满意度联系起来,也就是说有四分之一没有这样做 [2]。
人工评分者对 行为的 判断 一致,对 印象的 判断则 不然
评分者间信度,是指两个人为同一对象评分时给出相同分数的程度。它通常以 kappa 值表示,范围从 0(一致程度不比随机好)到 1(完全一致)。一项被广泛引用的分析认为,任何低于 0.60 的 kappa 值都不足以作为决策依据 [5];内容分析领域的标准参考文献则要求达到 0.80 才能依赖数据,达到 0.67 才能得出初步结论 [6]。
一致程度在很大程度上取决于评分者评判的是什么,而不是评分者是谁。在 2026 年一项由 38 名考官为 90 名护理专业学生评分的研究中,“进行胸部听诊”这一项的一致性 kappa 值为 0.95。而“表现出同理心态度”这一项为 0.30;若采用一种针对“该行为很少被标记为缺失”进行调整的统计量,则为 0.62 [7]。一项覆盖 14,650 名员工的元分析发现,两位主管对同一个人整体绩效的评分相关系数为 0.52,也就是说,他们的判断约有一半的方差是共有的 [8]。在 2002 年的那些案例研究中,一名坐席人员对完全相同的通话开场白得到了三个不同的评分 [4]。
校准会议的作用可能不如它的名声那么大。一项针对 52 名医学教育工作者的试验(其中 31 人被随机分组)发现,评分者培训研讨会并没有提高一致性或准确性;它提高的是评分者的信心 [9]。元分析确实发现,参照框架培训(用共同的示例来说明每个分数等级是什么样子)能够提高准确性 [10]。但一项为期两年的研究以观察 458 名教师的评分者为对象,发现漂移(即评分者的标准随时间推移而变化的倾向)在开始时就很大,而且始终没有收敛;评分者之间的差异越来越大 [11]。这些证据指向的应对办法,是依据一套固定的参考集进行持续测量,但这种办法本身尚未在对照研究中得到检验。
这些证据来自医学、教育和职场心理学。我们找不到任何报告商业联络中心评分卡 kappa 值的同行评审研究。这一空白本身就是一项发现。
语言 模型 充当评分者: 简单 案例上 表现强, 关键之处 表现弱
用于为转录文本评分的语言模型通常被称为“LLM 评委”(LLM judge)。被引用最多的研究报告称,GPT-4 与人工评分者的一致率为 85%,高于人与人之间 81% 的一致率 [12]。这个醒目的数字需要加上注脚。85% 这一数字排除了平局,以及交换两个答案的顺序后模型改变判断的情况。把这些情况计算在内,模型与人的一致率为 64% 至 66%,而人与人之间为 63% 至 67%。在一组刻意设计的高难度测试中,共有 80 对几乎相同的答案,这个 2023 年的模型在 35% 的情况下给出的判断取决于答案顺序;当两个答案的质量差异明显时,这种偏差会减小 [12]。
这些偏差都有记录,而且可以测量:
- 位置。调换两个答案的顺序,就让较弱的模型在 80 个测试案例中的 66 个里“击败”了较强的模型 [13]。
- 长度。在一个标准基准上,某个模型的胜率仅仅因为被要求回答得多详细,就在 22.9% 到 64.3% 之间大幅波动,直到在统计上对长度进行了控制 [14]。
- 自我偏好。能够识别出自己输出的模型会给它打更高的分 [15];与被评系统属于同一模型家族的评委,会抬高该系统的结果 [16]。
- 评分标准的呈现方式。颠倒评分标准中各等级的顺序,改变了某个前沿模型约四分之一的评分;附上一份得满分的参考答案,则改变了将近一半 [17]。
- 评分项类型。在 11 项分类任务中,某个模型与人的一致性 kappa 值从 0.84 一直低至负 0.24,其中毒性和安全性判断的结果最差 [18]。一致性取决于评分项本身,而不是评委。
与合规评分最接近的证据,是 2026 年的一项基准:它包含航空、医疗和保险场景中的 318 段合成对话,并在其中植入了违反规则的内容。当前最强的模型逐轮检测出了 78% 至 95% 的违规,而一个较早的模型只检测出 51% 至 57%。所有模型都会对合规的对话轮次过度扣分,同时漏掉真正的违规;一个针对该任务微调过的模型,也只在 39% 至 51% 的对话中把每一轮都判断正确 [19]。
缓解措施的效果已有测量。交换顺序并取平均值,使某个评估模型与人工多数意见的一致率从 53% 提高到 63%;把最难的 20% 案例交给人处理,则进一步提高到 74% [13]。把评分标准分解为“是/否”问题,使不同评委之间的一致性从 0.09 提高到 0.48 [20]。只在模型有把握时评分、其余案例升级处理,在约 80% 的案例上实现了超过 80% 的人工一致率 [22]。
二元 检查换来了 一致性,但 也有所 损失
许多评分卡默认“是/否”项比 1 至 5 分的量表更可靠。在人工评分者之间,2015 年一项涵盖 45 项研究的系统综述发现,核对清单的评分者间信度为 0.81,整体评分量表为 0.78:没有实质性差异。整体评分在不同任务之间的可推广性更好,分别为 0.80 和 0.69 [23]。1999 年的一项研究发现,经验丰富的临床医生在二元核对清单上的得分低于受训人员,而在整体评分上的得分最高 [24];原因很可能是,专家会跳过他们不需要的步骤。核对清单衡量的是周全程度。它可能会惩罚技能。
对于自动评委,情况则不同。把评分标准分解为“是/否”问题,使十二个不同评委模型之间的一致性从 0.09 提高到 0.48,并使它们与人工判断的相关性提高了 0.01 至 0.27 不等,具体取决于模型 [20]。在一项相关研究中,核对清单也使人工标注员之间的一致性从 0.19 提高到了 0.26 [21]。联络中心领域最主要的标准,其自身的指南要求采用二元评分,并要求将严重错误与总分分开跟踪 [25]。
为什么 平均值是 错误的 指标
两个团队的得分都是 82。第一个团队中,每次对话的得分都在 78 至 86 之间。第二个团队中,十次对话里有九次得 88 分,有一次得 28 分,因为跳过了身份核验。平均值相同;但其中一个团队每十次对话就有一次失误,而这类失误迟早会摆到监管机构面前。这是我们的示例,不是数据,但其中的原理是统计学的经典:四个均值、方差和相关系数完全相同的数据集,画成图后可能完全不同 [26];2017 年的一篇论文构造了十二个这样的数据集,其中一个的形状像恐龙 [27]。
就客户如何记住一次对话而言,分布的尾部也比中间部分更重要。人们评判一段经历,很大程度上取决于其中最糟糕的时刻和结尾 [28];而且在几乎所有被研究过的领域中,负面事件的分量都比正面事件更重 [29]。监管机构也是这样思考的。英国的行为监管规则要求企业监测其沟通和支持服务所产生的结果,并识别“是否有任何零售客户群体与另一群体相比获得了不同的结果”[30]。该监管机构对保险公司的审查批评了那些“在没有正当理由的情况下依据行业平均值设定”的阈值 [31];其 2026 年的审查则发现,“汇总的管理信息(MI)可能使人更难识别具有弱势特征的不同客户群体是否有不同的需求,或是否遇到不同的障碍和结果”[32]。
阿拉伯语是 自动评分最 薄弱的 环节
上述证据大多来自英语。对于海湾地区的运营而言,还有三个事实很重要。
为一通电话评分,就意味着为转录文本评分,而现成的语音识别在海湾方言上的表现远远差于在现代标准阿拉伯语上的表现。在一个沙特语音基准上,最大的开放通用模型在现代标准阿拉伯语(MSA)上的词错误率为 28%,在海湾方言(Khaliji)上为 60%;针对阿拉伯语调优的模型表现更好,但在方言上仍然比在 MSA 上差 [33]。在阿联酋阿拉伯语与英语语码转换的语音上,同一系列的模型产生的错误比词还多,而在纯英语片段上的词错误率为 12% [34]。一份每隔一个词就有一个错误的转录文本,无法用来评估同理心,也无法用来评估是否提供了必要的披露。
语言模型评判阿拉伯语的能力也不如评判英语。在一项涵盖 23 种语言的偏好判断基准中,阿拉伯语是得分最低的语言,所测模型的平均得分为 62.8% [35]。一个阿拉伯语排行榜背后的团队发现,他们最好的候选评委与单个人工评估者的一致性 kappa 值为 0.46,并写道,这一数值“相对较低,不足以作为决策依据”[36]。
此外,语音的方言色彩越浓,人工评分者之间的分歧就越大,包括在情绪判断上 [37]。用于校准自动评分器的人工参照,本身在方言上的噪声就更大。
海湾 地区的 监管 机构有 什么 要求
在阿联酋,阿联酋中央银行(CBUAE)的《消费者保护标准》(Consumer Protection Standards)要求持牌金融机构每月对抽样消费者进行回访并记录在案,以发现员工的不当行为,定期开展神秘顾客调查,并监测员工在公平对待客户方面的表现 [38]。这些标准针对的是依据中央银行法获得牌照的金融机构,因此对保险公司而言,最好将其视为参考,而非直接义务。2010 年的保险行为准则目前在阿联酋中央银行的监管下仍然有效,它要求每一起投诉都在 15 天以内作出处理决定,并要求投诉登记册向检查人员开放 [39]。阿联酋中央银行 2026 年发布的 AI 指导意见明确涵盖保险公司,提出应进行定期偏见测试、持续监测和有实质意义的人工监督,并为客户提供申请人工审查的途径 [40]。在沙特阿拉伯,保险管理局(Insurance Authority)于 2023 年 11 月开始运作,此前的规则在被取代之前继续有效 [41];我们无法在监管机构的官方网站上核实目前有效的行为监管文件,因此本文不作介绍。
在该地区以外,欧盟《人工智能法》(EU AI Act)自 2025 年 2 月起禁止推断“工作场所和教育机构领域”中人的情绪 [42]:这在分析客户情绪与分析员工情绪之间划出了一条值得注意的界线。
这意味着什么
抽样不会漏掉整个中心层面的规律;几百次随机抽取的对话就能很好地估计平均值。抽样看不到的是单个坐席人员、罕见的失误,以及获得不同结果的客户群体。而这些恰恰是监管机构会问到的。
为每一次对话评分,解决的是覆盖率问题。它解决不了标准的问题。自动评分器会继承所用评分表的每一个缺陷,再加上自身的偏差;在阿拉伯语中,它还会继承底层转录文本的错误。我们最初的假设是:评分项应当可观察,应当以人工评分为基准进行校准,并应当以分布的形式报告。这一假设经过三处修正后依然成立。
可观察的评分项是必要的,但并不充分。二元检查让自动评分保持一致、可供审计,适合用于不容妥协的要求:身份已核验、披露已提供、没有暗示任何理赔决定。它们不适合用于需要判断的方面;判断需要少量锚定清晰的量表项,并与检查项分开,而不是混合成一个数字。
以人工评分为基准的校准存在上限。如果经验丰富的评分者自己在某个评分项上的一致性 kappa 值都低于 0.6,那么该评分项上的任何自动评分都不应对任何个人产生后果。有用的比较不是“模型对比人”,而是“模型对比一套由多名评分者评过分的固定对话集,并持续测量”。
分布必须按语言和渠道细分。阿拉伯语方言通话和英语电子邮件的评分可靠性并不相同,用同一张排名表,会对负责较难语言的人员不利。
这其中存在取舍。为所有对话评分会提高监控强度,而 2002 年一项针对英国两家联络中心 347 名坐席人员的调查发现,感知到的监控强度与较低的幸福感密切相关,而工作控制感和主管支持会调节这种关系 [43]。覆盖率应当服务于团队。
我们如何据此设计
每一次对话都会被评分,无论处理它的是 AI 智能体还是您团队中的成员,而评分项由您确定。标准在实施阶段编写,分为两份独立的清单:针对可观察要求的二元检查,以及一小组判断项,每项都附有锚定说明,描述每个等级是什么样子。两者绝不会合并成一个百分比。
评分器看到的标准始终是同一种固定形式:评分项、它们的顺序和锚定说明在不同对话之间不会改变,评分器也绝不会看到附有分数的参考答案。每个分数都附有它所依据的转录文本段落,因此审阅人员无需重听通话就能看出原因。没有理由的分数会被视为缺陷。
分数以分布形式对照您的标准报告,首先列出低于标准的比例,并按语言、渠道和联系原因细分。联系原因分类会按照您定义的类别集合为每一次对话打标签,因此分布尾部的对话可以追溯到客户当时询问的内容。处理结果分类会记录每一次对话是已解决、未解决还是已升级,这为评分提供了一个独立的核查:未解决的对话得了高分,是一个需要追问的问题,而不是一个结论。
合规标记会依据您配置的规则检查对话;如果对话中说了不该说的话,就会将其标出。标记是交给人处理的队列,而不是裁决。鉴于模型经常对合规的对话轮次过度扣分,又漏掉真正的违规,这个队列在设计上就是要由人审阅的,审阅结果还会反馈到评分项中。
情绪分析评估的是客户对这次互动的感受。它针对的是客户,而不是您的团队,并且与质量分开报告,因为客户可能对一个正确且完整的答复仍然不满意。
辅导洞察会为您的团队组长呈现高分和低分对话中的规律:员工在哪些对话中感到困难,以及依据您制定的标准,在您自己的运营中什么才算做得好。它们的作用是支持员工处理那些需要由人处理的对话。
评分的校准基准是一套固定的对话集,由您自己的对话组成,并由您的质检人员评分;阿拉伯语和英语分开校准。我们按评分项而不是按整张评分卡报告一致性,并明确说明哪些评分项低于自动评分的阈值。如果某通电话的语音识别置信度较低,系统不会给出分数,而是将这通电话交给人处理。
我们尚不了解的
目前没有已发表的研究测量,在同一批对话上,转录错误会在多大程度上降低语言模型与人工评分者之间的一致性。这两种影响分别都有记录;但两者叠加的影响尚无记录。
目前没有已发表的研究测量语言模型与人工评分者在阿拉伯语客户服务对话上的一致性。最接近的证据来自通用基准。
目前没有已发表的研究报告商业联络中心评分卡的 kappa 值。关于人工一致性的证据借自医学、教育和职场心理学,我们在引用之处都已说明。
依据参考集进行持续测量,能否在生产环境中防止漂移,而不只是发现漂移,尚未在对照研究中得到检验。
此外,就我们所能找到的资料而言,业内近二十年来反复引用的覆盖率数字从未被实际测量过。如果您要引用这个数字,请根据您自己的对话量来计算。
参考来源
- 1.ICMI, Discover why contact center quality doesn't measure up, and what you can do about it, whitepaper, c. 2008. Unsourced industry estimate.https://www.icmi.com/~/media/files/resources/whitepapers/quality-whitepaper.ashx
- 2.COPC Inc., Global Benchmarking Series 2022: Contact Center Quality Assurance, survey of more than 900 executives, fieldwork September to December 2021, pp. 11, 21 and 37. Secondary, self-reported.https://cx.copc.com/hubfs/Global%20Benchmarking%20Series%202022_Contact%20Center%20Quality%20Assurance.pdf
- 3.Call Centre Helper, Poll: how many calls do you monitor per agent per month?, webinar poll, n=115, March 2013. Secondary.https://www.callcentrehelper.com/poll-how-many-calls-do-you-monitor-per-agent-per-month-43247.htm
- 4.Bain, P., Watson, A., Mulvey, G., Taylor, P. and Gall, G., Taylorism, targets and the pursuit of quantity and quality by call centre management, New Technology, Work and Employment 17(3), 2002 (page references are to the open-access manuscript, pp. 10 to 15).https://strathprints.strath.ac.uk/4165/6/strathprints004165.pdf
- 5.McHugh, M.L., Interrater reliability: the kappa statistic, Biochemia Medica 22(3), 2012.https://biochemia-medica.com/en/journal/22/3/10.11613/BM.2012.031/fullArticle
- 6.Krippendorff, K., Reliability in content analysis: some common misconceptions and recommendations, Human Communication Research 30(3), 2004. Foundational.https://www.academia.edu/21851693/
- 7.Yayama et al., inter-rater agreement in a nursing OSCE, Sage Open Nursing, 2026 (90 students, 38 examiners).https://journals.sagepub.com/doi/10.1177/23779608261417794
- 8.Viswesvaran, C., Ones, D.S. and Schmidt, F.L., Comparative analysis of the reliability of job performance ratings, Journal of Applied Psychology 81(5), 1996 (N=14,650). Foundational.https://www.academia.edu/20224570/
- 9.Cook, D.A. et al., Effect of rater training on reliability and accuracy of mini-CEX scores: a randomized, controlled trial, Journal of General Internal Medicine, 2009 (52 preceptors, 31 randomised).https://link.springer.com/article/10.1007/s11606-008-0842-3
- 10.Roch, S.G., Woehr, D.J., Mishra, V. and Kieszczynska, U., Rater training revisited: an updated meta-analytic review of frame-of-reference training, Journal of Occupational and Organizational Psychology 85(2), 2012.https://researchconnect.suny.edu/en/publications/rater-training-revisited-an-updated-meta-analytic-review-of-frame/
- 11.Casabianca, J.M., Lockwood, J.R. and McCaffrey, D.F., Trends in classroom observation scores, Educational and Psychological Measurement, 2015 (observations of 458 teachers over two years).https://journals.sagepub.com/doi/10.1177/0013164414539163
- 12.Zheng, L. et al., Judging LLM-as-a-judge with MT-Bench and Chatbot Arena, NeurIPS 2023, Tables 2, 5 and 6.https://arxiv.org/abs/2306.05685
- 13.Wang, P. et al., Large language models are not fair evaluators, 2023, abstract and Table 4.https://arxiv.org/abs/2305.17926
- 14.Dubois, Y. et al., Length-controlled AlpacaEval: a simple way to debias automatic evaluators, 2024, Figure 3.https://arxiv.org/abs/2404.04475
- 15.Panickssery, A., Bowman, S.R. and Feng, S., LLM evaluators recognize and favor their own generations, 2024.https://arxiv.org/abs/2404.13076
- 16.Li, D. et al., Preference leakage: a contamination problem in LLM-as-a-judge, ICLR 2026.https://arxiv.org/abs/2502.01534
- 17.Li et al. (Ant Group), Evaluating scoring bias in LLM-as-a-judge, 2025, Table 3.https://arxiv.org/abs/2506.22316
- 18.Bavaresco, A. et al., LLMs instead of human judges? A large scale empirical study across 20 NLP evaluation tasks, ACL 2025, Table 1 (Cohen's kappa for GPT-4o on the 11 categorical datasets).https://arxiv.org/abs/2406.18403
- 19.Yang et al., CompliBench: benchmarking LLM judges for compliance violation detection in dialogue systems, 2026, Table 1 and Figure 6.https://arxiv.org/abs/2604.12312
- 20.Lee et al., CheckEval, EMNLP 2025, Tables 1 and 2.https://arxiv.org/abs/2403.18771
- 21.Cook, J. et al., TICK: targeted instruct-evaluation with checklists, 2024, Tables 4 and 6.https://arxiv.org/abs/2410.03608
- 22.Jung, J., Brahman, F. and Choi, Y., Trust or escalate: LLM judges with provable guarantees for human agreement, 2024.https://arxiv.org/abs/2407.18370
- 23.Ilgen, J.S. et al., A systematic review of validity evidence for checklists versus global rating scales in simulation-based assessment, Medical Education 49(2), 2015 (45 studies).https://pubmed.ncbi.nlm.nih.gov/25626747/
- 24.Hodges, B., Regehr, G., McNaughton, N., Tiberius, R. and Hanson, M., OSCE checklists do not capture increasing levels of expertise, Academic Medicine, 1999. Foundational.https://pubmed.ncbi.nlm.nih.gov/10536636/
- 25.COPC Inc., What are the guidelines for QA form design and attributes?, 2024, and Measure quality using three metrics instead of one overall score, 2016. Secondary, practitioner guidance.https://www.copc.com/clearly-cx/what-are-the-guidelines-for-qa-form-design-and-attributes/
- 26.Anscombe, F.J., Graphs in statistical analysis, The American Statistician 27(1), 1973. Foundational.https://www.tandfonline.com/doi/abs/10.1080/00031305.1973.10478966
- 27.Matejka, J. and Fitzmaurice, G., Same stats, different graphs, CHI 2017.https://www.research.autodesk.com/publications/same-stats-different-graphs/
- 28.Kahneman, D., Fredrickson, B.L., Schreiber, C.A. and Redelmeier, D.A., When more pain is preferred to less, Psychological Science 4(6), 1993. Foundational.https://journals.sagepub.com/doi/10.1111/j.1467-9280.1993.tb00589.x
- 29.Baumeister, R.F., Bratslavsky, E., Finkenauer, C. and Vohs, K.D., Bad is stronger than good, Review of General Psychology 5(4), 2001. Foundational.https://journals.sagepub.com/doi/abs/10.1037/1089-2680.5.4.323
- 30.Financial Conduct Authority, Handbook PRIN 2A.9.8R, 2A.9.10R and 2A.9.11R, in force from 31 July 2023.https://handbook.fca.org.uk/handbook/prin2a/prin2as9
- 31.Financial Conduct Authority, Insurance multi-firm review of outcomes monitoring under the Consumer Duty, 26 June 2024.https://www.fca.org.uk/publications/multi-firm-reviews/insurance-multi-firm-review-outcomes-monitoring-under-consumer-duty
- 32.Financial Conduct Authority, Outcomes monitoring: good practice and areas for improvement, 2026.https://www.fca.org.uk/publications/good-and-poor-practice/outcomes-monitoring-good-practice-and-areas-improvement
- 33.ELM Company, Open universal Arabic ASR leaderboard, 2024, Tables 1 and 3 (Whisper-large-v3, zero-shot, on the SADA dataset). Industry technical report.https://arxiv.org/abs/2412.13788
- 34.Al Ali, M. and Aldarmaki, H., Mixat: a data set of bilingual Emirati-English speech, SIGUL 2024, Table 3 (Whisper medium, zero-shot).https://arxiv.org/abs/2405.02578
- 35.Gureja, S. et al., M-RewardBench: evaluating reward models in multilingual settings, ACL 2025.https://arxiv.org/abs/2410.15522
- 36.Inception and MBZUAI, AraGen leaderboard and 3C3H, Hugging Face, December 2024. Lab technical write-up, sample size not disclosed.https://huggingface.co/blog/leaderboard-3c3h-aragen
- 37.Keleg, A. and Magdy, W., on annotator agreement and Arabic level of dialectness, 2024.https://arxiv.org/abs/2405.11282
- 38.Central Bank of the UAE, Consumer Protection Standards, Notice 1158/2021, Articles 4.1.1.8, 4.1.1.9 and 5.2.2.4.https://rulebook.centralbank.ae/en/rulebook/consumer-protection-standards
- 39.Insurance Authority Board Resolution No. 3 of 2010, Instructions concerning the code of conduct and ethics, Article 10, in force under the Central Bank of the UAE.https://rulebook.centralbank.ae/en/rulebook/insurance-authority-board-resolution-no-3-2010-instructions-concerning-code-conduct-and
- 40.Central Bank of the UAE, Guidance note on the consumer protection and responsible adoption and use of AI and ML by licensed financial institutions, 2026.https://rulebook.centralbank.ae/en/rulebook/guidance-note-consumer-protection-and-responsible-adoption-and-use-artificial-intelligence
- 41.Saudi Press Agency, The Insurance Authority officially commences its operations, 23 November 2023.https://www.spa.gov.sa/en/N2002759
- 42.Regulation (EU) 2024/1689 (AI Act), Article 5(1)(f) and Recital 44.https://ai-act-service-desk.ec.europa.eu/en/ai-act/article-5
- 43.Holman, D., Chissick, C. and Totterdell, P., The effects of performance monitoring on emotional labor and well-being in call centers, Motivation and Emotion, 2002 (n=347).https://link.springer.com/article/10.1023/A:1015194108376
新研究发布时即可收到
我们发布研究时,会不定期发送电子邮件。