Noter chaque conversation au regard d’un référentiel rédigé par l’entreprise
La plupart des centres de contact évaluent la qualité en écoutant une poignée de conversations par conseiller chaque mois, et nous n’avons trouvé aucun chiffre mesuré indiquant à quel point cet échantillon est réduit. Cet article présente ce que disent les sources sur l’alternative qui consiste à noter chaque conversation : les cas où la notation automatisée est fiable, ceux où elle ne l’est pas, et la forme que doit prendre un référentiel pour qu’une note établie au regard de ce référentiel ait un sens.
Sur cette page
La situation
Chez un assureur automobile, le responsable sinistres dirige une équipe qui mène des dizaines de milliers de conversations par mois. Six évaluateurs qualité écoutent quelques appels par conseiller, les notent à l’aide d’une grille et tiennent une réunion de calibrage chaque trimestre. La note qualité est de 84 %, et ce depuis un an.
Puis une réclamation parvient au régulateur. Un client affirme que personne ne lui a dit que le procès-verbal de police désignait l’autre conducteur comme responsable : il a donc passé trois semaines à relancer le mauvais assureur. Le régulateur demande ce qu’on lui a dit, et quand. La réponse prend deux jours, car il faut retrouver l’enregistrement et l’écouter. Personne ne peut dire si cela est arrivé à d’autres personnes, car les 99 autres conversations du conseiller cette semaine-là n’ont jamais été examinées.
La note est réelle. Mais elle décrit un échantillon que personne n’a choisi avec soin, évalué selon une grille que personne n’a testée, et résumé par une moyenne qui masque les conversations qui finissent chez un régulateur.
Ce que montrent les sources
Personne ne sait à quel point l’échantillon est réduit
Le chiffre répété dans tout le secteur veut que les centres de contact examinent de 1 à 2 % des conversations. Nous n’avons trouvé aucune source qui l’ait mesuré. Sa plus ancienne apparition retrouvée est une phrase sans source dans un livre blanc d’un organisme professionnel datant d’environ 2008 [1]. Les grandes enquêtes menées depuis auprès des professionnels, dont l’une auprès de plus de 900 dirigeants en 2022, n’ont jamais demandé quelle proportion des conversations est examinée [2].
Ce qui est mesuré, c’est le nombre d’évaluations par conseiller. Un sondage de 2013 auprès de 115 professionnels des centres de contact a montré que les deux tiers examinaient six appels ou moins par conseiller et par mois [3]. Des études de cas évaluées par des pairs, menées en 2002 dans quatre centres écossais, ont relevé entre deux et environ huit évaluations par mois [4]. Ces données sont de seconde main et anciennes, mais elles vont dans le même sens depuis vingt ans.
Le calcul qui suit est le nôtre. Si un conseiller traite 400 conversations par mois et que cinq sont examinées, la couverture dépasse à peine 1 %. Si une défaillance grave, par exemple une vérification d’identité omise, survient une fois toutes les 200 conversations, la probabilité qu’un échantillon de cinq appels en contienne une est d’environ 2,5 %. Quatre réussites sur cinq donnent un intervalle de confiance à 95 % (méthode de Wilson) d’environ 38 à 96 %. La moyenne à l’échelle du centre peut néanmoins être fiable : environ 385 conversations tirées au hasard suffisent à estimer une proportion à cinq points près avec un niveau de confiance de 95 %, quel que soit le volume. La note par conseiller et l’événement rare se distinguent à peine du bruit.
Par ailleurs, l’échantillonnage n’est souvent pas aléatoire. Dans l’enquête de 2022, 63 % des dirigeants déclaraient que les interactions étaient sélectionnées au hasard, et 75 % que leur organisation cherchait à relier les notes qualité à la satisfaction client, ce qui signifie qu’un quart ne le faisait pas [2].
Les évaluateurs humains s’accordent sur les actions, pas sur les impressions
La fiabilité inter-évaluateurs est la mesure dans laquelle deux personnes qui notent la même chose attribuent la même note. Elle s’exprime généralement par le kappa, qui va de 0 (un accord qui ne fait pas mieux que le hasard) à 1 (un accord parfait). Une analyse largement citée soutient que tout kappa inférieur à 0,60 est insuffisant pour prendre des décisions [5] ; l’ouvrage de référence en analyse de contenu demande 0,80 pour se fier aux données et 0,67 pour des conclusions provisoires [6].
L’accord dépend bien davantage de ce que les évaluateurs jugent que de qui ils sont. Dans une étude de 2026 portant sur 38 examinateurs notant 90 étudiants en soins infirmiers, l’accord sur « réalise une auscultation thoracique » atteignait un kappa de 0,95. Sur « fait preuve d’une attitude empathique », il était de 0,30, ou de 0,62 selon une version de la statistique ajustée pour tenir compte de la rareté avec laquelle le comportement était noté comme absent [7]. Une méta-analyse portant sur 14 650 salariés a montré que les évaluations de la performance globale d’une même personne par deux supérieurs hiérarchiques présentaient une corrélation de 0,52, ce qui signifie qu’ils partageaient environ la moitié de la variance de leurs jugements [8]. Dans les études de cas de 2002, un conseiller a reçu trois notes différentes pour exactement la même ouverture d’appel [4].
Les réunions de calibrage sont peut-être moins efficaces que ne le laisse penser leur réputation. Un essai portant sur 52 formateurs en médecine, dont 31 répartis par tirage au sort, a constaté qu’un atelier de formation des évaluateurs n’améliorait ni l’accord ni l’exactitude des notes ; il renforçait la confiance des évaluateurs [9]. Les méta-analyses montrent en revanche que la formation au cadre de référence (frame-of-reference training), qui s’appuie sur des exemples partagés pour enseigner à quoi correspond chaque niveau de note, améliore l’exactitude [10]. Mais une étude de deux ans portant sur des évaluateurs observant 458 enseignants a constaté que la dérive, c’est-à-dire la tendance du niveau d’exigence d’un évaluateur à évoluer dans le temps, était importante au départ et n’a jamais convergé ; la variabilité entre évaluateurs a augmenté [11]. Une mesure continue au regard d’un ensemble de référence fixe est la réponse vers laquelle orientent ces données, même si elle n’a pas elle-même été testée dans une étude contrôlée.
Ces données proviennent de la médecine, de l’éducation et de la psychologie du travail. Nous n’avons trouvé aucune étude évaluée par des pairs indiquant le kappa des grilles d’évaluation des centres de contact commerciaux. Cette lacune est en soi un constat.
Les modèles de langage comme évaluateurs : solides sur les cas faciles, faibles là où cela compte
Un modèle de langage utilisé pour noter des transcriptions est souvent appelé « LLM juge » (LLM judge). L’étude la plus citée indiquait que GPT-4 était d’accord avec les évaluateurs humains dans 85 % des cas, soit davantage que les 81 % d’accord des humains entre eux [12]. Ce chiffre phare mérite sa note de bas de page. Les 85 % excluent les égalités et les cas où le modèle changeait de verdict lorsque les deux réponses étaient interverties. En les incluant, l’accord entre modèle et humains était de 64 à 66 %, contre 63 à 67 % entre paires d’humains. Sur un ensemble volontairement difficile de 80 paires de réponses quasi identiques, le modèle de 2023 rendait un verdict dépendant de l’ordre dans 35 % des cas ; ce biais diminue lorsque les deux réponses diffèrent nettement en qualité [12].
Les biais sont documentés et mesurables :
- Position. Changer l’ordre de deux réponses a permis à un modèle plus faible de « battre » un modèle plus fort dans 66 cas de test sur 80 [13].
- Longueur. Le taux de victoire d’un modèle sur un banc d’essai standard a varié de 22,9 à 64,3 % selon le seul degré de prolixité qui lui était demandé, jusqu’à ce que la longueur soit contrôlée statistiquement [14].
- Autopréférence. Les modèles qui reconnaissent leur propre production lui attribuent une note plus élevée [15], et un juge de la même famille de modèles que le système qu’il note gonfle les résultats de ce système [16].
- Présentation de la grille. Inverser l’ordre des niveaux de la grille a modifié environ un quart des notes d’un modèle frontière (frontier model) ; joindre une réponse de référence ayant obtenu la note maximale en a modifié près de la moitié [17].
- Type de critère. Sur 11 tâches de classification, l’accord d’un modèle avec les humains allait d’un kappa de 0,84 à moins 0,24, les résultats les plus faibles portant sur les jugements de toxicité et de sécurité [18]. L’accord est une propriété du critère, non du juge.
Les données les plus proches de la notation de conformité proviennent d’un banc d’essai de 2026 composé de 318 dialogues synthétiques dans les secteurs du transport aérien, de la santé et de l’assurance, dans lesquels des violations de règles avaient été introduites. Les modèles actuels les plus performants détectaient de 78 à 95 % des violations, tour de parole par tour de parole, tandis qu’un modèle plus ancien en détectait de 51 à 57 %. Tous pénalisaient à l’excès des tours conformes tout en manquant de vraies violations, et un modèle affiné pour la tâche n’a jugé correctement chaque tour d’une conversation que dans 39 à 51 % des conversations [19].
Les mesures correctives ont des effets mesurés. Intervertir l’ordre et faire la moyenne a porté l’accord d’un évaluateur avec une majorité humaine de 53 à 63 % ; confier aux humains les 20 % de cas les plus difficiles l’a porté à 74 % [13]. Décomposer une grille en questions fermées (oui/non) a porté l’accord entre différents juges de 0,09 à 0,48 [20]. Ne noter que lorsque le modèle est confiant, et faire remonter le reste, a permis d’obtenir plus de 80 % d’accord avec les humains sur environ 80 % des cas [22].
Les contrôles binaires apportent de la cohérence, au prix d’une perte
De nombreuses grilles d’évaluation partent du principe que les critères oui/non sont plus fiables que les échelles de 1 à 5. Entre évaluateurs humains, une revue systématique de 2015 portant sur 45 études a relevé une fiabilité inter-évaluateurs de 0,81 pour les listes de contrôle et de 0,78 pour les échelles d’évaluation globale : aucune différence significative. Les évaluations globales se généralisaient mieux d’une tâche à l’autre, 0,80 contre 0,69 [23]. Une étude de 1999 a montré que les cliniciens expérimentés obtenaient des notes plus basses que les professionnels en formation sur les listes de contrôle binaires, tout en obtenant les meilleures notes sur les évaluations globales [24] ; la raison probable est que les experts sautent les étapes dont ils n’ont pas besoin. Les listes de contrôle mesurent la minutie. Elles peuvent pénaliser la compétence.
Pour les juges automatisés, le tableau est différent. Décomposer une grille en questions oui/non a porté l’accord entre douze modèles juges différents de 0,09 à 0,48, et a amélioré leur corrélation avec le jugement humain, le gain allant de 0,01 à 0,27 selon le modèle [20]. Dans une étude connexe, les listes de contrôle ont aussi accru l’accord entre annotateurs humains, de 0,19 à 0,26 [21]. Les recommandations de la principale norme des centres de contact demandent elles-mêmes une notation binaire et un suivi des erreurs critiques séparé de la note globale [25].
Pourquoi la moyenne n’est pas le bon chiffre
Deux équipes obtiennent toutes deux 82. Dans la première, chaque conversation obtient entre 78 et 86. Dans la seconde, neuf conversations sur dix obtiennent 88 et une sur dix obtient 28, parce qu’une vérification d’identité a été omise. La moyenne est la même, mais l’une des équipes a, dans une conversation sur dix, une défaillance qui risque de finir chez un régulateur. C’est notre illustration, pas des données, mais le principe est un classique de la statistique : quatre jeux de données ayant des moyennes, des variances et des corrélations identiques peuvent paraître totalement différents une fois représentés graphiquement [26], et un article de 2017 en a produit douze, dont l’un en forme de dinosaure [27].
Les extrêmes comptent aussi davantage que le milieu de la distribution dans la façon dont les clients se souviennent d’une conversation. Les gens jugent une expérience en grande partie à son pire moment et à sa fin [28], et les événements négatifs pèsent plus lourd que les positifs dans presque tous les domaines étudiés [29]. Les régulateurs raisonnent de la même manière. Les règles de conduite britanniques imposent aux entreprises de surveiller les résultats de leurs communications et de l’assistance qu’elles fournissent, et de déterminer si « un groupe de clients de détail obtient des résultats différents de ceux d’un autre groupe » [30]. L’examen des assureurs mené par ce régulateur a critiqué des seuils « fixés à partir de moyennes du secteur sans justification » [31], et son examen de 2026 a constaté que « des informations de gestion agrégées peuvent rendre plus difficile de déterminer si différents groupes de clients présentant des caractéristiques de vulnérabilité ont des besoins différents ou rencontrent des obstacles et des résultats différents » [32].
C’est en arabe que la notation automatisée est la plus faible
La plupart des données ci-dessus portent sur l’anglais. Pour les activités dans le Golfe, trois autres faits comptent.
Noter un appel revient à noter une transcription, et la reconnaissance vocale standard est bien moins performante pour le dialecte du Golfe que pour l’arabe standard moderne. Sur un banc d’essai vocal saoudien, le taux d’erreur sur les mots du plus grand modèle généraliste ouvert était de 28 % sur l’arabe standard moderne et de 60 % sur le khaliji ; les modèles adaptés à l’arabe faisaient mieux, mais restaient moins bons sur le dialecte que sur l’arabe standard moderne [33]. Sur de la parole émirienne alternant arabe et anglais, la même famille de modèles a produit plus d’erreurs que de mots, tout en obtenant 12 % sur les segments uniquement en anglais [34]. Une transcription dont un mot sur deux est faux ne permet pas d’évaluer l’empathie ni la présence d’une mention obligatoire.
Les modèles de langage jugent aussi l’arabe moins bien que l’anglais. Dans un banc d’essai de jugement de préférence couvrant 23 langues, l’arabe était la langue la moins bien notée, avec 62,8 % en moyenne sur l’ensemble des modèles testés [35]. L’équipe à l’origine d’un classement de modèles arabes a constaté que l’accord entre son meilleur juge candidat et un évaluateur humain unique atteignait un kappa de 0,46, et a écrit que ce niveau était « relativement faible pour fonder une décision » [36].
Et les évaluateurs humains sont davantage en désaccord à mesure que la parole devient plus dialectale, y compris sur le sentiment [37]. La référence humaine utilisée pour calibrer un outil de notation automatisé est elle-même plus bruitée en dialecte.
Ce que demandent les régulateurs du Golfe
Aux Émirats arabes unis, les normes de protection des consommateurs (Consumer Protection Standards) de la Banque centrale (Central Bank of the UAE) imposent aux établissements financiers agréés de documenter des rappels mensuels auprès d’un échantillon de consommateurs afin de détecter les comportements inappropriés du personnel, de recourir régulièrement à des clients mystères et de suivre la performance du personnel en matière de traitement équitable [38]. Ces normes s’adressent aux établissements financiers agréés en vertu de la loi sur la Banque centrale ; pour un assureur, il est donc plus juste de les lire comme un point de référence que comme une obligation directe. Le code de conduite de l’assurance de 2010, toujours en vigueur sous l’autorité de la Banque centrale, exige que chaque réclamation soit tranchée dans un délai de 15 jours et que le registre des réclamations soit accessible aux inspecteurs [39]. La note d’orientation de 2026 de la Banque centrale sur l’IA, qui couvre expressément les assureurs, demande des tests de biais périodiques, une surveillance continue, une supervision humaine effective et un moyen pour les clients de demander un réexamen humain [40]. En Arabie saoudite, l’Autorité des assurances (Insurance Authority) a commencé ses activités en novembre 2023 et les règles antérieures restent en vigueur jusqu’à leur remplacement [41] ; nous n’avons pas pu vérifier les textes de conduite actuels sur un site officiel du régulateur et ne les décrivons pas ici.
Hors de la région, le règlement européen sur l’IA (EU AI Act) interdit depuis février 2025 d’inférer les émotions des personnes « dans les domaines du lieu de travail et des établissements d’enseignement » [42] : une frontière à retenir entre l’analyse du sentiment d’un client et celle du sentiment d’un salarié.
Ce que cela signifie
L’échantillonnage ne passe pas à côté des tendances à l’échelle du centre : quelques centaines de conversations tirées au hasard suffisent à bien estimer la moyenne. Ce qu’il ne permet pas de voir, c’est le conseiller pris individuellement, la défaillance rare et le groupe de clients qui obtient un résultat différent. C’est précisément sur ces points que portent les questions des régulateurs.
Noter chaque conversation règle le problème de la couverture. Cela ne règle pas celui du référentiel. Un outil de notation automatisé hérite de toutes les faiblesses de la grille qu’on lui fournit, y ajoute ses propres biais et, en arabe, hérite des erreurs de la transcription sur laquelle il s’appuie. Notre hypothèse de départ, selon laquelle les critères devraient être observables, calibrés par rapport à des évaluations humaines et présentés sous forme de distribution, tient, avec trois amendements.
Des critères observables sont nécessaires, mais pas suffisants. Les contrôles binaires rendent les notes automatisées cohérentes et auditables, et ils sont la bonne forme pour les exigences non négociables : identité vérifiée, mention obligatoire faite, aucune décision sur un sinistre laissée entendre. Ils ne conviennent pas aux questions d’appréciation, qui nécessitent quelques critères notés sur une échelle bien ancrée, distincts des contrôles plutôt que fondus dans un seul chiffre.
Le calibrage par rapport aux humains a un plafond. Lorsque des évaluateurs expérimentés s’accordent eux-mêmes avec un kappa inférieur à 0,6 sur un critère, aucune note automatisée sur ce critère ne devrait avoir de conséquences pour une personne. La comparaison utile n’est pas « modèle contre humain », mais « modèle contre un ensemble fixe de conversations notées par plusieurs évaluateurs, mesuré en continu ».
Les distributions doivent être ventilées par langue et par canal. Un appel en arabe dialectal et un e-mail en anglais ne sont pas notés avec la même fiabilité, et un classement unique pénalise celui qui sert la langue la plus difficile.
Il y a un arbitrage. Tout noter accroît l’intensité de la surveillance, et une enquête de 2002 auprès de 347 conseillers de deux centres britanniques a établi un lien fort entre l’intensité perçue de la surveillance et un moindre bien-être, lien modulé par la marge de manœuvre dans le travail et le soutien des superviseurs [43]. La couverture devrait être au service de l’équipe.
Comment nous concevons en conséquence
Chaque conversation est notée, qu’elle ait été menée par un agent IA ou par un membre de votre équipe, et les critères sont les vôtres. Le référentiel est rédigé pendant la mise en œuvre sous la forme de deux listes distinctes : des contrôles binaires pour les exigences observables, et un petit nombre de critères d’appréciation ancrés, accompagnés d’une description de ce à quoi correspond chaque niveau. Les deux ne sont jamais combinés en un seul pourcentage.
L’outil de notation voit le référentiel sous une forme unique et fixe : les critères, leur ordre et leurs ancrages ne changent pas d’une conversation à l’autre, et on ne lui montre jamais de réponse de référence assortie d’une note. Chaque note est accompagnée du passage de la transcription sur lequel elle repose, de sorte qu’un évaluateur peut en comprendre la raison sans réécouter l’appel. Une note sans justification est traitée comme un défaut.
Les notes sont présentées sous forme de distribution au regard de votre référentiel, la part située en dessous de ce référentiel étant indiquée en premier, et ventilées par langue, par canal et par motif de contact. La classification par motif de contact étiquette chaque conversation selon un ensemble de catégories que vous définissez, de sorte qu’une queue de distribution peut être rattachée à ce que demandaient les clients. La classification des résultats enregistre si chaque conversation a été résolue, n’a pas été résolue ou a fait l’objet d’une escalade, ce qui fournit à la notation un contrôle indépendant : une note élevée sur une conversation non résolue est une question, pas un résultat.
Le signalement de conformité vérifie les conversations au regard des règles que vous configurez et signale celles où a été dit quelque chose qui n’aurait pas dû l’être. Un signalement envoie la conversation dans une file d’attente pour une personne ; ce n’est pas un verdict. Compte tenu de la fréquence à laquelle les modèles pénalisent à l’excès des tours conformes et manquent de vraies violations, cette file d’attente est conçue pour être examinée, et cet examen alimente en retour les critères.
L’analyse du sentiment évalue ce que le client a ressenti lors de l’échange. Elle s’applique au client, non à votre équipe, et elle est présentée séparément de la qualité, car un client peut être mécontent d’une réponse qui était correcte et complète.
Les analyses pour le coaching font ressortir, pour vos chefs d’équipe, des tendances tirées des conversations les mieux et les moins bien notées : là où vos collaborateurs trouvent les conversations difficiles, et ce à quoi ressemble une bonne conversation dans votre propre activité, au regard du référentiel que vous avez rédigé. Elles existent pour soutenir les personnes qui traitent les conversations nécessitant l’intervention d’une personne.
La notation est calibrée au regard d’un ensemble fixe de vos conversations notées par vos évaluateurs, séparément pour l’arabe et pour l’anglais. Nous indiquons l’accord critère par critère, et non par grille d’évaluation, et nous disons clairement quels critères se situent sous le seuil requis pour une notation automatisée. Lorsque le niveau de confiance de la reconnaissance vocale sur un appel est faible, la note n’est pas attribuée et l’appel est confié à une personne.
Ce que nous ne savons pas encore
Aucune étude publiée n’évalue dans quelle mesure les erreurs de transcription dégradent l’accord d’un modèle de langage avec des évaluateurs humains sur les mêmes conversations. Les deux effets sont documentés séparément ; leur combinaison ne l’est pas.
Aucune étude publiée ne mesure l’accord entre modèles de langage et évaluateurs humains sur des conversations de service client en arabe. Les données les plus proches proviennent de bancs d’essai généralistes.
Aucune étude publiée n’indique le kappa des grilles d’évaluation des centres de contact commerciaux. Les données sur l’accord entre humains sont empruntées à la médecine, à l’éducation et à la psychologie du travail, et nous l’avons signalé là où elles apparaissent.
La question de savoir si une mesure continue au regard d’un ensemble de référence empêche la dérive en production, et ne se contente pas de la détecter, n’a pas été testée dans une étude contrôlée.
Et le chiffre de couverture que le secteur répète depuis près de vingt ans n’a, pour autant que nous ayons pu le vérifier, jamais été mesuré. Si vous en citez un, calculez-le à partir de vos propres volumes.
Sources
- 1.ICMI, Discover why contact center quality doesn't measure up, and what you can do about it, whitepaper, c. 2008. Unsourced industry estimate.https://www.icmi.com/~/media/files/resources/whitepapers/quality-whitepaper.ashx
- 2.COPC Inc., Global Benchmarking Series 2022: Contact Center Quality Assurance, survey of more than 900 executives, fieldwork September to December 2021, pp. 11, 21 and 37. Secondary, self-reported.https://cx.copc.com/hubfs/Global%20Benchmarking%20Series%202022_Contact%20Center%20Quality%20Assurance.pdf
- 3.Call Centre Helper, Poll: how many calls do you monitor per agent per month?, webinar poll, n=115, March 2013. Secondary.https://www.callcentrehelper.com/poll-how-many-calls-do-you-monitor-per-agent-per-month-43247.htm
- 4.Bain, P., Watson, A., Mulvey, G., Taylor, P. and Gall, G., Taylorism, targets and the pursuit of quantity and quality by call centre management, New Technology, Work and Employment 17(3), 2002 (page references are to the open-access manuscript, pp. 10 to 15).https://strathprints.strath.ac.uk/4165/6/strathprints004165.pdf
- 5.McHugh, M.L., Interrater reliability: the kappa statistic, Biochemia Medica 22(3), 2012.https://biochemia-medica.com/en/journal/22/3/10.11613/BM.2012.031/fullArticle
- 6.Krippendorff, K., Reliability in content analysis: some common misconceptions and recommendations, Human Communication Research 30(3), 2004. Foundational.https://www.academia.edu/21851693/
- 7.Yayama et al., inter-rater agreement in a nursing OSCE, Sage Open Nursing, 2026 (90 students, 38 examiners).https://journals.sagepub.com/doi/10.1177/23779608261417794
- 8.Viswesvaran, C., Ones, D.S. and Schmidt, F.L., Comparative analysis of the reliability of job performance ratings, Journal of Applied Psychology 81(5), 1996 (N=14,650). Foundational.https://www.academia.edu/20224570/
- 9.Cook, D.A. et al., Effect of rater training on reliability and accuracy of mini-CEX scores: a randomized, controlled trial, Journal of General Internal Medicine, 2009 (52 preceptors, 31 randomised).https://link.springer.com/article/10.1007/s11606-008-0842-3
- 10.Roch, S.G., Woehr, D.J., Mishra, V. and Kieszczynska, U., Rater training revisited: an updated meta-analytic review of frame-of-reference training, Journal of Occupational and Organizational Psychology 85(2), 2012.https://researchconnect.suny.edu/en/publications/rater-training-revisited-an-updated-meta-analytic-review-of-frame/
- 11.Casabianca, J.M., Lockwood, J.R. and McCaffrey, D.F., Trends in classroom observation scores, Educational and Psychological Measurement, 2015 (observations of 458 teachers over two years).https://journals.sagepub.com/doi/10.1177/0013164414539163
- 12.Zheng, L. et al., Judging LLM-as-a-judge with MT-Bench and Chatbot Arena, NeurIPS 2023, Tables 2, 5 and 6.https://arxiv.org/abs/2306.05685
- 13.Wang, P. et al., Large language models are not fair evaluators, 2023, abstract and Table 4.https://arxiv.org/abs/2305.17926
- 14.Dubois, Y. et al., Length-controlled AlpacaEval: a simple way to debias automatic evaluators, 2024, Figure 3.https://arxiv.org/abs/2404.04475
- 15.Panickssery, A., Bowman, S.R. and Feng, S., LLM evaluators recognize and favor their own generations, 2024.https://arxiv.org/abs/2404.13076
- 16.Li, D. et al., Preference leakage: a contamination problem in LLM-as-a-judge, ICLR 2026.https://arxiv.org/abs/2502.01534
- 17.Li et al. (Ant Group), Evaluating scoring bias in LLM-as-a-judge, 2025, Table 3.https://arxiv.org/abs/2506.22316
- 18.Bavaresco, A. et al., LLMs instead of human judges? A large scale empirical study across 20 NLP evaluation tasks, ACL 2025, Table 1 (Cohen's kappa for GPT-4o on the 11 categorical datasets).https://arxiv.org/abs/2406.18403
- 19.Yang et al., CompliBench: benchmarking LLM judges for compliance violation detection in dialogue systems, 2026, Table 1 and Figure 6.https://arxiv.org/abs/2604.12312
- 20.Lee et al., CheckEval, EMNLP 2025, Tables 1 and 2.https://arxiv.org/abs/2403.18771
- 21.Cook, J. et al., TICK: targeted instruct-evaluation with checklists, 2024, Tables 4 and 6.https://arxiv.org/abs/2410.03608
- 22.Jung, J., Brahman, F. and Choi, Y., Trust or escalate: LLM judges with provable guarantees for human agreement, 2024.https://arxiv.org/abs/2407.18370
- 23.Ilgen, J.S. et al., A systematic review of validity evidence for checklists versus global rating scales in simulation-based assessment, Medical Education 49(2), 2015 (45 studies).https://pubmed.ncbi.nlm.nih.gov/25626747/
- 24.Hodges, B., Regehr, G., McNaughton, N., Tiberius, R. and Hanson, M., OSCE checklists do not capture increasing levels of expertise, Academic Medicine, 1999. Foundational.https://pubmed.ncbi.nlm.nih.gov/10536636/
- 25.COPC Inc., What are the guidelines for QA form design and attributes?, 2024, and Measure quality using three metrics instead of one overall score, 2016. Secondary, practitioner guidance.https://www.copc.com/clearly-cx/what-are-the-guidelines-for-qa-form-design-and-attributes/
- 26.Anscombe, F.J., Graphs in statistical analysis, The American Statistician 27(1), 1973. Foundational.https://www.tandfonline.com/doi/abs/10.1080/00031305.1973.10478966
- 27.Matejka, J. and Fitzmaurice, G., Same stats, different graphs, CHI 2017.https://www.research.autodesk.com/publications/same-stats-different-graphs/
- 28.Kahneman, D., Fredrickson, B.L., Schreiber, C.A. and Redelmeier, D.A., When more pain is preferred to less, Psychological Science 4(6), 1993. Foundational.https://journals.sagepub.com/doi/10.1111/j.1467-9280.1993.tb00589.x
- 29.Baumeister, R.F., Bratslavsky, E., Finkenauer, C. and Vohs, K.D., Bad is stronger than good, Review of General Psychology 5(4), 2001. Foundational.https://journals.sagepub.com/doi/abs/10.1037/1089-2680.5.4.323
- 30.Financial Conduct Authority, Handbook PRIN 2A.9.8R, 2A.9.10R and 2A.9.11R, in force from 31 July 2023.https://handbook.fca.org.uk/handbook/prin2a/prin2as9
- 31.Financial Conduct Authority, Insurance multi-firm review of outcomes monitoring under the Consumer Duty, 26 June 2024.https://www.fca.org.uk/publications/multi-firm-reviews/insurance-multi-firm-review-outcomes-monitoring-under-consumer-duty
- 32.Financial Conduct Authority, Outcomes monitoring: good practice and areas for improvement, 2026.https://www.fca.org.uk/publications/good-and-poor-practice/outcomes-monitoring-good-practice-and-areas-improvement
- 33.ELM Company, Open universal Arabic ASR leaderboard, 2024, Tables 1 and 3 (Whisper-large-v3, zero-shot, on the SADA dataset). Industry technical report.https://arxiv.org/abs/2412.13788
- 34.Al Ali, M. and Aldarmaki, H., Mixat: a data set of bilingual Emirati-English speech, SIGUL 2024, Table 3 (Whisper medium, zero-shot).https://arxiv.org/abs/2405.02578
- 35.Gureja, S. et al., M-RewardBench: evaluating reward models in multilingual settings, ACL 2025.https://arxiv.org/abs/2410.15522
- 36.Inception and MBZUAI, AraGen leaderboard and 3C3H, Hugging Face, December 2024. Lab technical write-up, sample size not disclosed.https://huggingface.co/blog/leaderboard-3c3h-aragen
- 37.Keleg, A. and Magdy, W., on annotator agreement and Arabic level of dialectness, 2024.https://arxiv.org/abs/2405.11282
- 38.Central Bank of the UAE, Consumer Protection Standards, Notice 1158/2021, Articles 4.1.1.8, 4.1.1.9 and 5.2.2.4.https://rulebook.centralbank.ae/en/rulebook/consumer-protection-standards
- 39.Insurance Authority Board Resolution No. 3 of 2010, Instructions concerning the code of conduct and ethics, Article 10, in force under the Central Bank of the UAE.https://rulebook.centralbank.ae/en/rulebook/insurance-authority-board-resolution-no-3-2010-instructions-concerning-code-conduct-and
- 40.Central Bank of the UAE, Guidance note on the consumer protection and responsible adoption and use of AI and ML by licensed financial institutions, 2026.https://rulebook.centralbank.ae/en/rulebook/guidance-note-consumer-protection-and-responsible-adoption-and-use-artificial-intelligence
- 41.Saudi Press Agency, The Insurance Authority officially commences its operations, 23 November 2023.https://www.spa.gov.sa/en/N2002759
- 42.Regulation (EU) 2024/1689 (AI Act), Article 5(1)(f) and Recital 44.https://ai-act-service-desk.ec.europa.eu/en/ai-act/article-5
- 43.Holman, D., Chissick, C. and Totterdell, P., The effects of performance monitoring on emotional labor and well-being in call centers, Motivation and Emotion, 2002 (n=347).https://link.springer.com/article/10.1023/A:1015194108376
Recevez les nouvelles études dès leur publication
Des e-mails occasionnels, au fil de nos publications.