Telonic

Gobernanza30 SEP 2026Anthony Ombrore

Puntuar cada conversación según un estándar redactado por la empresa

La mayoría de los centros de contacto evalúan la calidad escuchando cada mes un puñado de conversaciones por asesor, y no hemos encontrado ninguna cifra medida de lo pequeña que es esa muestra. Este artículo expone lo que dice la evidencia sobre puntuar, en cambio, todas las conversaciones: dónde se puede confiar en la puntuación automatizada, dónde no, y cómo debe ser un estándar para que una puntuación con respecto a él signifique algo.

En esta página
  1. La situación
  2. Lo que muestra la evidencia
  3. Qué significa
  4. Cómo lo abordamos en el diseño
  5. Lo que aún no sabemos
  6. Fuentes

La situación

El responsable de siniestros de una aseguradora de automóviles dirige un equipo que mantiene decenas de miles de conversaciones al mes. Seis revisores escuchan unas pocas llamadas por asesor, las puntúan en un formulario y celebran una reunión de calibración cada trimestre. La puntuación de calidad es del 84 % y lleva un año así.

Entonces llega una reclamación al regulador. Un cliente afirma que nadie le dijo que el informe policial atribuía la culpa al otro conductor, por lo que pasó tres semanas reclamando a la aseguradora equivocada. El regulador pregunta qué se le dijo y cuándo. La respuesta tarda dos días, porque alguien tiene que encontrar la grabación y escucharla. Nadie puede decir si le ocurrió a alguien más, porque las otras 99 conversaciones de ese asesor durante esa semana nunca se revisaron.

La puntuación es real. Pero describe una muestra que nadie eligió con cuidado, con un formulario que nadie ha puesto a prueba, resumida en una media que oculta las conversaciones que llegan a un regulador.

Lo que muestra la evidencia

Nadie sabe lo pequeña que es la muestra

La cifra que se repite en todo el sector es que los centros de contacto revisan entre el 1 y el 2 % de las conversaciones. No hemos encontrado una fuente que la haya medido. Su primera aparición rastreable es una frase sin fuente en un documento técnico de un organismo del sector de alrededor de 2008 [1]. Las grandes encuestas a profesionales realizadas desde entonces, incluida una a más de 900 directivos en 2022, nunca preguntaron qué proporción de conversaciones se revisa [2].

Lo que sí se mide son las evaluaciones por asesor. Un sondeo de 2013 a 115 profesionales de centros de contacto halló que dos tercios revisaban seis llamadas o menos por asesor al mes [3]. Unos estudios de caso revisados por pares sobre cuatro centros escoceses en 2002 hallaron entre dos y aproximadamente ocho al mes [4]. Esta evidencia es secundaria y antigua, pero lleva veinte años apuntando en la misma dirección.

Los cálculos a partir de ahí son nuestros. Si un asesor gestiona 400 conversaciones al mes y se revisan cinco, la cobertura es algo superior al 1 %. Si un fallo grave, por ejemplo omitir una verificación de identidad, se produce una vez cada 200 conversaciones, la probabilidad de que una muestra de cinco llamadas contenga uno es de aproximadamente el 2.5 %. Cuatro aprobados de cinco dan un intervalo de confianza del 95 % (método de Wilson) de aproximadamente el 38 al 96 %. La media de todo el centro puede seguir siendo válida: unas 385 conversaciones aleatorias permiten estimar una proporción con un margen de cinco puntos y una confianza del 95 %, sea cual sea el volumen. La puntuación por asesor, y el suceso poco frecuente, apenas se distinguen del ruido.

Además, el muestreo a menudo no es aleatorio. En la encuesta de 2022, el 63 % de los directivos afirmó que las transacciones se seleccionaban de forma aleatoria, y el 75 % afirmó que su organización intentaba relacionar las puntuaciones de calidad con la satisfacción del cliente, de modo que una cuarta parte no lo hacía [2].

Los revisores humanos coinciden en las acciones, no en las impresiones

La fiabilidad entre evaluadores es el grado en que dos personas que puntúan lo mismo dan la misma puntuación. Suele expresarse como kappa, que va de 0 (una coincidencia no mejor que el azar) a 1 (coincidencia perfecta). Un análisis muy citado sostiene que cualquier kappa inferior a 0.60 es insuficiente para tomar decisiones [5]; la referencia clásica en análisis de contenido exige 0.80 para confiar en los datos y 0.67 para conclusiones provisionales [6].

La coincidencia depende mucho más de lo que juzgan los revisores que de quiénes son. En un estudio de 2026 con 38 examinadores que puntuaron a 90 estudiantes de enfermería, la coincidencia en «realiza la auscultación torácica» fue de kappa 0.95. En «muestra una actitud empática» fue de 0.30, o de 0.62 en una versión del estadístico ajustada según la poca frecuencia con que se marcó la conducta como ausente [7]. Un metaanálisis que abarcó a 14 650 empleados halló que las valoraciones de dos supervisores sobre el desempeño global de una misma persona tenían una correlación de 0.52, lo que significa que compartían aproximadamente la mitad de la varianza de sus juicios [8]. En los estudios de caso de 2002, un asesor recibió tres notas distintas por exactamente el mismo inicio de llamada [4].

Las reuniones de calibración pueden aportar menos de lo que sugiere su fama. Un ensayo con 52 docentes de medicina, 31 de ellos asignados al azar, halló que un taller de formación de evaluadores no mejoró la coincidencia ni la exactitud; mejoró la confianza de los evaluadores [9]. Los metaanálisis sí constatan que la formación en marco de referencia, que utiliza ejemplos compartidos para enseñar cómo es cada nivel de puntuación, mejora la exactitud [10]. Pero un estudio de dos años con evaluadores que observaron a 458 docentes halló que la deriva, la tendencia del criterio de un revisor a desplazarse con el tiempo, era grande al principio y nunca convergía; la variabilidad entre evaluadores aumentó [11]. La medición continua con respecto a un conjunto de referencia fijo es la respuesta a la que apunta esta evidencia, aunque esa respuesta no se ha probado en un estudio controlado.

Esta evidencia procede de la medicina, la educación y la psicología del trabajo. No hemos encontrado ningún estudio revisado por pares que informe de la kappa de las fichas de evaluación de centros de contacto comerciales. Esa laguna es en sí misma un hallazgo.

Los modelos de lenguaje como revisores: sólidos en los casos fáciles, débiles donde importa

Un modelo de lenguaje utilizado para puntuar transcripciones suele denominarse «juez LLM». El estudio más citado informó de que GPT-4 coincidía con los evaluadores humanos el 85 % de las veces, por encima del 81 % en que los humanos coincidían entre sí [12]. Ese titular necesita su nota al pie. El 85 % excluye los empates y los casos en que el modelo cambió su veredicto cuando se intercambiaron las dos respuestas. Si se incluyen, la coincidencia entre modelo y humanos fue del 64 al 66 %, frente al 63 al 67 % entre parejas de humanos. En un conjunto deliberadamente difícil de 80 pares de respuestas casi idénticas, el modelo de 2023 emitió un veredicto dependiente del orden el 35 % de las veces; el sesgo se reduce cuando las dos respuestas difieren claramente en calidad [12].

Los sesgos están documentados y son medibles:

  • Posición. Reordenar dos respuestas permitió que un modelo más débil «ganara» a uno más fuerte en 66 de 80 casos de prueba [13].
  • Longitud. La tasa de victorias de un modelo en una batería de referencia estándar osciló entre el 22.9 y el 64.3 % en función únicamente de lo extenso que se le indicaba que fuera, hasta que se controló estadísticamente la longitud [14].
  • Autopreferencia. Los modelos que reconocen sus propios resultados los puntúan más alto [15], y un juez de la misma familia de modelos que el sistema que puntúa infla los resultados de ese sistema [16].
  • Presentación de la rúbrica. Invertir el orden de los niveles de la rúbrica cambió aproximadamente una cuarta parte de las puntuaciones de un modelo de frontera; adjuntar una respuesta de referencia con la máxima puntuación cambió casi la mitad [17].
  • Tipo de criterio. En 11 tareas de clasificación, la coincidencia de un modelo con los humanos osciló entre kappa 0.84 y menos 0.24, con los peores resultados en los juicios sobre toxicidad y seguridad [18]. La coincidencia es una propiedad del criterio, no del juez.

La evidencia más próxima a la puntuación del cumplimiento normativo es una batería de referencia de 2026 de 318 diálogos sintéticos en contextos de aerolíneas, sanidad y seguros con infracciones de normas introducidas a propósito. Los modelos actuales más potentes detectaron entre el 78 y el 95 % de las infracciones turno a turno, mientras que un modelo más antiguo logró entre el 51 y el 57 %. Todos ellos penalizaron en exceso turnos conformes mientras pasaban por alto infracciones reales, y un modelo ajustado para la tarea acertó en todos los turnos de una conversación solo en el 39 al 51 % de las conversaciones [19].

Las medidas de mitigación tienen efectos medidos. Intercambiar el orden y promediar elevó la coincidencia de un evaluador con la mayoría humana del 53 al 63 %; enviar a personas el 20 % de los casos más difíciles la elevó al 74 [13]. Descomponer una rúbrica en preguntas de sí o no elevó la coincidencia entre distintos jueces de 0.09 a 0.48 [20]. Puntuar solo cuando el modelo tiene confianza, y escalar el resto, logró una coincidencia con los humanos superior al 80 % en aproximadamente el 80 % de los casos [22].

Las comprobaciones binarias aportan coherencia, y algo se pierde

Muchas fichas de evaluación dan por hecho que los elementos de sí o no son más fiables que las escalas de 1 a 5. Entre evaluadores humanos, una revisión sistemática de 2015 de 45 estudios halló una fiabilidad entre evaluadores de 0.81 para las listas de comprobación y de 0.78 para las escalas de valoración global: ninguna diferencia significativa. Las valoraciones globales se generalizaban mejor de una tarea a otra, 0.80 frente a 0.69 [23]. Un estudio de 1999 halló que los clínicos experimentados obtenían puntuaciones más bajas que los profesionales en formación en listas de comprobación binarias, mientras que obtenían las más altas en las valoraciones globales [24]; la razón probable es que los expertos se saltan los pasos que no necesitan. Las listas de comprobación miden la minuciosidad. Pueden penalizar la pericia.

Para los jueces automatizados, el panorama es distinto. Descomponer una rúbrica en preguntas de sí o no elevó la coincidencia entre doce modelos juez distintos de 0.09 a 0.48, y elevó su correlación con el juicio humano entre 0.01 y 0.27 según el modelo [20]. Las listas de comprobación también elevaron la coincidencia entre anotadores humanos, de 0.19 a 0.26, en un estudio relacionado [21]. Las propias directrices del principal estándar para centros de contacto piden una puntuación binaria y que los errores críticos se registren por separado de la puntuación global [25].

Por qué la media es la cifra equivocada

Dos equipos obtienen un 82. En el primero, todas las conversaciones puntúan entre 78 y 86. En el segundo, nueve de cada diez puntúan 88 y una de cada diez puntúa 28, porque se omitió una verificación de identidad. La media es la misma, pero uno de los equipos tiene, en una de cada diez conversaciones, un fallo camino del regulador. Es un ejemplo nuestro, no datos, pero el principio es un clásico de la estadística: cuatro conjuntos de datos con medias, varianzas y correlaciones idénticas pueden tener un aspecto completamente distinto al representarlos gráficamente [26], y un artículo de 2017 generó doce, uno de ellos con forma de dinosaurio [27].

Los extremos también importan más que el centro para el recuerdo que los clientes guardan de una conversación. Las personas juzgan una experiencia en gran medida por su peor momento y por su final [28], y los acontecimientos negativos pesan más que los positivos en casi todos los ámbitos estudiados [29]. Los reguladores piensan del mismo modo. Las normas de conducta del Reino Unido exigen que las empresas supervisen los resultados de sus comunicaciones y de su asistencia, y que determinen si «algún grupo de clientes minoristas está obteniendo resultados distintos en comparación con otro grupo» [30]. La revisión de las aseguradoras realizada por el regulador criticó los umbrales «fijados a partir de medias del sector sin justificación» [31], y su revisión de 2026 constató que «la información de gestión agregada puede dificultar que se determine si distintos grupos de clientes con características de vulnerabilidad tienen necesidades diferentes o se enfrentan a obstáculos y resultados diferentes» [32].

El árabe es donde la puntuación automatizada es más débil

La mayor parte de la evidencia anterior procede de estudios en inglés. Para las operaciones en el Golfo, importan otros tres hechos.

Puntuar una llamada significa puntuar una transcripción, y el reconocimiento del habla estándar, sin adaptar, es mucho peor para el dialecto del Golfo que para el árabe estándar moderno. En una batería de referencia de habla saudí, la tasa de error de palabras del mayor modelo abierto de uso general fue del 28 % en árabe estándar moderno y del 60 % en árabe del Golfo; los modelos ajustados para el árabe obtuvieron mejores resultados, pero seguían siendo peores en dialecto que en árabe estándar moderno [33]. En habla emiratí con cambio de código entre árabe e inglés, la misma familia de modelos produjo más errores que palabras, mientras que obtenía un 12 % en los segmentos solo en inglés [34]. Una transcripción en la que una de cada dos palabras es errónea no puede puntuarse en cuanto a empatía o a una información obligatoria.

Los modelos de lenguaje también juzgan peor el árabe que el inglés. En una batería de referencia de 23 idiomas sobre juicios de preferencia, el árabe fue el idioma con la puntuación más baja, con un 62.8 % de media entre los modelos evaluados [35]. El equipo responsable de una clasificación de modelos en árabe halló que su mejor candidato a juez coincidía con un único evaluador humano con una kappa de 0.46, y escribió que esta era «relativamente baja para basar una decisión en ella» [36].

Además, los evaluadores humanos discrepan más a medida que el habla se vuelve más dialectal, también en cuanto al sentimiento [37]. La referencia humana utilizada para calibrar un sistema de puntuación automatizado tiene, a su vez, más ruido en dialecto.

Lo que piden los reguladores del Golfo

En los Emiratos Árabes Unidos, las Normas de Protección del Consumidor del Banco Central exigen a las instituciones financieras con licencia documentar devoluciones de llamada mensuales a una muestra de consumidores para detectar conductas inapropiadas del personal, realizar periódicamente compras de incógnito y supervisar el desempeño del personal en cuanto al trato justo [38]. Esas Normas están dirigidas a las instituciones financieras con licencia en virtud de la ley del Banco Central, por lo que, para una aseguradora, conviene entenderlas como un punto de referencia más que como una obligación directa. El código de conducta de seguros de 2010, aún en vigor bajo la autoridad del Banco Central, exige que cada reclamación se resuelva en un plazo de 15 días y que el registro de reclamaciones esté a disposición de los inspectores [39]. La orientación del Banco Central de 2026 sobre la IA, que abarca expresamente a las aseguradoras, pide pruebas periódicas de sesgo, supervisión continua, una supervisión humana efectiva y una vía para que los clientes soliciten una revisión humana [40]. En Arabia Saudí, la Autoridad de Seguros inició sus operaciones en noviembre de 2023 y las normas anteriores siguen en vigor hasta que se sustituyan [41]; no hemos podido verificar los instrumentos de conducta vigentes en un sitio web del regulador y no los describimos aquí.

Fuera de la región, la Ley de IA de la UE prohíbe desde febrero de 2025 inferir las emociones de las personas «en los ámbitos del lugar de trabajo y de las instituciones educativas» [42]: una línea que conviene tener presente entre analizar el sentimiento de un cliente y analizar el de un empleado.

Qué significa

El muestreo no pasa por alto los patrones en el conjunto del centro; unos cientos de conversaciones aleatorias estiman bien la media. Lo que no puede ver es al asesor individual, el fallo poco frecuente y el grupo de clientes que obtiene un resultado distinto. Eso es exactamente lo que preguntan los reguladores.

Puntuar todas las conversaciones resuelve la cobertura. No resuelve el estándar. Un sistema de puntuación automatizado hereda todas las debilidades del formulario que recibe, añade sus propios sesgos y, en árabe, hereda los errores de la transcripción subyacente. La hipótesis de partida, que los criterios deben ser observables, estar calibrados con respecto a personas y presentarse como una distribución, se mantiene con tres enmiendas.

Los criterios observables son necesarios, pero no suficientes. Las comprobaciones binarias hacen que las puntuaciones automatizadas sean coherentes y auditables, y son la forma adecuada para lo innegociable: identidad verificada, información facilitada, ninguna decisión sobre el siniestro insinuada. Son la forma inadecuada para el juicio, que necesita unos pocos elementos de escala bien anclados, separados de las comprobaciones en lugar de mezclados en una sola cifra.

La calibración con respecto a personas tiene un techo. Cuando los propios revisores experimentados coinciden por debajo de kappa 0.6 en un criterio, ninguna puntuación automatizada sobre ese criterio debe tener consecuencias para una persona. La comparación útil no es «modelo frente a persona», sino «modelo frente a un conjunto fijo de conversaciones puntuadas por varios revisores, medido de forma continua».

Las distribuciones deben desglosarse por idioma y por canal. Una llamada en dialecto árabe y un correo electrónico en inglés no se puntúan con la misma fiabilidad, y una única clasificación penaliza a quien atiende en el idioma más difícil.

Hay una disyuntiva. Puntuarlo todo aumenta la intensidad de la supervisión, y una encuesta de 2002 a 347 asesores de dos centros del Reino Unido halló que la intensidad percibida de la supervisión estaba fuertemente asociada a un menor bienestar, moderada por el control sobre el propio trabajo y el apoyo del supervisor [43]. La cobertura debe estar al servicio del equipo.

Cómo lo abordamos en el diseño

Se puntúan todas las conversaciones, tanto si las mantuvo un agente de IA como un miembro de su equipo, y los criterios son los de su empresa. El estándar se redacta durante la implementación como dos listas separadas: comprobaciones binarias para los requisitos observables, y un pequeño conjunto de elementos de juicio anclados, con una descripción de cómo es cada nivel. Las dos nunca se combinan en un solo porcentaje.

El sistema de puntuación ve el estándar en una única forma fija: los criterios, su orden y sus anclajes no cambian de una conversación a otra, y nunca se le muestra una respuesta de referencia con una puntuación adjunta. Cada puntuación incluye el fragmento de la transcripción en el que se basa, de modo que un revisor puede ver el porqué sin volver a escuchar la llamada. Una puntuación sin motivo se trata como un defecto.

Las puntuaciones se presentan como una distribución con respecto a su estándar, indicando en primer lugar la proporción que queda por debajo de él, y desglosadas por idioma, canal y motivo del contacto. La clasificación por motivo del contacto etiqueta cada conversación según un conjunto de categorías que usted define, de modo que un extremo de la distribución puede vincularse con lo que preguntaban los clientes. La clasificación del resultado registra si cada conversación se resolvió, quedó sin resolver o se escaló, lo que aporta a la puntuación una comprobación independiente: una puntuación alta en una conversación sin resolver es una pregunta, no un resultado.

La detección de incumplimientos contrasta las conversaciones con las reglas que usted configura y marca aquellas en las que se dijo algo que no debería haberse dicho. Una marca es una cola de trabajo para una persona, no un veredicto. Dada la frecuencia con que los modelos penalizan en exceso turnos conformes y pasan por alto infracciones reales, esa cola está pensada para revisarse, y la revisión retroalimenta los criterios.

El análisis de sentimiento puntúa cómo se sintió el cliente con la interacción. Se aplica al cliente, no a su equipo, y se presenta por separado de la calidad, porque un cliente puede no estar satisfecho con una respuesta que era correcta y completa.

Los análisis de coaching muestran a los responsables de su equipo patrones de las conversaciones con puntuación alta y baja: dónde encuentran dificultades las personas en las conversaciones y cómo es un buen trabajo en su propia operación, según el estándar que usted redactó. Existen para apoyar a las personas que gestionan las conversaciones que necesitan una persona.

La puntuación se calibra con respecto a un conjunto fijo de sus conversaciones puntuadas por sus revisores, por separado para el árabe y el inglés. Informamos de la coincidencia por criterio, no por ficha de evaluación, y decimos con claridad qué criterios quedan por debajo del umbral para la puntuación automatizada. Cuando la confianza del reconocimiento del habla en una llamada es baja, no se emite la puntuación y la llamada pasa a una persona.

Lo que aún no sabemos

Ningún estudio publicado mide cómo los errores de transcripción degradan la coincidencia de un modelo de lenguaje con los revisores humanos en las mismas conversaciones. Los dos efectos están documentados por separado; su combinación, no.

Ningún estudio publicado mide la coincidencia entre los modelos de lenguaje y los evaluadores humanos en conversaciones de atención al cliente en árabe. La evidencia más próxima procede de baterías de referencia de uso general.

Ningún estudio publicado informa de la kappa de las fichas de evaluación de centros de contacto comerciales. La evidencia sobre la coincidencia humana procede de la medicina, la educación y la psicología del trabajo, y lo hemos indicado allí donde aparece.

No se ha probado en un estudio controlado si la medición continua con respecto a un conjunto de referencia evita la deriva en producción, en lugar de limitarse a detectarla.

Y la cifra de cobertura que el sector lleva repitiendo casi veinte años nunca se ha medido, hasta donde hemos podido comprobar. Si cita una, calcúlela a partir de sus propios volúmenes.

Fuentes

  1. 1.ICMI, Discover why contact center quality doesn't measure up, and what you can do about it, whitepaper, c. 2008. Unsourced industry estimate.⁠https://www.icmi.com/~/media/files/resources/whitepapers/quality-whitepaper.ashx
  2. 2.COPC Inc., Global Benchmarking Series 2022: Contact Center Quality Assurance, survey of more than 900 executives, fieldwork September to December 2021, pp. 11, 21 and 37. Secondary, self-reported.⁠https://cx.copc.com/hubfs/Global%20Benchmarking%20Series%202022_Contact%20Center%20Quality%20Assurance.pdf
  3. 3.Call Centre Helper, Poll: how many calls do you monitor per agent per month?, webinar poll, n=115, March 2013. Secondary.⁠https://www.callcentrehelper.com/poll-how-many-calls-do-you-monitor-per-agent-per-month-43247.htm
  4. 4.Bain, P., Watson, A., Mulvey, G., Taylor, P. and Gall, G., Taylorism, targets and the pursuit of quantity and quality by call centre management, New Technology, Work and Employment 17(3), 2002 (page references are to the open-access manuscript, pp. 10 to 15).⁠https://strathprints.strath.ac.uk/4165/6/strathprints004165.pdf
  5. 5.McHugh, M.L., Interrater reliability: the kappa statistic, Biochemia Medica 22(3), 2012.⁠https://biochemia-medica.com/en/journal/22/3/10.11613/BM.2012.031/fullArticle
  6. 6.Krippendorff, K., Reliability in content analysis: some common misconceptions and recommendations, Human Communication Research 30(3), 2004. Foundational.⁠https://www.academia.edu/21851693/
  7. 7.Yayama et al., inter-rater agreement in a nursing OSCE, Sage Open Nursing, 2026 (90 students, 38 examiners).⁠https://journals.sagepub.com/doi/10.1177/23779608261417794
  8. 8.Viswesvaran, C., Ones, D.S. and Schmidt, F.L., Comparative analysis of the reliability of job performance ratings, Journal of Applied Psychology 81(5), 1996 (N=14,650). Foundational.⁠https://www.academia.edu/20224570/
  9. 9.Cook, D.A. et al., Effect of rater training on reliability and accuracy of mini-CEX scores: a randomized, controlled trial, Journal of General Internal Medicine, 2009 (52 preceptors, 31 randomised).⁠https://link.springer.com/article/10.1007/s11606-008-0842-3
  10. 10.Roch, S.G., Woehr, D.J., Mishra, V. and Kieszczynska, U., Rater training revisited: an updated meta-analytic review of frame-of-reference training, Journal of Occupational and Organizational Psychology 85(2), 2012.⁠https://researchconnect.suny.edu/en/publications/rater-training-revisited-an-updated-meta-analytic-review-of-frame/
  11. 11.Casabianca, J.M., Lockwood, J.R. and McCaffrey, D.F., Trends in classroom observation scores, Educational and Psychological Measurement, 2015 (observations of 458 teachers over two years).⁠https://journals.sagepub.com/doi/10.1177/0013164414539163
  12. 12.Zheng, L. et al., Judging LLM-as-a-judge with MT-Bench and Chatbot Arena, NeurIPS 2023, Tables 2, 5 and 6.⁠https://arxiv.org/abs/2306.05685
  13. 13.Wang, P. et al., Large language models are not fair evaluators, 2023, abstract and Table 4.⁠https://arxiv.org/abs/2305.17926
  14. 14.Dubois, Y. et al., Length-controlled AlpacaEval: a simple way to debias automatic evaluators, 2024, Figure 3.⁠https://arxiv.org/abs/2404.04475
  15. 15.Panickssery, A., Bowman, S.R. and Feng, S., LLM evaluators recognize and favor their own generations, 2024.⁠https://arxiv.org/abs/2404.13076
  16. 16.Li, D. et al., Preference leakage: a contamination problem in LLM-as-a-judge, ICLR 2026.⁠https://arxiv.org/abs/2502.01534
  17. 17.Li et al. (Ant Group), Evaluating scoring bias in LLM-as-a-judge, 2025, Table 3.⁠https://arxiv.org/abs/2506.22316
  18. 18.Bavaresco, A. et al., LLMs instead of human judges? A large scale empirical study across 20 NLP evaluation tasks, ACL 2025, Table 1 (Cohen's kappa for GPT-4o on the 11 categorical datasets).⁠https://arxiv.org/abs/2406.18403
  19. 19.Yang et al., CompliBench: benchmarking LLM judges for compliance violation detection in dialogue systems, 2026, Table 1 and Figure 6.⁠https://arxiv.org/abs/2604.12312
  20. 20.Lee et al., CheckEval, EMNLP 2025, Tables 1 and 2.⁠https://arxiv.org/abs/2403.18771
  21. 21.Cook, J. et al., TICK: targeted instruct-evaluation with checklists, 2024, Tables 4 and 6.⁠https://arxiv.org/abs/2410.03608
  22. 22.Jung, J., Brahman, F. and Choi, Y., Trust or escalate: LLM judges with provable guarantees for human agreement, 2024.⁠https://arxiv.org/abs/2407.18370
  23. 23.Ilgen, J.S. et al., A systematic review of validity evidence for checklists versus global rating scales in simulation-based assessment, Medical Education 49(2), 2015 (45 studies).⁠https://pubmed.ncbi.nlm.nih.gov/25626747/
  24. 24.Hodges, B., Regehr, G., McNaughton, N., Tiberius, R. and Hanson, M., OSCE checklists do not capture increasing levels of expertise, Academic Medicine, 1999. Foundational.⁠https://pubmed.ncbi.nlm.nih.gov/10536636/
  25. 25.COPC Inc., What are the guidelines for QA form design and attributes?, 2024, and Measure quality using three metrics instead of one overall score, 2016. Secondary, practitioner guidance.⁠https://www.copc.com/clearly-cx/what-are-the-guidelines-for-qa-form-design-and-attributes/
  26. 26.Anscombe, F.J., Graphs in statistical analysis, The American Statistician 27(1), 1973. Foundational.⁠https://www.tandfonline.com/doi/abs/10.1080/00031305.1973.10478966
  27. 27.Matejka, J. and Fitzmaurice, G., Same stats, different graphs, CHI 2017.⁠https://www.research.autodesk.com/publications/same-stats-different-graphs/
  28. 28.Kahneman, D., Fredrickson, B.L., Schreiber, C.A. and Redelmeier, D.A., When more pain is preferred to less, Psychological Science 4(6), 1993. Foundational.⁠https://journals.sagepub.com/doi/10.1111/j.1467-9280.1993.tb00589.x
  29. 29.Baumeister, R.F., Bratslavsky, E., Finkenauer, C. and Vohs, K.D., Bad is stronger than good, Review of General Psychology 5(4), 2001. Foundational.⁠https://journals.sagepub.com/doi/abs/10.1037/1089-2680.5.4.323
  30. 30.Financial Conduct Authority, Handbook PRIN 2A.9.8R, 2A.9.10R and 2A.9.11R, in force from 31 July 2023.⁠https://handbook.fca.org.uk/handbook/prin2a/prin2as9
  31. 31.Financial Conduct Authority, Insurance multi-firm review of outcomes monitoring under the Consumer Duty, 26 June 2024.⁠https://www.fca.org.uk/publications/multi-firm-reviews/insurance-multi-firm-review-outcomes-monitoring-under-consumer-duty
  32. 32.Financial Conduct Authority, Outcomes monitoring: good practice and areas for improvement, 2026.⁠https://www.fca.org.uk/publications/good-and-poor-practice/outcomes-monitoring-good-practice-and-areas-improvement
  33. 33.ELM Company, Open universal Arabic ASR leaderboard, 2024, Tables 1 and 3 (Whisper-large-v3, zero-shot, on the SADA dataset). Industry technical report.⁠https://arxiv.org/abs/2412.13788
  34. 34.Al Ali, M. and Aldarmaki, H., Mixat: a data set of bilingual Emirati-English speech, SIGUL 2024, Table 3 (Whisper medium, zero-shot).⁠https://arxiv.org/abs/2405.02578
  35. 35.Gureja, S. et al., M-RewardBench: evaluating reward models in multilingual settings, ACL 2025.⁠https://arxiv.org/abs/2410.15522
  36. 36.Inception and MBZUAI, AraGen leaderboard and 3C3H, Hugging Face, December 2024. Lab technical write-up, sample size not disclosed.⁠https://huggingface.co/blog/leaderboard-3c3h-aragen
  37. 37.Keleg, A. and Magdy, W., on annotator agreement and Arabic level of dialectness, 2024.⁠https://arxiv.org/abs/2405.11282
  38. 38.Central Bank of the UAE, Consumer Protection Standards, Notice 1158/2021, Articles 4.1.1.8, 4.1.1.9 and 5.2.2.4.⁠https://rulebook.centralbank.ae/en/rulebook/consumer-protection-standards
  39. 39.Insurance Authority Board Resolution No. 3 of 2010, Instructions concerning the code of conduct and ethics, Article 10, in force under the Central Bank of the UAE.⁠https://rulebook.centralbank.ae/en/rulebook/insurance-authority-board-resolution-no-3-2010-instructions-concerning-code-conduct-and
  40. 40.Central Bank of the UAE, Guidance note on the consumer protection and responsible adoption and use of AI and ML by licensed financial institutions, 2026.⁠https://rulebook.centralbank.ae/en/rulebook/guidance-note-consumer-protection-and-responsible-adoption-and-use-artificial-intelligence
  41. 41.Saudi Press Agency, The Insurance Authority officially commences its operations, 23 November 2023.⁠https://www.spa.gov.sa/en/N2002759
  42. 42.Regulation (EU) 2024/1689 (AI Act), Article 5(1)(f) and Recital 44.⁠https://ai-act-service-desk.ec.europa.eu/en/ai-act/article-5
  43. 43.Holman, D., Chissick, C. and Totterdell, P., The effects of performance monitoring on emotional labor and well-being in call centers, Motivation and Emotion, 2002 (n=347).⁠https://link.springer.com/article/10.1023/A:1015194108376

Reciba las nuevas investigaciones en cuanto se publiquen

Correos electrónicos ocasionales cuando publicamos.

Suscribirse

Siga leyendo