Telonic

الحوكمة30 سبتمبر 2026Anthony Ombrore

تقييم كل محادثة وفق معيار وضعته المؤسسة بنفسها

تحكم معظم مراكز الاتصال على الجودة بالاستماع إلى عدد قليل من المحادثات لكل موظف خدمة عملاء كل شهر، ولم نعثر على رقم مقيس يبيّن مدى صغر هذه العينة. يعرض هذا المقال ما تقوله الأدلة عن تقييم كل محادثة بدلًا من ذلك: أين يمكن الوثوق بالتقييم الآلي، وأين لا يمكن، وكيف ينبغي أن يكون المعيار قبل أن يصبح لأي درجة وفقه معنى.

في هذه الصفحة
  1. الوضع
  2. ما تُظهره الأدلة
  3. ما يعنيه ذلك
  4. كيف نراعي ذلك في تصميمنا
  5. ما لا نعرفه بعد
  6. المصادر

الوضع

يدير رئيس قسم المطالبات في شركة تأمين على المركبات فريقًا يُجري عشرات الآلاف من المحادثات شهريًا. ويستمع ستة مراجعين إلى بضع مكالمات لكل موظف، ويقيّمونها على استمارة، ويعقدون اجتماع معايرة كل ربع سنة. ودرجة الجودة 84%، وهي كذلك منذ عام.

ثم تصل شكوى إلى الجهة التنظيمية. يقول عميل إن أحدًا لم يخبره بأن تقرير الشرطة حمّل السائق الآخر المسؤولية، فأمضى ثلاثة أسابيع يلاحق شركة التأمين الخطأ. وتسأل الجهة التنظيمية عمّا قيل له، ومتى. ويستغرق الجواب يومين، لأن على أحدهم أن يعثر على التسجيل ويستمع إليه. ولا يستطيع أحد أن يقول هل حدث ذلك لعملاء آخرين، لأن محادثات الموظف الـ99 الأخرى في ذلك الأسبوع لم تُراجع قط.

الدرجة حقيقية. لكنها تصف عينة لم يخترها أحد بعناية، وفق استمارة لم يختبرها أحد، ملخّصةً في متوسط يُخفي المحادثات التي تصل إلى الجهة التنظيمية.

ما تُظهره الأدلة

لا أحد يعرف مدى صغر العينة

الرقم المتداول في القطاع أن مراكز الاتصال تراجع ما بين 1% و2% من المحادثات. ولم نتمكن من العثور على مصدر مقيس له. وأقدم ظهور يمكن تتبعه له جملة غير موثقة المصدر في ورقة بيضاء أصدرتها هيئة قطاعية نحو عام 2008 [1]. ولم تسأل استطلاعات الممارسين الكبرى التي أُجريت منذ ذلك الحين، ومنها استطلاع شمل أكثر من 900 مسؤول تنفيذي عام 2022، عن نسبة المحادثات التي تخضع للمراجعة [2].

أما ما يُقاس فهو عدد التقييمات لكل موظف. فقد وجد استطلاع رأي أُجري عام 2013 على 115 من المختصين في مراكز الاتصال أن ثلثيهم يراجعون ست مكالمات أو أقل لكل موظف شهريًا [3]. ووجدت دراسات حالة محكّمة لأربعة مراكز في اسكتلندا عام 2002 أن العدد يتراوح بين تقييمين ونحو ثمانية تقييمات شهريًا [4]. وهذه أدلة ثانوية وقديمة، لكنها تشير إلى الاتجاه نفسه منذ عشرين عامًا.

والحساب انطلاقًا من ذلك حسابنا نحن. فإذا تعامل الموظف مع 400 محادثة شهريًا وروجعت خمس منها، فإن نسبة التغطية تزيد قليلًا على 1%. وإذا وقع إخفاق جسيم، كتخطّي التحقق من الهوية مثلًا، مرة في كل 200 محادثة، فإن احتمال أن تتضمن عينة من خمس مكالمات حالة واحدة منه يبلغ نحو 2.5%. ونجاح أربع مكالمات من خمس يعطي فترة ثقة 95% (بطريقة Wilson) تتراوح تقريبًا بين 38% و96%. وقد يظل المتوسط على مستوى المركز سليمًا: فنحو 385 محادثة عشوائية تكفي لتقدير نسبة ما بهامش لا يتجاوز خمس نقاط عند مستوى ثقة 95%، أيًا كان حجم المحادثات. أما درجة الموظف الفرد، والحدث النادر، فهما أقرب إلى الضجيج.

كذلك فإن العينات كثيرًا ما لا تُختار عشوائيًا. ففي استطلاع 2022، قال 63% من المسؤولين التنفيذيين إن المعاملات تُختار عشوائيًا، وقال 75% إن مؤسساتهم تحاول ربط درجات الجودة برضا العملاء، أي أن الربع لم يفعل ذلك [2].

المراجعون من البشر يتفقون على الأفعال لا على الانطباعات

الموثوقية بين المقيّمين هي مدى إعطاء شخصين يقيّمان الشيء نفسه الدرجةَ نفسها. وتُعرض عادةً بمعامل كابا (kappa)، الذي يتراوح بين 0 (اتفاق لا يزيد على المصادفة) و1 (اتفاق تام). ويرى تحليل واسع الاستشهاد أن أي قيمة لكابا دون 0.60 غير كافية لاتخاذ القرارات [5]، أما المرجع المعتمد في تحليل المحتوى فيشترط 0.80 للاعتماد على البيانات، و0.67 للخروج باستنتاجات أولية [6].

ويتوقف الاتفاق على ما يحكم عليه المراجعون أكثر بكثير مما يتوقف على هويتهم. ففي دراسة أُجريت عام 2026 شملت 38 ممتحنًا قيّموا 90 طالبًا في التمريض، بلغ الاتفاق على بند "يُجري التسمّع الصدري" كابا 0.95. أما على بند "يُبدي موقفًا متعاطفًا" فبلغ 0.30، أو 0.62 وفق صيغة من المقياس معدّلة لمراعاة ندرة تسجيل غياب هذا السلوك [7]. ووجد تحليل تجميعي شمل 14,650 موظفًا أن تقييمَي مشرفَين اثنين للأداء العام للشخص نفسه ارتبطا بمعامل 0.52، أي أنهما تقاسما نحو نصف التباين في أحكامهما [8]. وفي دراسات الحالة لعام 2002، حصل موظف واحد على ثلاث درجات مختلفة على افتتاحية المكالمة نفسها تمامًا [4].

وقد تكون فائدة اجتماعات المعايرة أقل مما يُشاع عنها. فقد وجدت تجربة شملت 52 من المعلّمين في التعليم الطبي، وُزّع 31 منهم عشوائيًا، أن ورشة لتدريب المقيّمين لم تحسّن الاتفاق ولا الدقة، بل حسّنت ثقة المقيّمين بأنفسهم [9]. وتجد التحليلات التجميعية فعلًا أن التدريب على الإطار المرجعي، الذي يستخدم أمثلة مشتركة لتعليم ما يبدو عليه كل مستوى من مستويات الدرجات، يحسّن الدقة [10]. لكن دراسة امتدت عامين لمقيّمين يراقبون 458 معلمًا وجدت أن الانجراف، أي ميل معيار المراجع إلى التحوّل مع مرور الوقت، كان كبيرًا في البداية ولم يتقارب قط، بل ازداد التباين بين المقيّمين [11]. والقياس المستمر وفق مجموعة مرجعية ثابتة هو الاستجابة التي تشير إليها هذه الأدلة، وإن لم يُختبر هو نفسه في دراسة مضبوطة.

تأتي هذه الأدلة من الطب والتعليم وعلم النفس المهني. ولم نعثر على أي دراسة محكّمة تعرض قيم كابا لبطاقات التقييم في مراكز الاتصال التجارية. وهذه الفجوة بحد ذاتها نتيجة.

النماذج اللغوية في دور المراجع: قوية في الحالات السهلة، ضعيفة حيث يهمّ الأمر

كثيرًا ما يُسمّى النموذج اللغوي المستخدم لتقييم نصوص المحادثات "النموذج اللغوي الحَكَم" (LLM judge). وقد أفادت الدراسة الأكثر استشهادًا بأن GPT-4 اتفق مع المقيّمين من البشر في 85% من الحالات، متجاوزًا نسبة 81% التي اتفق عندها البشر فيما بينهم [12]. لكن هذا الرقم اللافت يحتاج إلى حاشيته. فنسبة 85% تستبعد حالات التعادل والحالات التي غيّر فيها النموذج حكمه حين تبادلت الإجابتان موقعيهما. وبإدراج هذه الحالات، بلغ الاتفاق بين النموذج والبشر 64% إلى 66%، مقابل 63% إلى 67% بين أزواج البشر. وفي مجموعة صعبة عمدًا من 80 زوجًا من الإجابات شبه المتطابقة، أصدر نموذج 2023 حكمًا يتوقف على الترتيب في 35% من الحالات، ويتضاءل هذا الانحياز حين تختلف الإجابتان في الجودة اختلافًا واضحًا [12].

الانحيازات موثّقة وقابلة للقياس:

  • الموقع. أتاحت إعادة ترتيب إجابتين لنموذج أضعف أن "يتفوق" على نموذج أقوى في 66 من أصل 80 حالة اختبار [13].
  • الطول. تأرجح معدل فوز أحد النماذج في اختبار مرجعي قياسي بين 22.9% و64.3% تبعًا فقط لمدى الإسهاب الذي طُلب منه، إلى أن ضُبط الطول إحصائيًا [14].
  • تفضيل الذات. النماذج التي تتعرف على مخرجاتها تمنحها درجات أعلى [15]، والحَكَم المنتمي إلى عائلة النماذج نفسها التي ينتمي إليها النظام الذي يقيّمه يضخّم نتائج ذلك النظام [16].
  • طريقة عرض سلّم التقييم. غيّر عكسُ ترتيب مستويات سلّم التقييم نحو ربع الدرجات التي منحها أحد النماذج المتقدمة، وغيّر إرفاقُ إجابة مرجعية حاصلة على أعلى درجة ما يقارب نصفها [17].
  • نوع البند. في 11 مهمة تصنيف، تراوح اتفاق أحد النماذج مع البشر بين كابا 0.84 وسالب 0.24، وكانت أضعف النتائج في الأحكام المتعلقة بالمحتوى المسيء والسلامة [18]. فالاتفاق خاصية للبند المقيَّم، لا للحَكَم.

أقرب الأدلة إلى تقييم الامتثال اختبار مرجعي صدر عام 2026 يضم 318 حوارًا اصطناعيًا في سياقات الطيران والرعاية الصحية والتأمين، حُقنت فيها مخالفات للقواعد. وقد رصدت أقوى النماذج الحالية ما بين 78% و95% من المخالفات مداخلةً بمداخلة، في حين لم يتجاوز نموذج أقدم 51% إلى 57%. وقد بالغت جميعها في معاقبة المداخلات الملتزمة بالقواعد، بينما فاتتها مخالفات حقيقية، أما النموذج المُدرّب خصيصًا للمهمة فلم يُصب في جميع مداخلات المحادثة إلا في 39% إلى 51% من المحادثات [19].

وللتدابير المخففة آثار مقيسة. فقد رفع تبديل الترتيب وحساب المتوسط اتفاقَ أحد النماذج المقيِّمة مع أغلبية البشر من 53% إلى 63%، ورفعته إحالة أصعب 20% من الحالات إلى البشر إلى 74% [13]. ورفع تفكيك سلّم التقييم إلى أسئلة إجابتها نعم أو لا الاتفاقَ بين الحكّام المختلفين من 0.09 إلى 0.48 [20]. وحقق التقييم في الحالات التي يكون فيها النموذج واثقًا فقط، مع تصعيد البقية، اتفاقًا مع البشر يزيد على 80% في نحو 80% من الحالات [22].

الفحوص الثنائية تشتري الاتساق، لكن شيئًا ما يضيع

تفترض كثير من بطاقات التقييم أن البنود ذات الإجابة نعم أو لا أكثر موثوقية من المقاييس المتدرجة من 1 إلى 5. وبين المقيّمين من البشر، وجدت مراجعة منهجية أُجريت عام 2015 لـ45 دراسة أن الموثوقية بين المقيّمين بلغت 0.81 لقوائم التحقق و0.78 لمقاييس التقدير الشامل، أي لا فرق يُذكر. أما التقديرات الشاملة فكانت أقدر على التعميم من مهمة إلى أخرى، بواقع 0.80 مقابل 0.69 [23]. ووجدت دراسة أُجريت عام 1999 أن الأطباء ذوي الخبرة حصلوا على درجات أدنى من المتدربين في قوائم التحقق الثنائية، بينما حصلوا على أعلى الدرجات في التقديرات الشاملة [24]، والسبب المرجّح أن الخبراء يتخطون خطوات لا يحتاجون إليها. فقوائم التحقق تقيس الاستيفاء. وقد تعاقب المهارة.

أما بالنسبة إلى الحكّام الآليين فالصورة مختلفة. إذ رفع تفكيك سلّم التقييم إلى أسئلة نعم أو لا الاتفاقَ بين اثني عشر نموذجًا حَكَمًا مختلفًا من 0.09 إلى 0.48، ورفع ارتباطها بالحكم البشري بمقدار يتراوح بين 0.01 و0.27 تبعًا للنموذج [20]. كما رفعت قوائم التحقق الاتفاق بين القائمين على التوسيم من البشر، من 0.19 إلى 0.26، في دراسة ذات صلة [21]. وتطلب إرشادات المعيار الرائد في مراكز الاتصال نفسها اعتماد التقييم الثنائي، وتتبّع الأخطاء الحرجة بمعزل عن الدرجة الإجمالية [25].

لماذا المتوسط هو الرقم الخطأ

فريقان يحصل كلاهما على 82. في الأول، تتراوح درجة كل محادثة بين 78 و86. وفي الثاني، تحصل تسع محادثات من كل عشر على 88، وواحدة من كل عشر على 28، لأن التحقق من الهوية تُخطّي فيها. المتوسط واحد، لكن لدى أحد الفريقين إخفاقًا في محادثة من كل عشر يتجه نحو الجهة التنظيمية. وهذا مثال توضيحي من عندنا، لا بيانات، لكن المبدأ من كلاسيكيات الإحصاء: فأربع مجموعات بيانات لها المتوسطات والتباينات والارتباطات نفسها قد تبدو مختلفة تمامًا حين تُرسم بيانيًا [26]، وقد أنتجت ورقة بحثية عام 2017 اثنتي عشرة مجموعة، إحداها على شكل ديناصور [27].

وأطراف التوزيع أهم من وسطه أيضًا في طريقة تذكّر العملاء للمحادثة. فالناس يحكمون على التجربة إلى حد كبير بأسوأ لحظاتها وبنهايتها [28]، وللأحداث السلبية وزن أكبر من الإيجابية في كل المجالات المدروسة تقريبًا [29]. والجهات التنظيمية تفكر بالطريقة نفسها. إذ تُلزم قواعد السلوك في المملكة المتحدة الشركات بمراقبة نتائج اتصالاتها ودعمها، وبتحديد ما إذا كانت "أي فئة من عملاء التجزئة تشهد نتائج مختلفة مقارنةً بفئة أخرى" [30]. وانتقدت مراجعة الجهة التنظيمية لشركات التأمين العتباتِ التي "وُضعت باستخدام متوسطات القطاع دون مسوّغ" [31]، ووجدت مراجعتها لعام 2026 أن "معلومات الإدارة المجمّعة قد تجعل من الأصعب تحديد ما إذا كانت الفئات المختلفة من العملاء ذوي خصائص الهشاشة لديها احتياجات مختلفة أو تواجه عوائق ونتائج مختلفة" [32].

في العربية يكون التقييم الآلي في أضعف حالاته

معظم الأدلة السابقة باللغة الإنجليزية. وبالنسبة إلى العمليات في الخليج، ثمة ثلاث حقائق إضافية مهمة.

تقييم المكالمة يعني تقييم نصها المفرّغ، والتعرّف على الكلام بالأدوات الجاهزة أسوأ بكثير في اللهجة الخليجية منه في العربية الفصحى. ففي اختبار مرجعي للكلام السعودي، بلغ معدل الخطأ في الكلمات لدى أكبر نموذج مفتوح متعدد الأغراض 28% في العربية الفصحى و60% في اللهجة الخليجية، وكان أداء النماذج المضبوطة للعربية أفضل، لكنه ظل أسوأ في اللهجة منه في الفصحى [33]. وفي الكلام الإماراتي القائم على التبديل بين العربية والإنجليزية، أنتجت عائلة النماذج نفسها أخطاء أكثر من عدد الكلمات، بينما بلغ معدل خطئها 12% في المقاطع الإنجليزية الخالصة [34]. والنص المفرّغ الذي تكون فيه كلمة من كل كلمتين خاطئة لا يمكن تقييمه من حيث التعاطف أو تقديم إفصاح إلزامي.

كما أن النماذج اللغوية تحكم على النصوص العربية بجودة أقل من حكمها على الإنجليزية. ففي اختبار مرجعي لأحكام التفضيل يشمل 23 لغة، جاءت العربية في المرتبة الأدنى، بنسبة 62.8% في المتوسط عبر النماذج المختبرة [35]. ووجد الفريق القائم على إحدى لوحات الصدارة العربية أن أفضل نموذج مرشح لدور الحَكَم اتفق مع مقيّم بشري واحد بقيمة كابا 0.46، وكتب أن هذه القيمة "منخفضة نسبيًا لبناء قرار عليها" [36].

كذلك يختلف المقيّمون من البشر أكثر كلما ازداد الكلام اقترابًا من اللهجة العامية، بما في ذلك في الحكم على المشاعر [37]. فالمرجع البشري المستخدم لمعايرة المقيّم الآلي يكون هو نفسه أكثر تشويشًا في اللهجة.

ما تطلبه الجهات التنظيمية في الخليج

في الإمارات، تُلزم معايير حماية المستهلك الصادرة عن مصرف الإمارات العربية المتحدة المركزي المؤسساتِ المالية المرخصة بتوثيق اتصالات متابعة شهرية مع عينة من المستهلكين لرصد أي سلوك غير لائق من الموظفين، وبإجراء عمليات تسوّق خفي منتظمة، وبمراقبة أداء الموظفين في المعاملة العادلة [38]. وهذه المعايير موجهة إلى المؤسسات المالية المرخصة بموجب قانون المصرف المركزي، لذلك فالأجدر بشركة التأمين أن تقرأها نقطةً مرجعية لا التزامًا مباشرًا. أما مدونة قواعد السلوك الخاصة بالتأمين لعام 2010، التي لا تزال سارية في ظل المصرف المركزي، فتشترط البتّ في كل شكوى خلال 15 يومًا، وأن يكون سجل الشكاوى متاحًا للمفتشين [39]. وتطلب إرشادات المصرف المركزي لعام 2026 بشأن الذكاء الاصطناعي، التي تشمل شركات التأمين صراحةً، إجراء اختبارات دورية للتحيز، ومراقبة مستمرة، وإشرافًا بشريًا فعليًا، ومسارًا يتيح للعملاء طلب مراجعة بشرية [40]. وفي المملكة العربية السعودية، بدأت هيئة التأمين أعمالها في نوفمبر 2023، وتظل القواعد السابقة سارية إلى أن تُستبدل [41]، ولم نتمكن من التحقق من أدوات تنظيم السلوك الحالية على موقع رسمي تابع للجهة التنظيمية، لذا لا نصفها هنا.

وخارج المنطقة، يحظر قانون الاتحاد الأوروبي للذكاء الاصطناعي (AI Act) منذ فبراير 2025 استنتاج مشاعر الأشخاص "في مجالي أماكن العمل والمؤسسات التعليمية" [42]، وهو خط فاصل جدير بالملاحظة بين تحليل مشاعر العميل وتحليل مشاعر الموظف.

ما يعنيه ذلك

أخذ العينات لا يُغفل الأنماط على مستوى المركز، فبضع مئات من المحادثات العشوائية تكفي لتقدير المتوسط تقديرًا جيدًا. لكن ما لا تستطيع العينات رؤيته هو الموظف الفرد، والإخفاق النادر، وفئة العملاء التي تحصل على نتيجة مختلفة. وهذه بالضبط هي ما تسأل عنه الجهات التنظيمية.

تقييم كل محادثة يعالج مشكلة التغطية. لكنه لا يعالج المعيار. فالمقيّم الآلي يرث كل نقاط ضعف الاستمارة التي يُعطاها، ويضيف إليها انحيازاته الخاصة، ويرث في العربية أخطاء النص المفرّغ الذي يستند إليه. والفرضية التي انطلقنا منها، أي أن البنود ينبغي أن تكون قابلة للملاحظة، ومعايَرة وفق البشر، ومعروضة في صورة توزيع، تصمد مع ثلاثة تعديلات.

البنود القابلة للملاحظة ضرورية لكنها غير كافية. فالفحوص الثنائية تجعل التقييمات الآلية متسقة وقابلة للتدقيق، وهي الصيغة الصحيحة للأمور غير القابلة للتفاوض: التحقق من الهوية، وتقديم الإفصاح، وعدم الإيحاء بأي قرار بشأن المطالبة. لكنها الصيغة الخطأ لما يتطلب حكمًا تقديريًا، إذ يحتاج ذلك إلى عدد قليل من بنود المقياس المتدرج ذات المستويات المحددة بوضوح، تبقى منفصلة عن الفحوص بدلًا من دمجها في رقم واحد.

للمعايرة وفق البشر سقف. فحيث يتفق المراجعون ذوو الخبرة أنفسهم على بند ما بقيمة كابا دون 0.6، لا ينبغي أن يترتب على أي تقييم آلي لهذا البند أي عواقب على شخص. والمقارنة المفيدة ليست "النموذج مقابل الإنسان"، بل "النموذج مقابل مجموعة ثابتة من المحادثات قيّمها عدة مراجعين، مع القياس المستمر".

يجب تقسيم التوزيعات حسب اللغة والقناة. فمكالمة بلهجة عربية ورسالة بريد إلكتروني بالإنجليزية لا تُقيَّمان بالموثوقية نفسها، وجدول ترتيب واحد يعاقب من يخدم العملاء باللغة الأصعب.

وثمة مفاضلة. فتقييم كل شيء يرفع كثافة المراقبة، وقد وجد استطلاع أُجري عام 2002 على 347 موظفًا في مركزين في المملكة المتحدة أن الكثافة المُدرَكة للمراقبة ترتبط ارتباطًا قويًا بانخفاض الرفاه، وأن هذا الارتباط يتأثر بمدى تحكّم الموظف في عمله وبدعم المشرف [43]. وينبغي أن تخدم التغطيةُ الفريق.

كيف نراعي ذلك في تصميمنا

تُقيَّم كل محادثة، سواء أجراها وكيل أو أحد أعضاء فريقك، والبنود بنودك أنت. ويُكتب المعيار أثناء التنفيذ في قائمتين منفصلتين: فحوص ثنائية للمتطلبات القابلة للملاحظة، ومجموعة صغيرة من بنود الحكم التقديري ذات المستويات المحددة، مع وصف لما يبدو عليه كل مستوى. ولا تُدمج القائمتان أبدًا في نسبة مئوية واحدة.

يرى المقيّم المعيار في صيغة واحدة ثابتة: فالبنود وترتيبها وأوصاف مستوياتها لا تتغير من محادثة إلى أخرى، ولا تُعرض عليه أبدًا إجابة مرجعية مرفقة بدرجة. وكل درجة مصحوبة بمقطع النص الذي تستند إليه، كي يرى المراجع السبب دون إعادة تشغيل المكالمة. والدرجة التي لا سبب لها تُعامل على أنها خلل.

تُعرض الدرجات في صورة توزيع وفق معيارك، مع ذكر نسبة ما يقع دونه أولًا، ومقسّمة حسب اللغة والقناة وسبب التواصل. ويوسم تصنيفُ سبب التواصل كلَّ محادثة وفق مجموعة فئات تحددها أنت، كي يمكن ردّ أي طرف من أطراف التوزيع إلى ما كان العملاء يسألون عنه. ويسجّل تصنيف النتيجة ما إذا كانت كل محادثة قد حُلّت أو لم تُحل أو صُعّدت، ما يمنح التقييم أداة تحقق مستقلة: فالدرجة المرتفعة لمحادثة لم تُحل سؤال، لا نتيجة.

يفحص رصد الامتثال المحادثات وفق قواعد تضبطها أنت، ويضع إشارة على المحادثات التي قيل فيها ما لا ينبغي قوله. والإشارة إحالة إلى قائمة مراجعة لدى موظف، لا حكم نهائي. ونظرًا إلى أن النماذج كثيرًا ما تبالغ في معاقبة المداخلات الملتزمة وتفوتها مخالفات حقيقية، فإن هذه القائمة مصممة لتُراجَع، وتعود نتائج المراجعة لتغذّي البنود.

يقيّم تحليل المشاعر شعور العميل تجاه التفاعل. ويُطبَّق على العميل، لا على فريقك، ويُعرض منفصلًا عن الجودة، لأن العميل قد يكون غير راضٍ عن إجابة كانت صحيحة ومكتملة.

تُبرز رؤى التوجيه لقادة فرقك أنماطًا من المحادثات ذات الدرجات المرتفعة والمنخفضة: أين يجد الموظفون المحادثات صعبة، وكيف يبدو الأداء الجيد في عملياتك أنت، وفق المعيار الذي وضعته. وهي موجودة لدعم الأشخاص الذين يتولون المحادثات التي تحتاج إلى موظف.

يُعايَر التقييم وفق مجموعة ثابتة من محادثاتك قيّمها مراجعوك، لكل من العربية والإنجليزية على حدة. ونعرض الاتفاق لكل بند، لا لكل بطاقة تقييم، ونقول بوضوح أي البنود تقع دون العتبة اللازمة للتقييم الآلي. وحين تكون ثقة التعرّف على الكلام في مكالمة ما منخفضة، تُحجب الدرجة وتُحال المكالمة إلى موظف.

ما لا نعرفه بعد

لا توجد دراسة منشورة تقيس كيف تُضعف أخطاء التفريغ اتفاقَ النموذج اللغوي مع المراجعين من البشر على المحادثات نفسها. فكل من الأثرين موثّق على حدة، أما اجتماعهما فلا.

لا توجد دراسة منشورة تقيس الاتفاق بين النماذج اللغوية والمقيّمين من البشر على محادثات خدمة العملاء باللغة العربية. وأقرب الأدلة تأتي من اختبارات مرجعية عامة الأغراض.

لا توجد دراسة منشورة تعرض قيم كابا لبطاقات التقييم في مراكز الاتصال التجارية. والأدلة على اتفاق البشر مستعارة من الطب والتعليم وعلم النفس المهني، وقد ذكرنا ذلك حيثما وردت.

لم يُختبر في دراسة مضبوطة ما إذا كان القياس المستمر وفق مجموعة مرجعية يمنع الانجراف في بيئة التشغيل الفعلية، لا أن يرصده فحسب.

أما رقم التغطية الذي يردده القطاع منذ ما يقارب عشرين عامًا، فلم يُقَس قط، على حد ما وجدنا. وإن استشهدت برقم، فاحسبه من أحجام محادثاتك أنت.

المصادر

  1. 1.ICMI, Discover why contact center quality doesn't measure up, and what you can do about it, whitepaper, c. 2008. Unsourced industry estimate.⁠https://www.icmi.com/~/media/files/resources/whitepapers/quality-whitepaper.ashx
  2. 2.COPC Inc., Global Benchmarking Series 2022: Contact Center Quality Assurance, survey of more than 900 executives, fieldwork September to December 2021, pp. 11, 21 and 37. Secondary, self-reported.⁠https://cx.copc.com/hubfs/Global%20Benchmarking%20Series%202022_Contact%20Center%20Quality%20Assurance.pdf
  3. 3.Call Centre Helper, Poll: how many calls do you monitor per agent per month?, webinar poll, n=115, March 2013. Secondary.⁠https://www.callcentrehelper.com/poll-how-many-calls-do-you-monitor-per-agent-per-month-43247.htm
  4. 4.Bain, P., Watson, A., Mulvey, G., Taylor, P. and Gall, G., Taylorism, targets and the pursuit of quantity and quality by call centre management, New Technology, Work and Employment 17(3), 2002 (page references are to the open-access manuscript, pp. 10 to 15).⁠https://strathprints.strath.ac.uk/4165/6/strathprints004165.pdf
  5. 5.McHugh, M.L., Interrater reliability: the kappa statistic, Biochemia Medica 22(3), 2012.⁠https://biochemia-medica.com/en/journal/22/3/10.11613/BM.2012.031/fullArticle
  6. 6.Krippendorff, K., Reliability in content analysis: some common misconceptions and recommendations, Human Communication Research 30(3), 2004. Foundational.⁠https://www.academia.edu/21851693/
  7. 7.Yayama et al., inter-rater agreement in a nursing OSCE, Sage Open Nursing, 2026 (90 students, 38 examiners).⁠https://journals.sagepub.com/doi/10.1177/23779608261417794
  8. 8.Viswesvaran, C., Ones, D.S. and Schmidt, F.L., Comparative analysis of the reliability of job performance ratings, Journal of Applied Psychology 81(5), 1996 (N=14,650). Foundational.⁠https://www.academia.edu/20224570/
  9. 9.Cook, D.A. et al., Effect of rater training on reliability and accuracy of mini-CEX scores: a randomized, controlled trial, Journal of General Internal Medicine, 2009 (52 preceptors, 31 randomised).⁠https://link.springer.com/article/10.1007/s11606-008-0842-3
  10. 10.Roch, S.G., Woehr, D.J., Mishra, V. and Kieszczynska, U., Rater training revisited: an updated meta-analytic review of frame-of-reference training, Journal of Occupational and Organizational Psychology 85(2), 2012.⁠https://researchconnect.suny.edu/en/publications/rater-training-revisited-an-updated-meta-analytic-review-of-frame/
  11. 11.Casabianca, J.M., Lockwood, J.R. and McCaffrey, D.F., Trends in classroom observation scores, Educational and Psychological Measurement, 2015 (observations of 458 teachers over two years).⁠https://journals.sagepub.com/doi/10.1177/0013164414539163
  12. 12.Zheng, L. et al., Judging LLM-as-a-judge with MT-Bench and Chatbot Arena, NeurIPS 2023, Tables 2, 5 and 6.⁠https://arxiv.org/abs/2306.05685
  13. 13.Wang, P. et al., Large language models are not fair evaluators, 2023, abstract and Table 4.⁠https://arxiv.org/abs/2305.17926
  14. 14.Dubois, Y. et al., Length-controlled AlpacaEval: a simple way to debias automatic evaluators, 2024, Figure 3.⁠https://arxiv.org/abs/2404.04475
  15. 15.Panickssery, A., Bowman, S.R. and Feng, S., LLM evaluators recognize and favor their own generations, 2024.⁠https://arxiv.org/abs/2404.13076
  16. 16.Li, D. et al., Preference leakage: a contamination problem in LLM-as-a-judge, ICLR 2026.⁠https://arxiv.org/abs/2502.01534
  17. 17.Li et al. (Ant Group), Evaluating scoring bias in LLM-as-a-judge, 2025, Table 3.⁠https://arxiv.org/abs/2506.22316
  18. 18.Bavaresco, A. et al., LLMs instead of human judges? A large scale empirical study across 20 NLP evaluation tasks, ACL 2025, Table 1 (Cohen's kappa for GPT-4o on the 11 categorical datasets).⁠https://arxiv.org/abs/2406.18403
  19. 19.Yang et al., CompliBench: benchmarking LLM judges for compliance violation detection in dialogue systems, 2026, Table 1 and Figure 6.⁠https://arxiv.org/abs/2604.12312
  20. 20.Lee et al., CheckEval, EMNLP 2025, Tables 1 and 2.⁠https://arxiv.org/abs/2403.18771
  21. 21.Cook, J. et al., TICK: targeted instruct-evaluation with checklists, 2024, Tables 4 and 6.⁠https://arxiv.org/abs/2410.03608
  22. 22.Jung, J., Brahman, F. and Choi, Y., Trust or escalate: LLM judges with provable guarantees for human agreement, 2024.⁠https://arxiv.org/abs/2407.18370
  23. 23.Ilgen, J.S. et al., A systematic review of validity evidence for checklists versus global rating scales in simulation-based assessment, Medical Education 49(2), 2015 (45 studies).⁠https://pubmed.ncbi.nlm.nih.gov/25626747/
  24. 24.Hodges, B., Regehr, G., McNaughton, N., Tiberius, R. and Hanson, M., OSCE checklists do not capture increasing levels of expertise, Academic Medicine, 1999. Foundational.⁠https://pubmed.ncbi.nlm.nih.gov/10536636/
  25. 25.COPC Inc., What are the guidelines for QA form design and attributes?, 2024, and Measure quality using three metrics instead of one overall score, 2016. Secondary, practitioner guidance.⁠https://www.copc.com/clearly-cx/what-are-the-guidelines-for-qa-form-design-and-attributes/
  26. 26.Anscombe, F.J., Graphs in statistical analysis, The American Statistician 27(1), 1973. Foundational.⁠https://www.tandfonline.com/doi/abs/10.1080/00031305.1973.10478966
  27. 27.Matejka, J. and Fitzmaurice, G., Same stats, different graphs, CHI 2017.⁠https://www.research.autodesk.com/publications/same-stats-different-graphs/
  28. 28.Kahneman, D., Fredrickson, B.L., Schreiber, C.A. and Redelmeier, D.A., When more pain is preferred to less, Psychological Science 4(6), 1993. Foundational.⁠https://journals.sagepub.com/doi/10.1111/j.1467-9280.1993.tb00589.x
  29. 29.Baumeister, R.F., Bratslavsky, E., Finkenauer, C. and Vohs, K.D., Bad is stronger than good, Review of General Psychology 5(4), 2001. Foundational.⁠https://journals.sagepub.com/doi/abs/10.1037/1089-2680.5.4.323
  30. 30.Financial Conduct Authority, Handbook PRIN 2A.9.8R, 2A.9.10R and 2A.9.11R, in force from 31 July 2023.⁠https://handbook.fca.org.uk/handbook/prin2a/prin2as9
  31. 31.Financial Conduct Authority, Insurance multi-firm review of outcomes monitoring under the Consumer Duty, 26 June 2024.⁠https://www.fca.org.uk/publications/multi-firm-reviews/insurance-multi-firm-review-outcomes-monitoring-under-consumer-duty
  32. 32.Financial Conduct Authority, Outcomes monitoring: good practice and areas for improvement, 2026.⁠https://www.fca.org.uk/publications/good-and-poor-practice/outcomes-monitoring-good-practice-and-areas-improvement
  33. 33.ELM Company, Open universal Arabic ASR leaderboard, 2024, Tables 1 and 3 (Whisper-large-v3, zero-shot, on the SADA dataset). Industry technical report.⁠https://arxiv.org/abs/2412.13788
  34. 34.Al Ali, M. and Aldarmaki, H., Mixat: a data set of bilingual Emirati-English speech, SIGUL 2024, Table 3 (Whisper medium, zero-shot).⁠https://arxiv.org/abs/2405.02578
  35. 35.Gureja, S. et al., M-RewardBench: evaluating reward models in multilingual settings, ACL 2025.⁠https://arxiv.org/abs/2410.15522
  36. 36.Inception and MBZUAI, AraGen leaderboard and 3C3H, Hugging Face, December 2024. Lab technical write-up, sample size not disclosed.⁠https://huggingface.co/blog/leaderboard-3c3h-aragen
  37. 37.Keleg, A. and Magdy, W., on annotator agreement and Arabic level of dialectness, 2024.⁠https://arxiv.org/abs/2405.11282
  38. 38.Central Bank of the UAE, Consumer Protection Standards, Notice 1158/2021, Articles 4.1.1.8, 4.1.1.9 and 5.2.2.4.⁠https://rulebook.centralbank.ae/en/rulebook/consumer-protection-standards
  39. 39.Insurance Authority Board Resolution No. 3 of 2010, Instructions concerning the code of conduct and ethics, Article 10, in force under the Central Bank of the UAE.⁠https://rulebook.centralbank.ae/en/rulebook/insurance-authority-board-resolution-no-3-2010-instructions-concerning-code-conduct-and
  40. 40.Central Bank of the UAE, Guidance note on the consumer protection and responsible adoption and use of AI and ML by licensed financial institutions, 2026.⁠https://rulebook.centralbank.ae/en/rulebook/guidance-note-consumer-protection-and-responsible-adoption-and-use-artificial-intelligence
  41. 41.Saudi Press Agency, The Insurance Authority officially commences its operations, 23 November 2023.⁠https://www.spa.gov.sa/en/N2002759
  42. 42.Regulation (EU) 2024/1689 (AI Act), Article 5(1)(f) and Recital 44.⁠https://ai-act-service-desk.ec.europa.eu/en/ai-act/article-5
  43. 43.Holman, D., Chissick, C. and Totterdell, P., The effects of performance monitoring on emotional labor and well-being in call centers, Motivation and Emotion, 2002 (n=347).⁠https://link.springer.com/article/10.1023/A:1015194108376

احصل على الأبحاث الجديدة فور نشرها

رسائل بريد إلكتروني متباعدة عند النشر.

اشترك

اقرأ أيضًا