ہر گفتگو کو کاروبار کے لکھے ہوئے معیار کے مطابق اسکور دینا
زیادہ تر کانٹیکٹ سینٹرز ہر ماہ فی نمائندہ چند گفتگو سن کر کوالٹی کا اندازہ لگاتے ہیں، اور ہمیں اس بات کا کوئی ناپا ہوا عدد نہیں مل سکا کہ یہ نمونہ کتنا چھوٹا ہے۔ یہ مضمون بتاتا ہے کہ اس کے بجائے ہر گفتگو کو اسکور دینے کے بارے میں شواہد کیا کہتے ہیں: خودکار اسکورنگ پر کہاں بھروسہ کیا جا سکتا ہے، کہاں نہیں، اور کسی معیار کو کیسا ہونا لازمی ہے تاکہ اس کے مطابق دیا گیا اسکور کوئی معنی رکھے۔
اس صفحے پر
صورتحال
ایک موٹر انشورنس کمپنی میں کلیمز کے سربراہ کی ٹیم ہر ماہ دسیوں ہزار گفتگو کرتی ہے۔ چھ جائزہ کار فی نمائندہ چند کالز سنتے ہیں، انہیں ایک فارم پر اسکور دیتے ہیں، اور ہر سہ ماہی میں کیلیبریشن میٹنگ کرتے ہیں، یعنی اسکورنگ کو ہم آہنگ کرنے کی میٹنگ۔ کوالٹی اسکور 84 فیصد ہے، اور ایک سال سے یہی ہے۔
پھر ایک شکایت ریگولیٹر تک پہنچتی ہے۔ ایک کسٹمر کہتا ہے کہ کسی نے اسے نہیں بتایا کہ پولیس رپورٹ میں دوسرے ڈرائیور کو قصوروار ٹھہرایا گیا تھا، اس لیے وہ تین ہفتے غلط انشورنس کمپنی کے پیچھے بھاگتا رہا۔ ریگولیٹر پوچھتا ہے کہ اسے کیا بتایا گیا تھا، اور کب۔ جواب دینے میں دو دن لگتے ہیں، کیونکہ کسی کو ریکارڈنگ تلاش کر کے سننی پڑتی ہے۔ کوئی نہیں بتا سکتا کہ آیا کسی اور کے ساتھ بھی ایسا ہوا، کیونکہ اس ہفتے اس نمائندے کی باقی 99 گفتگو کا کبھی جائزہ نہیں لیا گیا۔
اسکور حقیقی ہے۔ لیکن یہ ایک ایسے نمونے کو بیان کرتا ہے جسے کسی نے سوچ سمجھ کر منتخب نہیں کیا، ایک ایسے فارم کے مطابق جسے کسی نے جانچا نہیں، اور اس کا خلاصہ ایک ایسی اوسط کی صورت میں کیا جاتا ہے جو ان گفتگو کو چھپا دیتی ہے جو ریگولیٹر تک پہنچتی ہیں۔
شواہد کیا بتاتے ہیں
کوئی نہیں جانتا کہ نمونہ کتنا چھوٹا ہے
پوری صنعت میں دہرایا جانے والا عدد یہ ہے کہ کانٹیکٹ سینٹرز ایک سے دو فیصد گفتگو کا جائزہ لیتے ہیں۔ ہمیں اس کا کوئی ایسا ماخذ نہیں مل سکا جو پیمائش پر مبنی ہو۔ اس کا سب سے پرانا قابل سراغ ذکر تقریباً 2008 کے ایک صنعتی ادارے کے وائٹ پیپر میں ایک ایسا جملہ ہے جس کا کوئی ماخذ نہیں دیا گیا [1]۔ اس کے بعد سے پیشہ ور افراد کے بڑے سرویز میں، جن میں 2022 میں 900 سے زیادہ ایگزیکٹوز کا ایک سروے بھی شامل ہے، کبھی یہ نہیں پوچھا گیا کہ گفتگو کے کتنے تناسب کا جائزہ لیا جاتا ہے [2]۔
جس چیز کی پیمائش ہوتی ہے وہ فی نمائندہ جائزوں کی تعداد ہے۔ کانٹیکٹ سینٹر کے 115 پیشہ ور افراد کے 2013 کے ایک پول میں پایا گیا کہ دو تہائی ہر ماہ فی نمائندہ چھ یا اس سے کم کالز کا جائزہ لیتے تھے [3]۔ 2002 میں اسکاٹ لینڈ کے چار سینٹرز کی ہم مرتبہ جائزہ شدہ کیس اسٹڈیز میں یہ تعداد ماہانہ دو سے تقریباً آٹھ کے درمیان پائی گئی [4]۔ یہ شواہد ثانوی اور پرانے ہیں، لیکن بیس سال سے ایک ہی سمت میں اشارہ کر رہے ہیں۔
اس کے بعد کا حساب ہمارا ہے۔ اگر کوئی نمائندہ ماہانہ 400 گفتگو سنبھالتا ہے اور ان میں سے پانچ کا جائزہ لیا جاتا ہے، تو جائزے کا احاطہ ایک فیصد سے کچھ زیادہ ہے۔ اگر کوئی سنگین کوتاہی، مثلاً شناخت کی جانچ چھوڑ دینا، 200 میں سے ایک گفتگو میں ہوتی ہے، تو اس بات کا امکان کہ پانچ کالز کے نمونے میں ایسی ایک گفتگو شامل ہو، تقریباً 2.5 فیصد ہے۔ پانچ میں سے چار کالز کامیاب ہوں تو 95 فیصد اعتماد کا وقفہ (confidence interval، Wilson طریقہ) تقریباً 38 سے 96 فیصد بنتا ہے۔ پورے سینٹر کی اوسط پھر بھی ٹھیک ہو سکتی ہے: بلا ترتیب منتخب کی گئی تقریباً 385 گفتگو، حجم چاہے کتنا ہی ہو، 95 فیصد اعتماد کے ساتھ کسی تناسب کا اندازہ پانچ پوائنٹس کے اندر لگا دیتی ہیں۔ فی نمائندہ اسکور، اور کبھی کبھار ہونے والا واقعہ، تقریباً محض شور (noise) ہیں۔
نمونوں کا انتخاب بھی اکثر بلا ترتیب نہیں ہوتا۔ 2022 کے سروے میں 63 فیصد ایگزیکٹوز نے کہا کہ ٹرانزیکشنز بلا ترتیب منتخب کی جاتی تھیں، اور 75 فیصد نے کہا کہ ان کا ادارہ کوالٹی اسکورز کو کسٹمر کے اطمینان سے جوڑنے کی کوشش کرتا تھا، یعنی ایک چوتھائی ایسا نہیں کرتے تھے [2]۔
انسانی جائزہ کار عمل پر متفق ہوتے ہیں، تاثرات پر نہیں
جائزہ کاروں کے درمیان مطابقت (inter-rater reliability) سے مراد یہ ہے کہ ایک ہی چیز کو اسکور دینے والے دو افراد کس حد تک ایک جیسا اسکور دیتے ہیں۔ عام طور پر اسے کاپا (kappa) کی صورت میں بیان کیا جاتا ہے، جو 0 (ایسی مطابقت جو محض اتفاق سے بہتر نہ ہو) سے 1 (مکمل مطابقت) تک ہوتا ہے۔ ایک کثرت سے حوالہ دیا جانے والا تجزیہ کہتا ہے کہ 0.60 سے کم کوئی بھی کاپا فیصلوں کے لیے ناکافی ہے [5]؛ مواد کے تجزیے (content analysis) کا معیاری حوالہ ڈیٹا پر انحصار کے لیے 0.80 اور عارضی نتائج کے لیے 0.67 کا تقاضا کرتا ہے [6]۔
مطابقت کا انحصار اس پر کہیں زیادہ ہوتا ہے کہ جائزہ کار کس چیز کو پرکھ رہے ہیں، بجائے اس کے کہ وہ کون ہیں۔ 2026 کی ایک تحقیق میں، جس میں 38 ممتحن نرسنگ کے 90 طلبہ کو اسکور دے رہے تھے، "اسٹیتھوسکوپ سے سینے کا معائنہ کرتا ہے" پر مطابقت کاپا 0.95 تھی۔ "ہمدردانہ رویہ ظاہر کرتا ہے" پر یہ 0.30 تھی، یا اس شماریاتی پیمانے کی ایک ایسی شکل میں 0.62، جسے اس لحاظ سے ایڈجسٹ کیا گیا کہ یہ رویہ کتنی کم بار غیر موجود درج کیا گیا [7]۔ 14,650 ملازمین پر مشتمل ایک میٹا اینالیسس (meta-analysis) میں پایا گیا کہ ایک ہی فرد کی مجموعی کارکردگی کی درجہ بندی کرنے والے دو سپروائزرز کے درمیان ارتباط 0.52 تھا، یعنی ان کے فیصلوں کا تقریباً نصف تغیر (variance) مشترک تھا [8]۔ 2002 کی کیس اسٹڈیز میں ایک نمائندے کو کال کے بالکل ایک ہی آغاز پر تین مختلف نمبر ملے [4]۔
کیلیبریشن میٹنگز شاید اتنی مؤثر نہ ہوں جتنی ان کی شہرت ہے۔ 52 طبی اساتذہ پر ایک تجربے میں، جن میں سے 31 کو بلا ترتیب گروپوں میں تقسیم کیا گیا، پایا گیا کہ جائزہ کاروں کی تربیتی ورکشاپ سے نہ مطابقت بہتر ہوئی نہ درستگی؛ اس سے جائزہ کاروں کا اعتماد بڑھا [9]۔ میٹا اینالیسس سے یہ ضرور معلوم ہوتا ہے کہ فریم آف ریفرنس تربیت (frame-of-reference training)، جس میں مشترکہ مثالوں کے ذریعے سکھایا جاتا ہے کہ اسکور کی ہر سطح کیسی ہوتی ہے، درستگی بہتر کرتی ہے [10]۔ لیکن 458 اساتذہ کا مشاہدہ کرنے والے جائزہ کاروں کی دو سالہ تحقیق میں پایا گیا کہ بتدریج انحراف (drift)، یعنی وقت کے ساتھ جائزہ کار کے معیار کے بدلتے جانے کا رجحان، آغاز میں زیادہ تھا اور کبھی ایک نقطے پر نہیں آیا؛ جائزہ کاروں کے درمیان فرق بڑھتا گیا [11]۔ یہ شواہد جس حل کی طرف اشارہ کرتے ہیں وہ ایک مقررہ حوالہ سیٹ کے مقابلے میں مسلسل پیمائش ہے، اگرچہ اس طریقے کو خود کسی کنٹرولڈ تحقیق میں نہیں آزمایا گیا۔
یہ شواہد طب، تعلیم اور کام کی جگہ سے متعلق نفسیات سے لیے گئے ہیں۔ ہمیں کوئی ہم مرتبہ جائزہ شدہ تحقیق نہیں مل سکی جو تجارتی کانٹیکٹ سینٹرز کے اسکور کارڈز کے لیے کاپا بیان کرتی ہو۔ یہ خلا بذات خود ایک نتیجہ ہے۔
لسانی ماڈلز بطور جائزہ کار: آسان معاملات میں مضبوط، اہم جگہوں پر کمزور
تحریری نقول کو اسکور دینے کے لیے استعمال ہونے والے لسانی ماڈل کو اکثر "LLM جج" کہا جاتا ہے۔ سب سے زیادہ حوالہ دی جانے والی تحقیق نے بتایا کہ GPT-4 کی انسانی جائزہ کاروں سے مطابقت 85 فیصد رہی، جو انسانوں کی آپس میں 81 فیصد مطابقت سے زیادہ ہے [12]۔ اس نمایاں عدد کے ساتھ ایک وضاحت ضروری ہے۔ 85 فیصد کے عدد میں برابری والے نتائج اور وہ معاملات شامل نہیں جن میں دونوں جوابات کی ترتیب بدلنے پر ماڈل نے اپنا فیصلہ بدل دیا۔ انہیں شامل کرنے پر ماڈل اور انسان کی مطابقت 64 سے 66 فیصد رہی، جبکہ انسانی جوڑوں کی 63 سے 67 فیصد۔ تقریباً ایک جیسے جوابات کے 80 جوڑوں پر مشتمل ایک جان بوجھ کر مشکل بنائے گئے سیٹ پر، 2023 کے ماڈل نے 35 فیصد مواقع پر ایسا فیصلہ دیا جو جوابات کی ترتیب پر منحصر تھا؛ جب دونوں جوابات کی کوالٹی میں واضح فرق ہو تو یہ جھکاؤ کم ہو جاتا ہے [12]۔
یہ جھکاؤ دستاویزی ہیں اور ان کی پیمائش کی جا سکتی ہے:
- ترتیب۔ دو جوابات کی ترتیب بدلنے سے 80 میں سے 66 ٹیسٹ کیسز میں کمزور ماڈل نے مضبوط ماڈل کو "ہرا" دیا [13]۔
- طوالت۔ ایک معیاری بینچ مارک پر ایک ماڈل کی جیت کی شرح صرف اس بنیاد پر 22.9 سے 64.3 فیصد کے درمیان بدلتی رہی کہ اسے کتنی تفصیل سے لکھنے کو کہا گیا، جب تک کہ طوالت کو شماریاتی طور پر کنٹرول نہیں کیا گیا [14]۔
- خود کو ترجیح۔ جو ماڈلز اپنا تیار کردہ مواد پہچان لیتے ہیں وہ اسے زیادہ اسکور دیتے ہیں [15]، اور جو جج اسی ماڈل فیملی سے ہو جس سے وہ سسٹم ہے جسے وہ اسکور دے رہا ہے، وہ اس سسٹم کے نتائج کو بڑھا چڑھا کر پیش کرتا ہے [16]۔
- روبرک کی پیشکش۔ روبرک (اسکورنگ کا رہنما خاکہ) کی سطحوں کی ترتیب الٹنے سے صف اول کے ایک ماڈل (frontier model) کے تقریباً ایک چوتھائی اسکورز بدل گئے؛ سب سے زیادہ اسکور والا حوالہ جواب ساتھ لگانے سے تقریباً نصف بدل گئے [17]۔
- نکتے کی نوعیت۔ درجہ بندی کے 11 کاموں میں ایک ماڈل کی انسانوں سے مطابقت کاپا 0.84 سے لے کر منفی 0.24 تک رہی، اور سب سے کمزور نتائج زہریلے مواد (toxicity) اور حفاظت سے متعلق فیصلوں پر آئے [18]۔ مطابقت نکتے کی خصوصیت ہے، جج کی نہیں۔
تعمیل کی اسکورنگ کے قریب ترین شواہد 2026 کے ایک بینچ مارک سے ملتے ہیں جس میں ایئر لائن، صحت اور انشورنس کے ماحول میں 318 مصنوعی مکالمے شامل ہیں، جن میں جان بوجھ کر قواعد کی خلاف ورزیاں ڈالی گئیں۔ موجودہ سب سے مضبوط ماڈلز نے ہر باری کی سطح پر 78 سے 95 فیصد خلاف ورزیوں کی نشاندہی کی، جبکہ ایک پرانا ماڈل 51 سے 57 فیصد تک ہی پہنچ سکا۔ ان سب نے قواعد کے مطابق باریوں کو ضرورت سے زیادہ غلط قرار دیا اور ساتھ ہی حقیقی خلاف ورزیاں نظرانداز کیں، اور اس کام کے لیے خاص طور پر تربیت یافتہ (fine-tuned) ایک ماڈل صرف 39 سے 51 فیصد گفتگو میں ہر باری کو درست جانچ سکا [19]۔
ان مسائل کو کم کرنے کے طریقوں کے اثرات ناپے گئے ہیں۔ ترتیب بدل کر اوسط نکالنے سے ایک خودکار جائزہ کار کی انسانی اکثریت سے مطابقت 53 سے بڑھ کر 63 فیصد ہو گئی؛ سب سے مشکل 20 فیصد معاملات انسانوں کو بھیجنے سے یہ 74 تک پہنچ گئی [13]۔ روبرک کو ہاں یا نہیں والے سوالات میں تقسیم کرنے سے مختلف ججز کے درمیان مطابقت 0.09 سے بڑھ کر 0.48 ہو گئی [20]۔ صرف وہاں اسکور دینے سے جہاں ماڈل پراعتماد ہو، اور باقی معاملات ایسکلیٹ کر دینے سے، تقریباً 80 فیصد معاملات پر انسانوں سے 80 فیصد سے زیادہ مطابقت حاصل ہوئی [22]۔
ہاں یا نہیں والی جانچ سے یکسانیت ملتی ہے، اور کچھ کھو بھی جاتا ہے
بہت سے اسکور کارڈز یہ فرض کرتے ہیں کہ ہاں یا نہیں والے نکات 1 سے 5 تک کے پیمانوں سے زیادہ قابل اعتماد ہیں۔ انسانی جائزہ کاروں کے معاملے میں، 45 تحقیقات کے 2015 کے ایک منظم جائزے (systematic review) میں جائزہ کاروں کے درمیان مطابقت چیک لسٹس کے لیے 0.81 اور مجموعی درجہ بندی کے پیمانوں (global rating scales) کے لیے 0.78 پائی گئی: کوئی قابل ذکر فرق نہیں۔ مجموعی درجہ بندیاں ایک کام سے دوسرے کام پر بہتر طور پر لاگو ہوئیں، 0.80 بمقابلہ 0.69 [23]۔ 1999 کی ایک تحقیق میں پایا گیا کہ تجربہ کار معالجین نے ہاں یا نہیں والی چیک لسٹس پر زیر تربیت معالجین سے کم اسکور حاصل کیا، جبکہ مجموعی درجہ بندیوں پر سب سے زیادہ اسکور حاصل کیا [24]؛ غالباً اس کی وجہ یہ ہے کہ ماہرین وہ مراحل چھوڑ دیتے ہیں جن کی انہیں ضرورت نہیں ہوتی۔ چیک لسٹس جامعیت کو ناپتی ہیں۔ یہ مہارت کو سزا دے سکتی ہیں۔
خودکار ججز کے لیے تصویر مختلف ہے۔ روبرک کو ہاں یا نہیں والے سوالات میں تقسیم کرنے سے بارہ مختلف جج ماڈلز کے درمیان مطابقت 0.09 سے بڑھ کر 0.48 ہو گئی، اور انسانی فیصلے سے ان کے ارتباط میں، ماڈل کے لحاظ سے، 0.01 سے 0.27 تک کا اضافہ ہوا [20]۔ ایک متعلقہ تحقیق میں چیک لسٹس سے انسانی جائزہ کاروں (annotators) کے درمیان مطابقت بھی 0.19 سے بڑھ کر 0.26 ہو گئی [21]۔ کانٹیکٹ سینٹرز کے سرکردہ معیار کی اپنی رہنمائی ہاں یا نہیں والی اسکورنگ کا تقاضا کرتی ہے، اور اس بات کا کہ سنگین غلطیوں کو مجموعی اسکور سے الگ ٹریک کیا جائے [25]۔
اوسط غلط عدد کیوں ہے
دو ٹیمیں ہیں، دونوں کا اسکور 82 ہے۔ پہلی ٹیم میں ہر گفتگو کا اسکور 78 اور 86 کے درمیان ہے۔ دوسری ٹیم میں دس میں سے نو گفتگو کا اسکور 88 ہے اور دس میں سے ایک کا 28، کیونکہ اس میں شناخت کی جانچ چھوڑ دی گئی۔ اوسط ایک جیسی ہے؛ ایک ٹیم میں دس میں سے ایک ایسی ناکامی ہے جس کا رخ ریگولیٹر کی طرف ہے۔ یہ ہماری دی گئی مثال ہے، ڈیٹا نہیں، لیکن یہ اصول شماریات کی ایک کلاسیکی مثال ہے: ایک جیسی اوسط، تغیر (variance) اور ارتباط والے چار ڈیٹا سیٹس گراف پر بالکل مختلف نظر آ سکتے ہیں [26]، اور 2017 کے ایک مقالے میں بارہ ایسے ڈیٹا سیٹس تیار کیے گئے، جن میں سے ایک کی شکل ڈائنوسار جیسی تھی [27]۔
کسٹمرز کسی گفتگو کو کیسے یاد رکھتے ہیں، اس کے لیے بھی انتہائی سرے (tails) درمیان سے زیادہ اہمیت رکھتے ہیں۔ لوگ کسی تجربے کو زیادہ تر اس کے بدترین لمحے اور اس کے اختتام سے پرکھتے ہیں [28]، اور تحقیق کیے گئے تقریباً ہر میدان میں منفی واقعات مثبت واقعات سے زیادہ وزن رکھتے ہیں [29]۔ ریگولیٹرز بھی اسی طرح سوچتے ہیں۔ برطانیہ کے طرز عمل کے قواعد (conduct rules) فرموں کے لیے ضروری قرار دیتے ہیں کہ وہ اپنے رابطوں اور سپورٹ کے نتائج کی نگرانی کریں اور یہ پہچانیں کہ آیا "ریٹیل کسٹمرز کا کوئی گروپ کسی دوسرے گروپ کے مقابلے میں مختلف نتائج کا سامنا کر رہا ہے" [30]۔ انشورنس کمپنیوں کے بارے میں ریگولیٹر کے جائزے نے ان سطحوں (thresholds) پر تنقید کی جو "بغیر کسی جواز کے صنعت کی اوسط استعمال کر کے طے کی گئیں" [31]، اور اس کے 2026 کے جائزے میں پایا گیا کہ "مجموعی انتظامی معلومات (MI) سے یہ پہچاننا مشکل ہو سکتا ہے کہ آیا نازک حالات کی علامات رکھنے والے کسٹمرز کے مختلف گروپوں کی ضروریات مختلف ہیں یا انہیں مختلف رکاوٹوں اور نتائج کا سامنا ہے" [32]۔
خودکار اسکورنگ عربی میں سب سے کمزور ہے
اوپر بیان کیے گئے زیادہ تر شواہد انگریزی زبان سے متعلق ہیں۔ خلیجی آپریشنز کے لیے تین مزید حقائق اہم ہیں۔
کسی کال کو اسکور دینے کا مطلب اس کی تحریری نقل کو اسکور دینا ہے، اور بازار میں تیار دستیاب گفتار کی شناخت خلیجی بولی کے لیے جدید معیاری عربی کے مقابلے میں کہیں زیادہ خراب ہے۔ سعودی گفتار کے ایک بینچ مارک پر، عمومی استعمال کے سب سے بڑے اوپن ماڈل کی الفاظ میں غلطی کی شرح جدید معیاری عربی (MSA) پر 28 فیصد اور خلیجی (Khaliji) بولی پر 60 فیصد تھی؛ عربی کے لیے خاص طور پر تیار کیے گئے ماڈلز کی کارکردگی بہتر رہی، لیکن ان کی کارکردگی بھی بولی پر MSA کے مقابلے میں کمزور تھی [33]۔ اماراتی عربی اور انگریزی کی ملی جلی گفتار پر، ماڈلز کی اسی فیملی نے الفاظ کی تعداد سے زیادہ غلطیاں کیں، جبکہ صرف انگریزی حصوں پر اس کی شرح 12 فیصد رہی [34]۔ جس تحریری نقل میں ہر دوسرا لفظ غلط ہو، اسے ہمدردی یا کسی لازمی اعلان کے لحاظ سے اسکور نہیں دیا جا سکتا۔
لسانی ماڈلز بھی عربی کو انگریزی کے مقابلے میں کم اچھی طرح پرکھتے ہیں۔ 23 زبانوں پر مشتمل ترجیحی فیصلوں کے ایک بینچ مارک میں عربی سب سے کم اسکور والی زبان تھی، جانچے گئے ماڈلز کی اوسط کے لحاظ سے 62.8 فیصد [35]۔ عربی کے ایک لیڈر بورڈ کی تیاری کرنے والی ٹیم نے پایا کہ اس کے بہترین امیدوار جج کی ایک انسانی جائزہ کار سے مطابقت کاپا 0.46 تھی، اور لکھا کہ یہ "کسی فیصلے کی بنیاد بنانے کے لیے نسبتاً کم ہے" [36]۔
اور جیسے جیسے گفتار میں بولی کا رنگ گہرا ہوتا جاتا ہے، انسانی جائزہ کاروں کے درمیان اختلاف بڑھتا جاتا ہے، جذبات کی درجہ بندی میں بھی [37]۔ خودکار اسکورر کو کیلیبریٹ کرنے کے لیے استعمال ہونے والے انسانی حوالے میں بھی بولی کی صورت میں شور (noise) زیادہ ہوتا ہے۔
خلیجی ریگولیٹرز کیا تقاضا کرتے ہیں
متحدہ عرب امارات میں مرکزی بینک (Central Bank of the UAE, CBUAE) کے صارفین کے تحفظ کے معیارات (Consumer Protection Standards) لائسنس یافتہ مالیاتی اداروں کے لیے ضروری قرار دیتے ہیں کہ وہ عملے کے نامناسب طرز عمل کی نشاندہی کے لیے صارفین کے ایک نمونے کو کی گئی ماہانہ واپسی کالز کا دستاویزی ریکارڈ رکھیں، باقاعدگی سے مسٹری شاپنگ کروائیں، اور منصفانہ برتاؤ کے حوالے سے عملے کی کارکردگی کی نگرانی کریں [38]۔ یہ معیارات مرکزی بینک کے قانون کے تحت لائسنس یافتہ مالیاتی اداروں کے لیے ہیں، اس لیے کسی انشورنس کمپنی کے لیے بہتر یہ ہے کہ انہیں براہ راست ذمہ داری کے بجائے ایک حوالے کے طور پر دیکھا جائے۔ انشورنس کا 2010 کا ضابطہ اخلاق، جو مرکزی بینک کے تحت اب بھی نافذ ہے، یہ ضروری قرار دیتا ہے کہ ہر شکایت کا فیصلہ 15 دن کے اندر کیا جائے، اور شکایات کا رجسٹر معائنہ کاروں کے لیے کھلا ہو [39]۔ اے آئی سے متعلق مرکزی بینک کی 2026 کی رہنمائی، جس میں انشورنس کمپنیاں واضح طور پر شامل ہیں، وقتاً فوقتاً تعصب کی جانچ، مسلسل نگرانی، بامعنی انسانی نگرانی، اور کسٹمرز کے لیے انسانی جائزے کی درخواست کرنے کے ایک راستے کا تقاضا کرتی ہے [40]۔ سعودی عرب میں انشورنس اتھارٹی (Insurance Authority) نے نومبر 2023 میں کام شروع کیا، اور پچھلے قواعد اس وقت تک نافذ رہتے ہیں جب تک ان کی جگہ نئے قواعد نہ لے لیں [41]؛ ہم طرز عمل سے متعلق موجودہ ضوابط کی کسی ریگولیٹر کی ویب سائٹ پر تصدیق نہیں کر سکے، اس لیے یہاں ان کی تفصیل بیان نہیں کرتے۔
خطے سے باہر، یورپی یونین کے اے آئی قانون (EU AI Act) نے فروری 2025 سے "کام کی جگہ اور تعلیمی اداروں کے دائرے میں" لوگوں کے جذبات کا اندازہ لگانے پر پابندی عائد کر رکھی ہے [42]: کسی کسٹمر کے جذبات کا تجزیہ کرنے اور کسی ملازم کے جذبات کا تجزیہ کرنے کے درمیان یہ ایک قابل غور حد ہے۔
اس کا مطلب کیا ہے
نمونوں کے ذریعے جائزہ سینٹر کی سطح پر رجحانات کو نظرانداز نہیں کرتا؛ بلا ترتیب منتخب کی گئی چند سو گفتگو اوسط کا اچھا اندازہ دے دیتی ہیں۔ جو چیز یہ نہیں دیکھ سکتا وہ انفرادی نمائندہ، کبھی کبھار ہونے والی ناکامی، اور کسٹمرز کا وہ گروپ ہے جسے مختلف نتیجہ مل رہا ہو۔ ریگولیٹرز ٹھیک انہی چیزوں کے بارے میں پوچھتے ہیں۔
ہر گفتگو کو اسکور دینے سے احاطے کا مسئلہ حل ہو جاتا ہے۔ معیار کا مسئلہ حل نہیں ہوتا۔ خودکار اسکورر اسے دیے گئے فارم کی ہر کمزوری اپنا لیتا ہے، اپنے جھکاؤ بھی شامل کر دیتا ہے، اور عربی میں اس تحریری نقل کی غلطیاں بھی اپنا لیتا ہے جس پر اسکورنگ کی بنیاد ہوتی ہے۔ ہمارا ابتدائی مفروضہ، کہ نکات قابل مشاہدہ ہونے چاہییں، انسانوں کے مقابلے میں کیلیبریٹ کیے جانے چاہییں اور ان کے نتائج تقسیم (distribution) کی صورت میں بیان کیے جانے چاہییں، تین ترامیم کے ساتھ برقرار رہتا ہے۔
قابل مشاہدہ نکات ضروری ہیں لیکن کافی نہیں۔ ہاں یا نہیں والی جانچ خودکار اسکورز کو یکساں اور قابل آڈٹ بناتی ہے، اور یہ ان نکات کے لیے درست شکل ہے جن پر کوئی سمجھوتہ نہیں ہو سکتا: شناخت کی تصدیق ہوئی، لازمی اعلان کیا گیا، کلیم کے کسی فیصلے کا تاثر نہیں دیا گیا۔ یہ صوابدیدی فیصلے کے لیے غلط شکل ہے، جس کے لیے چند ایسے پیمانہ نما نکات درکار ہیں جن کی ہر سطح واضح طور پر متعین ہو، اور جنہیں ایک عدد میں ملانے کے بجائے ہاں یا نہیں والی جانچ سے الگ رکھا جائے۔
انسانوں کے مقابلے میں کیلیبریشن کی ایک بالائی حد ہے۔ جہاں تجربہ کار جائزہ کاروں کی آپس میں کسی نکتے پر مطابقت کاپا 0.6 سے کم ہو، وہاں اس نکتے پر دیے گئے کسی خودکار اسکور کے نتائج کسی فرد کو نہیں بھگتنے چاہییں۔ مفید موازنہ "ماڈل بمقابلہ انسان" نہیں، بلکہ "ماڈل بمقابلہ گفتگو کا ایک مقررہ سیٹ جسے کئی جائزہ کاروں نے اسکور دیا ہو، اور جس کی پیمائش مسلسل کی جائے" ہے۔
تقسیم کو زبان اور چینل کے لحاظ سے الگ الگ دکھانا لازمی ہے۔ عربی بولی میں کی گئی کال اور انگریزی ای میل کو یکساں اعتبار کے ساتھ اسکور نہیں دیا جاتا، اور ایک ہی درجہ بندی کی فہرست (league table) اس کو نقصان پہنچاتی ہے جو زیادہ مشکل زبان میں خدمات فراہم کرتا ہے۔
یہاں ایک چیز کے بدلے دوسری چھوڑنی پڑتی ہے۔ ہر چیز کو اسکور دینے سے نگرانی کی شدت بڑھتی ہے، اور برطانیہ کے دو سینٹرز کے 347 نمائندوں کے 2002 کے ایک سروے میں پایا گیا کہ نگرانی کی محسوس کی جانے والی شدت کا ان کی بہبود میں کمی سے گہرا تعلق تھا، اور اس تعلق کی شدت کام پر اختیار اور سپروائزر کی مدد سے کم یا زیادہ ہوتی تھی [43]۔ احاطے کا مقصد ٹیم کی مدد ہونا چاہیے۔
ہم اس کے مطابق ڈیزائن کیسے کرتے ہیں
ہر گفتگو کو اسکور دیا جاتا ہے، چاہے وہ اے آئی ایجنٹ نے کی ہو یا آپ کی ٹیم کے کسی رکن نے، اور نکات آپ کے ہوتے ہیں۔ معیار عمل درآمد کے دوران دو الگ فہرستوں کی صورت میں لکھا جاتا ہے: قابل مشاہدہ تقاضوں کے لیے ہاں یا نہیں والی جانچ، اور صوابدیدی فیصلے کے چند متعین نکات، جن کے ساتھ یہ وضاحت ہوتی ہے کہ ہر سطح کیسی ہوتی ہے۔ ان دونوں کو کبھی ایک فیصد میں یکجا نہیں کیا جاتا۔
اسکورر معیار کو ایک ہی مقررہ شکل میں دیکھتا ہے: نکات، ان کی ترتیب اور ان کی سطحوں کی وضاحتیں ایک گفتگو سے دوسری گفتگو تک نہیں بدلتیں، اور اسے کبھی کوئی ایسا حوالہ جواب نہیں دکھایا جاتا جس کے ساتھ اسکور لگا ہو۔ ہر اسکور کے ساتھ تحریری نقل کا وہ حصہ ہوتا ہے جس پر وہ مبنی ہے، تاکہ جائزہ کار کال دوبارہ سنے بغیر وجہ دیکھ سکے۔ بغیر وجہ کے اسکور کو خرابی سمجھا جاتا ہے۔
اسکورز آپ کے معیار کے مقابلے میں تقسیم کی صورت میں بیان کیے جاتے ہیں، جس میں سب سے پہلے یہ بتایا جاتا ہے کہ کتنا حصہ معیار سے نیچے ہے، اور انہیں زبان، چینل اور رابطے کی وجہ کے لحاظ سے الگ الگ دکھایا جاتا ہے۔ رابطے کی وجہ کی درجہ بندی ہر گفتگو کو آپ کے متعین کردہ زمروں کے مطابق ٹیگ کرتی ہے، تاکہ تقسیم کے کسی سرے (tail) کا سراغ اس بات تک لگایا جا سکے کہ کسٹمرز کس بارے میں پوچھ رہے تھے۔ نتیجے کی درجہ بندی یہ درج کرتی ہے کہ ہر گفتگو حل ہوئی، حل نہیں ہوئی یا ایسکلیٹ کی گئی، جس سے اسکورنگ کی ایک آزادانہ جانچ ممکن ہوتی ہے: کسی حل نہ ہونے والی گفتگو پر زیادہ اسکور ایک سوال ہے، نتیجہ نہیں۔
تعمیل سے متعلق نشاندہی گفتگو کو آپ کے ترتیب دیے گئے قواعد کے مطابق جانچتی ہے اور ان گفتگو کو نشان زد کرتی ہے جن میں کوئی ایسی بات کہی گئی جو نہیں کہی جانی چاہیے تھی۔ نشان زد ہونے کا مطلب ہے کہ معاملہ کسی فرد کی قطار میں چلا جائے، یہ کوئی حتمی فیصلہ نہیں۔ یہ دیکھتے ہوئے کہ ماڈلز کتنی کثرت سے قواعد کے مطابق باریوں کو ضرورت سے زیادہ غلط قرار دیتے ہیں اور حقیقی خلاف ورزیاں نظرانداز کر دیتے ہیں، یہ قطار اسی لیے بنائی جاتی ہے کہ اس کا جائزہ لیا جائے، اور جائزے کے نتائج نکات میں واپس شامل کیے جاتے ہیں۔
جذبات کا تجزیہ اس بات کو اسکور دیتا ہے کہ کسٹمر نے اس رابطے کے بارے میں کیسا محسوس کیا۔ یہ کسٹمر پر لاگو ہوتا ہے، آپ کی ٹیم پر نہیں، اور کوالٹی سے الگ بیان کیا جاتا ہے، کیونکہ کسٹمر کسی ایسے جواب سے بھی ناخوش ہو سکتا ہے جو درست اور مکمل تھا۔
کوچنگ سے متعلق بصیرت زیادہ اور کم اسکور والی گفتگو سے رجحانات نکال کر آپ کے ٹیم لیڈرز کے سامنے لاتی ہے: لوگوں کو کن گفتگو میں مشکل پیش آ رہی ہے، اور آپ کے لکھے ہوئے معیار کے مطابق آپ کے اپنے آپریشن میں اچھا کام کیسا دکھائی دیتا ہے۔ اس کا مقصد ان لوگوں کی مدد کرنا ہے جو وہ گفتگو سنبھالتے ہیں جن کے لیے کسی فرد کی ضرورت ہوتی ہے۔
اسکورنگ کو آپ کی گفتگو کے ایک ایسے مقررہ سیٹ کے مقابلے میں کیلیبریٹ کیا جاتا ہے جسے آپ کے جائزہ کاروں نے اسکور دیا ہو، عربی اور انگریزی کے لیے الگ الگ۔ ہم مطابقت کو ہر نکتے کے لحاظ سے بیان کرتے ہیں، پورے اسکور کارڈ کے لحاظ سے نہیں، اور صاف بتاتے ہیں کہ کون سے نکات خودکار اسکورنگ کی کم از کم سطح سے نیچے ہیں۔ جہاں کسی کال پر گفتار کی شناخت کا اعتماد کم ہو، وہاں اسکور روک لیا جاتا ہے اور کال کسی فرد کے پاس جاتی ہے۔
جو ہم ابھی نہیں جانتے
کوئی شائع شدہ تحقیق یہ نہیں ناپتی کہ تحریری نقل کی غلطیاں ایک ہی گفتگو پر لسانی ماڈل کی انسانی جائزہ کاروں سے مطابقت کو کس حد تک کم کرتی ہیں۔ دونوں اثرات الگ الگ دستاویزی ہیں؛ ان کا مشترکہ اثر نہیں۔
کوئی شائع شدہ تحقیق عربی کسٹمر سروس کی گفتگو پر لسانی ماڈلز اور انسانی جائزہ کاروں کے درمیان مطابقت کی پیمائش نہیں کرتی۔ قریب ترین شواہد عمومی نوعیت کے بینچ مارکس سے ہیں۔
کوئی شائع شدہ تحقیق تجارتی کانٹیکٹ سینٹرز کے اسکور کارڈز کے لیے کاپا بیان نہیں کرتی۔ انسانی مطابقت کے بارے میں شواہد طب، تعلیم اور کام کی جگہ سے متعلق نفسیات سے لیے گئے ہیں، اور جہاں یہ شواہد آئے ہیں وہاں ہم نے یہ بات واضح کی ہے۔
کیا حوالہ سیٹ کے مقابلے میں مسلسل پیمائش لائیو ماحول میں بتدریج انحراف کو صرف پکڑتی ہی نہیں بلکہ روکتی بھی ہے، اسے کسی کنٹرولڈ تحقیق میں نہیں آزمایا گیا۔
اور احاطے کا وہ عدد جو صنعت تقریباً بیس سال سے دہرا رہی ہے، جہاں تک ہم معلوم کر سکے، کبھی ناپا ہی نہیں گیا۔ اگر آپ کوئی عدد بیان کریں، تو اسے اپنی گفتگو کی تعداد سے حساب لگا کر نکالیں۔
مآخذ
- 1.ICMI, Discover why contact center quality doesn't measure up, and what you can do about it, whitepaper, c. 2008. Unsourced industry estimate.https://www.icmi.com/~/media/files/resources/whitepapers/quality-whitepaper.ashx
- 2.COPC Inc., Global Benchmarking Series 2022: Contact Center Quality Assurance, survey of more than 900 executives, fieldwork September to December 2021, pp. 11, 21 and 37. Secondary, self-reported.https://cx.copc.com/hubfs/Global%20Benchmarking%20Series%202022_Contact%20Center%20Quality%20Assurance.pdf
- 3.Call Centre Helper, Poll: how many calls do you monitor per agent per month?, webinar poll, n=115, March 2013. Secondary.https://www.callcentrehelper.com/poll-how-many-calls-do-you-monitor-per-agent-per-month-43247.htm
- 4.Bain, P., Watson, A., Mulvey, G., Taylor, P. and Gall, G., Taylorism, targets and the pursuit of quantity and quality by call centre management, New Technology, Work and Employment 17(3), 2002 (page references are to the open-access manuscript, pp. 10 to 15).https://strathprints.strath.ac.uk/4165/6/strathprints004165.pdf
- 5.McHugh, M.L., Interrater reliability: the kappa statistic, Biochemia Medica 22(3), 2012.https://biochemia-medica.com/en/journal/22/3/10.11613/BM.2012.031/fullArticle
- 6.Krippendorff, K., Reliability in content analysis: some common misconceptions and recommendations, Human Communication Research 30(3), 2004. Foundational.https://www.academia.edu/21851693/
- 7.Yayama et al., inter-rater agreement in a nursing OSCE, Sage Open Nursing, 2026 (90 students, 38 examiners).https://journals.sagepub.com/doi/10.1177/23779608261417794
- 8.Viswesvaran, C., Ones, D.S. and Schmidt, F.L., Comparative analysis of the reliability of job performance ratings, Journal of Applied Psychology 81(5), 1996 (N=14,650). Foundational.https://www.academia.edu/20224570/
- 9.Cook, D.A. et al., Effect of rater training on reliability and accuracy of mini-CEX scores: a randomized, controlled trial, Journal of General Internal Medicine, 2009 (52 preceptors, 31 randomised).https://link.springer.com/article/10.1007/s11606-008-0842-3
- 10.Roch, S.G., Woehr, D.J., Mishra, V. and Kieszczynska, U., Rater training revisited: an updated meta-analytic review of frame-of-reference training, Journal of Occupational and Organizational Psychology 85(2), 2012.https://researchconnect.suny.edu/en/publications/rater-training-revisited-an-updated-meta-analytic-review-of-frame/
- 11.Casabianca, J.M., Lockwood, J.R. and McCaffrey, D.F., Trends in classroom observation scores, Educational and Psychological Measurement, 2015 (observations of 458 teachers over two years).https://journals.sagepub.com/doi/10.1177/0013164414539163
- 12.Zheng, L. et al., Judging LLM-as-a-judge with MT-Bench and Chatbot Arena, NeurIPS 2023, Tables 2, 5 and 6.https://arxiv.org/abs/2306.05685
- 13.Wang, P. et al., Large language models are not fair evaluators, 2023, abstract and Table 4.https://arxiv.org/abs/2305.17926
- 14.Dubois, Y. et al., Length-controlled AlpacaEval: a simple way to debias automatic evaluators, 2024, Figure 3.https://arxiv.org/abs/2404.04475
- 15.Panickssery, A., Bowman, S.R. and Feng, S., LLM evaluators recognize and favor their own generations, 2024.https://arxiv.org/abs/2404.13076
- 16.Li, D. et al., Preference leakage: a contamination problem in LLM-as-a-judge, ICLR 2026.https://arxiv.org/abs/2502.01534
- 17.Li et al. (Ant Group), Evaluating scoring bias in LLM-as-a-judge, 2025, Table 3.https://arxiv.org/abs/2506.22316
- 18.Bavaresco, A. et al., LLMs instead of human judges? A large scale empirical study across 20 NLP evaluation tasks, ACL 2025, Table 1 (Cohen's kappa for GPT-4o on the 11 categorical datasets).https://arxiv.org/abs/2406.18403
- 19.Yang et al., CompliBench: benchmarking LLM judges for compliance violation detection in dialogue systems, 2026, Table 1 and Figure 6.https://arxiv.org/abs/2604.12312
- 20.Lee et al., CheckEval, EMNLP 2025, Tables 1 and 2.https://arxiv.org/abs/2403.18771
- 21.Cook, J. et al., TICK: targeted instruct-evaluation with checklists, 2024, Tables 4 and 6.https://arxiv.org/abs/2410.03608
- 22.Jung, J., Brahman, F. and Choi, Y., Trust or escalate: LLM judges with provable guarantees for human agreement, 2024.https://arxiv.org/abs/2407.18370
- 23.Ilgen, J.S. et al., A systematic review of validity evidence for checklists versus global rating scales in simulation-based assessment, Medical Education 49(2), 2015 (45 studies).https://pubmed.ncbi.nlm.nih.gov/25626747/
- 24.Hodges, B., Regehr, G., McNaughton, N., Tiberius, R. and Hanson, M., OSCE checklists do not capture increasing levels of expertise, Academic Medicine, 1999. Foundational.https://pubmed.ncbi.nlm.nih.gov/10536636/
- 25.COPC Inc., What are the guidelines for QA form design and attributes?, 2024, and Measure quality using three metrics instead of one overall score, 2016. Secondary, practitioner guidance.https://www.copc.com/clearly-cx/what-are-the-guidelines-for-qa-form-design-and-attributes/
- 26.Anscombe, F.J., Graphs in statistical analysis, The American Statistician 27(1), 1973. Foundational.https://www.tandfonline.com/doi/abs/10.1080/00031305.1973.10478966
- 27.Matejka, J. and Fitzmaurice, G., Same stats, different graphs, CHI 2017.https://www.research.autodesk.com/publications/same-stats-different-graphs/
- 28.Kahneman, D., Fredrickson, B.L., Schreiber, C.A. and Redelmeier, D.A., When more pain is preferred to less, Psychological Science 4(6), 1993. Foundational.https://journals.sagepub.com/doi/10.1111/j.1467-9280.1993.tb00589.x
- 29.Baumeister, R.F., Bratslavsky, E., Finkenauer, C. and Vohs, K.D., Bad is stronger than good, Review of General Psychology 5(4), 2001. Foundational.https://journals.sagepub.com/doi/abs/10.1037/1089-2680.5.4.323
- 30.Financial Conduct Authority, Handbook PRIN 2A.9.8R, 2A.9.10R and 2A.9.11R, in force from 31 July 2023.https://handbook.fca.org.uk/handbook/prin2a/prin2as9
- 31.Financial Conduct Authority, Insurance multi-firm review of outcomes monitoring under the Consumer Duty, 26 June 2024.https://www.fca.org.uk/publications/multi-firm-reviews/insurance-multi-firm-review-outcomes-monitoring-under-consumer-duty
- 32.Financial Conduct Authority, Outcomes monitoring: good practice and areas for improvement, 2026.https://www.fca.org.uk/publications/good-and-poor-practice/outcomes-monitoring-good-practice-and-areas-improvement
- 33.ELM Company, Open universal Arabic ASR leaderboard, 2024, Tables 1 and 3 (Whisper-large-v3, zero-shot, on the SADA dataset). Industry technical report.https://arxiv.org/abs/2412.13788
- 34.Al Ali, M. and Aldarmaki, H., Mixat: a data set of bilingual Emirati-English speech, SIGUL 2024, Table 3 (Whisper medium, zero-shot).https://arxiv.org/abs/2405.02578
- 35.Gureja, S. et al., M-RewardBench: evaluating reward models in multilingual settings, ACL 2025.https://arxiv.org/abs/2410.15522
- 36.Inception and MBZUAI, AraGen leaderboard and 3C3H, Hugging Face, December 2024. Lab technical write-up, sample size not disclosed.https://huggingface.co/blog/leaderboard-3c3h-aragen
- 37.Keleg, A. and Magdy, W., on annotator agreement and Arabic level of dialectness, 2024.https://arxiv.org/abs/2405.11282
- 38.Central Bank of the UAE, Consumer Protection Standards, Notice 1158/2021, Articles 4.1.1.8, 4.1.1.9 and 5.2.2.4.https://rulebook.centralbank.ae/en/rulebook/consumer-protection-standards
- 39.Insurance Authority Board Resolution No. 3 of 2010, Instructions concerning the code of conduct and ethics, Article 10, in force under the Central Bank of the UAE.https://rulebook.centralbank.ae/en/rulebook/insurance-authority-board-resolution-no-3-2010-instructions-concerning-code-conduct-and
- 40.Central Bank of the UAE, Guidance note on the consumer protection and responsible adoption and use of AI and ML by licensed financial institutions, 2026.https://rulebook.centralbank.ae/en/rulebook/guidance-note-consumer-protection-and-responsible-adoption-and-use-artificial-intelligence
- 41.Saudi Press Agency, The Insurance Authority officially commences its operations, 23 November 2023.https://www.spa.gov.sa/en/N2002759
- 42.Regulation (EU) 2024/1689 (AI Act), Article 5(1)(f) and Recital 44.https://ai-act-service-desk.ec.europa.eu/en/ai-act/article-5
- 43.Holman, D., Chissick, C. and Totterdell, P., The effects of performance monitoring on emotional labor and well-being in call centers, Motivation and Emotion, 2002 (n=347).https://link.springer.com/article/10.1023/A:1015194108376
نئی تحقیق شائع ہوتے ہی حاصل کریں
جب ہم کچھ شائع کرتے ہیں تو کبھی کبھار ای میلز۔