جملے کے درمیان زبان بدلنے والی گفتگو پر اے آئی ایجنٹس کی جانچ
خلیجی ممالک کے کسٹمرز معمول کے مطابق عربی جملوں کے اندر انگریزی الفاظ استعمال کرتے ہیں، اور شائع شدہ شواہد بتاتے ہیں کہ گفتار کے سسٹمز ایسی گفتگو میں ان وجوہات سے ناکام ہوتے ہیں جنہیں درستگی کا معیاری اسکور نہیں دیکھ پاتا۔ یہ مضمون بتاتا ہے کہ زبان کی اس تبدیلی کے بارے میں کیا معلوم ہے، سسٹمز کہاں ناکام ہوتے ہیں، اور کسی ٹیسٹ کو کس طرح تیار کرنا لازمی ہے تاکہ وہ آپ کو کچھ بھی بتا سکے۔
اس صفحے پر
صورتحال
ایک خریدار جمعرات کی شام کسی رئیل اسٹیٹ ڈویلپر کی کسٹمر کیئر لائن کو پیغام بھیجتا ہے:
هلا، بغيت أعرف الـ next instalment حق الـ unit، متى الـ due date؟
ہیلو، میں unit کی next instalment جاننا چاہتا ہوں، due date کب ہے؟ یہ جملہ خلیجی عربی میں ہے۔ درخواست کا مفہوم جن تین الفاظ میں ہے، وہ انگریزی کے ہیں۔ تعمیر سے منسلک ادائیگی کے پلان میں جواب کا انحصار اس پر ہوتا ہے کہ پروجیکٹ کس سنگ میل تک پہنچا ہے، نہ کہ کیلنڈر کی کسی تاریخ پر، اس لیے اے آئی ایجنٹ کو یونٹ کی شناخت کرنی ہوتی ہے، سنگ میل معلوم کرنا ہوتا ہے، اور ایسا جواب دینا ہوتا ہے جس کی بنیاد پر خریدار کوئی قدم اٹھا سکے۔
اس پیغام میں کچھ بھی غیر معمولی نہیں۔ غیر معمولی اس کی جانچ ہے۔ کوئی سسٹم عربی کو کتنی اچھی طرح سنبھالتا ہے، اس کی زیادہ تر شائع شدہ پیمائشیں صرف عربی پر، صرف انگریزی پر، یا اس رسمی عربی پر کی جاتی ہیں جو سروس لائن پر کوئی استعمال نہیں کرتا۔ اس لیے متحدہ عرب امارات یا سعودی عرب کے لیے اے آئی ایجنٹ خریدنے یا بنانے والے کسی بھی فرد کے سامنے سوالات یہ ہیں: زبانوں کا یہ امتزاج کتنا عام ہے، یہ گفتار اور لسانی سسٹمز کو کیوں ناکام بنا دیتا ہے، اور جانچ کیسے کی جائے تاکہ یہ پہلو فرض نہ کر لیا جائے بلکہ جانچ میں شامل ہو۔
شواہد کیا بتاتے ہیں
یہ کتنا عام ہے، اور اس کی شکل کیا ہوتی ہے
ماہرین لسانیات زبان بدلنے کی دو اقسام میں فرق کرتے ہیں۔ جملوں کے مابین زبان کی تبدیلی (inter-sentential switching) میں زبان ایک جملے اور اگلے جملے کے درمیان بدلتی ہے۔ جملے کے اندر زبان کی تبدیلی (intra-sentential switching) میں زبان جملے کے اندر ہی بدل جاتی ہے، جیسا کہ اوپر والے پیغام میں۔ یہ فرق 1980 کے ایک بنیادی تحقیقی کام سے چلا آ رہا ہے [24]، اور یہاں یہ اس لیے اہم ہے کہ دونوں اقسام کسی سسٹم پر مختلف طرح کا دباؤ ڈالتی ہیں۔
خلیجی شواہد واضح طور پر دوسری قسم کی طرف اشارہ کرتے ہیں۔ Mixat، جو انگریزی کی آمیزش والی اماراتی گفتار کا سب سے بڑا عوامی ذخیرہ (corpus) ہے، اس میں دو پوڈکاسٹس کے 14.9 گھنٹوں کی تحریری نقل تیار کی گئی۔ 36 فیصد جملوں (5,316 میں سے 1,947) میں زبان کی تبدیلی تھی، 61 فیصد صرف عربی میں تھے اور 2 فیصد صرف انگریزی میں۔ اس کا کوڈ مکسنگ انڈیکس (code-mixing index)، یعنی 0 سے 1 تک کا ایک اسکور جو اس وقت بڑھتا ہے جب جملہ زبانوں کے درمیان زیادہ برابر تقسیم ہو، زبان بدلنے والے جملوں میں اوسطاً 0.11 رہا: یعنی ایسے عربی جملے جن میں انگریزی کے چند الفاظ ہوں [1]۔ ایک دوسرے اماراتی ذخیرے میں، جو یونیورسٹی کے 16 طلبہ کے Zoom پر کیے گئے کرداری مکالموں (role-plays) کے 12 گھنٹوں پر مشتمل ہے، پایا گیا کہ 19 فیصد فقروں میں زبان بدلی، اور زبان بدلنے والے فقروں میں انگریزی اسما ایک زبان والے فقروں کے مقابلے میں 56.9 فیصد زیادہ کثرت سے آئے [2]۔ اسی نوعیت کے مصری ذخیرے میں، جو قاہرہ کے 38 طلبہ کے انٹرویوز کے 12 گھنٹوں پر مشتمل ہے، 63.2 فیصد جملے ملی جلی زبان میں تھے، جن میں سے 88.9 فیصد ایسے عربی جملے تھے جن کے اندر انگریزی شامل تھی، اور انگریزی کے 66.3 فیصد حصے صرف ایک لفظ پر مشتمل تھے۔ زبان بدلنے سے فوراً پہلے سب سے زیادہ آنے والا لفظ عربی کا حرف تعریف (definite article) تھا [3]، اور اوپر والے پیغام میں بالکل یہی انداز ہے۔ واحد سعودی ذخیرہ، جو چار مرد بولنے والوں کے ایک ہی پوڈکاسٹ کے 4.45 گھنٹوں پر مشتمل ہے، یہی شکل دکھاتا ہے، اور اس میں تقریباً ہر پانچ ٹوکنز (الفاظ کی اکائیوں) میں سے ایک انگریزی کا ہے [4]۔
یہ ذخیرے نوجوان اور تعلیم یافتہ افراد کے پوڈکاسٹس، انٹرویوز اور کرداری مکالموں پر مبنی ہیں، اس لیے یہ دکھاتے ہیں کہ زبان کی تبدیلی کیسی دکھائی دیتی ہے، یہ نہیں کہ پوری آبادی ایسا کتنی بار کرتی ہے۔ یونیورسٹی کے 100 اماراتی طلبہ کے 2019 کے ایک سروے میں 78 فیصد نے کہا کہ وہ جملوں کے اندر دونوں زبانیں ملا کر استعمال کرتے ہیں [6]۔ دبئی میں ATM استعمال کرنے والے 566 افراد کا 2024 کا ایک سروے تصویر کا دوسرا رخ دکھاتا ہے: غیر عرب صارفین میں سے 99.7 فیصد نے انگریزی کا انتخاب کیا، اماراتیوں نے صرف 19.7 فیصد مواقع پر انگریزی چنی، اور زیادہ تنخواہ والی ملازمتوں میں کام کرنے والے عرب تارکین وطن نے 69 فیصد مواقع پر انگریزی چنی، جبکہ کم تنخواہ والی ملازمتوں والوں نے 84.3 فیصد مواقع پر عربی چنی [5]۔ سعودی عرب میں 2022 کی مردم شماری کے مطابق 32.2 ملین رہائشیوں میں سے 58.4 فیصد سعودی شہری تھے [7]۔ اس خطے میں خدمات فراہم کرنے والے اے آئی ایجنٹ کو صرف انگریزی، صرف عربی اور ملی جلی زبان، تینوں طرح کی گفتگو سے واسطہ پڑے گا، اور کون سی گفتگو آئے گی، اس کا انحصار اس پر ہے کہ کسٹمر کون ہے۔
زبان کی اس تبدیلی کے نیچے دو تہیں ہیں۔ پہلی تہہ بولی ہے۔ عربی دو سطحی زبان (diglossic) ہے: اس کی رسمی قسم، جدید معیاری عربی، لکھنے اور رسمی گفتگو کے لیے استعمال ہوتی ہے، جبکہ روزمرہ بول چال علاقائی بولی میں ہوتی ہے [23]۔ خلیج سے کال کرنے والا خلیجی عربی بولتا ہے، خطے کی افرادی قوت کا بڑا حصہ مصری یا شامی (Levantine) عربی بولتا ہے، اور ان میں سے کوئی بھی سروس لائن پر جدید معیاری عربی نہیں بولتا۔ دوسری تہہ عربیزی (Arabizi) ہے، یعنی لاطینی حروف میں ٹائپ کی گئی عربی، جس میں ان آوازوں کے لیے ہندسے استعمال ہوتے ہیں جن کے لیے لاطینی رسم الخط میں کوئی حرف نہیں، جیسے ع کے لیے 3 اور ح کے لیے 7۔ 2003 میں زاید یونیورسٹی (Zayed University) کے طلبہ میں اس کے استعمال کو دستاویزی شکل دی گئی [25]۔ 2019 کے سروے میں 45 فیصد طلبہ نے کہا کہ وہ اسے کبھی استعمال نہیں کرتے اور 16 فیصد نے کہا کہ وہ ہمیشہ اسے استعمال کرتے ہیں [6]، اس لیے WhatsApp پر پیغامات کے ایک سلسلے میں عربی رسم الخط، لاطینی رسم الخط اور دونوں ایک ساتھ ہو سکتے ہیں۔
سسٹمز کہاں ناکام ہوتے ہیں
اس تحقیق کا ابتدائی مفروضہ یہ تھا کہ ناکامیاں اس مقام پر مرکوز ہوتی ہیں جہاں زبان بدلتی ہے۔ شواہد بتاتے ہیں کہ زبان کی تبدیلی تین ناکامیوں میں سے ایک ہے، اور سب سے بڑی نہیں۔
سب سے بڑی ناکامی بولی کی ہے۔ گفتار کی شناخت کو الفاظ میں غلطی کی شرح (word error rate) سے ناپا جاتا ہے: یعنی جو کچھ کہا گیا اس کے مقابلے میں تحریری نقل کے ان الفاظ کا تناسب جو غلط ہوں، چھوٹ گئے ہوں یا زائد شامل ہو گئے ہوں۔ یہ شرح جتنی کم ہو اتنا بہتر ہے، اور 100 فیصد سے زیادہ کی شرح کا مطلب ہے کہ سسٹم نے اصل الفاظ کی تعداد سے بھی زیادہ غلط الفاظ لکھے۔ سعودی نشریات پر مبنی ایک ٹیسٹ سیٹ پر، گفتار کی شناخت کے ایک وسیع پیمانے پر استعمال ہونے والے اوپن ماڈل کی شرح جدید معیاری عربی پر 27.95 فیصد اور خلیجی بولی پر 59.92 فیصد رہی، جبکہ مصری عربی پر 59.28 فیصد [8]۔ اس فرق کا انگریزی سے کوئی تعلق نہیں۔ یہ اس بات کی قیمت ہے کہ زیادہ تر رسمی عربی پر تربیت یافتہ ماڈل کا سامنا ایسے کسٹمر سے ہوتا ہے جو رسمی عربی نہیں بولتا۔
دوسری ناکامی غلط کام انجام دینا ہے۔ جب Mixat کے مصنفین نے اپنی اماراتی ریکارڈنگز پر عمومی استعمال کا ایک گفتار ماڈل چلایا، تو اس کی شرح صرف انگریزی جملوں پر 12.06 فیصد اور صرف عربی جملوں پر 195.98 فیصد رہی۔ یہ ماڈل "جملوں کا MSA (جدید معیاری عربی) میں ترجمہ کر دیتا ہے، اور ترجمے اکثر درست ہوتے ہیں۔ اس سے ظاہر ہوتا ہے کہ Whisper دراصل بولی اور زبان کی تبدیلی کو پہچان لیتا ہے، لیکن غلط کام انجام دیتا ہے" [1]۔ آٹھ بولیوں پر مبنی ایک تحقیق میں ملی جلی زبان والے حصوں پر یہی دیکھا گیا: "Whisper تمام صورتوں میں دوسری زبان کا کوئی بھی لفظ لکھنے میں ناکام رہا۔ خاص طور پر، جب ڈی کوڈنگ کی زبان انگریزی پر سیٹ کی گئی تب بھی، Whisper نے کام کو 'transcription' کے طور پر متعین کرنے کے باوجود ترجمے کا کام انجام دیا" [9]۔ مینڈرن اور انگریزی کی ملی جلی گفتار پر بھی یہی رویہ دستاویزی طور پر سامنے آیا ہے [26]۔ کسٹمر "claim" کہتا ہے اور تحریری نقل میں کلیم کے لیے عربی لفظ آ جاتا ہے، یا پورا جملہ اس رسمی عربی میں واپس آتا ہے جو کسٹمر نے کبھی بولی ہی نہیں۔
تیسری ناکامی خود زبان کی تبدیلی ہے۔ یہ حقیقی ہے، لیکن نمایاں مجموعی اسکور میں زیادہ تر نظر نہیں آتی۔ 2025 کی ایک تحقیق نے ایک ایسا پیمانہ متعارف کرایا جو صرف ان الفاظ کو اسکور کرتا ہے جن پر زبان بدلی گئی ہو۔ کسی ماڈل کو ایک زبان والی مزید عربی اور انگریزی پر تربیت دینے سے ملی جلی زبان کے ٹیسٹ سیٹس پر الفاظ میں غلطی کی اس کی مجموعی شرح بہتر ہوئی، "جبکہ زبان کی تبدیلی کی اصل مثالوں کی شناخت بگڑ رہی ہے" [10]۔ کوئی ماڈل اوسطاً بہتر اور ساتھ ہی ان پروڈکٹ ناموں، ریفرنس نمبروں اور تکنیکی اصطلاحات پر بدتر ہو سکتا ہے جن میں درخواست کا اصل مفہوم ہوتا ہے، اور عام ٹیسٹ بہتری کی رپورٹ دیتا ہے۔
بڑی کلاؤڈ گفتار سروسز خود بھی یہ بات تسلیم کرتی ہیں۔ ایک سروس بتاتی ہے کہ اس کی زبان کی مسلسل شناخت "ایک ہی جملے کے اندر زبان بدلنے کو سپورٹ نہیں کرتی۔ مثال کے طور پر، اگر آپ بنیادی طور پر ہسپانوی بول رہے ہیں اور کچھ انگریزی الفاظ شامل کرتے ہیں، تو یہ ہر لفظ کی سطح پر زبان کی تبدیلی کی شناخت نہیں کرتی" [15]۔ ایک اور سروس زیادہ سے زیادہ تین ممکنہ زبانوں کی اجازت دیتی ہے، "فہرست میں سے سب سے موزوں زبان استعمال کرتے ہوئے" تحریری نقل تیار کرتی ہے، اور اس سہولت کو "ان ایپس کے لیے مثالی جنہیں وائس کمانڈز یا تلاش جیسے مختصر جملوں کی تحریری نقل تیار کرنی ہو" قرار دیتی ہے [16]۔ یہ ان سسٹمز کی دیانتدارانہ وضاحتیں ہیں جو ہر فقرے کے لیے ایک زبان منتخب کرنے کے لیے بنائے گئے ہیں۔
عام اسکور گمراہ کیوں کرتا ہے
ملی جلی زبان والی گفتار کے ساتھ الفاظ میں غلطی کی شرح کا ایک خاص مسئلہ ہے۔ اگر کسٹمر "booking" کہے اور سسٹم اسے عربی حروف میں لکھ دے، تو پڑھنے والا اسے سمجھ لیتا ہے لیکن یہ پیمانہ اسے غلط شمار کرتا ہے۔ 2022 کی ایک تحقیق میں چار دو لسانی افراد نے مصری ملی جلی گفتار کی 3,903 تحریری نقول میں ترمیم کر کے انہیں درست کیا، اور پھر جانچا گیا کہ کون سا خودکار اسکور اس بات سے سب سے زیادہ مطابقت رکھتا ہے کہ کسی انسان کو کتنی ترمیم کرنی پڑی۔ الفاظ میں غلطی کی سادہ شرح کا ارتباط (correlation) 0.55 تھا۔ انگریزی الفاظ کو عربی رسم الخط میں منتقل (transliterate) کرنے اور ہجے کو یکساں بنانے کے بعد حروف میں غلطی کی شرح (character error rate) کا ارتباط 0.80 تھا [11]۔ اماراتی ڈیٹا پر تیار کیا گیا 2024 کا ایک طریقہ زبان بدلنے والے کسی لفظ کے ہوبہو اندراج، دوسرے رسم الخط میں اس کی منتقلی یا اس کے ترجمے کو درست تسلیم کرتا ہے [12]۔ اس طرح کی کسی ایڈجسٹمنٹ کے بغیر، خلیجی گفتگو کا ٹیسٹ سیٹ درست رویے کی سزا دیتا ہے، اور غلط کام والی ناکامی جب بھی حوالہ متن (reference) کے رسم الخط سے مطابقت رکھتی ہو، اسے نوازتا ہے۔
گہری بات یہ ہے کہ تحریری نقل اصل نتیجہ نہیں۔ 2021 کی ایک تحقیق میں تحریری نقول کے سیٹس کے ایسے جوڑے بنائے گئے جن میں الفاظ میں غلطی کی شرح یکساں تھی، دونوں میں 6.16 فیصد، اور پایا گیا کہ جس سیٹ کی غلطیوں سے مطلب برقرار رہا اس میں مقصد کی درستگی (intent accuracy)، یعنی ان درخواستوں کا تناسب جن میں سسٹم نے سمجھا کہ کیا مطلوب ہے، 96.22 فیصد رہی، جبکہ جس سیٹ کی غلطیوں سے مطلب برقرار نہیں رہا اس میں یہ 94.63 فیصد تھی [13]۔ گھریلو ڈیوائس کو دی گئی زبانی درخواستوں کے 58 گھنٹوں پر مشتمل انگریزی بینچ مارک پر، بہترین سسٹم کے مقصد کو درست سمجھنے کی شرح، 16 فیصد شرح غلطی والی حقیقی آڈیو پر، بے عیب تحریری نقول کے مقابلے میں، صرف تقریباً 5 پوائنٹس کم رہی، لیکن درخواست کی تفصیلات، یعنی نام، تاریخیں اور مقامات، پر اس کی درستگی بینچ مارک کے اپنے پیمانے پر 78.19 سے گر کر 69.53 رہ گئی [14]۔ مقصد تحریری نقل کی غلطیوں کے باوجود برقرار رہتا ہے۔ تفصیلات نہیں۔ کلیم سے متعلق کال میں مقصد ہے "میرا کلیم کہاں ہے"؛ تفصیل گاڑی کی نمبر پلیٹ ہے۔ دونوں کی جانچ ضروری ہے، الگ الگ۔ دونوں تحقیقات انگریزی میں ہیں؛ کوئی شائع شدہ تحقیق عربی اور انگریزی کی ملی جلی گفتار پر مقصد کی درستگی کی پیمائش نہیں کرتی، اور یہ ایک خلا ہے، اطمینان کی بات نہیں۔
جواب بول کر سنانا
وائس چینل پر کام کرنے والے اے آئی ایجنٹ کو ملا جلا جملہ سننے کے ساتھ ساتھ بولنا بھی ہوتا ہے۔ متن کو آواز میں بدلنے کا نظام (text-to-speech)، یعنی وہ سسٹم جو تحریری جواب کو آڈیو میں بدلتا ہے، زبان کی تبدیلی کے معاملے میں اپنا الگ مسئلہ رکھتا ہے۔ ایک بڑا فراہم کنندہ بتاتا ہے کہ جملے کے اندر کسی غیر ملکی زبان کے حصے کی نشاندہی کرنے والا اس کا ٹیگ "عربی، عبرانی اور فارسی جیسی سامی زبانوں" کے لیے "سپورٹ نہیں کیا جاتا" اور اس کا "نتیجہ خاموشی کی صورت میں نکلے گا" [17]۔ عربی میں متن کو آواز میں بدلنے پر پہلا شائع شدہ کام جو بولی اور زبانوں کے امتزاج کو سنبھالتا ہے، 2025 میں سامنے آیا؛ یہ ایک ہی بولنے والے کی ایک گھنٹے کی مصری عربی اور انگریزی گفتار پر مبنی تھا، اور اس نے امتزاج کو اس طرح سنبھالا کہ ہر جملے کو ایک زبان والے فقروں میں تقسیم کیا اور ہر فقرے کی آواز الگ تیار کی [18]۔ خلیجی عربی کے لیے ایسا کوئی کام موجود نہیں۔ اعداد ایک اور تہہ کا اضافہ کرتے ہیں: عربی میں اعداد جنس کے لحاظ سے بدلتے ہیں، اور بولیاں جنس کی ان علامات کو چھوڑ دیتی ہیں لیکن اعداد کو اپنے اپنے انداز میں پڑھتی ہیں، اس لیے کوئی ریفرنس نمبر یا درہم میں کوئی رقم اسکرین پر درست اور بول کر سنانے میں غلط ہو سکتی ہے [19]۔
زبان کی خودکار شناخت بھی اتنی پختہ نہیں جتنی بظاہر لگتی ہے۔ وائس اے آئی ایجنٹس کا ایک پلیٹ فارم خبردار کرتا ہے کہ "پس منظر میں ہونے والی بات چیت یا غیر معمولی تلفظ کبھی کبھار زبان کی ایسی تبدیلی کو متحرک کر سکتا ہے جس کا کال کرنے والے کا ارادہ نہیں تھا"، اور ایک ایسی ترتیب فراہم کرتا ہے جو زبان کی تبدیلی کو گفتگو کی پہلی دو باریوں تک محدود کر دیتی ہے [27]۔ زبان کی شناخت کو صرف درست تبدیلیوں کے لیے نہیں، بلکہ غلط تبدیلیوں کے لیے بھی جانچنا لازمی ہے۔
کس چیز کی جانچ نہیں ہو رہی
2025 کے ایک جائزاتی مطالعے میں ملی جلی عربی گفتار کے موجودہ ذخائر میں الفاظ میں غلطی کی شرح 24.8 فیصد سے 53.8 فیصد تک پائی گئی، اور اس میں کہا گیا ہے کہ "موجودہ بینچ مارکس میں CSW عربی (یعنی زبان بدلنے والی عربی) کی نمائندگی اب بھی کم ہے" [20]۔ 2025 کا ایک الگ جائزاتی مطالعہ، جس میں عربی لسانی ماڈلز کے 40 سے زیادہ بینچ مارکس کا جائزہ لیا گیا، زبان کی تبدیلی کی جانچ اور کئی باریوں پر مشتمل مکالمے کو سنگین خلا قرار دیتا ہے [21]۔ ملی جلی گفتار کی جانچ کے لیے عوامی طور پر دستیاب خلیجی مواد کل ملا کر پوڈکاسٹس، ٹیلی وژن اور طلبہ کے کرداری مکالموں کے چند درجن گھنٹوں پر مشتمل ہے، جس کا زیادہ تر حصہ ایسے لائسنسوں کے تحت ہے جو تجارتی استعمال کی اجازت نہیں دیتے، اور اس میں سے کچھ بھی کسی کاروبار کی فون لائن پر ریکارڈ نہیں کیا گیا۔ ملی جلی زبان میں کسٹمرز کی درخواستوں کا ایسا کوئی عوامی خلیجی ٹیسٹ سیٹ موجود نہیں جس میں یہ درج ہو کہ کسٹمر کیا چاہتا تھا۔
ایک نتیجہ اس کے برعکس ہے۔ تحریری متن پر، بڑے لسانی ماڈلز کے بارے میں 2025 کی ایک تحقیق میں پایا گیا کہ کسی غیر انگریزی جملے میں انگریزی الفاظ شامل کرنے سے "اکثر سمجھ بہتر ہو جاتی ہے، خاص طور پر ان ماڈلز کے لیے جن کی جملے کی بنیادی زبان (matrix language) میں مہارت محدود ہو"، جبکہ انگریزی میں غیر ملکی الفاظ شامل کرنے سے سمجھ میں کمی آئی [22]۔ عربی میں لکھے گئے WhatsApp پیغام میں موجود انگریزی لفظ ماڈل کی مدد کر سکتا ہے۔ مشکل اسی لفظ کی بولی گئی شکل میں مرکوز ہوتی ہے۔
اس کا مطلب کیا ہے
ہمارا ابتدائی مفروضہ یہ تھا کہ ناکامیاں ان مقامات پر مرکوز ہوتی ہیں جہاں زبان بدلتی ہے۔ شواہد اس کی اصلاح کرتے ہیں۔ ناکامیاں سب سے پہلے بولی پر مرکوز ہوتی ہیں، دوسرے نمبر پر اس بات پر کہ ماڈل وہ کام نہیں کرتا جو اسے کہا گیا بلکہ کوئی اور کام کرتا ہے، اور صرف تیسرے نمبر پر زبان بدلنے والے الفاظ پر، جنہیں معیاری اسکور چھپا لیتا ہے۔ صرف زبان بدلنے کے مقامات کے گرد بنایا گیا ٹیسٹ دو بڑی ناکامیوں کو نہیں پکڑ پائے گا۔ یک لسانی درستگی پر بنایا گیا ٹیسٹ تینوں کو نہیں پکڑ پائے گا۔
یہ جاننا مفید ہے کہ کہاں کس چیز کے بدلے کیا چھوڑنا پڑتا ہے۔ گفتار کی کسی سروس کو ایک زبان تک محدود کرنے سے اس زبان پر اس کی درستگی بڑھ جاتی ہے، اور زبان کی تبدیلی کا ساتھ دینے کی اس کی صلاحیت ختم ہو جاتی ہے۔ کسی عمومی ماڈل کو زبردستی عربی پر سیٹ کرنے سے وہ ترجمہ کرنے لگتا ہے۔ دوسرے رسم الخط میں لکھے گئے الفاظ کو درست تسلیم کرنے سے اسکور دیانتدارانہ ہو جاتا ہے، لیکن پھر اس کا موازنہ کسی ایسے وینڈر کے اعداد و شمار سے نہیں کیا جا سکتا جس نے ایسا نہیں کیا۔ اور بہتر اوسط درستگی کے ساتھ ساتھ اہم الفاظ پر درستگی بدتر بھی ہو سکتی ہے۔
اس لیے اس خطے کے لیے کسی اے آئی ایجنٹ کے ٹیسٹ میں چار چیزوں کو الگ الگ جانچنا لازمی ہے: کیا جملے کا عربی ڈھانچہ اس بولی میں سمجھا گیا جو کسٹمر نے استعمال کی؛ کیا انگریزی میں شامل کیے گئے الفاظ درست طور پر پہنچے؛ کیا مقصد اور تفصیلات درج ہوئیں، اور انہیں تحریری نقل کے بجائے سمجھ کی بنیاد پر اسکور کیا گیا؛ اور کیا جواب، اعداد سمیت، درست طور پر بولا گیا۔ اس میں ایسا پیمانہ استعمال کرنا لازمی ہے جو دونوں میں سے کسی بھی رسم الخط میں لکھے گئے درست لفظ کو تسلیم کرے۔ اور اسے ان گفتگو سے تیار کرنا لازمی ہے جو کاروبار کو حقیقت میں موصول ہوتی ہیں، کیونکہ کوئی عوامی ڈیٹا سیٹ ان کا متبادل نہیں۔
ہم اس کے مطابق ڈیزائن کیسے کرتے ہیں
ہمارے اے آئی ایجنٹس ایسے بولنے والے کا ساتھ دیتے ہیں جو ایک ہی جملے میں عربی اور انگریزی ملا کر بولتا ہے، اور کسٹمر سے زبان منتخب کرنے کو کہنے کے بجائے پہلے چند الفاظ سے پہچان لیتے ہیں کہ وہ کون سی زبان استعمال کر رہا ہے۔ وہ خلیجی، مصری اور شامی عربی، جدید معیاری عربی اور انگریزی سمجھتے ہیں اور ان میں جواب دیتے ہیں، کیونکہ دبئی یا ریاض کے کسٹمرز میں ان سب کے بولنے والے شامل ہوتے ہیں، اور جواب اسی بولی میں ہوتا ہے جو کسٹمر نے استعمال کی۔
جہاں اے آئی ایجنٹ کو یقین نہ ہو، وہاں وہ اندازہ لگانے کے بجائے وضاحت کے لیے سوال پوچھتا ہے، اور جس گفتگو کو وہ حل نہ کر سکے وہ کسی فرد کے حوالے کر دی جاتی ہے۔ چونکہ بنیادی گفتار اور لسانی ماڈلز بولی کے لحاظ سے ایک دوسرے سے بہت مختلف ہوتے ہیں، اس لیے ماڈلز ہر تعیناتی کے لیے الگ منتخب کیے جاتے ہیں اور انہیں بدلا جا سکتا ہے، تاکہ کلائنٹ کسٹمرز سے پہلے دیکھ سکے کہ کسی تبدیلی کا کیا اثر ہوتا ہے۔
ہمارے جائزے کے سیٹس (evaluation sets) اسی ٹیسٹ ڈیزائن کے مطابق بنائے جاتے ہیں: ہر صنعت کے حقیقی پیٹرنز پر مبنی ٹیسٹ گفتگو، جنہیں صرف تحریری نقل کی بنیاد پر نہیں، بلکہ اس بنیاد پر اسکور کیا جاتا ہے کہ آیا اے آئی ایجنٹ نے سمجھا کہ کسٹمر کیا چاہتا تھا اور تفصیلات، یعنی یونٹ نمبر، کلیم کا ریفرنس اور پرواز، درست طور پر درج کیں، اور جنہیں اس معیار پر جانچا جاتا ہے کہ کسی کلیم یا قبضے کی حوالگی میں معاملہ حل ہونے کا کیا مطلب ہے۔ زبان کی ترجیح یاد رکھنے کی سہولت کا مطلب ہے کہ جس کسٹمر نے پچھلی بار انگریزی چنی تھی، اسے اس بار انگریزی میں خوش آمدید کہا جاتا ہے، اور جس نے خلیجی عربی میں لکھا تھا، اسے رسمی عربی میں جواب نہیں دیا جاتا۔
ہم اپنے اے آئی ایجنٹس کی درستگی کے اعداد و شمار شائع نہیں کرتے۔ جب ہم ایسا کریں گے، تو ان کے ساتھ ٹیسٹ سیٹ، بولیوں کا تناسب اور اسکورنگ کا طریقہ بھی ہوں گے، کیونکہ ان کے بغیر ملی جلی زبان کی گفتار کے لیے کوئی بھی عدد بے معنی ہے۔
جو ہم ابھی نہیں جانتے
کسی نے یہ نہیں ناپا کہ خلیجی سروس لائنز پر کسٹمرز کتنی بار زبان بدلتے ہیں، یا ان گفتگو میں سے کتنا حصہ عربی، انگریزی یا ملی جلی زبان میں ہوتا ہے۔ اوپر بیان کیے گئے ذخائر دستیاب ذخائر میں سب سے بہتر ہیں، اور ان میں سے کوئی بھی کسی کاروبار کی فون لائن پر ریکارڈ نہیں کیا گیا۔
عربی سے متعلق کوئی شائع شدہ تحقیق خود زبان بدلنے کے مقام پر غلطی کی پیمائش نہیں کرتی، نہ ہی عربی جملوں کے اندر انگریزی پروڈکٹ ناموں، ریفرنس نمبروں اور بولے گئے ہندسوں پر۔ یہ عمل کیسے ہوتا ہے، یہ دستاویزی ہے؛ کسٹمر کی گفتگو میں اس کا حجم دستاویزی نہیں۔
اس بات کا کوئی آزادانہ جائزہ موجود نہیں کہ متن کو آواز میں بدلنے والی تجارتی آوازیں ایسے خلیجی عربی جملے کو کیسے ادا کرتی ہیں جس کے اندر انگریزی ہو۔ وینڈرز کی دستاویزات حدود بیان کرتی ہیں؛ وینڈرز کے علاوہ کسی نے ان کی پیمائش نہیں کی۔
اس بارے میں کسی بھی طرف کوئی ثبوت نہیں کہ عربی کی بورڈز کے عام ہونے کے ساتھ عربیزی کا استعمال کم ہو رہا ہے یا نہیں، اور اس بارے میں کوئی تحقیق نہیں کہ آیا خلیجی سننے والے سروس کال میں مصری یا شامی عربی میں دیے گئے جوابات کو قابل قبول سمجھتے ہیں۔
ان میں سے ہر ایک ایسا سوال ہے جس کا جواب تلاش کرنے کا آغاز کسی کاروبار کی اپنی گفتگو سے بنایا گیا ٹیسٹ سیٹ کر سکتا ہے۔ یہی وجہ ہے کہ ایسا ٹیسٹ سیٹ تعیناتی کے بعد نہیں، بلکہ اس سے پہلے بنایا جائے۔
مآخذ
- 1.Al Ali, M. K. and Aldarmaki, H. Mixat: A Data Set of Bilingual Emirati-English Speech. SIGUL workshop at LREC-COLING, 2024.https://aclanthology.org/2024.sigul-1.26/
- 2.Hamed, I., Eryani, F., Palfreyman, D. and Habash, N. ZAEBUC-Spoken: A Multilingual Multidialectal Arabic-English Speech Corpus. LREC-COLING, 2024.https://aclanthology.org/2024.lrec-main.1546/
- 3.Hamed, I., Vu, N. T. and Abdennadher, S. ArzEn: A Speech Corpus for Code-switched Egyptian Arabic-English. LREC, 2020.https://aclanthology.org/2020.lrec-1.523/
- 4.Alharbi, S. et al. (SDAIA National Center for AI). Saudilang Code-Switch Corpus, 2024.https://huggingface.co/datasets/SDAIANCAI/Saudilang-Code-Switch-Corpus
- 5.Al-Issa and Sulieman. Language choice at ATMs in Dubai. Frontiers in Communication 9:1355632, 2024.https://www.frontiersin.org/journals/communication/articles/10.3389/fcomm.2024.1355632/full
- 6.Hopkyns, Zoghbor and Hassall. The use of English and linguistic hybridity among Emirati millennials. World Englishes, 2020.https://doi.org/10.1111/weng.12506
- 7.General Authority for Statistics, Saudi Arabia. Saudi Census 2022 results, via Saudi Press Agency, 31 May 2023.https://www.spa.gov.sa/w1911463
- 8.Wang, Alhmoud and Alqurishi (Elm). Open Universal Arabic ASR Leaderboard. Interspeech, 2025.https://www.isca-archive.org/interspeech_2025/wang25_interspeech.pdf
- 9.Talafha et al. Casablanca: Data and Models for Multidialectal Arabic Speech Recognition. EMNLP, 2024.https://aclanthology.org/2024.emnlp-main.1211/
- 10.Ugan, E. Y., Pham, N. Q., Bärmann, L. and Waibel, A. PIER: A Novel Metric for Evaluating What Matters in Code-Switching. ICASSP, 2025.https://arxiv.org/abs/2501.09512
- 11.Hamed, I., Hussein, A., Chellah, O., Chowdhury, S., Mubarak, H., Sitaram, S., Habash, N. and Ali, A. Benchmarking Evaluation Metrics for Code-Switching Automatic Speech Recognition. IEEE SLT, 2022.https://arxiv.org/abs/2211.16319
- 12.Kadaoui, K., Al Ali, M., Toyin, H., Mohammed, I. and Aldarmaki, H. PolyWER: A Holistic Evaluation Framework for Code-Switched Speech Recognition. Findings of EMNLP, 2024.https://aclanthology.org/2024.findings-emnlp.356/
- 13.Kim, S., Arora, A., Le, D., Yeh, C.-F., Fuegen, C., Kalinli, O. and Seltzer, M. L. Semantic Distance: A New Metric for ASR Performance Analysis Towards Spoken Language Understanding. Interspeech, 2021.https://www.isca-archive.org/interspeech_2021/kim21e_interspeech.pdf
- 14.Bastianelli, E., Vanzo, A., Swietojanski, P. and Rieser, V. SLURP: A Spoken Language Understanding Resource Package. EMNLP, 2020.https://aclanthology.org/2020.emnlp-main.588/
- 15.Microsoft. Language identification with the Speech service. Azure AI documentation, updated 4 March 2026.https://learn.microsoft.com/en-us/azure/ai-services/speech-service/language-identification
- 16.Google Cloud. Detect language in audio (multiple languages). Speech-to-Text documentation, updated 24 September 2026.https://docs.cloud.google.com/speech-to-text/docs/multiple-languages
- 17.Google Cloud. Speech Synthesis Markup Language (SSML). Text-to-Speech documentation, updated 24 September 2026.https://docs.cloud.google.com/text-to-speech/docs/ssml
- 18.Lodagala, V. S., Alkanhal, M., Izham, M., Mehta, S., Chowdhury, S. A., Makki, M., Hussein, A., Henter, G. E. and Ali, A. SawtArabi: A Benchmark Corpus for Arabic TTS. Standard, Dialectal and Code-Switching. Interspeech, 2025.https://www.isca-archive.org/interspeech_2025/lodagala25_interspeech.pdf
- 19.Albasiri, E., Kim, M., Ferchichi, N. and Olabiyi, O. Inverse Text Normalization for Arabic Numbers in Streaming ASR. CAWL workshop at LREC, 2026.https://aclanthology.org/2026.cawl-1.11/
- 20.Hamed, I., Sabty, C., Abdennadher, S., Vu, N. T., Solorio, T. and Habash, N. A Survey of Code-switched Arabic NLP: Progress, Challenges, and Future Directions. COLING, 2025.https://aclanthology.org/2025.coling-main.307/
- 21.Alzubaidi et al. A survey of Arabic large language model benchmarks, 2025 (preprint).https://arxiv.org/abs/2510.13430
- 22.Mohamed, A., Zhang, Y., Vazirgiannis, M. and Shang, G. Lost in the Mix: Evaluating LLM Understanding of Code-Switched Text, 2025 (preprint).https://arxiv.org/abs/2506.14012
- 23.Ferguson, C. A. Diglossia. Word 15(2), 1959.https://doi.org/10.1080/00437956.1959.11659702
- 24.Poplack, S. Sometimes I'll start a sentence in Spanish y termino en español: toward a typology of code-switching. Linguistics 18(7-8), 1980.https://doi.org/10.1515/ling.1980.18.7-8.581
- 25.Palfreyman, D. and Al Khalil, M. "A Funky Language for Teenzz to Use": Representing Gulf Arabic in Instant Messaging. Journal of Computer-Mediated Communication 9(1), 2003.https://doi.org/10.1111/j.1083-6101.2003.tb00355.x
- 26.Peng, P., Yan, B., Watanabe, S. and Harwath, D. Prompting the Hidden Talent of Web-Scale Speech Models for Zero-Shot Task Generalization. Interspeech, 2023.https://par.nsf.gov/servlets/purl/10478271
- 27.ElevenLabs. Language detection (Agents platform documentation).https://elevenlabs.io/docs/agents-platform/customization/tools/system-tools/language-detection
نئی تحقیق شائع ہوتے ہی حاصل کریں
جب ہم کچھ شائع کرتے ہیں تو کبھی کبھار ای میلز۔