Telonic

گورننس30 ستمبر 2026Ishaan Mirchandani, Anthony Ombrore

ایسے اے آئی ایجنٹس کا ڈیزائن جو بڑے اداروں کے پیمانے پر گورننس کے سامنے جواب دہ ہوں

کسی بڑے ادارے کو کیسے طے کرنا چاہیے کہ اے آئی ایجنٹ کون سے فیصلے خود کرے، کون سے حدود کے اندر رہ کر کرے، اور کون سے فیصلے ہمیشہ کسی فرد کے پاس رہیں۔ اور یہ کہ اے آئی ایجنٹ نے کیا کیا اور کیوں کیا، اس کا ریکارڈ ان ہدایات سے زیادہ اہم کیوں ہے جو اسے دی گئی تھیں۔

اس صفحے پر
  1. صورتحال
  2. شواہد کیا بتاتے ہیں
  3. اس کا مطلب کیا ہے
  4. ہم اس کے مطابق ڈیزائن کیسے کرتے ہیں
  5. جو ہم ابھی نہیں جانتے
  6. مآخذ

صورتحال

متحدہ عرب امارات کی کسی موٹر انشورنس کمپنی کے لیے لازمی ہے کہ وہ کلیم دائر کرنے والے کو تین دن کے اندر بتائے کہ کون سی دستاویزات موجود نہیں ہیں، اور مکمل فائل موصول ہونے کے پندرہ دن کے اندر کلیم کا تصفیہ کرے [1]۔ 23:00 پر ایک پالیسی ہولڈر WhatsApp پر پیغام بھیجتا ہے: "کیا میرا کلیم منظور ہو گیا ہے؟" اے آئی ایجنٹ کلیمز کے سسٹم سے کلیم کی صورتحال معلوم کر سکتا ہے، ان دو دستاویزات کی فہرست دے سکتا ہے جو ابھی باقی ہیں، اور یہ وضاحت کر سکتا ہے کہ کٹوتی کی رقم کے بارے میں پالیسی کیا کہتی ہے۔ البتہ اس پر لازم ہے کہ وہ ایک کام کبھی نہ کرے: اس سوال کا جواب اپنی طرف سے ہاں یا نہیں میں دینا۔

اے آئی ایجنٹ تعینات کرنے والا ہر ادارہ اسی طرح کی ایک حد کھینچتا ہے۔ کوئی رئیل اسٹیٹ ڈویلپر طے کرتا ہے کہ آیا ایجنٹ ادائیگی کے پلان کو ازسرنو ترتیب دے سکتا ہے یا نہیں۔ کوئی ہوٹل طے کرتا ہے کہ آیا ایجنٹ خیر سگالی کا واؤچر جاری کر سکتا ہے، اور زیادہ سے زیادہ کتنی مالیت کا۔ مشکل اس بات پر اتفاق کرنا نہیں کہ ایسی حد موجود ہے۔ مشکل یہ طے کرنا ہے کہ وہ حد کہاں ہو، یہ یقینی بنانا ہے کہ جب کوئی دیکھ نہ رہا ہو تب بھی وہ قائم رہے، اور بعد میں یہ ٹھیک ٹھیک دکھانے کے قابل ہونا ہے کہ ایجنٹ نے کیا کیا اور کس بنیاد پر کیا۔

شواہد کیا بتاتے ہیں

فریم ورکس نگرانی کو خطرے کے تناسب سے رکھتے ہیں۔ ان میں سے کوئی بھی ہر فیصلے پر کسی فرد کی موجودگی کا تقاضا نہیں کرتا۔

NIST کا اے آئی رسک مینجمنٹ فریم ورک (AI Risk Management Framework)، جو امریکہ کا ایک رضاکارانہ معیار ہے، خطرے کو کسی واقعے کے امکان اور اس کے نتائج کی شدت کا مجموعہ قرار دیتا ہے، اور اداروں سے کہتا ہے کہ وہ دستاویزی شکل میں بتائیں کہ انسان کسی سسٹم کی نگرانی کیسے کرتے ہیں، اور ایسے طریقے برقرار رکھیں جن سے سسٹم کو "رد کرنا، منقطع کرنا یا غیر فعال کرنا" ممکن ہو [2]۔ ISO/IEC 42001، جو مینجمنٹ سسٹم کا ایک ایسا معیار ہے جس کی سرٹیفیکیشن حاصل کی جا سکتی ہے، لاگنگ سے متعلق صرف ایک کنٹرول رکھتا ہے، جس کے تحت ایونٹ لاگز کو کم از کم اس وقت تک محفوظ رکھنا ضروری ہے جب تک سسٹم استعمال میں ہو [3]۔ دونوں میں سے کوئی بھی یہ نہیں بتاتا کہ عمل میں کسی فرد کا کہاں موجود ہونا لازمی ہے۔

یورپی یونین کا اے آئی قانون (EU AI Act) سب سے زیادہ واضح ہے۔ جن سسٹمز کو یہ زیادہ خطرے والا قرار دیتا ہے، ان کے لیے آرٹیکل 14 یہ ضروری قرار دیتا ہے کہ سسٹم کی نگرانی کرنے والے افراد اس پر نظر رکھ سکیں، اس کے نتیجے کو رد یا کالعدم کر سکیں، اور اسے روک سکیں۔ اس مضمون کے لیے جو قانونی طور پر لازم متون مل سکے، ان میں یہ واحد متن ہے جو آٹومیشن تعصب (automation bias) کا نام لیتا ہے، یعنی مشین کے نتیجے کو جانچے بغیر قبول کر لینے کا وہ رجحان جو اچھی طرح دستاویزی ہے، اور اسے ایسی چیز قرار دیتا ہے جس کا مقابلہ کرنے میں نگرانی کرنے والوں کی مدد کرنا لازمی ہے [4]۔ کسی استعمال کو زیادہ خطرے والا قرار دینے کے لیے اس کے معیارات میں یہ شامل ہے کہ سسٹم کس حد تک خود کارروائی کرتا ہے، اور "اے آئی سسٹم کی شمولیت سے پیدا ہونے والے نتیجے کو کس حد تک آسانی سے درست یا واپس کیا جا سکتا ہے" [5]۔

خلیجی ممالک کے قاری کے لیے دو وضاحتیں اہم ہیں۔ زیادہ خطرے والے استعمالات کی فہرست موضوع کے لحاظ سے ترتیب دی گئی ہے، اور کسٹمر سروس اور کلیمز نمٹانا اس میں شامل نہیں؛ صرف لائف اور ہیلتھ انشورنس میں خطرے کا جائزہ اور قیمتوں کا تعین اس میں شامل ہیں [6]۔ اور یہ قانون یورپی یونین سے باہر کی کسی ایسی کمپنی پر، جو اے آئی سسٹم استعمال کرتی ہے، صرف اس صورت میں لاگو ہوتا ہے جب سسٹم کا نتیجہ یورپی یونین کے اندر استعمال ہو [7]، اس لیے خلیجی کسٹمرز کو خدمات فراہم کرنے والا متحدہ عرب امارات یا سعودی عرب کا کوئی ادارہ اس کے دائرہ کار سے باہر ہے۔ زیادہ خطرے والے سسٹمز سے متعلق اس کی ذمہ داریاں اب دسمبر 2027 سے لاگو ہوں گی [8]۔

خلیجی قوانین فیصلے کے موضوع کو نہیں، اس کے اثر کو بنیاد بناتے ہیں۔

متحدہ عرب امارات کا ذاتی ڈیٹا کے تحفظ کا وفاقی قانون کسی فرد کو ان فیصلوں پر اعتراض کرنے کا حق دیتا ہے جو "خودکار پروسیسنگ کے نتیجے میں ہوں، بشمول پروفائلنگ، خاص طور پر وہ فیصلے جن کے اس پر قانونی اثرات ہوں یا جو اسے منفی طور پر متاثر کریں"، اور ڈیٹا کنٹرولر کے لیے ضروری قرار دیتا ہے کہ وہ "متعلقہ فرد (Data Subject) کی درخواست پر خودکار پروسیسنگ کے فیصلوں کے جائزے میں انسانی عنصر شامل کرے" [9]۔ یہ قانون جنوری 2022 سے نافذ ہے، لیکن 2026 کے وسط تک اس کے نفاذی ضوابط جاری نہیں ہوئے تھے، اور وفاقی ڈیٹا آفس کبھی مکمل طور پر فعال نہیں ہوا، اس لیے ابھی اس پر عمل درآمد کرانے کا کوئی نظام موجود نہیں [10]۔ یہ قانون DIFC یا ADGM میں لاگو نہیں ہوتا، جن کے اپنے الگ قانونی نظام ہیں۔

DIFC کے قواعد خطے میں سب سے زیادہ ترقی یافتہ ہیں۔ ریگولیشن 10 (Regulation 10) کسی سسٹم کو تجارتی طور پر ذاتی ڈیٹا کی پروسیسنگ کی اجازت صرف اس صورت میں دیتا ہے جب اس کے مقاصد انسانوں نے متعین یا منظور کیے ہوں، یا جہاں سسٹم اپنے مقاصد خود طے کرتا ہو، وہاں وہ ایسا "صرف انسانوں کی متعین کردہ پابندیوں کی حدود کے اندر" کرے؛ اور آرٹیکل 38 کسی فرد کو یہ حق دیتا ہے کہ وہ کسی ایسے فیصلے پر اعتراض کرے جو صرف خودکار طریقے سے کیا گیا ہو اور جس کے قانونی یا "دیگر سنگین اثرات رکھنے والے نتائج" ہوں، اور دستی جائزے کا تقاضا کرے [11][12]۔ یہ قواعد صرف DIFC کے اداروں پر لازم ہیں۔ سعودی عرب میں ذاتی ڈیٹا کے تحفظ کے قانون (Personal Data Protection Law) کے نفاذی ضوابط، جن پر ستمبر 2024 سے عمل درآمد ہو رہا ہے، صرف خودکار طریقے سے کیے گئے فیصلوں کے لیے واضح رضامندی، اور جہاں فیصلوں کی بنیاد خودکار پروسیسنگ پر ہو وہاں اثرات کا جائزہ (impact assessment) ضروری قرار دیتے ہیں؛ یہ بات ایک قانونی فرم کے خلاصے پر مبنی ہے، کیونکہ ریگولیٹر کے انگریزی متن تک رسائی ممکن نہیں ہو سکی [13]۔

متحدہ عرب امارات میں آن شور لائسنس رکھنے والی انشورنس کمپنیوں کے لیے، متحدہ عرب امارات کے مرکزی بینک (Central Bank of the UAE, CBUAE) کا فروری 2026 کا رہنما نوٹ نگرانی کے تین درجے بیان کرتا ہے۔ "انسانی شمولیت کے بغیر" (Human-out-of-the-loop) درجہ، جس میں سسٹم براہ راست انسانی شمولیت کے بغیر کارروائی کرتا ہے، "صرف کم خطرے والے اور غیر اہم عملوں کے لیے استعمال کیا جانا چاہیے"، اور صارفین کو "اے آئی سے تیار کردہ فیصلوں کے انسانی جائزے یا وضاحت کی درخواست کرنے کے قابل ہونا چاہیے" [14]۔ یہ رہنمائی ہے، ضابطہ نہیں، اور یہ لائسنس یافتہ مالیاتی اداروں پر لاگو ہوتی ہے، رئیل اسٹیٹ ڈویلپرز یا ہوٹلوں پر نہیں۔

مشین کی جانچ کرنے والا فرد اتنا مضبوط کنٹرول نہیں جتنا نظر آتا ہے۔

"عمل کے اندر انسان" (human in the loop) کا مطلب ہے کہ ہر فیصلہ نافذ ہونے سے پہلے کوئی فرد اسے منظور کرتا ہے۔ "عمل کے اوپر انسان" (human on the loop) کا مطلب ہے کہ سسٹم کارروائی کرتا ہے اور کوئی فرد نتائج کی نگرانی کرتا ہے۔ دونوں کا انحصار اس بات پر ہے کہ وہ فرد واقعی توجہ دے، اور کئی دہائیوں کی تحقیق بتاتی ہے کہ ناکامی یہیں ہوتی ہے۔

پرواز کی سمیولیشن پر مبنی ایک کنٹرولڈ تحقیق میں، جن شرکا کو ایک ایسا خودکار امدادی نظام دیا گیا جو بڑی حد تک، لیکن مکمل طور پر نہیں، قابل اعتماد تھا، وہ ان واقعات میں سے 41 فیصد کو نظرانداز کر گئے جن کی اس نظام نے نشاندہی نہیں کی، اور 65 فیصد مواقع پر انہوں نے اس کی غلط سفارش پر عمل کیا، ان صورتوں میں بھی جب دوسرے آلات اس کی تردید کر رہے تھے [15]۔ ایک تحقیق میں 554 غیر ماہر شرکا نے مقدمے کی سماعت سے پہلے کے مرحلے کے نتائج کی پیش گوئی کی؛ ان میں سے جن 304 کو خطرے کا اسکور دیا گیا، ان میں صرف 23.7 فیصد کی کارکردگی تنہا اسکور سے بہتر رہی، 64.1 فیصد کی کارکردگی اس سے بدتر رہی، اور ان کے اعتماد اور ان کی کارکردگی کے درمیان منفی تعلق تھا [16]۔ مشین کے استدلال کی وضاحت سے یہ مسئلہ حل نہیں ہوتا: 1,626 شرکا پر مبنی ایک تحقیق میں وضاحتوں سے سفارش کے ساتھ اتفاق بڑھ گیا، چاہے سفارش درست ہو یا غلط [17]۔ OWASP کی 2025 کی فہرست، جس میں اے آئی ایجنٹ ایپلیکیشنز کے دس بڑے خطرات شامل ہیں، انسان اور ایجنٹ کے درمیان اعتماد کے غلط استعمال (human-agent trust exploitation) کو بھی شمار کرتی ہے، جس میں پراعتماد اور نفیس وضاحتیں آپریٹرز کو گمراہ کر کے ان سے نقصان دہ کارروائیاں منظور کروا لیتی ہیں [18]۔

منظر عام پر آنے والی ناکامیوں کی شکل ایک جیسی ہے۔ نیدرلینڈز میں بچوں کی نگہداشت کے الاؤنس کے اسکینڈل میں، نشان زد درخواستوں کا جائزہ لینے والے سرکاری ملازمین وہ معلومات نہیں دیکھ سکتے تھے جن کی بنیاد پر خطرے کا اسکور دیا گیا تھا [19]۔ آسٹریلیا کی Robodebt اسکیم میں عملہ پہلے سالانہ تقریباً 20,000 زیادہ خطرے والی فائلوں کا جائزہ لیتا تھا؛ خودکار سسٹم تقریباً 20,000 فی ہفتہ کی رفتار سے نوٹس بھیجتا تھا [20]۔ ہر معاملے میں جائزہ کار کے پاس تین چیزوں میں سے کم از کم ایک کی کمی تھی: وقت، معلومات یا اختیار۔ جہاں ان تینوں میں سے کسی ایک کی بھی کمی ہو، وہاں انسانی جانچ محض ایک رسمی کارروائی ہوتی ہے۔

جو منظوری کے مراحل بار بار سامنے آئیں، انہیں نظرانداز کر دیا جاتا ہے۔

جو منظوری کا مرحلہ ہر معمول کی کارروائی میں رکاوٹ ڈالے، وہ لوگوں کو بغیر پڑھے آگے کلک کرنے کا عادی بنا دیتا ہے۔ 112 معالجین کو دی گئی 1.27 ملین طبی یاد دہانیوں پر مبنی ایک تحقیق میں، مریض سے ایک ہی ملاقات کے دوران ہر اضافی یاد دہانی کے ساتھ کسی یاد دہانی کے قبول کیے جانے کا امکان 30 فیصد کم ہو گیا [21]۔ اس لیے منظوری کا مرحلہ صرف وہیں ہونا چاہیے جہاں اس کی ضرورت ہو۔ ایک وینڈر کے تجزیے میں، جو اس نے اپنے ہی پلیٹ فارم پر اے آئی ایجنٹس کی سرگرمی کے بارے میں کیا اور جس کا ہم مرتبہ جائزہ (peer review) نہیں ہوا، پایا گیا کہ ایجنٹس کی صرف تقریباً 0.8 فیصد کارروائیاں ناقابل واپسی معلوم ہوتی تھیں [22]۔ اگر کسٹمرز سے رابطے میں بھی یہی صورتحال ہو، تو انسانی توجہ کو ناقابل واپسی کارروائیوں پر مرکوز کرنا قابل برداشت ہے، جبکہ ہر چیز کا جائزہ لینا قابل برداشت نہیں۔

کب رکنا ہے، اس بارے میں صرف اے آئی ایجنٹ کے اپنے اندازے پر انحصار نہیں کیا جا سکتا۔

اعتماد پر مبنی ایسکلیشن کا مطلب ہے کہ جب اے آئی ایجنٹ کا یہ اندازہ کہ وہ درست ہے، اعتماد کی کم از کم سطح سے نیچے آ جائے تو وہ گفتگو کسی فرد کے حوالے کر دیتا ہے۔ یہ اندازہ ایک حقیقی اشارہ ہے، لیکن جانبدار اشارہ۔ 2026 کے ایک پری پرنٹ (preprint) میں، جس میں آٹھ لسانی ماڈلز کو حقیقی انسانی فیصلوں کے ڈیٹا والے کاموں پر جانچا گیا، پایا گیا کہ جس اعتماد کی سطح پر ہر ماڈل نے ایسکلیٹ کرنے کا فیصلہ کیا، وہ تقریباً 53 فیصد سے لے کر 100 فیصد سے زیادہ تک تھی، دو ماڈلز نے ہر معاملہ ایسکلیٹ کر دیا، اور ماڈل اور حالات کے 66 فیصد امتزاجات میں ماڈل نے اپنی درستگی کا اندازہ حقیقت سے زیادہ لگایا [23]۔ اے آئی ایجنٹس کی حفاظت کے 2,000 ٹیسٹس پر مشتمل ایک بینچ مارک پر کوئی بھی ایجنٹ 60 فیصد سے زیادہ اسکور حاصل نہیں کر سکا، اور مصنفین نے یہ نتیجہ اخذ کیا کہ "صرف دفاعی ہدایات (prompts) پر انحصار ناکافی ہو سکتا ہے" [24]۔ اعتماد کی کم از کم سطح کو تعیناتی سے پہلے اسی مخصوص ماڈل کے لیے ناپنا لازمی ہے، اور اس کی جگہ ان قواعد کے ساتھ ہے جنہیں اے آئی ایجنٹ کسی دلیل سے ٹال نہیں سکتا، ان کے متبادل کے طور پر نہیں۔

قابل استعمال ریکارڈ میں کیا شامل ہوتا ہے، یہ دوسری جگہوں پر پہلے ہی طے ہو چکا ہے۔

فلائٹ ڈیٹا ریکارڈر یہ درج کرتا ہے کہ طیارے نے کیا کیا اور عملے نے کیا کیا، اور یہ سب وقت کے ایک ہی پیمانے پر ہوتا ہے، تاکہ کاک پٹ وائس ریکارڈر کی ریکارڈنگ کو اس کے ساتھ ملا کر دیکھا جا سکے۔ نئے بڑے طیاروں میں کاک پٹ ریکارڈرز اب دو کے بجائے 25 گھنٹے کی ریکارڈنگ محفوظ رکھتے ہیں، کیونکہ دو گھنٹے کی ریکارڈنگز، کسی کو یہ معلوم ہونے سے پہلے ہی کہ ان کی ضرورت ہے، بار بار نئی ریکارڈنگ سے اوور رائٹ ہو جاتی تھیں، بشمول سان فرانسسکو میں 2017 کے ایک واقعے کے بعد [25]۔ یورپی سرمایہ کاری فرموں کے لیے لازمی ہے کہ وہ کلائنٹس کے آرڈرز سے متعلق گفتگو ریکارڈ کریں، "چاہے اس گفتگو یا رابطے کے نتیجے میں ایسے لین دین طے نہ پائیں"، اور یہ ریکارڈ پانچ سے سات سال تک رکھیں [26]۔ امریکی سیکیورٹیز کے قواعد یہ ضروری قرار دیتے ہیں کہ ریکارڈ ایسے ذخیرے میں رکھے جائیں جس میں صرف ایک بار لکھا جا سکے (write-once storage)، یا ہر تبدیلی اور اسے کرنے والے فرد کی "وقت کے اندراج کے ساتھ مکمل آڈٹ ٹریل" کے ساتھ رکھے جائیں [27]۔ اے آئی کی صنعت بھی اسی طرح کے فیلڈز کی فہرست پر متفق ہوتی جا رہی ہے: جنریٹو اے آئی کے لیے OpenTelemetry کے ضوابط (conventions)، جو سسٹمز کی کارکردگی پر نظر رکھنے (observability) کا ایک کھلا معیار ہے، ماڈل، ہدایات، ان پٹ اور آؤٹ پٹ پیغامات، ہر استعمال کیے گئے ٹول کو اس کے آرگیومنٹس اور نتیجے سمیت، اور ایجنٹ اور گفتگو کے شناختی کوڈز کو درج کیے جانے والے فیلڈز کے طور پر متعین کرتے ہیں [28]۔ چھیڑ چھاڑ ظاہر کرنے والا لاگ (tamper-evident log) اپنے اندراجات کو ایک زنجیر کی صورت میں جوڑتا ہے، اس طرح کہ ہر اندراج میں اپنے سے پچھلے اندراج کا ایک کرپٹوگرافک فنگر پرنٹ ہوتا ہے، جس کی وجہ سے بعد میں کی گئی کسی بھی ترمیم کا پتا لگایا جا سکتا ہے [29]۔

تنازعات کا فیصلہ ریکارڈ سے ہوتا ہے۔ فروری 2024 میں کینیڈا کے ایک ٹریبونل نے Air Canada کو ایک مسافر کو معاوضہ ادا کرنے کا حکم دیا۔ اس سے پہلے ایئر لائن کی ویب سائٹ کے چیٹ بوٹ نے مسافر کو بتایا تھا کہ وہ ٹکٹ خریدنے کے 90 دن کے اندر کسی عزیز کی وفات کی صورت میں ملنے والے رعایتی کرایے (bereavement fare) کے لیے درخواست دے سکتا ہے، جو ایئر لائن کی پالیسی کے صفحے کے برعکس تھا۔ Air Canada نے مؤقف اختیار کیا کہ چیٹ بوٹ عملاً ایک الگ قانونی وجود تھا جو اپنے اقدامات کا خود ذمہ دار تھا۔ ٹریبونل نے اسے "ایک غیر معمولی مؤقف" قرار دیا اور فیصلہ دیا کہ "Air Canada پر یہ واضح ہونا چاہیے کہ وہ اپنی ویب سائٹ پر موجود تمام معلومات کی ذمہ دار ہے" [30]۔ مسافر کے پاس اسکرین شاٹ موجود تھا۔ برطانیہ کے ایک ریگولیٹر نے 2025 میں ہوم اور ٹریول انشورنس فراہم کرنے والی 23 کمپنیوں کا جائزہ لیا، جس میں اے آئی کا کوئی ذکر نہیں تھا، اور پایا کہ بہت سے معاملات میں کلیمز کمیٹی کے اہم اجلاسوں کی روداد میں "اتنی تفصیل نہیں تھی کہ بامعنی بحث، اعتراض یا فیصلہ سازی ثابت ہو سکے" [31]۔ فیصلہ کرنے والا کسی بھی نوعیت کا ہو، ثبوت کا معیار وہی رہتا ہے۔

اس کا مطلب کیا ہے

اس مضمون کا ابتدائی مفروضہ یہ تھا کہ فیصلوں کی درجہ بندی ان کے موضوع کے بجائے ان کے نتائج اور قابل واپسی ہونے کی بنیاد پر کی جانی چاہیے، اور یہ کہ گورننس کا نفاذ اس بات کے ذریعے ہونا لازمی ہے کہ اے آئی ایجنٹ کیا کر سکتا ہے، اور ایک مکمل ریکارڈ کے ذریعے، نہ کہ صرف ہدایات کے ذریعے۔ شواہد دونوں کی تائید کرتے ہیں، دو اصلاحات کے ساتھ۔

پہلی بات، نتائج اور قابل واپسی ہونا درست محور ہیں، لیکن موضوع کی اہمیت پھر بھی برقرار ہے۔ قانون ساز نتائج اور قابل واپسی ہونے کو یہ طے کرنے کے لیے استعمال کرتے ہیں کہ کس چیز کو ضابطے میں لایا جائے، اور پھر موضوع کے لحاظ سے ضوابط بناتے ہیں [5][6]۔ کچھ فیصلے، خواہ وہ قابل واپسی ہوں یا نہ ہوں، ہر حال میں الگ رکھے جاتے ہیں: قانون کی رو سے، جیسے طبی فیصلہ؛ ریگولیٹر کی توقع کی رو سے، جیسے کلیم کا فیصلہ، جسے مرکزی بینک کی رہنمائی کم خطرے والا اور غیر اہم عمل قرار نہیں دے گی؛ یا خود کاروبار کے فیصلے سے، جیسے کوئی بھی معاملہ جو پہلے ہی ریگولیٹر کے پاس ہو۔ درجہ بندی کے کسی بھی نظام میں ایک ایسا قاعدہ ضروری ہے جو ان فیصلوں کو اے آئی ایجنٹ کے دائرے سے مکمل طور پر نکال دے۔

دوسری بات، نتائج کا اندازہ پہلے سے، ہر قسم کی کارروائی کے لیے الگ، اور انسانوں کے ذریعے لگانا لازمی ہے۔ کام کے دوران خطرے کے بارے میں اے آئی ایجنٹ کا اندازہ اتنا غیر مستقل ہوتا ہے کہ یہ ذمہ داری اس پر نہیں ڈالی جا سکتی [23][24]۔ اعتماد پر مبنی ایسکلیشن دوسری حفاظتی تہہ ہے، پہلی نہیں۔

نفاذ سے متعلق مفروضہ درست ثابت ہوتا ہے، ایک اضافے کے ساتھ۔ صلاحیت کی حدود اور مکمل ریکارڈ کم از کم بنیاد ہیں۔ لیکن انسانی منظوری کا مرحلہ خود ایک ایسا کنٹرول ہے جو قابل پیش گوئی طریقوں سے ناکام ہوتا ہے، اس لیے اسے جائزہ کار کو مدنظر رکھ کر ڈیزائن کرنا لازمی ہے: یہ کم ہی سامنے آئے، قائل کرنے والے خلاصے کے بجائے حقائق کے ساتھ آئے، اور ایسے فرد کے پاس جائے جس کے پاس نتیجہ بدلنے کا اختیار ہو۔ ریکارڈ بذات خود کچھ نہیں روکتا؛ یہ بعد میں جواب دہی کو ممکن بناتا ہے، اور اگر اسے پڑھا جائے تو سسٹم کو بہتر بناتا ہے۔ یہاں ایک چیز کے بدلے دوسری چھوڑنی پڑتی ہے۔ منظوری کے کم مراحل کا مطلب ہے کہ زیادہ فیصلے کسی فرد کے بغیر ہوں گے؛ زیادہ مراحل کا مطلب ہے ایک ایسا فرد جو پڑھنا چھوڑ دیتا ہے۔ منظوری کا مرحلہ وہاں ہونا چاہیے جہاں ناقابل واپسی کارروائیاں ہوں، اور تقریباً کہیں اور نہیں۔

ہم اس کے مطابق ڈیزائن کیسے کرتے ہیں

کارروائیوں کی درجہ بندی تعیناتی سے پہلے کی جاتی ہے، اور یہ درجہ بندی اس میں نافذ ہوتی ہے کہ اے آئی ایجنٹ کیا کر سکتا ہے۔ ہر وہ کارروائی جو اے آئی ایجنٹ کسی کلائنٹ کے سسٹمز میں کر سکتا ہے، چار زونز میں سے کسی ایک میں آتی ہے۔ وہ کارروائیاں جو وہ خود کرتا ہے اور ریکارڈ میں درج کرتا ہے: کسی کلیم کی صورتحال دیکھنا، غائب دستاویزات کی فہرست بتانا۔ وہ کارروائیاں جو وہ کاروبار کی طے کردہ حدود کے اندر کرتا ہے: کرایے کے قواعد کے اندر دوبارہ بکنگ، ایک مقررہ مالیت تک کا واؤچر۔ وہ کارروائیاں جو وہ تیار کرتا ہے تاکہ کوئی فرد انہیں منظور کرے۔ اور وہ کارروائیاں جو اسے کبھی دی ہی نہیں جاتیں۔ انشورنس میں اے آئی ایجنٹ نہ کبھی ذمہ داری کا تعین کرتا ہے، نہ تصفیے کی رقم طے کرتا ہے، اور نہ کسی کلیم کو منظور یا مسترد کرتا ہے، اور ایسا اس لیے ہے کہ فیصلے کی یہ کارروائیاں اے آئی ایجنٹ کو فراہم ہی نہیں کی جاتیں، اس لیے نہیں کہ اسے انہیں استعمال نہ کرنے کی ہدایت دی گئی ہے۔ کاروبار طے کرتا ہے، اور بدل سکتا ہے، کہ کون سی گفتگو کسی فرد کے پاس جائے، کن ٹریگرز پر جائے، اور کون سے موضوعات دائرہ کار سے باہر ہیں۔ دوسرے زون میں کلائنٹ کے قواعد، جیسے منظوری کی حدود اور کسٹمرز کے استحقاق، ایسی ہدایات کے طور پر نہیں لکھے جاتے جنہیں اے آئی ایجنٹ نظرانداز کر سکے، بلکہ سسٹم کے ڈھانچے (architecture) میں نافذ کیے جاتے ہیں، اور جن کارروائیوں کو کاروبار حساس قرار دیتا ہے وہ کسی فرد کی منظوری کا انتظار کرتی ہیں۔

اے آئی ایجنٹ کا اعتماد دوسرا ٹریگر ہے، اور حوالگی میں فرد کو حقائق ملتے ہیں، کسی فیصلے کی وکالت نہیں۔ جب اے آئی ایجنٹ کو کافی اعتماد نہ ہو تو گفتگو کسی فرد کے حوالے ہو جاتی ہے؛ ضرورت سے زیادہ اعتماد کے بارے میں شواہد کو دیکھتے ہوئے، اعتماد کی کم از کم سطح تعیناتی سے پہلے ہر ماڈل کے لیے الگ ناپی جاتی ہے اور اوپر بیان کردہ قواعد کے ساتھ ایک اضافی تہہ کے طور پر شامل کی جاتی ہے۔ جب اے آئی ایجنٹ کو یقین نہ ہو تو وہ اندازہ لگانے کے بجائے وضاحت کے لیے سوال پوچھتا ہے۔ گفتگو سنبھالنے والے فرد کو پوری گفتگو اور ایک خلاصہ ملتا ہے، اور وضاحتیں جائزہ کاروں پر جو اثر ڈالتی ہیں اس کے پیش نظر، یہ خلاصہ اس طرح ڈیزائن کیا گیا ہے کہ وہ دکھائے کہ کسٹمر نے کیا کہا، اے آئی ایجنٹ نے کیا کیا اور اسے کہاں یقین نہیں تھا، نہ کہ کسی نتیجے کے حق میں دلیل دے۔

ریکارڈ کل کے ڈیش بورڈ کے لیے نہیں، بلکہ دو سال بعد کے کسی تنازع کے لیے بنایا جاتا ہے۔ ہر کال رضامندی سے مشروط ریکارڈ کی جا سکتی ہے اور ساتھ ساتھ اس کی تحریری نقل تیار کی جا سکتی ہے؛ ہر گفتگو ختم ہونے پر اس کا خلاصہ بنایا جاتا ہے اور اس کے نتیجے کی درجہ بندی کی جاتی ہے؛ اور اے آئی ایجنٹ صرف کلائنٹ کے منظور شدہ مواد سے جواب دیتا ہے، اس لیے کسی بھی جواب کے ماخذ کا سراغ لگایا جا سکتا ہے۔ ایک مکمل آڈٹ ٹریل اے آئی ایجنٹ کی ہر کارروائی اور اس کی وجہ کو ایسی شکل میں درج کرتا ہے جس میں بعد میں کی گئی کسی بھی تبدیلی کا پتا لگایا جا سکتا ہے؛ اس کے ساتھ ورژن کنٹرول ہوتا ہے، تاکہ اے آئی ایجنٹ میں ہر تبدیلی ریکارڈ ہو اور اسے واپس لیا جا سکے، اور ڈیٹا محفوظ رکھنے کی وہ مدتیں ہوتی ہیں جو کلائنٹ طے کرتا ہے۔ اسی ریکارڈ میں ماڈل کا ورژن بھی ہونا چاہیے اور منظوری کے مرحلے سے گزرنے والی کسی کارروائی کو منظور کرنے والے فرد کی شناخت بھی۔

جائزے کا مقصد سیکھنا ہے، الزام دینا نہیں۔ یورپی ہوابازی اپنے ریکارڈرز کے ساتھ رپورٹنگ کا ایک ایسا نظام رکھتی ہے جو "منصفانہ کلچر" (just culture) پر مبنی ہے، جس میں لوگوں کو دیانتدارانہ غلطیوں پر سزا نہیں دی جاتی، اور حفاظت سے متعلق معلومات کو "الزام یا ذمہ داری عائد کرنے کے لیے" استعمال نہیں کیا جا سکتا [32]۔ ہر گفتگو قابل تلاش ہے۔ ہر گفتگو کو کلائنٹ کے اپنے معیار کے مطابق اسکور دیا جاتا ہے، تاکہ جائزہ چند نمونوں پر نہیں بلکہ منظم انداز میں ہو، اور اس کے نتائج اے آئی ایجنٹ کے ڈیزائن میں واپس شامل ہوں۔

جو ہم ابھی نہیں جانتے

کوئی شائع شدہ تحقیق ایسی تعیناتی کا، جس میں منظوری کے مراحل نتائج اور قابل واپسی ہونے کی بنیاد پر رکھے گئے ہوں، موضوع کی بنیاد پر مراحل رکھنے والی تعیناتی سے اس لحاظ سے موازنہ نہیں کرتی کہ حقیقت میں کتنا نقصان ہوا۔ یہاں بیان کی گئی درجہ بندی شواہد سے اخذ کی گئی ہے، لیکن متبادل طریقے کے مقابلے میں اسے آزمایا نہیں گیا۔

اس بارے میں کوئی آڈٹ شدہ ڈیٹا موجود نہیں کہ انشورنس کلیمز کے جائزہ کار یا کسٹمر سروس کے سپروائزر کتنی بار کسی خودکار سفارش کو رد کرتے ہیں، اور کسی نے یہ شائع نہیں کیا کہ غلطی کی کسی مخصوص شرح کو برقرار رکھنے کے لیے گفتگو کے کتنے بڑے نمونے کا جائزہ لینا لازمی ہے۔ جو کچھ موجود ہے وہ مقدمات میں لگائے گئے الزامات اور صنعت کے رواج ہیں، پیمائش نہیں۔

اگر انسانوں کے قبول کرنے یا درست کرنے کے فیصلوں کو یہ طے کرنے کے لیے استعمال کیا جائے کہ اے آئی ایجنٹ کب ایسکلیٹ کرے، اور وہ انسان خود آٹومیشن تعصب کا شکار ہوں، تو ایسکلیشن کے اشارے میں بھی وہی تعصب منتقل ہو جاتا ہے۔ ایسا لگتا ہے کہ کسی تحقیق نے اس کی پیمائش نہیں کی۔

خلیج سے متعلق مخصوص شواہد کم ہیں۔ عربی زبان میں دی جانے والی یا خلیجی ممالک کی کسٹمر سروس میں نگرانی کے طرز عمل پر ہم مرتبہ جائزہ شدہ کوئی تحقیق موجود نہیں، اور متحدہ عرب امارات یا سعودی عرب میں کسی اے آئی سسٹم کی جانب سے کسٹمر کو دیے گئے بیانات سے متعلق کسی عدالت یا ریگولیٹر کا کوئی شائع شدہ فیصلہ تلاش نہیں کیا جا سکا۔ یہ مضمون لکھے جانے کے وقت تین ریگولیٹری سوالات حل طلب تھے: متحدہ عرب امارات کے نفاذی ضوابط کب جاری ہوں گے، کیا ریگولیشن 10 پر DIFC کی 2026 کی مشاورت کو نافذ کیا جا چکا ہے، اور کیا سعودی عرب کی انشورنس اتھارٹی (Insurance Authority) نے انفرادی کلیمز کے تصفیے کی وہ مختصر مدت اختیار کر لی ہے جو اس نے 2025 کے آخر میں تجویز کی تھی [33]۔

مآخذ

  1. 1.Insurance Authority Board of Directors' Decision No. (25) of 2016 Pertinent to Regulation of the Unified Motor Vehicle Insurance Policies, UAE (in force 2017; now in the CBUAE Rulebook).⁠https://rulebook.centralbank.ae/en/rulebook/insurance-authority-board-directors-decision-no-25-2016-pertinent-regulation-unified-motor
  2. 2.NIST, Artificial Intelligence Risk Management Framework (AI RMF 1.0), NIST AI 100-1, 2023.⁠https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.100-1.pdf
  3. 3.ISO/IEC 42001:2023, Information technology, Artificial intelligence, Management system, Annex A control A.6.2.8, 2023.⁠https://www.iso.org/standard/42001
  4. 4.Regulation (EU) 2024/1689 (EU AI Act), Article 14, 2024.⁠https://artificialintelligenceact.eu/article/14/
  5. 5.Regulation (EU) 2024/1689, Article 7(2), 2024.⁠https://artificialintelligenceact.eu/article/7/
  6. 6.Regulation (EU) 2024/1689, Annex III, 2024.⁠https://artificialintelligenceact.eu/annex/3/
  7. 7.Regulation (EU) 2024/1689, Article 2(1)(c), 2024.⁠https://artificialintelligenceact.eu/article/2/
  8. 8.Regulation (EU) 2026/1744 (Digital Omnibus on AI), Official Journal, 24 July 2026.⁠https://eur-lex.europa.eu/eli/reg/2026/1744/oj
  9. 9.UAE Federal Decree-Law No. 45 of 2021 on the Protection of Personal Data, Article 18, 2021 (English translation, UAE legislation portal).⁠https://uaelegislation.gov.ae/en/legislations/1972
  10. 10.Chambers and Partners, Data Protection & Privacy 2026: UAE, Trends and Developments, 2026; Morgan Lewis, UAE Establishes Federal Authority for Artificial Intelligence and Data, June 2026.⁠https://practiceguides.chambers.com/practice-guides/data-protection-privacy-2026/uae/trends-and-developments ; https://www.morganlewis.com/pubs/2026/06/uae-establishes-federal-authority-for-artificial-intelligence-and-data
  11. 11.DIFC Data Protection Regulations, Consolidated Version No. 2, Regulation 10 (Personal Data Processed through Autonomous and Semi-Autonomous Systems), in force 1 September 2023.⁠https://www.difc.com/business/registrars-and-commissioners/commissioner-of-data-protection/regulation-10
  12. 12.DIFC Data Protection Law, DIFC Law No. 5 of 2020 (consolidated July 2025), Article 38.⁠https://www.difc.com/business/registrars-and-commissioners/commissioner-of-data-protection
  13. 13.Clyde & Co, Saudi Arabia issues Implementing Regulations to the Personal Data Protection Law, September 2023 (secondary source; regulator text not reachable).⁠https://www.clydeco.com/en/insights/2023/09/saudi-arabia-issues-implementing-regulations
  14. 14.Central Bank of the UAE, Guidance Note on Consumer Protection and the Responsible Adoption and Use of Artificial Intelligence and Machine Learning by Licensed Financial Institutions in the U.A.E., February 2026, sections 7(a) and 7(c).⁠https://rulebook.centralbank.ae/en/rulebook/guidance-note-consumer-protection-and-responsible-adoption-and-use-artificial-intelligence
  15. 15.Skitka, L. J., Mosier, K. L. and Burdick, M., Does automation bias decision-making?, International Journal of Human-Computer Studies 51(5), 1999; figures as restated in Skitka, Mosier and Burdick, Accountability and automation bias, IJHCS 52(4), 2000, p. 702.⁠https://www.sciencedirect.com/science/article/abs/pii/S1071581999902525 ; https://lskitka.people.uic.edu/IJHCS2000.pdf
  16. 16.Green, B. and Chen, Y., Disparate interactions: an algorithm-in-the-loop analysis of fairness in risk assessments, ACM FAT* 2019.⁠https://www.benzevgreen.com/wp-content/uploads/2019/02/19-fat.pdf
  17. 17.Bansal, G. et al., Does the whole exceed its parts? The effect of AI explanations on complementary team performance, ACM CHI 2021.⁠https://idl.cs.washington.edu/files/2021-AIExplanationsTeamPerformance-CHI.pdf
  18. 18.OWASP GenAI Security Project, OWASP Top 10 for Agentic Applications, December 2025, item ASI09.⁠https://genai.owasp.org/2025/12/09/owasp-top-10-for-agentic-applications-the-benchmark-for-agentic-security-in-the-age-of-autonomous-ai/
  19. 19.Amnesty International, Xenophobic Machines, October 2021, p. 26.⁠https://www.amnesty.nl/content/uploads/2021/10/20211014_FINAL_Xenophobic-Machines.pdf
  20. 20.Royal Commission into the Robodebt Scheme, Report, Volume 1, Overview, pp. xxiv and xxvi, Australia, July 2023.⁠https://robodebt.royalcommission.gov.au/
  21. 21.Ancker, J. S. et al., Effects of workload, work complexity, and repeated alerts on alert fatigue in a clinical decision support system, BMC Medical Informatics and Decision Making 17:36, 2017.⁠https://link.springer.com/article/10.1186/s12911-017-0430-8
  22. 22.Anthropic, Measuring AI agent autonomy in practice, February 2026 (vendor-published analysis of its own platform traffic).⁠https://www.anthropic.com/research/measuring-agent-autonomy
  23. 23.DosSantos DiSorbo, M. and Ju, H., Act or escalate? Evaluating escalation behavior in automation with language models, arXiv preprint 2604.08588, 2026 (not yet peer reviewed).⁠https://arxiv.org/abs/2604.08588
  24. 24.Zhang, Z. et al., Agent-SafetyBench: evaluating the safety of LLM agents, arXiv 2412.14470, 2024.⁠https://arxiv.org/abs/2412.14470
  25. 25.US Federal Aviation Administration, 25-Hour Cockpit Voice Recorder Requirement, New Aircraft Production, final rule, Federal Register, 2 February 2026 (FR Doc. 2026-02110), and the December 2023 proposed rule; 14 CFR 121.344 and 121.359.⁠https://www.federalregister.gov/documents/2023/12/04/2023-26144/ ; https://www.ecfr.gov/current/title-14/chapter-I/subchapter-G/part-121/subpart-K/section-121.359
  26. 26.Directive 2014/65/EU (MiFID II), Article 16(7), 2014.⁠https://eur-lex.europa.eu/legal-content/EN/TXT/HTML/?uri=CELEX:02014L0065-20240328
  27. 27.US Securities and Exchange Commission, Rule 17a-4(f), 17 CFR 240.17a-4, as amended 2022.⁠https://www.ecfr.gov/current/title-17/chapter-II/part-240/section-240.17a-4
  28. 28.OpenTelemetry, Semantic conventions for generative AI systems, attribute registry, 2024 to 2026.⁠https://opentelemetry.io/docs/specs/semconv/registry/attributes/gen-ai/
  29. 29.Crosby, S. A. and Wallach, D. S., Efficient data structures for tamper-evident logging, USENIX Security 2009.⁠https://static.usenix.org/event/sec09/tech/full_papers/crosby.pdf
  30. 30.Moffatt v. Air Canada, 2024 BCCRT 149, Civil Resolution Tribunal of British Columbia, 14 February 2024, paras 27 to 29 and 40 to 44.⁠https://decisions.civilresolutionbc.ca/crt/crtd/en/item/525448/index.do
  31. 31.UK Financial Conduct Authority, Home and travel claims handling arrangements: good practice and areas for improvement, July 2025.⁠https://www.fca.org.uk/publications/good-and-poor-practice/home-travel-claims-handling-arrangements
  32. 32.Regulation (EU) No 376/2014 on the reporting, analysis and follow-up of occurrences in civil aviation, Articles 2(12), 15 and 16, 2014.⁠https://eur-lex.europa.eu/legal-content/EN/TXT/HTML/?uri=CELEX:32014R0376
  33. 33.Middle East Insurance Review, Saudi Arabia: Insurance Authority proposes shorter claims settlement period, 25 November 2025; Atlas Magazine, Saudi Arabia to speed up insurance claims processing, November 2025 (secondary sources reporting the Insurance Authority's draft amendment; regulator text not reachable).⁠https://www.atlas-mag.net/en/article/saudi-arabia-to-speed-up-insurance-claims-processing

نئی تحقیق شائع ہوتے ہی حاصل کریں

جب ہم کچھ شائع کرتے ہیں تو کبھی کبھار ای میلز۔

سبسکرائب کریں

یہ بھی پڑھیں