在 企业 规模下 设计 接受 治理 约束的 AI 智能体
企业应如何决定:哪些决策由 AI 智能体自行作出,哪些在限制范围内作出,哪些始终由人作出。以及为什么关于智能体做了什么、为何这样做的记录,比它收到的指令更重要。
情境
阿联酋的一家车险公司必须在三天以内告知索赔人缺少哪些材料,并在收到完整案卷后十五天以内完成赔付 [1]。23 点,一位保单持有人在 WhatsApp 上发来消息:“我的理赔批准了吗?”智能体可以从理赔系统中读取这项理赔的进度,列出仍未提交的两份材料,并解释保单中关于免赔额的规定。它绝不能做的一件事,是自行给出“是”或“否”来回答这个问题。
每一家部署智能体的企业都会划出这样一条界线。开发商决定智能体是否可以重新安排付款计划。酒店决定智能体是否可以发放善意补偿代金券,以及金额上限是多少。难点不在于认同存在这样一条界线。难点在于决定界线划在哪里,确保在无人监看时界线依然有效,并且事后能够准确说明智能体做了什么、依据是什么。
证据表明什么
各类 框架按 风险 高低 调整 监督 力度。 没有 一个 要求每项 决策 都由人 把关。
美国国家标准与技术研究院(NIST)的《人工智能风险管理框架》(AI RMF)是一项自愿采用的美国标准。它将风险定义为事件发生概率与后果严重程度的综合,并提出各组织应记录人如何监督系统,同时保留“取代、脱离或停用”系统的机制 [2]。ISO/IEC 42001 是一项可认证的管理体系标准,其中只有一项关于日志记录的控制措施,要求至少在系统使用期间保留事件日志 [3]。两者都没有规定人必须在哪个环节介入。
欧盟《人工智能法》(EU AI Act)的规定最为具体。对于被其归为高风险的系统,第 14 条要求监督系统的人员能够监控系统、推翻或撤销系统的输出,并能叫停系统。在为本文查找到的具有约束力的文本中,只有它点名提到自动化偏差,即人们不加核查便接受机器输出的倾向(这一倾向已有充分的记录),并指出必须帮助监督人员抵御这种偏差 [4]。它将某一用途归为高风险的标准包括:系统在多大程度上自行行动,以及“涉及 AI 系统所产生的结果在多大程度上易于纠正或逆转”[5]。
对海湾地区的读者而言,有两点需要准确把握。高风险清单按主题编排,客户服务和理赔处理都不在其中;只有人寿保险和健康保险的风险评估与定价在列 [6]。此外,对于使用 AI 系统的欧盟以外公司,该法仅在该系统的输出在欧盟境内使用时才适用 [7],因此为海湾地区客户提供服务的阿联酋或沙特企业不在其适用范围内。其高风险义务现定于 2027 年 12 月起适用 [8]。
海湾 地区的 法律 着眼于 决策的 影响,而非 决策的 主题。
阿联酋联邦数据保护法赋予个人权利,可以反对“由自动化处理(包括用户画像)产生的决策,特别是对其产生法律影响或不利影响的决策”,并要求控制者“应数据主体的要求,在审查自动化处理决策时纳入人的因素”[9]。该法自 2022 年 1 月起生效,但截至 2026 年年中,其实施条例仍未发布,联邦数据办公室也始终未能全面投入运作,因此目前尚无执法机制 [10]。该法不适用于迪拜国际金融中心(DIFC)和阿布扎比全球市场(ADGM),这两地有各自的监管制度。
DIFC 的规则是该地区最完善的。第 10 号条例(Regulation 10)规定,系统仅在以下情况下才可以出于商业目的处理个人数据:其目的由人定义或经人批准;或者,在系统自行设定目的的情况下,它“仅在人所定义的约束范围内”这样做。第 38 条则允许个人反对具有法律后果或“其他严重影响后果”的完全基于自动化处理的决策,并有权要求进行人工复核 [11][12]。这些规定仅约束 DIFC 实体。在沙特阿拉伯,自 2024 年 9 月起执行的《个人数据保护法》(Personal Data Protection Law,PDPL)实施条例要求,完全基于自动化处理的决策须获得明确同意,在决策依赖自动化处理时须进行影响评估;这一点依据的是一家律师事务所的摘要,因为未能访问监管机构的英文文本 [13]。
对于在阿联酋本土持牌的保险公司,阿联酋中央银行(CBUAE)2026 年 2 月发布的指导说明规定了三个监督层级。“人不在回路中”(Human-out-of-the-loop)指系统在没有人直接参与的情况下行事,这种方式“只应被用于低风险、非实质性的流程”;消费者“应能够要求对 AI 生成的决策进行人工审查或解释”[14]。这份文件是指导意见,而非监管法规,适用于持牌金融机构,不适用于开发商或酒店。
由人 检查 机器, 这种 控制比 看上去要弱。
“人在回路中”(human in the loop)指每项决策在生效前都由人批准。“人在回路上”(human on the loop)指系统先行动,由人监控结果。两者都取决于人是否真正投入,而数十年的研究表明,问题恰恰出在这里。
在一项受控的飞行模拟研究中,参与者使用一种高度可靠但并非完全可靠的自动化辅助工具。对于该工具未能标记的事件,他们漏掉了 41%;即使其他仪表显示的信息与之矛盾,他们仍在 65% 的情况下听从了它的错误建议 [15]。在一项由 554 名非专业参与者预测审前结果的研究中,获得风险评分的 304 人里,只有 23.7% 的人表现优于评分本身,64.1% 的人表现更差,而且他们的信心与表现呈负相关 [16]。解释机器的推理过程并不能解决这个问题:在一项有 1,626 名参与者的研究中,无论建议正确与否,解释都提高了参与者对建议的认同 [17]。OWASP 2025 年发布的 AI 智能体应用十大风险清单中包括“利用人对智能体的信任”:自信而措辞考究的解释会误导操作人员批准有害的操作 [18]。
公开曝光的失败案例呈现出同一种模式。在荷兰儿童保育津贴丑闻中,审查被标记申请的公务员看不到用于给出风险评分的信息 [19]。在澳大利亚的 Robodebt 计划中,工作人员此前每年审查约 20,000 份高风险案卷;而自动化系统发出通知的速度约为每周 20,000 份 [20]。在每个案例中,审查者都至少缺少以下三者之一:时间、信息或决定权。只要三者缺一,人工检查就只是一种形式。
频繁 触发的 审批 节点会被 忽视。
如果每一项例行操作都被审批节点打断,人们就会养成直接点击通过的习惯。一项研究覆盖 112 名临床医生收到的 127 万条临床提醒,发现在同一次诊疗中每多出一条提醒,提醒被采纳的可能性就下降 30% [21]。因此,审批节点只应设置在需要的地方。一家供应商对其自有平台上的智能体流量进行了分析(未经同行评审),发现只有约 0.8% 的智能体操作看起来是不可逆的 [22]。如果这一结论在客户沟通中同样成立,那么把人的注意力集中在不可逆的操作上,成本是可以承受的,而审查所有操作则不然。
不能单靠 智能体 自己 判断 何时该 停下来。
基于置信度的升级,是指当智能体对自身正确性的估计低于某个阈值时,将对话转交给人。这一估计是真实的信号,但带有偏差。2026 年的一篇预印本论文用包含真实人类决策数据的任务测试了八个语言模型,发现各模型选择升级时所对应的置信度从约 53% 到 100% 以上不等,其中两个模型对所有任务都选择升级;而且在 66% 的模型与条件组合中,模型高估了自身的准确率 [23]。在一项包含 2,000 个智能体安全测试的基准中,没有一个智能体的得分超过 60%,作者的结论是“仅依赖防御性提示词可能不够”[24]。阈值必须在部署前针对具体模型进行测量,而且它应与智能体无法与之争辩的规则并用,而不是取而代之。
一份 可用的 记录应 包含 什么,在 其他 领域 早有 定论。
飞行数据记录器在同一时间基准上记录飞机做了什么和机组做了什么,因此可以将驾驶舱语音记录器的内容与之叠加对照。新生产的大型飞机上的驾驶舱记录器现在保存 25 小时而不是两小时,因为两小时的录音一再在人们意识到需要它们之前就被覆盖,2017 年旧金山发生一起事件之后也是如此 [25]。欧洲的投资公司必须录制有关客户订单的对话,“即使这些对话或通信并未促成此类交易的达成”,保存期为五至七年 [26]。美国证券规则要求记录以一次写入的方式存储,或附有记录每一项更改及更改人的“完整的、带时间戳的审计日志”[27]。AI 行业正在形成与之相当的字段清单:开放可观测性标准 OpenTelemetry 的生成式 AI 约定列出了模型、指令、输入与输出消息、每次调用的工具及其参数和结果,以及智能体标识符和对话标识符 [28]。防篡改日志将各条目串联起来,使每一条都带有前一条的加密指纹,因此任何事后修改都能被发现 [29]。
记录决定争议的结果。2024 年 2 月,加拿大一家审裁庭裁定加拿大航空(Air Canada)向一名乘客作出赔偿。此前,该公司网站上的聊天机器人告诉这名乘客,他可以在购票后 90 天以内申请丧亲优惠票价,这与该航空公司政策页面上的内容相矛盾。加拿大航空辩称,该聊天机器人实际上是一个独立的法律实体,应对自己的行为负责。审裁庭称这是“一个非同寻常的主张”,并认定“加拿大航空理应清楚,它要为其网站上的所有信息负责”[30]。这名乘客保留了截图。英国一家监管机构在 2025 年对 23 家家财险和旅行险保险公司进行了审查(审查并未涉及 AI),发现在许多情况下,关键理赔委员会会议的纪要“缺乏足够的细节,无法证明进行了有意义的讨论、质疑或决策”[31]。无论作出决策的是哪一类主体,证据标准都不会改变。
这意味着什么
本文的工作假设是:决策应按后果和可逆性而非主题分类;治理必须依靠智能体能够执行的操作范围和完整的记录来落实,而不能只靠指令。证据支持这两点,但需要作两处修正。
第一,后果和可逆性是正确的维度,但主题仍然重要。立法者依据后果和可逆性来决定监管什么,然后再按主题进行监管 [5][6]。有些决策无论是否可逆,都必须保留给人:有的出于法律规定,例如医疗判断;有的出于监管机构的期望,例如理赔决定,阿联酋中央银行的指导说明不会将其归为低风险、非实质性的流程;有的出于企业自身的决定,例如任何已在监管机构处理中的事项。分类方案需要一条规则,把这些决策完全排除在智能体之外。
第二,对后果的判断必须由人事先按操作类型作出。智能体在运行时对风险的感知波动太大,无法承担这一判断 [23][24]。基于置信度的升级是第二道防线,而不是第一道。
关于落实方式的假设成立,但需要补充一点。能力限制和完整的记录是底线。然而,人工审批节点本身也是一种会以可预见的方式失效的控制,因此必须围绕审阅者来设计:很少触发;附上事实,而不是一份有说服力的摘要;交给有权改变结果的人。记录本身无法防止任何事情;它让事后问责成为可能,而且如果有人阅读,还能让系统变得更好。这种取舍是真实存在的。审批节点越少,未经人参与作出的决策就越多;审批节点越多,审批的人就越容易不再认真阅读。审批节点应设在不可逆操作所在之处,几乎不设在其他地方。
我们如何据此设计
操作在部署前就已分类,而且这种分类通过智能体能够执行的操作来落实。智能体在企业客户的系统中可以执行的每一项操作,都归入四个区域之一。智能体执行并记录的操作:读取理赔进度、列出缺少的材料。智能体在企业设定的限制范围内执行的操作:在票价规则范围内改签、在一定金额以内发放代金券。智能体准备好、交由人审批的操作。以及智能体永远不会被授予的操作。在保险领域,智能体从不认定责任、从不确定赔付金额,也从不批准或拒绝理赔申请;之所以如此,是因为这些决策操作根本不向智能体开放,而不是因为智能体被告知不要使用它们。哪些对话转交给人、依据哪些触发条件、哪些话题禁止涉及,都由企业设定,并且企业可以更改。在第二个区域中,企业客户的规则(例如审批限额和权益规定)在架构层面强制执行,而不是写成智能体可能忽略的指令;企业标记为敏感的操作会等待人工审批。
智能体的置信度是第二个触发条件,转交时交给人的是事实,而不是论点。当智能体信心不足时,对话会转交给人;鉴于有关过度自信的证据,阈值会在部署前针对每个模型分别测量,并叠加在上述规则之上。智能体在没有把握时会提出澄清问题,而不是猜测。接手的人会收到完整的对话和一份摘要;考虑到解释对审阅者的影响,这份转交摘要旨在呈现客户说了什么、智能体做了什么以及它的不确定性在哪里,而不是为某个结果提供论证。
记录是为两年后的争议而建,而不是为明天的看板而建。每一通电话都可以在获得同意的前提下录音,并实时转录;每一次对话在结束时都会生成摘要,并对处理结果进行分类;智能体只依据企业客户经审批的资料作答,因此每个答复都可以追溯到其来源。完整的审计日志会记录智能体执行的每一项操作及其原因,其形式使任何事后更改都能被发现;同时配有版本控制,使对智能体的每一项变更都有记录且可撤销;保留期限由企业客户设定。模型版本应记入同一份记录;对于受审批节点管控的操作,审批人的身份也应记入其中。
审阅是为了从中学习,而不是为了追责。欧洲航空业将记录器与一套基于“公正文化”的报告制度结合起来:在这种文化中,人们不会因非故意的差错而受到惩罚,安全信息也不得被用于“归咎过错或认定责任”[32]。每一次对话都可以检索。每一次对话都会按照企业客户自己的标准评分,因此审阅是系统性的,而不是抽样进行的,审阅结果还会反馈到智能体的设计中。
我们尚不了解的
目前没有已发表的研究以实际造成的损害为标准,比较按后果和可逆性设置审批节点的部署与按主题设置审批节点的部署。本文描述的分类方式源自现有证据,但尚未与另一种方式进行对照检验。
关于保险理赔审核人员或客服主管推翻自动化建议的频率,目前没有经过审计的数据;也没有人公布过,要将错误率维持在某一水平,需要审阅多大的对话样本。现有的只是诉讼中的指控和行业惯例,而不是测量数据。
如果用人接受或纠正智能体决定的情况来调整智能体何时升级,而这些人本身又受自动化偏差的影响,那么升级信号就会继承这种偏差。似乎还没有研究对此进行过测量。
针对海湾地区的证据很少。目前没有关于阿拉伯语客户服务或海湾地区客户服务中监督行为的同行评审研究;也未能找到阿联酋或沙特阿拉伯就 AI 系统对客户所作陈述而公布的任何法院判决或监管决定。截至撰写本文时,有三个监管问题尚无定论:阿联酋的实施条例何时发布;DIFC 2026 年就第 10 号条例开展的征求意见是否已正式颁布实施;沙特保险管理局(Insurance Authority)是否已采纳其于 2025 年年底提出的、缩短个人理赔赔付时限的提议 [33]。
参考来源
- 1.Insurance Authority Board of Directors' Decision No. (25) of 2016 Pertinent to Regulation of the Unified Motor Vehicle Insurance Policies, UAE (in force 2017; now in the CBUAE Rulebook).https://rulebook.centralbank.ae/en/rulebook/insurance-authority-board-directors-decision-no-25-2016-pertinent-regulation-unified-motor
- 2.NIST, Artificial Intelligence Risk Management Framework (AI RMF 1.0), NIST AI 100-1, 2023.https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.100-1.pdf
- 3.ISO/IEC 42001:2023, Information technology, Artificial intelligence, Management system, Annex A control A.6.2.8, 2023.https://www.iso.org/standard/42001
- 4.Regulation (EU) 2024/1689 (EU AI Act), Article 14, 2024.https://artificialintelligenceact.eu/article/14/
- 5.Regulation (EU) 2024/1689, Article 7(2), 2024.https://artificialintelligenceact.eu/article/7/
- 6.Regulation (EU) 2024/1689, Annex III, 2024.https://artificialintelligenceact.eu/annex/3/
- 7.Regulation (EU) 2024/1689, Article 2(1)(c), 2024.https://artificialintelligenceact.eu/article/2/
- 8.Regulation (EU) 2026/1744 (Digital Omnibus on AI), Official Journal, 24 July 2026.https://eur-lex.europa.eu/eli/reg/2026/1744/oj
- 9.UAE Federal Decree-Law No. 45 of 2021 on the Protection of Personal Data, Article 18, 2021 (English translation, UAE legislation portal).https://uaelegislation.gov.ae/en/legislations/1972
- 10.Chambers and Partners, Data Protection & Privacy 2026: UAE, Trends and Developments, 2026; Morgan Lewis, UAE Establishes Federal Authority for Artificial Intelligence and Data, June 2026.https://practiceguides.chambers.com/practice-guides/data-protection-privacy-2026/uae/trends-and-developments ; https://www.morganlewis.com/pubs/2026/06/uae-establishes-federal-authority-for-artificial-intelligence-and-data
- 11.DIFC Data Protection Regulations, Consolidated Version No. 2, Regulation 10 (Personal Data Processed through Autonomous and Semi-Autonomous Systems), in force 1 September 2023.https://www.difc.com/business/registrars-and-commissioners/commissioner-of-data-protection/regulation-10
- 12.DIFC Data Protection Law, DIFC Law No. 5 of 2020 (consolidated July 2025), Article 38.https://www.difc.com/business/registrars-and-commissioners/commissioner-of-data-protection
- 13.Clyde & Co, Saudi Arabia issues Implementing Regulations to the Personal Data Protection Law, September 2023 (secondary source; regulator text not reachable).https://www.clydeco.com/en/insights/2023/09/saudi-arabia-issues-implementing-regulations
- 14.Central Bank of the UAE, Guidance Note on Consumer Protection and the Responsible Adoption and Use of Artificial Intelligence and Machine Learning by Licensed Financial Institutions in the U.A.E., February 2026, sections 7(a) and 7(c).https://rulebook.centralbank.ae/en/rulebook/guidance-note-consumer-protection-and-responsible-adoption-and-use-artificial-intelligence
- 15.Skitka, L. J., Mosier, K. L. and Burdick, M., Does automation bias decision-making?, International Journal of Human-Computer Studies 51(5), 1999; figures as restated in Skitka, Mosier and Burdick, Accountability and automation bias, IJHCS 52(4), 2000, p. 702.https://www.sciencedirect.com/science/article/abs/pii/S1071581999902525 ; https://lskitka.people.uic.edu/IJHCS2000.pdf
- 16.Green, B. and Chen, Y., Disparate interactions: an algorithm-in-the-loop analysis of fairness in risk assessments, ACM FAT* 2019.https://www.benzevgreen.com/wp-content/uploads/2019/02/19-fat.pdf
- 17.Bansal, G. et al., Does the whole exceed its parts? The effect of AI explanations on complementary team performance, ACM CHI 2021.https://idl.cs.washington.edu/files/2021-AIExplanationsTeamPerformance-CHI.pdf
- 18.OWASP GenAI Security Project, OWASP Top 10 for Agentic Applications, December 2025, item ASI09.https://genai.owasp.org/2025/12/09/owasp-top-10-for-agentic-applications-the-benchmark-for-agentic-security-in-the-age-of-autonomous-ai/
- 19.Amnesty International, Xenophobic Machines, October 2021, p. 26.https://www.amnesty.nl/content/uploads/2021/10/20211014_FINAL_Xenophobic-Machines.pdf
- 20.Royal Commission into the Robodebt Scheme, Report, Volume 1, Overview, pp. xxiv and xxvi, Australia, July 2023.https://robodebt.royalcommission.gov.au/
- 21.Ancker, J. S. et al., Effects of workload, work complexity, and repeated alerts on alert fatigue in a clinical decision support system, BMC Medical Informatics and Decision Making 17:36, 2017.https://link.springer.com/article/10.1186/s12911-017-0430-8
- 22.Anthropic, Measuring AI agent autonomy in practice, February 2026 (vendor-published analysis of its own platform traffic).https://www.anthropic.com/research/measuring-agent-autonomy
- 23.DosSantos DiSorbo, M. and Ju, H., Act or escalate? Evaluating escalation behavior in automation with language models, arXiv preprint 2604.08588, 2026 (not yet peer reviewed).https://arxiv.org/abs/2604.08588
- 24.Zhang, Z. et al., Agent-SafetyBench: evaluating the safety of LLM agents, arXiv 2412.14470, 2024.https://arxiv.org/abs/2412.14470
- 25.US Federal Aviation Administration, 25-Hour Cockpit Voice Recorder Requirement, New Aircraft Production, final rule, Federal Register, 2 February 2026 (FR Doc. 2026-02110), and the December 2023 proposed rule; 14 CFR 121.344 and 121.359.https://www.federalregister.gov/documents/2023/12/04/2023-26144/ ; https://www.ecfr.gov/current/title-14/chapter-I/subchapter-G/part-121/subpart-K/section-121.359
- 26.Directive 2014/65/EU (MiFID II), Article 16(7), 2014.https://eur-lex.europa.eu/legal-content/EN/TXT/HTML/?uri=CELEX:02014L0065-20240328
- 27.US Securities and Exchange Commission, Rule 17a-4(f), 17 CFR 240.17a-4, as amended 2022.https://www.ecfr.gov/current/title-17/chapter-II/part-240/section-240.17a-4
- 28.OpenTelemetry, Semantic conventions for generative AI systems, attribute registry, 2024 to 2026.https://opentelemetry.io/docs/specs/semconv/registry/attributes/gen-ai/
- 29.Crosby, S. A. and Wallach, D. S., Efficient data structures for tamper-evident logging, USENIX Security 2009.https://static.usenix.org/event/sec09/tech/full_papers/crosby.pdf
- 30.Moffatt v. Air Canada, 2024 BCCRT 149, Civil Resolution Tribunal of British Columbia, 14 February 2024, paras 27 to 29 and 40 to 44.https://decisions.civilresolutionbc.ca/crt/crtd/en/item/525448/index.do
- 31.UK Financial Conduct Authority, Home and travel claims handling arrangements: good practice and areas for improvement, July 2025.https://www.fca.org.uk/publications/good-and-poor-practice/home-travel-claims-handling-arrangements
- 32.Regulation (EU) No 376/2014 on the reporting, analysis and follow-up of occurrences in civil aviation, Articles 2(12), 15 and 16, 2014.https://eur-lex.europa.eu/legal-content/EN/TXT/HTML/?uri=CELEX:32014R0376
- 33.Middle East Insurance Review, Saudi Arabia: Insurance Authority proposes shorter claims settlement period, 25 November 2025; Atlas Magazine, Saudi Arabia to speed up insurance claims processing, November 2025 (secondary sources reporting the Insurance Authority's draft amendment; regulator text not reachable).https://www.atlas-mag.net/en/article/saudi-arabia-to-speed-up-insurance-claims-processing
新研究发布时即可收到
我们发布研究时,会不定期发送电子邮件。