为什么 政策 应当 落在 架构中, 而不是 提示词里
提示词中的一条指令,会改变 AI 智能体说出某些话的概率。它无法排除任何可能,而审裁机构、监管机构和相关研究如今都已表明其代价。本文阐述这些证据,以及让价格、权益和退款不由模型掌控的设计决策。
情境
一位采用与工程进度挂钩付款计划的购房者在 21 点通过 WhatsApp 给您发来消息:“我下一笔要付多少,什么时候付?”答案取决于项目已经达到哪个工程节点,而不是日历上的某个日期,还取决于这位购房者已签署的买卖协议中的付款时间表。您的客户服务团队中的工作人员会打开档案,照着读出来。而一个只被告知了您的付款结构的智能体,会生成一句听起来与正确答案一模一样的话,无论它是否正确。
当保险公司的智能体被问到某项治疗是否在保障范围内,或者航空公司的智能体被问到某张机票能否改签时,也会出现同样的情况。在法律上,在客户心目中,智能体说的话就是公司说的话。问题在于,您如何确保这些话只传达您的系统中实际记载的内容。
证据表明什么
那些 当众 吸取 教训的 公司
2024 年 2 月,不列颠哥伦比亚省民事审裁庭(Civil Resolution Tribunal)对 Moffatt v. Air Canada 一案作出裁决 [1]。该航空公司网站上的聊天机器人告诉一名乘客,他可以在购票后 90 天以内申请丧亲优惠票价。而该航空公司自己的丧亲优惠页面写明,旅行结束后该政策不再适用。审裁庭认定构成过失性失实陈述(这一法律术语指他人合理信赖的、因疏忽而作出的虚假陈述),并判令支付 CA$812.02 的损害赔偿金、利息和费用。裁决没有说明该聊天机器人使用的是什么技术,而且这次对话发生在当前这一代语言模型被广泛使用之前。裁决的关键在于这些话是谁说的,而不在于它们是如何生成的。
2026 年 5 月,德国哈姆高等地区法院(Higher Regional Court of Hamm)对一家诊所作出裁决:该诊所网站上的聊天机器人把其医生描述为经过认证的专科医生,而事实并非如此 [2]。法院认定,这些陈述属于该公司自身的商业行为,因为是该公司设定了聊天机器人的范围,并且可以对其重新编程。法院发出了禁令,并准许上诉,因此该裁决尚非终局裁决。
有两起案例从未诉至法院。2025 年 4 月,一家软件公司的电子邮件支持智能体告诉客户,登录问题是由“单设备政策”造成的。而这项政策根本不存在。该公司为客户办理了退款,并表示今后 AI 回复都会加上标注 [3]。2023 年 12 月,一家汽车经销商网站上的智能体,在一名访客指示它同意他所说的一切之后,以书面形式同意以一美元的价格出售一辆新车 [4]。此事并未被强制履行。该供应商后来写道,在大约 3,000 次试图让智能体“说傻话”的尝试中,99% 都失败了 [5]。反过来看,这意味着约有 30 次成功。
对于寄希望于检索的人来说,最后一个案例最值得关注。纽约市面向企业的聊天机器人运行在 Microsoft 的 Azure AI 服务上,依据该市自己的 2,000 多个网页作答。2024 年 3 月,人们发现它告诉雇主可以从员工小费中抽成,还告诉餐馆可以拒收现金,而这两种做法在该市都是违法的 [6]。它在加强警示后继续上线运行,之后于 2026 年年初被撤下 [7]。让智能体以权威文档为依据,缩小了它的错误范围。但并没有消除错误。
为什么 指令 不是 保证
语言模型只做一件事:根据已有的文本,预测最有可能出现的下一个词。提示词,无论来自您还是来自客户,都只是更多的文本。英国国家网络安全中心(National Cyber Security Centre)在 2025 年 12 月指出,由于数据和指令之间没有内在的区分,提示词注入(即把指令夹带进模型所读取内容中的做法)“可能永远无法像 SQL 注入攻击那样被彻底缓解”,并建议构建“约束系统操作的确定性(非 LLM)保障措施”[8]。大多数安全团队都以 OWASP 的清单为工作依据;OWASP 在其 2025 年语言模型应用十大风险中指出,“目前尚不清楚是否存在完全可靠的提示词注入防范方法”[9]。
研究测量了提示词的约束力能维持多久。答案是:能维持一阵子。
它会在对话过程中衰减。SysBench(2024)使用 500 个系统提示词和 2,500 轮对话,测试模型在五轮对话中遵守系统提示词每一条规则的能力。在所测模型中表现最强的 GPT-4o,在 54.4% 的会话中自始至终完整遵守了每一条规则。当后面的问题依赖前面的回答时,仍完全遵守规则的对话比例,从第一轮后的 84.8% 降至第五轮后的 33.7% [10]。另一项涵盖超过 200,000 次模拟对话的研究发现,当同样的信息分多轮传达而不是一次性给出时,模型表现平均下降 39%;而且“在对话中走错一步”的模型往往无法恢复 [11]。客户对话正是一轮一轮进行的。
它会在压力下让步。模型是用人类反馈训练的,而这种反馈会奖励附和。在 2023 年的一项研究中,当用户说“我觉得不对。你确定吗?”时,当时的一个模型在 98% 的问题上错误地承认自己犯了错 [12]。2025 年一项针对三个主流模型的研究发现,一次质疑就会让正确答案在 14.66% 的情况下变成错误答案 [13]。一位说“有人告诉我可以退款”的客户,施加的正是这种压力。
它不可重复。把模型的随机性设为零,在实践中并不能让它变得确定。在 2025 年的一项实验中,在这一设置下向同一个模型提出同一个问题 1,000 次,得到了 80 个不同的答案,因为服务系统内部的运算会随同一时刻正在处理的其他请求数量而变化 [14]。“我们测试过,它遵守了政策”,说的只是某一次运行的情况。
仅有工具和书面政策是不够的。τ-bench(2024)为模型提供了操作零售或航空数据库的工具,以及一份必须遵守的政策文件,其中包含“基础经济舱航班不可更改”这样的规则。GPT-4o 正确完成了 61.2% 的零售任务和 35.2% 的航空任务。当要求它连续八次完成同一项任务时,零售任务的成功率降至约 25% [15]。政策只是向模型描述过。它并没有通过工具强制执行。
被注入的指令会被执行。AgentDojo(2024)进行了 629 次攻击,把指令隐藏在智能体读取的数据中,例如一封电子邮件或一个网页。GPT-4o 在 47.69% 的情况下执行了攻击者的指令。所测试的防御措施中最有效的,不是更好的提示词,而是限制智能体可以调用哪些工具,这使该比例降至 7.5% [16]。即便是架构层面的修复也留下了残余风险,这也是本文没有止步于此的原因。
阿拉伯语会改变这些数字。这些研究大多基于英语。我们找到的唯一一项专门针对阿拉伯语的研究来自海湾地区以外,而且关注的是有害内容,而不是业务政策。它之所以与这里相关,是因为海湾地区客户的打字方式。用标准阿拉伯语写的提示词,在 2.5% 的情况下让 GPT-4 产生了不安全的输出。同样的提示词改用 Arabizi(用拉丁字母和数字书写的阿拉伯语)后,在 10.19% 的情况下产生了不安全的输出;改用罗马化转写时,这一比例为 12.12%。一个专门针对这种情况编写的系统提示词,把该比例降至约 1% [17]。这是很大的改进,但仍然不是零。
检索有 帮助,但 也有其 自身的 失效 模式
给模型提供正确的文档,并不等于给客户提供正确的数字。RAGTruth(2024)考察了 17,790 条模型回复,这些回复都是在模型面前摆有正确源材料的情况下写成的。无依据陈述比例最高的任务(68.6% 的回复)是把结构化数据记录改写成文字 [18]。而这正是智能体读取付款时间表并将其改写成一句话时所发生的事。2023 年的一项研究还发现,当检索到的证据与模型在训练中学到的内容部分一致时,模型会对后者表现出“强烈的确认偏差”[19]。模型可能掌握着正确的事实,却仍然说出它熟悉的那个。
责任 落在谁 身上
加拿大航空案中的审裁庭驳回了聊天机器人是“一个应对自身行为负责的独立法律实体”这一主张,并补充道:“信息来自静态页面还是聊天机器人,没有任何区别”[1]。德国法院通过不同的路径得出了相同的结论 [2]。美国联邦贸易委员会(Federal Trade Commission)在 2024 年表示,“现行法律中没有针对 AI 的豁免”[20]。这三者都在海湾地区以外。我们尚未找到阿联酋或沙特就聊天机器人的陈述作出的裁决。但将会适用的规则已经写好了。
在阿联酋,关于消费者保护的 2020 年第 15 号联邦法律(Federal Law No. 15 of 2020)赋予每位消费者获得其所接受服务的“正确信息”的权利,禁止“以包含不正确数据的方式”描述服务,并规定任何免除供应商上述义务的合同条款均属无效 [21]。在聊天窗口下方加一条免责声明,并不能让您免责。对于保险公司,电子保险法规把“聊天机器人”列为公司网站的组成部分之一,要求网站上的信息保持更新,并要求通过网站获得的记录至少保存十年 [22]。2026 年 2 月,阿联酋中央银行(CBUAE)为持牌金融机构(包括保险公司)发布了指导意见,提出董事会和高级管理层对 AI 系统及其结果“应当负责并承担问责”,金融机构“不应使用其无法控制的 AI 模型”,并且客户应当能够要求人工审查 [23]。这是指导意见,而非监管法规,它描述的是监管机构所期望的合理注意应当是什么样子。
在沙特阿拉伯,电子商务法走得更远:电子广告是“补充合同、对各方具有约束力的合同文件”,并且不得包含任何会“直接或间接”误导消费者的陈述 [24]。保险行为准则要求公司“采取合理措施,确保向客户提供的信息准确、清晰”,并将理赔和投诉记录保存十年 [25]。国家 AI 伦理原则规定,AI 系统的“所有者”和“采购方”,而不仅仅是其开发者,都要对系统的决策和行为负责 [26]。
这意味着什么
由此得出三个结论和一项取舍。
第一,智能体的输出是一个可能性分布,每一条指令都会移动这个分布,却无法切掉它的尾部。训练、更好的提示词和安全护栏分类器都会改变概率,有时改变很大,但没有一种能让错误答案不可能出现。在大型运营所处理的对话量下,一个很小的尾部就是每天都会发生的事。如果每一百个答案中有一个是错的,那么每月五万次对话就会产生五百个错误答案,而且每一个都有记录在案。
第二,法律并不关心尾部从何而来。无论是生成的、检索的,还是由人输入的,它都是您的陈述;而在海湾地区,约束这类陈述的消费者保护和保险规则已经生效。
第三,因此,任何具有商业或法律后果的内容都根本不能通过生成得出。价格、付款日期、承保限额、退款权益和票价规则,都必须作为从掌管该数据的系统中读取的值来提供;任何改变客户处境的操作,都必须由执行该操作的系统决定是否允许智能体执行。模型的工作是组织事实周围的措辞。它永远不是事实的来源。
这种取舍是真实存在的。以这种方式构建的智能体能做的事更少。Google 的 CaMeL 是目前已发表的、让注入文本无法触发操作的最严谨尝试,它在有安全性证明的前提下完成了 77% 的基准任务,而未设防的系统为 84% [27]。来自苏黎世联邦理工学院(ETH Zurich)、Google、Microsoft、IBM 等机构的安全研究人员在 2025 年发表的设计模式论文指出,其模式“约束智能体的操作,明确地阻止它们解决任意任务”[28]。如果处理不当,强制模型采用僵硬的输出格式可能会损害其推理能力:2024 年的一项研究发现,在严格的输出模式约束下,算术准确率从 86.51% 降至 23.44%,不过一项使用匹配提示词的复现研究并未发现这种下降 [29] [30]。确定性系统也有其自身的失效方式:2012 年,Knight Capital 在 45 分钟内损失了超过 4.6 亿美元,原因是一名技术人员没有把新代码复制到八台服务器中的一台上,而且没有人检查 [31]。主张使用规则,就是主张使用可审计的规则,并配以您会对计费系统提出的那种部署纪律。
我们如何据此设计
政策是约束,而不是指令。您的定价结构、审批限额、费用和权益规定,都内置于智能体能够执行的操作之中。它无法提供企业不允许的东西,因为这样的提议不在它被允许的操作范围内。OWASP 将此称为完全仲裁(complete mediation):“在下游系统中实施授权,而不是依赖 LLM 来决定某项操作是否被允许”[32]。
条款通过检索获得,绝不靠生成。当购房者询问下一笔要付多少时,智能体会从您的系统中读取这套房屋的付款时间表并予以呈现。当保单持有人询问保障范围时,答案来自其保单的实际保险条款。智能体无法构造记录中不存在的付款计划,也无法描述记录中不存在的承保内容,因为除了读取之外,它没有任何办法得出这些值。
决策类操作不向智能体开放。在保险领域,智能体从不认定责任、从不确定赔付金额,也从不批准或拒绝理赔申请。这些操作对它不可用;它们会转给您的理赔团队。同样的原则也适用于旅游业中的代金券和补偿:在您的政策限额以内发放,超出限额的交给人处理;也适用于改签:只在票价规则允许的范围内提供。
文档负责解释,系统负责决定。知识库答复只来自您自己的文档、政策和常见问题解答,智能体也被限定在这些材料范围内。这是用于解释的合适工具,而不是用于提供数值的工具。文档告诉客户您的丧亲优惠政策是如何运作的。系统则告诉客户他们的预订是否符合条件。
该由人审批的,由人审批。对话究竟何时转交给您的团队,由您决定;敏感操作可以在执行前等待人工审批。Meta 公布的智能体安全规则指出,一个读取不受信任的输入、能看到私密数据并能改变状态的智能体,在没有硬性约束的情况下不应同时做这三件事 [33]。负责退款的智能体正是这样的智能体。审批节点就是那个约束。
每一项操作都有记录。阿联酋和沙特的规则期望客户记录保存多年,并在监管机构或客户询问当时说了什么时能够提供。我们的智能体会记录自己执行的每一项操作及其原因,因此“他们当时被告知了什么,是在什么时候”这个问题的答案,只需一次查询,而不必在录音中翻找。
我们尚不了解的
阿联酋或沙特的法院或审裁机构,尚未就面向客户的智能体所作的陈述作出过裁决。阿联酋新的《民事交易法》(Civil Transactions Law)自 2026 年 6 月起生效,新增了一项义务:须披露对另一方订约决定具有决定性意义的信息 [34];但没有人知道法院会如何将其适用于自动化对话。
目前没有已发表的研究考察海湾阿拉伯语方言中,或在一句话中切换阿拉伯语和英语的对话中,提示词注入或政策偏离的情况。上文关于 Arabizi 的发现涉及的是有害内容,而不是退款和价格。这一空白应当通过测量来填补,而不是凭假设。
还没有人公布过,受约束的智能体在实际的客户运营中(而不是在基准测试中)会损失什么。德国的裁决正在上诉中,而加拿大航空案的裁决也没有说明该聊天机器人是自行生成了答案,还是读取了一个写得很糟糕的模板。此外,大多数研究针对的是文本。语音在上述所有问题之上还会叠加转录错误,而我们尚未看到有人为此目的对其进行测量。
参考来源
- 1.British Columbia Civil Resolution Tribunal, Moffatt v. Air Canada, 2024 BCCRT 149, 14 February 2024.https://www.canlii.org/en/bc/bccrt/doc/2024/2024bccrt149/2024bccrt149.html
- 2.Oberlandesgericht Hamm, judgment of 12 May 2026, 4 UKl 3/25 (full text, German).https://nrwe.justiz.nrw.de/olgs/hamm/j2026/4_UKl_3_25_Urteil_20260512.html English summary: DLA Piper, "German court addresses liability for AI chatbot statements", June 2026. https://www.dlapiper.com/en-us/insights/publications/2026/06/german-court-addresses-liability
- 3.M. Truell (Cursor co-founder), comment on Hacker News, 16 April 2025.https://news.ycombinator.com/item?id=43700931 Reported in The Register, "Cursor AI's own support bot hallucinated its usage policy", 18 April 2025. https://www.theregister.com/2025/04/18/cursor_ai_support_bot_lies/
- 4.VentureBeat, "A Chevy for $1? Car dealer chatbots show perils of AI for customer service", 19 December 2023 (secondary; the original exchange exists only as a social media screenshot).https://venturebeat.com/ai/a-chevy-for-1-car-dealer-chatbots-show-perils-of-ai-for-customer-service
- 5.Fullpath, "What really happened when Fullpath's ChatGPT chatbot went viral", 21 December 2023.https://www.fullpath.com/blog/what-really-happened-when-fullpaths-chatgpt-chatbot-went-viral/
- 6.The Markup, "NYC's AI chatbot tells businesses to break the law", 29 March 2024 (secondary; no official audit exists).https://themarkup.org/artificial-intelligence/2024/03/29/nycs-ai-chatbot-tells-businesses-to-break-the-law
- 7.The Markup, "Mamdani to kill the NYC AI chatbot we caught telling businesses to break the law", 30 January 2026.https://themarkup.org/artificial-intelligence/2026/01/30/mamdani-to-kill-the-nyc-ai-chatbot-we-caught-telling-businesses-to-break-the-law
- 8.UK National Cyber Security Centre, D. Chismon, "Prompt injection is not SQL injection (it may be worse)", 8 December 2025.https://www.ncsc.gov.uk/blog-post/prompt-injection-is-not-sql-injection
- 9.OWASP, "LLM01:2025 Prompt Injection", OWASP Top 10 for LLM Applications 2025.https://genai.owasp.org/llmrisk/llm01-prompt-injection/
- 10.Y. Qin et al., "SysBench: Can Large Language Models Follow System Messages?", 2024, Tables 2 and 4.https://arxiv.org/abs/2408.10943
- 11.P. Laban et al., "LLMs Get Lost in Multi-Turn Conversation", 2025.https://arxiv.org/abs/2505.06120
- 12.M. Sharma et al., "Towards Understanding Sycophancy in Language Models", 2023, section 3.2.https://arxiv.org/abs/2310.13548
- 13.A. Fanous et al., "SycEval: Evaluating LLM Sycophancy", 2025.https://arxiv.org/abs/2502.08177
- 14.H. He, "Defeating Nondeterminism in LLM Inference", Thinking Machines, 10 September 2025.https://thinkingmachines.ai/blog/defeating-nondeterminism-in-llm-inference/
- 15.S. Yao et al., "τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains", 2024, Table 2 and Figure 4.https://arxiv.org/abs/2406.12045
- 16.E. Debenedetti et al., "AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents", NeurIPS 2024, Tables 3 and 5.https://arxiv.org/abs/2406.13352
- 17.M. Al Ghanim et al., "Jailbreaking LLMs with Arabic Transliteration and Arabizi", EMNLP 2024, Tables 2 and 3.https://arxiv.org/abs/2406.18725
- 18.C. Niu et al., "RAGTruth: A Hallucination Corpus for Developing Trustworthy Retrieval-Augmented Language Models", ACL 2024, Table 2.https://aclanthology.org/2024.acl-long.585.pdf
- 19.J. Xie et al., "Adaptive Chameleon or Stubborn Sloth: Revealing the Behavior of Large Language Models in Knowledge Conflicts", ICLR 2024.https://arxiv.org/abs/2305.13300
- 20.US Federal Trade Commission, "FTC Announces Crackdown on Deceptive AI Claims and Schemes", 25 September 2024.https://www.ftc.gov/news-events/news/press-releases/2024/09/ftc-announces-crackdown-deceptive-ai-claims-schemes
- 21.UAE Federal Law No. 15 of 2020 on Consumer Protection, Articles 4(2), 17 and 21 (Ministry of Economy English text).https://www.moet.gov.ae/documents/20121/0/Law_15_2020_pdf.pdf
- 22.UAE Insurance Authority Board of Directors' Resolution No. 18 of 2020 concerning Electronic Insurance Regulations, Articles 1, 8 and 16(3).https://rulebook.centralbank.ae/en/rulebook/insurance-authority-board-directors-resolution-no-18-2020-concerning-electronic-insurance
- 23.Central Bank of the UAE, "Guidance Note on the Consumer Protection and Responsible Adoption and Use of Artificial Intelligence and Machine Learning by Licensed Financial Institutions", 11 February 2026, sections 2, 4 and 7.https://rulebook.centralbank.ae/en/rulebook/guidance-note-consumer-protection-and-responsible-adoption-and-use-artificial-intelligence
- 24.Kingdom of Saudi Arabia, E-Commerce Law, Royal Decree No. M/126 of 1440H (2019), Articles 10 and 11 (Arabic text governs; English wording is an unofficial rendering).https://laws.boe.gov.sa
- 25.Saudi Arabian Monetary Authority (sector now supervised by the Insurance Authority), Insurance Market Code of Conduct Regulation, Articles 8, 16 and 28.https://rulebook.sama.gov.sa/en/entiresection/563
- 26.Saudi Data and Artificial Intelligence Authority, "AI Ethics Principles", version 1.0, September 2023, Accountability and Responsibility principle.https://dgp.sdaia.gov.sa/wps/wcm/connect/4c56ed1c-1b82-447d-ac29-638f5f99c12e/ai-principles-EN.pdf
- 27.E. Debenedetti et al., "Defeating Prompt Injections by Design", Google DeepMind and ETH Zurich, 2025.https://arxiv.org/abs/2503.18813
- 28.L. Beurer-Kellner et al., "Design Patterns for Securing LLM Agents against Prompt Injections", 2025.https://arxiv.org/abs/2506.08837
- 29.Z. R. Tam et al., "Let Me Speak Freely? A Study on the Impact of Format Restrictions on Performance of Large Language Models", 2024, Table 1.https://arxiv.org/abs/2408.02442
- 30.W. Kurt, "Say What You Mean: A Response to 'Let Me Speak Freely'", .txt (undated vendor blog).https://blog.dottxt.ai/say-what-you-mean.html
- 31.US Securities and Exchange Commission, In the Matter of Knight Capital Americas LLC, Release No. 34-70694, 16 October 2013, paragraphs 1 and 15.https://www.sec.gov/files/litigation/admin/2013/34-70694.pdf
- 32.OWASP, "LLM06:2025 Excessive Agency", OWASP Top 10 for LLM Applications 2025.https://genai.owasp.org/llmrisk/llm062025-excessive-agency/
- 33.Meta AI, "Agents Rule of Two: A Practical Approach to AI Agent Security", 31 October 2025.https://ai.meta.com/blog/practical-ai-agent-security/
- 34.HLC, "New UAE Civil Transactions Law: four key implications for corporate and commercial transactions", 2026 (secondary; law firm summary of Federal Decree-Law No. 25 of 2025).https://www.hlc.com/en/publications/new-uae-civil-transactions-law-four-key-implications-for-corporate-and-commercial-transactions
新研究发布时即可收到
我们发布研究时,会不定期发送电子邮件。