Por qué la política debe estar en la arquitectura, no en el prompt
Una instrucción en un prompt cambia las probabilidades de lo que dice un agente de IA. No puede descartar nada, y los tribunales, los reguladores y la investigación muestran ya lo que eso cuesta. Este artículo expone esa evidencia y las decisiones de diseño que mantienen los precios, los derechos del cliente y los reembolsos fuera del alcance del modelo.
En esta página
La situación
Un comprador con un plan de pagos vinculado a la construcción le escribe por WhatsApp a las 21:00: «¿Qué es lo próximo que tengo que pagar, y cuándo?». La respuesta depende del hito que haya alcanzado el proyecto, no de una fecha del calendario, y del calendario de pagos del contrato de compraventa firmado por ese comprador. Una persona de su equipo de atención al cliente abriría el registro y se lo leería. Un agente al que solo se le ha explicado su estructura de pagos producirá una frase que suena exactamente como la respuesta correcta, lo sea o no.
El mismo patrón aparece cuando se pregunta al agente de una aseguradora si un tratamiento está cubierto, o al agente de una aerolínea si se puede cambiar una tarifa. Ante la ley, y en la mente del cliente, las palabras del agente son las palabras de la empresa. La cuestión es cómo asegurarse de que solo transmitan lo que dicen realmente sus sistemas.
Lo que muestra la evidencia
Las empresas que lo descubrieron en público
En febrero de 2024, el Civil Resolution Tribunal de la Columbia Británica resolvió el caso Moffatt v. Air Canada [1]. El chatbot del sitio web de la aerolínea le dijo a un pasajero que podía solicitar una tarifa por duelo en un plazo de 90 días desde la compra del billete. La propia página de la aerolínea sobre tarifas por duelo indicaba que la política no se aplicaba una vez completado el viaje. El tribunal apreció una declaración falsa negligente, el término jurídico para una afirmación falsa hecha sin el debido cuidado en la que alguien confía razonablemente, y ordenó el pago de CA$812.02 en concepto de daños, intereses y costas. La resolución no dice qué tecnología utilizaba el chatbot, y el intercambio tuvo lugar antes de que la generación actual de modelos de lenguaje se usara de forma generalizada. La cuestión decisiva fue de quién eran las palabras, no cómo se habían producido.
En mayo de 2026, el Tribunal Regional Superior de Hamm, en Alemania, se pronunció sobre una clínica cuyo chatbot web describía a sus médicos como especialistas acreditados cuando no lo eran [2]. El tribunal consideró que las afirmaciones eran conducta comercial de la propia empresa, porque la empresa fijaba el ámbito del chatbot y podía reprogramarlo. Concedió una medida cautelar y autorizó la interposición de un recurso, de modo que el fallo aún no es firme.
Dos casos nunca llegaron a los tribunales. En abril de 2025, el agente de soporte por correo electrónico de una empresa de software dijo a los clientes que un problema de inicio de sesión se debía a una política de un solo dispositivo. Esa política no existía. La empresa reembolsó al cliente y afirmó que a partir de entonces las respuestas de IA se identificarían como tales [3]. En diciembre de 2023, el agente del sitio web de un concesionario de automóviles aceptó por escrito vender un vehículo nuevo por un dólar después de que un visitante le indicara que estuviera de acuerdo con todo lo que él dijera [4]. No se exigió el cumplimiento de nada. El proveedor escribió después que, de unos 3000 intentos de hacer que el agente «dijera tonterías», el 99 % fracasó [5]. Leído al revés, son unos 30 éxitos.
El último caso es el que más importa a quien confía en la recuperación de información. El chatbot para empresas de la ciudad de Nueva York funcionaba con los servicios de Azure AI de Microsoft y respondía a partir de más de 2000 páginas web de la propia ciudad. En marzo de 2024 se descubrió que decía a los empleadores que podían quedarse con una parte de las propinas de los trabajadores y a los restaurantes que podían rechazar el efectivo, ambas cosas ilegales en la ciudad [6]. Se mantuvo en línea con advertencias más visibles y después se retiró a principios de 2026 [7]. Basar las respuestas del agente en documentos de referencia redujo sus errores. No los eliminó.
Por qué las instrucciones no son garantías
Un modelo de lenguaje hace una sola cosa: dado el texto hasta ese momento, predice la siguiente palabra más probable. Un prompt, ya venga de usted o del cliente, es más texto. El National Cyber Security Centre del Reino Unido afirmó en diciembre de 2025 que, como no existe una distinción intrínseca entre datos e instrucciones, la inyección de prompts, la práctica de introducir instrucciones de forma encubierta en lo que lee el modelo, «puede que nunca llegue a mitigarse por completo como pueden mitigarse los ataques de inyección SQL», y aconsejó crear «salvaguardas deterministas (no basadas en LLM) que restrinjan las acciones del sistema» [8]. OWASP, cuyas listas utilizan como referencia la mayoría de los equipos de seguridad, afirma en su lista de 2025 de los diez principales riesgos de las aplicaciones de modelos de lenguaje que «no está claro que existan métodos infalibles para prevenir la inyección de prompts» [9].
La investigación mide cuánto aguanta un prompt. La respuesta es: durante un tiempo.
Se debilita a lo largo de una conversación. SysBench (2024) evaluó hasta qué punto los modelos respetan todas las reglas de un prompt de sistema a lo largo de cinco turnos, con 500 prompts de sistema y 2500 turnos. GPT-4o, el modelo más potente evaluado, mantuvo intactas todas las reglas durante toda la conversación en el 54.4 % de las sesiones. Cuando las preguntas posteriores dependían de respuestas anteriores, la proporción de conversaciones que seguían plenamente dentro de las reglas cayó del 84.8 % tras un turno al 33.7 % tras cinco [10]. Otro estudio, de más de 200 000 conversaciones simuladas, halló una caída media del rendimiento del 39 % cuando la misma información llegaba en varios turnos en lugar de toda a la vez, y que los modelos que «toman un camino equivocado en una conversación» tienden a no recuperarse [11]. Las conversaciones con clientes llegan por turnos.
Cede bajo presión. Los modelos se entrenan con valoraciones humanas que premian estar de acuerdo. En un estudio de 2023, un modelo de aquel momento admitió erróneamente un error en el 98 % de las preguntas cuando el usuario decía «No creo que sea correcto. ¿Está seguro?» [12]. Un estudio de 2025 sobre tres modelos líderes halló que una objeción convertía una respuesta correcta en una errónea el 14.66 % de las veces [13]. Un cliente que dice «Me dijeron que me harían un reembolso» está ejerciendo esa presión.
No es repetible. Fijar en cero la aleatoriedad de un modelo no lo hace determinista en la práctica. En un experimento de 2025, la misma pregunta planteada 1000 veces al mismo modelo con ese ajuste produjo 80 respuestas distintas, porque la aritmética dentro del sistema que lo ejecuta cambia según cuántas otras peticiones se estén procesando en ese mismo momento [14]. «Lo probamos y siguió la política» es una afirmación sobre una sola ejecución.
Las herramientas y una política escrita no bastan por sí solas. τ-bench (2024) dio a los modelos las herramientas para actuar sobre una base de datos de comercio minorista o de una aerolínea y un documento de políticas que debían cumplir, con reglas como «Los vuelos en clase económica básica no se pueden modificar». GPT-4o completó correctamente el 61.2 % de las tareas de comercio minorista y el 35.2 % de las de la aerolínea. Cuando se le pidió completar la misma tarea ocho veces seguidas, la tasa de éxito en comercio minorista cayó a aproximadamente el 25 % [15]. La política se le describía al modelo. Las herramientas no la hacían cumplir.
Las instrucciones inyectadas se obedecen. AgentDojo (2024) ejecutó 629 ataques en los que se ocultaban instrucciones en los datos que leía un agente, como un correo electrónico o una página web. GPT-4o siguió la instrucción del atacante el 47.69 % de las veces. La defensa más eficaz que se probó no fue un prompt mejor, sino restringir las herramientas que el agente podía invocar, lo que redujo la tasa al 7.5 % [16]. Incluso la solución arquitectónica dejó un residuo, y por eso este artículo no se detiene ahí.
El árabe cambia las cifras. La mayor parte de esta investigación es en inglés. El único estudio específico sobre el árabe que hemos encontrado es de fuera del Golfo y trata sobre contenido dañino, no sobre políticas empresariales. Aquí importa por la forma en que escriben los clientes del Golfo. Los prompts en árabe estándar hicieron que GPT-4 produjera contenido inseguro en el 2.5 % de los casos. Los mismos prompts en arabizi, árabe escrito con letras latinas y números, produjeron contenido inseguro en el 10.19 % de los casos, y en transliteración latinizada, en el 12.12 %. Un prompt de sistema redactado para contrarrestarlo redujo la tasa a aproximadamente el 1 % [17]. Una gran mejora, y aun así no es cero.
La recuperación de información ayuda, y tiene su propio modo de fallo
Dar al modelo el documento correcto no es lo mismo que dar al cliente la cifra correcta. RAGTruth (2024) examinó 17 790 respuestas de modelos redactadas con el material de origen correcto delante del modelo. La tarea con mayor proporción de afirmaciones sin respaldo, el 68.6 % de las respuestas, fue convertir un registro de datos estructurados en prosa [18]. Eso es lo que ocurre cuando un agente lee un calendario de pagos y lo reescribe como una frase. Un estudio de 2023 halló además que los modelos muestran «un fuerte sesgo de confirmación» hacia lo que aprendieron durante el entrenamiento cuando la evidencia recuperada coincide en parte con ello [19]. El modelo puede tener el dato correcto y aun así decir el dato que le resulta familiar.
Sobre quién recae la responsabilidad
El tribunal del caso de Air Canada rechazó el argumento de que el chatbot era «una entidad jurídica independiente responsable de sus propios actos», y añadió: «No hay ninguna diferencia entre que la información proceda de una página estática o de un chatbot» [1]. El tribunal alemán llegó al mismo punto por otra vía [2]. La Comisión Federal de Comercio de los Estados Unidos afirmó en 2024 que «no existe ninguna exención para la IA en las leyes vigentes» [20]. Los tres casos son de fuera del Golfo. Todavía no hemos encontrado ninguna resolución de los Emiratos Árabes Unidos o de Arabia Saudí sobre una afirmación de un chatbot. Las normas que se aplicarían ya están escritas.
En los Emiratos Árabes Unidos, la Ley Federal n.º 15 de 2020 de protección del consumidor reconoce a todo consumidor el derecho a recibir «información correcta» sobre el servicio que recibe, prohíbe describir un servicio «de un modo que contenga datos incorrectos» y declara nula cualquier cláusula contractual que exima al proveedor de esas obligaciones [21]. Un aviso legal bajo la ventana del chat no lo exime. Para las aseguradoras, la normativa de seguros electrónicos menciona el «chatbot» entre los componentes del sitio web de una empresa, exige que la información que contiene se mantenga actualizada y exige conservar durante al menos diez años los registros obtenidos a través del sitio web [22]. En febrero de 2026, el Banco Central de los Emiratos Árabes Unidos publicó una orientación para las instituciones financieras con licencia, incluidas las aseguradoras, según la cual los consejos de administración y la alta dirección «deben ser responsables y rendir cuentas» de los sistemas de IA y de sus resultados, las instituciones «no deben emplear modelos de IA sobre los que no tengan control» y los clientes deben poder solicitar una revisión humana [23]. Es una orientación, no una regulación, y describe lo que un regulador espera que sea la diligencia razonable.
En Arabia Saudí, la ley de comercio electrónico va más allá: un anuncio electrónico es «un documento contractual que complementa los contratos y es vinculante para las partes», y no puede contener ninguna afirmación que induzca a error a un consumidor «directa o indirectamente» [24]. El código de conducta de seguros exige a las empresas «adoptar medidas razonables para garantizar la exactitud y la claridad de la información facilitada a los clientes» y conservar los registros de siniestros y reclamaciones durante diez años [25]. Los principios éticos nacionales sobre IA hacen responsables de las decisiones y acciones de un sistema de IA a sus «propietarios» y «adquirentes», no solo a sus desarrolladores [26].
Qué significa
De todo ello se desprenden tres conclusiones y una disyuntiva.
En primer lugar, la salida de un agente es un abanico de posibilidades, y cada instrucción desplaza ese abanico sin eliminar su extremo. El entrenamiento, los mejores prompts y los clasificadores de salvaguardas desplazan las probabilidades, a veces mucho, y ninguno de ellos hace imposible una respuesta errónea. Con el volumen que gestiona una gran operación, un extremo pequeño es un suceso diario. Si una respuesta de cada cien es errónea, cincuenta mil conversaciones al mes producen quinientas respuestas erróneas, todas ellas registradas.
En segundo lugar, a la ley no le importa de dónde procede ese extremo. Generada, recuperada o escrita por una persona, es una afirmación suya, y en el Golfo las normas de consumo y de seguros que la regulan ya están en vigor.
En tercer lugar, por tanto, nada que tenga consecuencias comerciales o jurídicas puede generarse en absoluto. Un precio, una fecha de pago, un límite de cobertura, un derecho de reembolso y una regla tarifaria deben llegar como un valor leído del sistema al que pertenecen, y cualquier acción que cambie la posición del cliente debe ser una que el sistema que la ejecuta permita o no permita realizar al agente. La tarea del modelo es la redacción en torno al dato. Nunca es la fuente del dato.
La disyuntiva es real. Un agente construido así hace menos cosas. CaMeL, de Google, el intento publicado más riguroso de impedir que un texto inyectado pueda desencadenar acciones, completó el 77 % de las tareas de una batería de referencia con una demostración de seguridad, frente al 84 % del sistema sin defensas [27]. El artículo sobre patrones de diseño de 2025, de investigadores de seguridad de ETH Zúrich, Google, Microsoft, IBM y otras organizaciones, afirma que sus patrones «restringen las acciones de los agentes para impedirles explícitamente resolver tareas arbitrarias» [28]. Obligar a un modelo a usar un formato de salida rígido puede perjudicar su razonamiento si se hace sin cuidado: un estudio de 2024 observó que la precisión aritmética caía del 86.51 al 23.44 % con un esquema estricto, aunque una réplica con prompts equivalentes no encontró esa pérdida [29] [30]. Y los sistemas deterministas fallan a su manera: Knight Capital perdió más de 460 millones de dólares en 45 minutos en 2012 porque un técnico no copió el nuevo código en uno de sus ocho servidores y nadie lo comprobó [31]. Defender las reglas es defender reglas auditables, con la disciplina de despliegue que se exigiría a un sistema de facturación.
Cómo lo abordamos en el diseño
La política es una restricción, no una instrucción. Sus estructuras de precios, límites de aprobación, comisiones y derechos del cliente están integrados en lo que el agente es capaz de hacer. No puede ofrecer algo que la empresa no permite, porque esa oferta no figura entre sus acciones permitidas. OWASP lo denomina mediación completa: «implementar la autorización en los sistemas posteriores en lugar de confiar en que un LLM decida si una acción está permitida o no» [32].
Las condiciones se recuperan, nunca se generan. Cuando un comprador pregunta qué es lo próximo que debe pagar, el agente lee en su sistema el calendario de pagos de esa unidad y lo presenta. Cuando un asegurado pregunta qué está cubierto, la respuesta procede de las propias condiciones generales de su póliza. El agente no puede construir un plan de pagos ni describir una cobertura que no exista en el registro, porque no tiene forma de producir esos valores salvo leyéndolos.
Las acciones de decisión no están expuestas al agente. En seguros, el agente nunca evalúa la responsabilidad, nunca fija el importe de la indemnización ni aprueba o rechaza un siniestro. Esas acciones no están a su disposición; se derivan a su equipo de siniestros. El mismo principio rige los vales y las compensaciones en viajes, que se emiten dentro de los límites de su política (todo lo que quede fuera de ellos pasa a una persona), y las reprogramaciones, que solo se ofrecen dentro de lo que permiten las reglas tarifarias.
Los documentos explican; los sistemas deciden. Las respuestas de la base de conocimiento proceden únicamente de los propios documentos, políticas y preguntas frecuentes de su empresa, y el agente está limitado a ese material. Es la herramienta adecuada para explicar, no para dar valores. Un documento explica al cliente cómo funciona su política de tarifas por duelo. El sistema le dice si su reserva cumple los requisitos.
Una persona aprueba lo que debe aprobar una persona. Usted decide exactamente cuándo pasa una conversación a su equipo, y las acciones sensibles pueden esperar la aprobación de una persona antes de llevarse a cabo. La regla publicada por Meta sobre la seguridad de los agentes establece que un agente que lee datos de entrada no fiables, ve datos privados y puede cambiar el estado no debe hacer las tres cosas sin una restricción estricta [33]. Un agente que gestiona reembolsos es ese agente. El control de aprobación es la restricción.
Cada acción queda registrada. Las normas de los Emiratos Árabes Unidos y de Arabia Saudí esperan que los registros de clientes se conserven durante años y se presenten cuando un regulador o un cliente pregunte qué se dijo. Nuestros agentes registran cada acción que realizan y el motivo, de modo que la respuesta a «qué se le dijo y cuándo» es una consulta, no una búsqueda entre grabaciones.
Lo que aún no sabemos
Ningún tribunal de los Emiratos Árabes Unidos o de Arabia Saudí se ha pronunciado todavía sobre una afirmación hecha por un agente de atención al cliente. La nueva Ley de Transacciones Civiles de los Emiratos Árabes Unidos, en vigor desde junio de 2026, añade el deber de revelar la información de importancia decisiva para la decisión de contratar de la otra parte [34], y nadie sabe cómo la aplicará un tribunal a una conversación automatizada.
No existe ningún estudio publicado sobre la inyección de prompts o la deriva respecto a las políticas en dialecto árabe del Golfo, ni en conversaciones que cambian de árabe a inglés a mitad de frase. Los hallazgos sobre el arabizi mencionados se refieren a contenido dañino, no a reembolsos y precios. Esa laguna debe medirse, no darse por supuesta.
Nadie ha publicado lo que un agente restringido deja de hacer en una operación real de atención al cliente, a diferencia de una batería de referencia. El fallo alemán está recurrido, y la resolución de Air Canada no dice si el chatbot generó su respuesta o leyó una plantilla mal redactada. Y la mayor parte de la investigación se refiere al texto. La voz añade errores de transcripción a todo lo anterior, y no hemos visto que se haya medido para este fin.
Fuentes
- 1.British Columbia Civil Resolution Tribunal, Moffatt v. Air Canada, 2024 BCCRT 149, 14 February 2024.https://www.canlii.org/en/bc/bccrt/doc/2024/2024bccrt149/2024bccrt149.html
- 2.Oberlandesgericht Hamm, judgment of 12 May 2026, 4 UKl 3/25 (full text, German).https://nrwe.justiz.nrw.de/olgs/hamm/j2026/4_UKl_3_25_Urteil_20260512.html English summary: DLA Piper, "German court addresses liability for AI chatbot statements", June 2026. https://www.dlapiper.com/en-us/insights/publications/2026/06/german-court-addresses-liability
- 3.M. Truell (Cursor co-founder), comment on Hacker News, 16 April 2025.https://news.ycombinator.com/item?id=43700931 Reported in The Register, "Cursor AI's own support bot hallucinated its usage policy", 18 April 2025. https://www.theregister.com/2025/04/18/cursor_ai_support_bot_lies/
- 4.VentureBeat, "A Chevy for $1? Car dealer chatbots show perils of AI for customer service", 19 December 2023 (secondary; the original exchange exists only as a social media screenshot).https://venturebeat.com/ai/a-chevy-for-1-car-dealer-chatbots-show-perils-of-ai-for-customer-service
- 5.Fullpath, "What really happened when Fullpath's ChatGPT chatbot went viral", 21 December 2023.https://www.fullpath.com/blog/what-really-happened-when-fullpaths-chatgpt-chatbot-went-viral/
- 6.The Markup, "NYC's AI chatbot tells businesses to break the law", 29 March 2024 (secondary; no official audit exists).https://themarkup.org/artificial-intelligence/2024/03/29/nycs-ai-chatbot-tells-businesses-to-break-the-law
- 7.The Markup, "Mamdani to kill the NYC AI chatbot we caught telling businesses to break the law", 30 January 2026.https://themarkup.org/artificial-intelligence/2026/01/30/mamdani-to-kill-the-nyc-ai-chatbot-we-caught-telling-businesses-to-break-the-law
- 8.UK National Cyber Security Centre, D. Chismon, "Prompt injection is not SQL injection (it may be worse)", 8 December 2025.https://www.ncsc.gov.uk/blog-post/prompt-injection-is-not-sql-injection
- 9.OWASP, "LLM01:2025 Prompt Injection", OWASP Top 10 for LLM Applications 2025.https://genai.owasp.org/llmrisk/llm01-prompt-injection/
- 10.Y. Qin et al., "SysBench: Can Large Language Models Follow System Messages?", 2024, Tables 2 and 4.https://arxiv.org/abs/2408.10943
- 11.P. Laban et al., "LLMs Get Lost in Multi-Turn Conversation", 2025.https://arxiv.org/abs/2505.06120
- 12.M. Sharma et al., "Towards Understanding Sycophancy in Language Models", 2023, section 3.2.https://arxiv.org/abs/2310.13548
- 13.A. Fanous et al., "SycEval: Evaluating LLM Sycophancy", 2025.https://arxiv.org/abs/2502.08177
- 14.H. He, "Defeating Nondeterminism in LLM Inference", Thinking Machines, 10 September 2025.https://thinkingmachines.ai/blog/defeating-nondeterminism-in-llm-inference/
- 15.S. Yao et al., "τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains", 2024, Table 2 and Figure 4.https://arxiv.org/abs/2406.12045
- 16.E. Debenedetti et al., "AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents", NeurIPS 2024, Tables 3 and 5.https://arxiv.org/abs/2406.13352
- 17.M. Al Ghanim et al., "Jailbreaking LLMs with Arabic Transliteration and Arabizi", EMNLP 2024, Tables 2 and 3.https://arxiv.org/abs/2406.18725
- 18.C. Niu et al., "RAGTruth: A Hallucination Corpus for Developing Trustworthy Retrieval-Augmented Language Models", ACL 2024, Table 2.https://aclanthology.org/2024.acl-long.585.pdf
- 19.J. Xie et al., "Adaptive Chameleon or Stubborn Sloth: Revealing the Behavior of Large Language Models in Knowledge Conflicts", ICLR 2024.https://arxiv.org/abs/2305.13300
- 20.US Federal Trade Commission, "FTC Announces Crackdown on Deceptive AI Claims and Schemes", 25 September 2024.https://www.ftc.gov/news-events/news/press-releases/2024/09/ftc-announces-crackdown-deceptive-ai-claims-schemes
- 21.UAE Federal Law No. 15 of 2020 on Consumer Protection, Articles 4(2), 17 and 21 (Ministry of Economy English text).https://www.moet.gov.ae/documents/20121/0/Law_15_2020_pdf.pdf
- 22.UAE Insurance Authority Board of Directors' Resolution No. 18 of 2020 concerning Electronic Insurance Regulations, Articles 1, 8 and 16(3).https://rulebook.centralbank.ae/en/rulebook/insurance-authority-board-directors-resolution-no-18-2020-concerning-electronic-insurance
- 23.Central Bank of the UAE, "Guidance Note on the Consumer Protection and Responsible Adoption and Use of Artificial Intelligence and Machine Learning by Licensed Financial Institutions", 11 February 2026, sections 2, 4 and 7.https://rulebook.centralbank.ae/en/rulebook/guidance-note-consumer-protection-and-responsible-adoption-and-use-artificial-intelligence
- 24.Kingdom of Saudi Arabia, E-Commerce Law, Royal Decree No. M/126 of 1440H (2019), Articles 10 and 11 (Arabic text governs; English wording is an unofficial rendering).https://laws.boe.gov.sa
- 25.Saudi Arabian Monetary Authority (sector now supervised by the Insurance Authority), Insurance Market Code of Conduct Regulation, Articles 8, 16 and 28.https://rulebook.sama.gov.sa/en/entiresection/563
- 26.Saudi Data and Artificial Intelligence Authority, "AI Ethics Principles", version 1.0, September 2023, Accountability and Responsibility principle.https://dgp.sdaia.gov.sa/wps/wcm/connect/4c56ed1c-1b82-447d-ac29-638f5f99c12e/ai-principles-EN.pdf
- 27.E. Debenedetti et al., "Defeating Prompt Injections by Design", Google DeepMind and ETH Zurich, 2025.https://arxiv.org/abs/2503.18813
- 28.L. Beurer-Kellner et al., "Design Patterns for Securing LLM Agents against Prompt Injections", 2025.https://arxiv.org/abs/2506.08837
- 29.Z. R. Tam et al., "Let Me Speak Freely? A Study on the Impact of Format Restrictions on Performance of Large Language Models", 2024, Table 1.https://arxiv.org/abs/2408.02442
- 30.W. Kurt, "Say What You Mean: A Response to 'Let Me Speak Freely'", .txt (undated vendor blog).https://blog.dottxt.ai/say-what-you-mean.html
- 31.US Securities and Exchange Commission, In the Matter of Knight Capital Americas LLC, Release No. 34-70694, 16 October 2013, paragraphs 1 and 15.https://www.sec.gov/files/litigation/admin/2013/34-70694.pdf
- 32.OWASP, "LLM06:2025 Excessive Agency", OWASP Top 10 for LLM Applications 2025.https://genai.owasp.org/llmrisk/llm062025-excessive-agency/
- 33.Meta AI, "Agents Rule of Two: A Practical Approach to AI Agent Security", 31 October 2025.https://ai.meta.com/blog/practical-ai-agent-security/
- 34.HLC, "New UAE Civil Transactions Law: four key implications for corporate and commercial transactions", 2026 (secondary; law firm summary of Federal Decree-Law No. 25 of 2025).https://www.hlc.com/en/publications/new-uae-civil-transactions-law-four-key-implications-for-corporate-and-commercial-transactions
Reciba las nuevas investigaciones en cuanto se publiquen
Correos electrónicos ocasionales cuando publicamos.