Un preprint publicado el 20 de agosto de 2026 sostiene que los modelos de lenguaje de gran tamaño pueden revelar secretos presentes en su contexto mediante respuestas aparentemente inocuas, incluso cuando rechazan una petición directa del secreto. Los autores denominan a este comportamiento fuga involuntaria de contexto. La conclusión central no es que todos los modelos o agentes filtren cualquier secreto. Es que los controles de rechazo podrían no impedir que el contexto oculto influya en respuestas posteriores.
El hallazgo importa a las organizaciones que colocan credenciales, datos personales, expedientes, documentos recuperados o memoria persistente dentro del contexto de trabajo de un agente. Si un modelo codifica información sobre ese contexto en texto aparentemente benigno, un atacante podría no necesitar una inyección de prompt convencional ni una revelación literal. Varias observaciones podrían bastar para inferir un dato protegido.
Qué probó el estudio sobre fugas de contexto en LLM
El trabajo Inadvertent Context Leakage in Language Models es la primera versión de un preprint de arXiv de Jaiden Fairoze, Neal Mangaokar, Kamalika Chaudhuri, Sanjam Garg y Saeed Mahloujifar. Los investigadores realizaron experimentos de caja negra con ocho modelos propietarios. Colocaron un secreto en el contexto del modelo, plantearon preguntas no relacionadas y comprobaron si los patrones estadísticos de las respuestas benignas revelaban el secreto.
En experimentos controlados con dígitos, los autores comunican una recuperación casi perfecta de secretos de dos dígitos y una coincidencia exacta del 82 por ciento para los de cuatro dígitos. También afirman que un clasificador pudo inferir propiedades semánticas de información oculta a partir de salidas que no la repetían expresamente. En otro experimento de aprendizaje por refuerzo, un adversario reconstruyó números completos de la Seguridad Social de Estados Unidos en lo que el trabajo describe como un entorno de agente similar a producción.
Esas cifras son resultados atribuidos a los autores. No establecen una tasa general de fuga para agentes en producción y no deben trasladarse a otro modelo, prompt, flujo o tipo de datos sin pruebas. El trabajo también señala que los modelos más potentes filtraron en ocasiones más información dentro de su configuración experimental, lo que cuestiona la suposición de que una mayor capacidad de razonamiento mejore automáticamente la confidencialidad.
Por qué una salida benigna cambia el modelo de seguridad de los agentes
Muchos controles de agentes se centran en sucesos claramente peligrosos: una respuesta prohibida, una llamada maliciosa a una herramienta o un prompt que anula instrucciones. Una fuga de contexto es más discreta. Una salida permitida puede seguir correlacionada con un contexto protegido. Por ello, una secuencia de respuestas de bajo riesgo aparente puede convertirse en un canal de información.
El riesgo es especialmente relevante cuando un agente combina solicitudes del usuario con instrucciones del sistema, documentos recuperados, memoria, resultados de herramientas y material de autenticación. La guía de OWASP sobre divulgación de información sensible identifica los prompts del sistema, archivos, resultados de herramientas, datos empresariales y datos personales como material susceptible de exposición mediante una aplicación LLM. OWASP no valida de forma independiente los resultados del nuevo estudio, pero su modelo de riesgo respalda la premisa operativa de que el contexto activo es una superficie de datos sensibles.
Las organizaciones deberían tratar la construcción del contexto como un límite de seguridad. La guía de Maetra sobre controles contra la inyección de prompts en agentes de IA explica cómo combinar aislamiento de entradas, autorización de herramientas y controles de salida. La fuga de contexto añade otra razón para minimizar los datos antes de que se genere cualquier respuesta.
Una respuesta práctica para responsables de agentes
Los equipos de seguridad, privacidad y plataforma de IA pueden aplicar siete controles:
- Minimizar el contexto activo. Enviar solo los campos necesarios para la decisión actual. No incluir credenciales reutilizables, registros completos de identidad ni colecciones documentales sin límites en un contexto de uso general.
- Separar zonas de confianza. Mantener los datos de distintos usuarios, asuntos, clientes y niveles de privilegio en memorias y sistemas de recuperación separados. Autorizar antes de recuperar, no únicamente después de generar.
- Tokenizar valores críticos. Sustituir secretos e identificadores directos por referencias de corta duración cuando el modelo no necesite el valor subyacente. Resolver la referencia solo dentro de una herramienta controlada.
- Limitar la salida y la repetición. Reducir respuestas libres innecesarias, limitar patrones de sondeo y supervisar preguntas benignas repetidas que puedan facilitar una inferencia estadística.
- Probar la extracción indirecta. Incorporar valores señuelo e intentos de inferencia en varios turnos a las evaluaciones ofensivas. La prueba debe buscar correlaciones entre salidas, no solo la repetición literal de un secreto.
- Aislar herramientas de alto impacto. Entregar a los agentes credenciales temporales y de mínimo privilegio mediante un intermediario. Exigir autorización determinista y revisión humana para acciones externas importantes.
- Conservar evidencia útil. Registrar la versión del modelo y la política, las fuentes del contexto, el resultado de autorización, las llamadas a herramientas, las redacciones, la decisión del revisor y la respuesta a incidentes sin retener secretos innecesarios.
El registro debe permitir reconstruir por qué un dato entró en el contexto y qué control lo autorizó. La guía de Maetra sobre registros de auditoría de IA describe un conjunto mínimo para decisiones de agentes trazables.
Límites y la decisión que debe tomarse ahora
Se trata de investigación inicial, no de una medición revisada por pares de todos los sistemas desplegados. El preprint estudia ciertos modelos propietarios bajo condiciones controladas y los modelos comerciales pueden cambiar. Las tareas de reconstrucción de dígitos no demuestran que cualquier secreto de producción pueda recuperarse con la misma tasa. El experimento similar a producción es evidencia de la configuración de los autores, no una brecha real divulgada.
La conclusión prudente es más limitada: superar una prueba de rechazo no demuestra que el contexto confidencial no pueda influir en salidas permitidas. Los responsables deberían identificar los flujos que colocan datos de alto impacto en el contexto, reducirlos antes de la generación y probar fugas en varios turnos como parte de la aprobación de despliegue.
Análisis de Maetra: la minimización del contexto, la separación de privilegios y la captura de evidencia deberían ser criterios de lanzamiento para agentes que tratan datos regulados o confidenciales. Los equipos pueden utilizar Maetra Secure para vincular estos controles con riesgos de exposición y responsables concretos.