Todos los artículos
Noticias del sector24 ago 2026Fuente: NVIDIA

NVIDIA sitúa los controles de seguridad de agentes de IA bajo el harness

Equipo de seguridad de IA revisando una pila de agentes con el límite de control por debajo del harness

NVIDIA publicó el 21 de agosto de 2026 una arquitectura técnica que sitúa los controles de seguridad aplicables a los agentes de IA en el entorno de ejecución y la infraestructura, por debajo del harness del agente. La idea central es práctica: los prompts y las reglas del harness pueden influir en lo que intenta el agente, pero solo una capa externa puede decidir qué está autorizado a hacer.

Esta es la posición de NVIDIA, no una nueva norma ni una garantía de seguridad validada de forma independiente. AI Understanding describió la propuesta por separado y señaló que el enfoque no cuenta con validación independiente. Para los equipos de plataforma y seguridad, el desarrollo útil es una separación más clara entre orientación del comportamiento y autoridad aplicada de forma efectiva.

Qué propone la arquitectura de seguridad de NVIDIA

NVIDIA describe una pila formada por el modelo, el harness del agente, la orquestación, un entorno de ejecución seguro y la infraestructura de inferencia. El modelo y el harness están por encima de un límite de seguridad. La identidad, la política, las credenciales, el aislamiento y la auditoría están por debajo.

Cada solicitud que produzca un efecto externo debería cruzar ese límite. Esto incluye archivos, procesos, red, llamadas API, cambios de datos, comunicaciones y asignación de recursos. Los componentes superiores no deberían poder concederse autoridad ni eludir la decisión.

NVIDIA también propone cuatro perfiles de carga:

PerfilUso habitualControles prioritarios
AisladoPreproducción con datos desechablesSin credenciales de producción, red restringida, sesión registrada
ConectadoPreproducción con servicios aprobadosIdentidad de corta duración, datos enmascarados, límites, registro completo
ProducciónCambios en sistemas o datos empresarialesAcceso ligado a la tarea, comprobaciones independientes, revisión humana para acciones de alto impacto
AdversarialRed team o evaluaciones con menos salvaguardasComunicaciones denegadas por defecto, cuarentena, máximo aislamiento

Son recomendaciones de NVIDIA. No demuestran que NVIDIA OpenShell, ni otra implementación, contenga por completo a todos los agentes o evite todos los fallos.

Por qué no bastan los controles dentro del harness

El harness controla el ciclo de trabajo, las herramientas, el contexto y la memoria. Puede rechazar una solicitud, pedir confirmación u orientar al modelo hacia un plan más seguro. Son controles útiles, pero el harness también es software que puede cambiar, configurarse mal o recibir influencia de entradas no fiables.

NVIDIA identifica problemas recurrentes como credenciales duraderas, documentos no fiables tratados como instrucciones, efectos externos sin control y evidencia de auditoría incompleta. Una inyección de prompt puede explotar estas debilidades cuando el mismo agente interpreta el contenido y decide si la acción resultante está autorizada.

La autorización debe mantenerse fuera de ese camino. El entorno de ejecución puede vincular una solicitud a una identidad, evaluar una política, conceder acceso limitado y registrar el resultado. Las señales de riesgo pueden reducir autoridad, pero no aumentarla. La guía de Maetra sobre controles de inyección de prompt para agentes explica por qué analizar contenido y controlar acciones de forma determinista resuelve partes distintas del problema.

Seis comprobaciones para agentes que usan herramientas

Los responsables de seguridad y plataforma pueden utilizar la arquitectura como lista de revisión:

  1. Mapear cada ruta de efecto. Enumerar herramientas, API, archivos, redes, identidades, almacenes de datos y acciones físicas o financieras accesibles.
  2. Localizar el punto de política con autoridad. Identificar el componente que permite, bloquea o exige revisión. Confirmar que el agente no puede cambiarlo ni evitarlo.
  3. Reducir la autoridad permanente. Sustituir credenciales amplias y duraderas por acceso breve y limitado a la tarea cuando la plataforma lo permita.
  4. Separar orientación y exigencia. Mantener prompts y reglas del harness sin tratarlos como el límite final de seguridad.
  5. Probar fallo y recuperación. Cubrir inyección de prompt, abuso de herramientas, salida de red, acceso a credenciales, delegación, revocación y resultados externos inciertos.
  6. Conservar evidencia de decisión. Registrar identidad, versión de política, acción solicitada, decisión, revisor cuando corresponda, resultado y estado de conciliación. La guía de registros de auditoría de IA ofrece una estructura práctica.

La revisión debe incluir rutas indirectas. Si una herramienta aprobada puede crear una credencial, lanzar recursos, instalar software o delegar en otro agente, la autoridad efectiva es mayor de lo que su nombre sugiere.

Qué sigue siendo incierto

El artículo de NVIDIA es una posición arquitectónica basada en su trabajo con OpenShell, desarrolladores, proyectos de código abierto y socios. No incluye una evaluación comparativa que demuestre que la propuesta supera otros diseños de seguridad. Siguen siendo necesarias las pruebas del producto, los permisos cloud, la red y la respuesta a incidentes.

La infraestructura también puede fallar si la política es incorrecta, falta una ruta de efecto, una identidad tiene demasiados permisos o un sistema externo devuelve un resultado ambiguo. La revisión humana es adecuada para algunas acciones de alto impacto, pero debe depender de la política y la consecuencia, no aplicarse automáticamente a todo.

Análisis de Maetra: definir autoridad antes de añadir autonomía

La lección más útil no es que todos los equipos necesiten el mismo entorno de ejecución. El límite de autoridad debe ser explícito antes de que un agente reciba más herramientas o un horizonte operativo más largo.

Empiece con un flujo de consecuencias reales. Identifique tarea, acción, sistema afectado, credencial, decisión de política, efecto esperado y evidencia. Después pruebe si alguna ruta alcanza el efecto sin cruzar el punto de control. Maetra Secure permite inspeccionar prompts y llamadas sospechosas mientras la autorización final permanece en una capa capaz de aplicar la política.

Fuentes

límite de seguridad de agentes IApolítica de ejecución de agentesNVIDIA OpenShellmínimo privilegio para agentes IA
NVIDIA sitúa los controles de seguridad de agentes de IA bajo el harness | Maetra Insights