Secure AI Atlas mark Secure AI Atlas SECURITY & GOVERNANCE

Framework

Agentic AI Governance Blueprint

Borrador de marco práctico para diseñar, limitar, registrar y revisar agentes que actúan sobre contenido, código, repositorios, datos o herramientas.

IA agentica gobierno Human Approval mapeo de controles

Estado y propósito

Este blueprint es un borrador público y una línea de investigación de Secure AI Atlas. No es un producto comercial cerrado, una certificación ni un sustituto de una evaluación jurídica o de seguridad.

Su propósito es conectar el diseño del agente con evidencia de gobierno antes de que una salida se convierta en una acción sobre contenido, código, datos, repositorios o herramientas.

Audiencia y problemas

Está dirigido a arquitectura de seguridad, ingeniería de IA y aplicaciones, plataformas, GRC, producto, auditoría, privacidad y responsables humanos de operaciones asistidas por agentes.

  • Inventarios que describen herramientas pero omiten identidad y autoridad.
  • Permisos heredados sin reducción al objetivo de la tarea.
  • Tool calls que convierten una salida probabilística en un efecto determinista.
  • Human Approval no forzado técnicamente.
  • Logs que no permiten reconstruir decisión, aprobación y resultado.
  • Pilotos exitosos que se convierten en autonomía implícita.

Principios

  • Diseñar la autoridad en lugar de inferirla.
  • Usar identidades atribuibles y least privilege específico para la tarea.
  • Tratar prompts, archivos, memoria, retrieval y tool output como fronteras de confianza.
  • Separar recomendación, aprobación y ejecución.
  • Registrar las acciones con consecuencias y favorecer operaciones reversibles.
  • Dar al revisor capacidad real para detener o modificar.
  • Ampliar autonomía solo mediante nueva evidencia y decisión.
  • Reducir autoridad cuando falte evidencia o falle un control.

Controles mínimos

  • Registro del agente, propietario, entorno, datos, identidades, herramientas y acciones permitidas.
  • Permisos de corta duración, separación de funciones y denegación explícita.
  • Allowlist y validación de herramientas, argumentos, destinos, coste y volumen.
  • Clasificación de datos, protección de secretos, retención y límites de memoria.
  • Logging de contexto, policy decision, tool call, aprobación, efecto y rollback.
  • Approval thresholds por impacto y revisión humana vinculada a la acción exacta.
  • Pruebas adversarias, monitorización, kill paths, contención e incident response.

Ciclo operativo

  • Register: caso de uso, propietario, entorno y valor esperado.
  • Map: capacidades, identidad, datos, herramientas y amenazas.
  • Bound: acciones permitidas, límites y approval gates.
  • Test: abuso, bypass, fallos, logs, rollback y estado seguro.
  • Authorize: evidencia, riesgo residual, condiciones y fecha de revisión.
  • Operate y Review: telemetría, excepciones, near misses y eficacia.
  • Change or retire: reevaluación, revocación y cierre.

Relación con otros marcos y evolución

El blueprint funciona como capa de traducción hacia controles y evidencia. OWASP aporta amenazas de aplicaciones LLM; NIST AI RMF estructura Govern, Map, Measure y Manage; MITRE ATLAS aporta tácticas adversarias; EU AI Act introduce obligaciones según contexto; Zero Trust disciplina identidad y acceso; Secure SDLC integra agentes, herramientas y cambios en la cadena de software.

Las siguientes entregas pueden incluir assessment, checklist, registro de casos de uso, matriz de controles, inventario de permisos y herramientas, matriz de aprobación, runbook y evidence pack.