Framework
Agentic AI Governance Blueprint
Borrador de marco práctico para diseñar, limitar, registrar y revisar agentes que actúan sobre contenido, código, repositorios, datos o herramientas.
Estado y propósito
Este blueprint es un borrador público y una línea de investigación de Secure AI Atlas. No es un producto comercial cerrado, una certificación ni un sustituto de una evaluación jurídica o de seguridad.
Su propósito es conectar el diseño del agente con evidencia de gobierno antes de que una salida se convierta en una acción sobre contenido, código, datos, repositorios o herramientas.
Audiencia y problemas
Está dirigido a arquitectura de seguridad, ingeniería de IA y aplicaciones, plataformas, GRC, producto, auditoría, privacidad y responsables humanos de operaciones asistidas por agentes.
- Inventarios que describen herramientas pero omiten identidad y autoridad.
- Permisos heredados sin reducción al objetivo de la tarea.
- Tool calls que convierten una salida probabilística en un efecto determinista.
- Human Approval no forzado técnicamente.
- Logs que no permiten reconstruir decisión, aprobación y resultado.
- Pilotos exitosos que se convierten en autonomía implícita.
Principios
- Diseñar la autoridad en lugar de inferirla.
- Usar identidades atribuibles y least privilege específico para la tarea.
- Tratar prompts, archivos, memoria, retrieval y tool output como fronteras de confianza.
- Separar recomendación, aprobación y ejecución.
- Registrar las acciones con consecuencias y favorecer operaciones reversibles.
- Dar al revisor capacidad real para detener o modificar.
- Ampliar autonomía solo mediante nueva evidencia y decisión.
- Reducir autoridad cuando falte evidencia o falle un control.
Controles mínimos
- Registro del agente, propietario, entorno, datos, identidades, herramientas y acciones permitidas.
- Permisos de corta duración, separación de funciones y denegación explícita.
- Allowlist y validación de herramientas, argumentos, destinos, coste y volumen.
- Clasificación de datos, protección de secretos, retención y límites de memoria.
- Logging de contexto, policy decision, tool call, aprobación, efecto y rollback.
- Approval thresholds por impacto y revisión humana vinculada a la acción exacta.
- Pruebas adversarias, monitorización, kill paths, contención e incident response.
Ciclo operativo
- Register: caso de uso, propietario, entorno y valor esperado.
- Map: capacidades, identidad, datos, herramientas y amenazas.
- Bound: acciones permitidas, límites y approval gates.
- Test: abuso, bypass, fallos, logs, rollback y estado seguro.
- Authorize: evidencia, riesgo residual, condiciones y fecha de revisión.
- Operate y Review: telemetría, excepciones, near misses y eficacia.
- Change or retire: reevaluación, revocación y cierre.
Relación con otros marcos y evolución
El blueprint funciona como capa de traducción hacia controles y evidencia. OWASP aporta amenazas de aplicaciones LLM; NIST AI RMF estructura Govern, Map, Measure y Manage; MITRE ATLAS aporta tácticas adversarias; EU AI Act introduce obligaciones según contexto; Zero Trust disciplina identidad y acceso; Secure SDLC integra agentes, herramientas y cambios en la cadena de software.
Las siguientes entregas pueden incluir assessment, checklist, registro de casos de uso, matriz de controles, inventario de permisos y herramientas, matriz de aprobación, runbook y evidence pack.