Gobernanza de la IA15 de julio de 2026Actualizado el 5 de agosto de 202626 min de lectura

Cómo auditar un sistema de agentes de IA: un marco empresarial para la producción

Un marco de auditoría de agentes de IA de dominio 12, listo para el trabajo de campo, para alcance, propiedad, autoridad, controles de tiempo de ejecución, muestreo, evidencia, hallazgos y seguimiento.

Antonella Serine

Antonella Serine

Founder, KLA

Founder of KLA, building the independent runtime governance control plane for regulated AI agents under the Reglamento de IA de la UE.

Diagrama editorial de una auditoría de un agente de IA empresarial: doce dominios de control convergen en un registro de evidencia que pasa por una verificación independiente.

Desplácese horizontalmente para ver el gráfico.

El objeto de la auditoría empresarial abarca los límites del agente, los propietarios responsables, la autoridad, la ejecución, la supervisión, los resultados y la evidencia verificable de forma independiente.

Abrir gráfico a tamaño completo

Respuesta citable

Objeto de citación

Definición

Una auditoría del sistema de agentes de IA es un método de trabajo de campo para probar la responsabilidad, la autoridad, la ejecución, la supervisión, los resultados y la evidencia a través de los límites de un agente de producción. Combina conciliación de la población, muestreo basado en riesgos, pruebas de control, repetición, comprobaciones de integridad de la evidencia, hallazgos y seguimiento para que un auditor pueda indicar qué criterios se probaron y qué respaldan los registros.

Alcance y excepciones

Se aplica cuando
Utilice este marco para una auditoría interna o un compromiso de aseguramiento que cubra agentes que acceden a herramientas, influyen en las decisiones comerciales, cambian registros u operan en Procesos regulados.
Excepciones
Una evaluación de modelo, una prueba de penetración o un cuestionario de proveedores tiene un objetivo más limitado. Amplíe el límite cuando el componente pueda cambiar un registro de acción, autoridad, resultado o evidencia.

Marco de decisión

  1. Inventario y alcance; responsabilidad y rendición de cuentas.
  2. Identidad y delegación; permisos, herramientas y límites de datos.
  3. Clasificación de riesgos y aseguramiento de preproducción; Aplicación de políticas en tiempo de ejecución.
  4. Aprobación humana y escalada; linaje de ejecución y resultados comerciales.
  5. Aseguramiento continuo y gestión del cambio; respuesta a incidentes, revocación y reversión.
  6. Integridad, retención y verificación independiente de la evidencia; dependencias de múltiples agentes y de terceros.

Evidencia mínima

  • Claves de población: agente, versión, entorno, proceso, tipo de decisión, resultado, nivel de riesgo y rango de fechas.
  • Campos de autoridad: principal patrocinador, identidad del agente, delegación, herramientas, recursos, propósito, duración y umbrales de aprobación.
  • Campos de ejecución: llamadas de modelos y herramientas, veredictos de políticas, solicitudes de decisión, cambios de estado, notificaciones y resultados comerciales.
  • Campos de evidencia: ID de registro, marcas de tiempo, manifiesto, hashes, firmas, cadena de custodia, política de retención y resultados del verificador.

Workflow regulado trabajado

Trabajo de campo para una decisión de préstamo regulado

Escenario: Un banco minorista de la UE utiliza un agente para recopilar datos de solicitudes, solicitar un modelo de riesgo crediticio, aplicar una política de préstamos y encaminar los casos dudosos a un asegurador.

Workflow: El auditor concilia la población de aplicaciones con las ejecuciones de agentes, decisiones de políticas, aprobaciones humanas, escrituras posteriores y evidencia sellada. Un caso de muestra se reproduce desde la identidad y la autoridad a través del acceso a los datos, las versiones de modelos y herramientas, el veredicto de la póliza, la justificación del asegurador, el resultado y la verificación de evidencia. Las excepciones se cuantifican, se asignan a los propietarios y se incluyen en las conclusiones de la auditoría.

Preguntas de los compradores

¿Qué cubre una auditoría de agente de IA?
Cubre todos los límites operativos: propósito, propiedad, identidad, autoridad delegada, herramientas, datos, política, supervisión humana, efectos de ejecución, monitoreo, incidentes, liberaciones, retención y verificación de evidencia independiente.
¿Cómo puedo auditar y reproducir las decisiones de los agentes de IA?
Congele y concilie la población, conserve las entradas versionadas y controle los resultados, luego reproduzca una muestra reproducible en un entorno controlado. El registro debe mostrar por qué se permitió, retuvo, bloqueó o cambió la acción.
¿Qué evidencia necesita una auditoría de un agente de IA?
Como mínimo, el auditor necesita identidades estables, autoridad y delegación, registros de políticas y aprobación, herramientas ordenadas y eventos de resultados, referencias de fuentes, metadatos de integridad, detalles de retención y una forma de verificar la integridad.
¿Con qué frecuencia se debe auditar un sistema de agentes de IA?
Establezca la cadencia a partir del impacto, la autonomía, el volumen, la tasa de cambio, el historial de incidentes, la detectabilidad, los deberes legales y la calidad de la evidencia. Desencadene trabajo adicional después de cambios en el modelo de material, la política, el permiso, la herramienta, la implementación o el control.

Fuentes primarias

Actualización:

Cómo implementa esto KLA Control Plane

KLA Control Plane proporciona registros de tiempo de ejecución para decisiones políticas, aprobaciones humanas, linaje de ejecución, resultados comerciales y evidencia sellada. Un equipo de auditoría puede utilizar esos registros como fuente de evidencia manteniendo su propio alcance, criterios, muestreo y conclusión independiente.

Límite de alcance: KLA no establece el objetivo de la auditoría, no reemplaza la independencia de la auditoría interna, no determina conclusiones legales ni es propietaria del préstamo, pago, caso o sistema de registro del cliente subyacente.

Auditoría de responsabilidad, autoridad, ejecución, supervisión y evidencia en toda la empresa en los sistemas de agentes de IA. Una auditoría de producción sigue el sistema operativo completo alrededor de un agente: el propósito comercial, el modelo y la orquestación, las identidades humanas y no humanas, la autoridad delegada, los datos y las herramientas, las decisiones políticas, las aprobaciones, los cambios de estado, los resultados comerciales, el monitoreo, los incidentes, las liberaciones, la reversión, la retención y la verificación independiente. El método siguiente brinda a los equipos de auditoría interna, cumplimiento, riesgo de modelo, seguridad y operaciones una estructura de trabajo de campo preservando al mismo tiempo sus responsabilidades separadas.

El marco de auditoría de agentes de IA empresarial del dominio 12

Utilice esta tabla para configurar el universo de auditoría, asignar solicitudes de evidencia y escribir procedimientos. Cada fila necesita una población definida, un propietario designado, un control comprobable, un registro de fuente veraz y una condición de falla explícita antes de que comience el trabajo de campo.

El agente de IA empresarial audita dominios, controles, evidencia y señales de falla
Dominio de auditoríaLa pregunta del auditorpropietario responsableControlar para probarSe requiere evidenciaseñal de fallaDónde en KLA / guía más profunda
1. Inventario y alcance¿Qué agentes, emisiones, entornos, procesos, decisiones y dependencias se encuentran en la población?Dueño de negocioConciliación de inventario y aprobación de límites.Inventario de agentes, mapa de procesos, flujo de datos, registro de dependencia, recuentos de poblaciónAgente desconocido, entorno perdido, población no reconciliada.Registro de Agente; guía de cumplimiento
2. Responsabilidad y rendición de cuentas¿A quién pertenecen los resultados, la operación de control, la aceptación de riesgos y la remediación?Dueño de negocioAutoridad designada de propiedad y aprobaciónMatriz de responsabilidad, cartas de roles, aprobaciones, propietarios de problemasResponsabilidad compartida, rol vacante, propietario sin autoridadRegistro de Agente; Mapeo de controles
3. Identidad y delegación¿Puede cada acción estar vinculada a un agente, un principal patrocinador y una delegación?Propietario de la identidadIdentidad única y delegación de alcanceRegistros de identidad, reclamaciones de tokens, cadena de delegación, alcance de la sesiónCredencial compartida, identidad huérfana, principal independienteRegistro de Agente; guía de permisos
4. Permisos, herramientas y límites de datos¿Podría el agente leer o cambiar recursos más allá de su propósito aprobado?Propietario de la aplicaciónPolítica de privilegios mínimos en el momento de la acciónSubvenciones efectivas, entrada al catálogo de herramientas, límites de datos, veredictos de políticasAmplio alcance, derivación directa, herramienta no registrada, combinación de subvenciones tóxicasCatálogo de herramientas; Límites de datos; Motor de políticas KLA
5. Clasificación de riesgos y aseguramiento de preproducción¿Se clasificó y probó el uso en comparación con su impacto y contexto reales?Propietario del riesgoClasificación documentada y puerta de liberación.Evaluación de impacto, modelo de amenaza, plan de evaluación, umbrales de aceptación.Clasificación no admitida, prueba faltante, umbral fallido exentoMapeo de controles; Centro de aseguramiento
6. Aplicación de políticas en tiempo de ejecución¿Se evaluó la política aprobada antes de cada acción consecuente?Propietario del controlPermitir, denegar o escalar decisiones en líneaVersión de política, reglas coincidentes, solicitud de decisión, recibo de acciónLa acción precede al veredicto, política obsoleta y elusión de la aplicación de la leyCreador de políticas; Motor de políticas KLA; pista de auditoría; guía para gobernar un agente
7. Aprobación humana y escalada¿Un revisor autorizado recibió suficientes pruebas y ejerció su criterio?Dueño de operacionesAprobación y escalamiento basados ​​en riesgosSolicitud de decisión, instantánea de la autoridad, evidencia mostrada, justificación, marcas de tiempoSello de goma, autoridad vencida, aprobación tardía, falta de justificaciónMesa de Decisiones; autonomía responsable
8. Linaje de ejecución y resultados comerciales¿Puede el auditor rastrear la intención a través de los efectos de las herramientas y el resultado final?Dueño del procesoCorrelación de extremo a extremo y conciliación de resultadosRegistro de linaje, viaje, llamadas a herramientas, estado before/after, registro de resultadosCorrelación rota, efecto secundario no registrado, desajuste de resultadosExplorador de linaje; guía de seguimientos de auditoría
9. Aseguramiento continuo y gestión del cambio¿Los cambios provocaron una reevaluación, un seguimiento y una implementación controlada?Propietario de ingenieríaAprobación de lanzamiento, detección de deriva, pruebas activadas por cambiosDiferencia de versión, resultados de pruebas, registro de implementación, alertas de garantía, remediaciónCambio no aprobado, deriva silenciosa, control fallido no resueltoAgentes; Centro de Aseguramiento; guía de seguimiento
10. Respuesta a incidentes, revocación y reversión¿Podría la organización contener al agente y revertir las acciones afectadas?Propietario del incidenteProcedimiento de eliminación, revocación, contención, notificación y reversiónCronograma del incidente, revocación de credenciales, reversión, lista de casos afectadosEjecución continua, alcance incompleto, reversión fallidaCentro de Seguridad; Agentes; Sala de pruebas
11. Integridad, retención y verificación independiente de la evidencia¿Está la evidencia completa, a prueba de manipulaciones, retenida y comprobable de forma independiente?Propietario de registrosConciliación de población, sellado, retención, prueba de verificador.Manifiesto, hashes, firmas, cadena de custodia, política de retención, retención legalError de hash, registro faltante, fuente mutable, retención caducadaSala de Pruebas; Paquete de pruebas selladas; Paquete de control; evidencia de manipulación; paquete de muestra
12. Dependencias de múltiples agentes y de terceros¿Están los agentes, modelos, herramientas, protocolos y proveedores delegados dentro de los límites de la auditoría?Propietario del servicioAprobación de dependencia y transferencia autenticadaInventario de proveedores, contratos, versiones, mensajes entre agentes, informes de control.Subagente opaco, mensaje no autenticado, componente no compatibleRegistro de Agente; Catálogo de herramientas; [Paso de peatones OWASP] (/blog/owasp-asi-top10-eu-ai-act-crosswalk)

Definir los límites del sistema antes de la actividad de muestreo.

Comience con el resultado del negocio y siga hacia adentro. El límite incluye todos los componentes que pueden influir en una acción o su prueba: configuración del agente, modelo, versiones de solicitud y orquestación, memoria, fuentes de recuperación, identidades de usuario y servicio, delegación, política, herramientas, sistemas posteriores, revisores humanos, monitoreo, procesos de incidentes y almacenes de evidencia. Incluya subagentes y terceros siempre que sus resultados puedan cambiar la decisión final, la autoridad disponible o la integridad del registro.

Construir una población que pueda reconciliarse. El NIST AI RMF 1.0 es un marco voluntario final para la IA en general, y GOVERN 1.6 respalda el mantenimiento de un inventario del sistema de IA para la gestión de riesgos. Para el trabajo de campo de auditoría, amplíe ese inventario a versiones, implementaciones, tipos de decisiones, entornos, herramientas, fuentes de datos, propietarios, niveles de riesgo, historial de incidentes y ubicaciones de evidencia.

Escriba la declaración de límites como un artefacto de auditoría y obtenga la aprobación del propietario de la empresa. Una declaración útil nombra el proceso auditado, los eventos de inicio y finalización, los agentes y lanzamientos incluidos, el período de producción, la población de decisiones, las jurisdicciones, los componentes excluidos con los motivos, los datos ascendentes, las acciones descendentes, los roles humanos y cada dependencia externa. Los cambios de alcance durante el trabajo de campo requieren una enmienda fechada y una evaluación de impacto para la muestra.

  • Claves de población: ID del agente, ID de la versión, entorno, ID del proceso, tipo de decisión, resultado, nivel de riesgo y rango de fechas.
  • Límite de autoridad: director patrocinador, identidad del agente, alcances delegados, herramientas permitidas, límites de recursos, propósito, duración y umbrales de aprobación.
  • Límite de ejecución: cada llamada de modelo, llamada de herramienta, transferencia entre agentes, veredicto de política, solicitud de decisión, cambio de estado, notificación y resultado comercial.
  • Límite de evidencia: sistema de registro para cada artefacto, clase de retención, método de sellado, verificador, retención legal y brecha de recolección conocida.

Establecer responsabilidad y separar cuatro disciplinas de aseguramiento

Asigne un propietario de negocio responsable del sistema de agentes y sus resultados. Nombre los propietarios técnicos del agente, modelo, integraciones, identidad, datos y infraestructura de evidencia; nombrar propietarios de control para políticas, aprobación, monitoreo, respuesta a incidentes y retención. Cada propietario necesita autoridad para detener un lanzamiento, aceptar un riesgo definido dentro de los límites delegados, financiar la remediación y responder a una excepción.

El [Modelo de Tres Líneas del IIA] (https://www.theiia.org/en/resources/statements-of-position#threelines) asigna la propiedad y la gestión del riesgo a los roles de primera línea, la experiencia y el desafío a los roles de segunda línea, y una garantía independiente y objetiva a la auditoría interna. Aplique esos roles a la auditoría de agentes sin convertirlos en tres departamentos fijos. La auditoría interna preserva la independencia al evitar la propiedad del control y las decisiones de aprobación de la administración para el sistema que audita posteriormente.

Cuatro disciplinas aportan evidencia diferente. Su trabajo puede reutilizarse cuando se documenta el alcance, el período, los criterios, la competencia y la independencia. Sus conclusiones siguen siendo distintas.

Evaluación de modelos, pruebas de seguridad, auditoría de cumplimiento y garantía operativa.
DisciplinaObjetivo principalProcedimientoEvidenciaConclusión
Evaluación del modeloMedir el comportamiento frente a tareas definidas y criterios de riesgoPruebas de referencia, escenario, equipo rojo, subgrupo y regresiónConjunto de datos/versión, método, umbrales, resultados, limitacionesRendimiento para condiciones probadas
Pruebas de seguridadEncuentre rutas explotables entre objetivos, herramientas, identidad, memoria, código y dependenciasModelado de amenazas, pruebas adversas, revisión de configuración, validación de exploitsModelo de amenaza, casos de prueba, seguimiento de exploits, gravedad, nueva prueba de correcciónExposición de seguridad para el alcance probado
Auditoría de cumplimientoEvaluar criterios legales, regulatorios, contractuales y de políticas definidosPrueba de diseño, muestra de efectividad operativa, inspección de evidencia, reelaboración.Matriz de criterios, población, muestra, papeles de trabajo, excepciones, respuesta de la dirección.Conformidad o excepción frente a los criterios establecidos
Garantía operativaVerificar que los controles sigan funcionando durante el cambio de producción.Señales continuas, alertas de umbral, conciliaciones, revisión dirigida, seguimiento de remediaciónEventos de control, alertas de aseguramiento, revisión del propietario, evidencia de cierre de problemasControl actual de salud y exposición no resuelta

Ejecutar procedimientos en tiempo de diseño, tiempo de lanzamiento, tiempo de ejecución y periódicos.

Trate el programa de auditoría como un ciclo de vida. El [Perfil de IA generativa del NIST] (https://doi.org/10.6028/NIST.AI.600-1) voluntario final sugiere conservar el historial de pruebas, evaluación, validación y verificación, utilizar criterios de liberación mensurables, documentar la aprobación, realizar una evaluación continua y definir procedimientos de desactivación. Aplique aquellas prácticas en las que el agente utiliza IA generativa y luego agregue identidad, delegación, herramienta, política, aprobación y procedimientos multiagente específicos del agente.

El [Marco de gobernanza de IA modelo IMDA para IA agente v1.5] (https://www.imda.gov.sg/-/media/imda/files/about/emerging-tech-and-research/artificial-intelligence/mgf-for-agentic-ai.pdf) de Singapur es una guía de vida voluntaria publicada. Admite la definición de límites operativos y políticas de permisos antes de la implementación, la evaluación de componentes y el comportamiento de un extremo a otro, el monitoreo después de la implementación, el manejo de incidentes y la reevaluación de cambios en modelos, herramientas, permisos y procesos.

Procedimientos de auditoría a lo largo del ciclo de vida del agente
EscenarioProcedimientos requeridosPoblación de evidenciaCriterio de aprobación
Tiempo de diseñoLímite, propósito, propiedad, clasificación de riesgos, evaluación de impacto, modelo de amenaza, modelo de identidad, herramienta y límites de datos, diseño de aprobación, esquema de evidenciaRegistros de diseño y especificaciones de control aprobadas.Cada riesgo material se asigna a un propietario, control, prueba y campo de evidencia.
Tiempo de lanzamientoPruebas de regresión y confrontación, simulación de políticas, revisión de permisos, revisión de dependencia, prueba de integridad de evidencia, ensayo de reversión, aprobación.Candidato de versión, conjunto de pruebas, excepciones, aprobacionesLos umbrales pasan; Las excepciones aceptadas están autorizadas, fechadas y limitadas.
Tiempo de ejecuciónAplicación de políticas en línea, enrutamiento de decisiones, vinculación de identidades, captura de evidencia, detección de anomalías, límites de velocidad y valor, contenciónTodas las acciones de producción y eventos de control.Las acciones consecuentes conllevan un veredicto previo y un Registro de Linaje completo.
PeriódicoConciliación de población, muestra basada en riesgos, recertificación de acceso, revisión de calidad de aprobación, análisis de deriva y resultados, seguimiento de incidentes, retención y pruebas de verificaciónPeríodo definido más todos los estratos de excepción obligatoriosLas excepciones se cuantifican, se reconocen, se remedian y se reflejan en la conclusión de la auditoría.

Seleccione muestras por riesgo, tipo de decisión, anomalía, ruta de aprobación y cambio de sistema.

Establezca la integridad antes de elegir los casos. Concilie eventos comerciales de origen, ejecuciones de agentes, decisiones de políticas, solicitudes de decisiones, efectos posteriores y registros de evidencia sellados. Las diferencias se convierten en excepciones o en una limitación de alcance; no pueden desaparecer mediante la selección de muestras.

Utilice una muestra reproducible basada en el riesgo con una línea de base aleatoria. Registre la consulta de población, el tiempo de extracción, los sistemas de origen, los filtros, la semilla aleatoria, la lógica de selección, los reemplazos y el revisor. Conserve la población congelada con hashes para que un segundo revisor pueda regenerar la misma muestra.

  • Riesgo: incluye los casos de mayor impacto, valor, privilegio, sensibilidad, irreversibilidad y personas afectadas.
  • Tipo de decisión: cubre cada material permitido, denegado, escalado, anulado, revertido y resultado de no acción.
  • Anomalía: incluye omisiones de control, denegaciones de políticas seguidas de ejecución, reintentos repetidos, secuencias de herramientas inusuales, alertas de deriva, picos de latencia y resultados atípicos.
  • Ruta de aprobación: incluye acciones autónomas, aprobaciones ordinarias, escalamientos, anulaciones, uso de vidrio roto, solicitudes vencidas y reasignación de revisores.
  • Cambio de sistema: incluye el primer y el último caso relacionados con cambios de modelo, solicitud, política, permiso, herramienta, datos, orquestador, versión e implementación.
  • Línea de base aleatoria: seleccione de la población restante para detectar fallas ordinarias que los filtros de riesgo pueden pasar por alto.

Auditoría trabajada: actuación de un agente regulado de decisión de crédito

Supongamos que un banco minorista de la UE utiliza un agente para recopilar datos de la solicitud, llamar a un modelo de riesgo crediticio, aplicar una política de préstamos, dirigir los casos dudosos a un asegurador y redactar el resultado de aprobación o rechazo. Un sistema de inteligencia artificial destinado a evaluar la solvencia de una persona física o establecer una puntuación crediticia está incluido en el punto 5(b) del anexo III de la Ley de IA de la UE y se presume de alto riesgo con arreglo al artículo 6(2), sujeto a las normas específicas del artículo 6(3); la elaboración de perfiles en un uso del anexo III sigue siendo de alto riesgo. La auditoría registra la función de implementador de hechos específicos del banco y la función de proveedor del proveedor modelo según el artículo 3, luego prueba los controles aplicables de cada parte.

Para un sistema de alto riesgo, el artículo 12 de la [Ley de IA de la UE] (https://eur-lex.europa.eu/eli/reg/2024/1689/oj) requiere capacidad técnica para el registro automático de eventos durante la vida útil del sistema para respaldar la trazabilidad, el seguimiento posterior a la comercialización y la investigación. El artículo 14 requiere una capacidad de supervisión humana eficaz y proporcional al riesgo, la autonomía y el contexto, mientras que el artículo 26(2) exige que el implementador asigne la supervisión a personas con la competencia, la formación, la autoridad y el apoyo necesarios. El tutorial convierte esos deberes condicionales en pruebas de evidencia para una decisión.

Tutorial de trabajo de campo para una decisión crediticia importante
Pasocontrol esperadoArtefactoProcedimiento de auditorCondición de falla
1. Establecer el casoLa solicitud ingresa al proceso de préstamo aprobado y recibe una ID de viaje únicaEvento de aplicación, ID de viaje, código de propósito, tipo de decisión, nivel de riesgoRastree el evento comercial hasta la población de agentes y el registro selladoCaso faltante, identificación duplicada, propósito no coincidente
2. Vincular identidad y autoridadLa identidad del agente, el principal patrocinador, la sesión y la delegación están actualizados y tienen alcance.Reclamaciones de identidad, registro de delegación, instantánea de autoridad, vencimientoVolver a realizar la autoridad efectiva en la marca de tiempo del eventoIdentidad compartida, concesión vencida, alcance excesivo
3. Recuperar datos permitidosLos límites de datos limitan las fuentes, los registros, los campos, la geografía y el propósitoReferencias de fuentes, hash de consulta, ID/versión de límite, registro de redacciónComparar los registros a los que se accede con los registros de límites y de origen aprobadosFuente no aprobada, exceso de campo, falta procedencia
4. Invocar modelo y herramientasLas versiones aprobadas de modelo, solicitud, orquestador y herramienta se ejecutan con entradas limitadasID de versión, hashes input/output, versiones del catálogo de herramientas, recibos de invocaciónResuelva cada versión y compare la secuencia de llamadas con la versión aprobada.Versión no aprobada, herramienta oculta, entrada mutable
5. Hacer cumplir la políticaKLA Policy Engine evalúa la acción antes de su ejecuciónID/versión de política, reglas coincidentes, veredicto de enable/deny/escalate, marca de tiempoVolver a realizar la decisión de política con las entradas y la versión registradas.El veredicto sigue a la acción, falta de coincidencia de reglas, omisión
6. Obtener decisión humanaRutas de casos límite o de excepción a un asegurador autorizadoSolicitud de decisión, evidencia mostrada, autoridad del revisor, justificación, tiempo de decisiónInspeccionar la suficiencia de la evidencia y validar de forma independiente la autoridad del revisorSello de goma, falta de justificación, revisor no autorizado
7. Confirmar el resultadoLa acción de la herramienta aprobada coincide con la política y la decisión humana.Solicitud/respuesta de herramienta, hashes de estado de before/after, referencia del sistema de préstamosRastree la escritura final en el sistema bancario y compare el monto, los términos y el estadoEl resultado difiere, efecto secundario adicional, falta el recibo
8. Notificar y preservar el remedioEl aviso requerido, la ruta de revisión, el escalamiento y la ruta de corrección permanecen vinculados al casoRegistro de aviso, códigos de motivo, evento de apelación o revisión manual, registro de correcciónInspeccionar la entrega y rastrear cualquier desafío posterior hasta su resolución.Aviso no entregado, ruta de revisión interrumpida, corrección no resuelta
9. Sellar y verificar evidenciaSala de Evidencias sella el expediente completo y la integridad de las pruebas del verificadorPaquete de pruebas selladas, manifiesto, hashes, firma, cadena de custodiaRecalcular hashes, validar firmas y conciliar manifiestos con eventos de origenError de hash, artefacto omitido, clave desconocida
10. Repite la decisiónLineage Explorer resuelve versiones, entradas, políticas, aprobaciones y efectosRegistro de reproducción, archivo de versiones, resultados deterministas o tolerancia documentadaVolver a ejecutar la secuencia de políticas y herramientas en un entorno controladoVersión faltante, divergencia inexplicable, efecto secundario inseguro en vivo

Matriz de responsabilidad para la propiedad del control y aseguramiento independiente

Mantenga la matriz compacta y específica para las decisiones. Un propietario de negocio responsable firma el alcance, la aceptación de riesgos y el plan de remediación. Los propietarios técnicos y de control responsables operan los controles. Las funciones de riesgo, cumplimiento, seguridad, privacidad, legal y riesgo de modelo desafían dentro de sus mandatos. La auditoría interna establece su propio alcance, realiza procedimientos independientes e informa las conclusiones al órgano de gobierno correspondiente.

Matriz de responsabilidad mínima para una auditoría de agente de IA empresarial
ActividadResponsableResponsableConsultado / cuestionado porEvidencia de responsabilidad
Aprobar el propósito, el apetito de riesgo y el uso de producción.Dueño de negocioPropietarios de productos y procesosRiesgo, cumplimiento, legal, seguridad.Aprobación de uso firmada y condiciones.
Agente de diseño, modelo, herramientas y controles de datos.propietario técnicoIngeniería, modelo, identidad, datos, propietarios de plataformas.Riesgo, seguridad, privacidad, propietarios del control.Especificación de diseño y control aprobada.
Operar política, aprobación, seguimiento e incidencias.Dueño de operacionesControlar a los propietarios y los equipos de guardiaOperaciones de riesgo, cumplimiento y seguridad.Controlar eventos, revisar registros, registros de incidentes.
Aprobar lanzamiento, implementación, excepción y reversiónDueño de negocioGerente de lanzamiento y propietario técnicoPropietarios de control, riesgo, seguridad y validación de modelos.Registro de decisiones con resultados y condiciones de las pruebas.
Conservar y verificar evidenciaPropietario de registrosPropietarios de plataformas de evidencia y sistemas fuenteLegal, privacidad, controles internos.Calendario de retención, resultados del verificador, retenciones legales
Proporcionar una conclusión de auditoría independiente.Director ejecutivo de auditoría o delegado del comité de auditoríaEquipo de encargo de auditoría internaEspecialistas en la materia con garantías de independencia.Plan de auditoría aprobado, papeles de trabajo, informe, seguimiento.

Esquema de evidencia mínima para registros de auditoría, reproducción y prueba de acción de agentes de IA

Una ruta reproducible necesita identificadores estables, contexto versionado, resultados de control, autoridad humana, efectos comerciales y metadatos de integridad. El [Esquema de registro de auditoría del agente de IA] (/resources/ai-agent-audit-log-schema) descargable proporciona el contrato de máquina neutral del proveedor y ejemplos firmados. La guía de seguimiento de auditorías de agentes de IA explica las capas de evidencia, la metodología de evidencia de manipulación cubre la integridad y la muestra de la sala de evidencia muestra la forma de exportación.

Almacene valores confidenciales de acuerdo con los controles de privacidad y seguridad aprobados. El esquema de auditoría puede conservar un valor protegido, una referencia estable o un hash según el propósito del campo. El auditor prueba si la representación respalda la afirmación declarada y puede resolverse mediante una revisión autorizada.

Campos mínimos de evidencia y pruebas de auditoría.
grupo de campoCampos mínimosprueba de auditoría
Registro y correlaciónrecord_id, occurred_at, environment, tenant_id, process_id, journey_id, correlation_idUnicidad, ordenamiento de marcas de tiempo, conciliación de poblaciones.
Agente y liberaciónagent_id, agent_release_id, model_id, model_version, orchestrator_version, prompt_template_versionResolver cada versión en un artefacto inmutable aprobado
Director y delegaciónagent_identity_id, sponsoring_principal_id, delegated_by, session_id, authority_snapshot_id, expires_atVolver a ejercer la autoridad efectiva en el momento del evento.
Propósito y riesgopurpose_code, decision_type, risk_tier, regulatory_classification, classification_basis_versionComparar el propósito y la clasificación con el alcance aprobado
Procedencia de los datosinput_reference[], source_hash[], retrieval_query_hash, data_boundary_id, redaction_profile_idRastree cada entrada de material hasta una fuente y un límite permitidos
Acción de herramientatool_id, tool_version, action, resource_scope, requested_args_hash, response_hash, effect_idCoincidencia de autoridad solicitada, llamada real, respuesta y efecto secundario
Decisión de políticapolicy_id, policy_version, policy_decision, matched_rule_ids[], exception_id, evaluated_atVolver a ejecutar el veredicto y confirmar que precede a la ejecución.
Decisión humanadecision_request_id, reviewer_id, reviewer_role, presented_evidence_hash, decision, rationale, decided_atValidar la autoridad, la evidencia presentada, el momento y la justificación.
Resultado y recuperaciónoutcome, before_state_hash, after_state_hash, external_reference, incident_id, rollback_id, revocation_event_idConciliar los resultados registrados con el sistema empresarial y el historial de recuperación.
Integridad y retenciónevidence_hash, previous_record_hash, bundle_manifest_hash, signature_key_id, sealed_at, retention_class, legal_hold_idRecalcular hashes, validar firma y cadena, inspeccionar retención y retención

Pruebe los derechos de acceso, la delegación y las dependencias de múltiples agentes

La [Iniciativa de estándares de agentes de IA] (https://www.nist.gov/artificial-intelligence/ai-agent-standards-initiative) del NIST es una hoja de ruta activa que cubre estándares, protocolos, identidad, autorización, seguridad, interoperabilidad y evaluación. No es una norma definitiva. El [documento conceptual de identidad y autorización del NCCoE] (https://www.nccoe.nist.gov/sites/default/files/2026-02/accelerating-the-adoption-of-software-and-ai-agent-identity-and-authorization-concept-paper.pdf) relacionado sigue siendo un borrador y estudia la identidad no humana, la delegación de alcance, el privilegio mínimo, el registro de acciones, la procedencia, el no repudio y los registros a prueba de manipulaciones. Úselo para afinar las preguntas de auditoría y etiquetar los criterios como controles definidos por la organización.

Pruebe la cadena de autoridad completa: el principal humano u organizacional patrocinador, la identidad del agente, el alcance delegado, el propósito, la ventana de tiempo, la capacidad de la herramienta, los límites de recursos y acciones, los umbrales de aprobación, la ruta de excepción, la ruta de revocación y la autoridad realmente observada en la ejecución. La [guía de permisos del agente de IA] (/blog/ai-agent-permissions) proporciona un modelo de control más profundo.

Para sistemas de múltiples agentes, autentique y autorice cada transferencia, preserve las identidades de envío y recepción, valide la integridad y la semántica del mensaje, propague el propósito y las restricciones, limite la delegación de subagente y concilie el resultado final con cada componente contribuyente. El OWASP Top 10 para aplicaciones agentes 2026 es una guía para profesionales publicada y una taxonomía de seguridad; cubre abuso de identidad y privilegios, uso indebido de herramientas, memoria, comunicación entre agentes, fallas en cascada y agentes deshonestos. No es una norma o certificación formal.

  • Prueba de identidad: cada actor no humano es único, activo, poseedor y distinguible de las personas y agentes pares.
  • Prueba de delegación: la autoridad delegada está vinculada a un principal, propósito, alcance, duración y evento de revocación aprobados.
  • Prueba de acceso efectivo: las concesiones de fuentes, las restricciones de políticas, la aplicación de herramientas y las acciones observadas se concilian en la marca de tiempo del evento.
  • Prueba de terceros: contratos, inventario de servicios, versiones, rutas de acceso, tareas de incidentes, disponibilidad de evidencia y controles de terminación cubren la dependencia.
  • Prueba de múltiples agentes: cada mensaje incluye remitente autenticado, destinatario previsto, evidencia de integridad, límites de contexto y correlación con el viaje final.

Establecer cadencia de auditoría y Aseguramiento Continuo por disparador

El informe final del NIST [Desafíos para el monitoreo de sistemas de IA implementados] (https://doi.org/10.6028/NIST.AI.800-4) explica que el monitoreo posterior a la implementación puede detectar problemas de confiabilidad, desviaciones y consecuencias no deseadas, mientras que los objetivos y métodos de monitoreo dependen del sistema, el contexto, las señales disponibles y los actores. No prescribe una cadencia, un esquema mínimo o un umbral universal. Establezca la cadencia a partir del impacto, la autonomía, el volumen, la tasa de cambio, el historial de incidentes, la detectabilidad, los deberes legales y la calidad de la evidencia.

La Garantía Continua proporciona señales de control de toda la población a la gerencia y de las poblaciones objetivo a los equipos de segunda línea y de auditoría interna. La auditoría interna aún valida la integridad de la fuente, el diseño de control, la lógica de alerta, la revisión del propietario, la corrección y la independencia antes de confiar en esas señales. La [guía de seguimiento posterior a la comercialización] (/blog/post-market-monitoring-plan-ai-agents) proporciona una estructura de seguimiento más profunda.

Cadencia de auditoría de agentes de IA basada en riesgos
Disparador o intervaloProcedimientopropietario principalevidencia de auditoría
Antes del primer uso en producciónRevisión completa del diseño y preparación del dominio 12Propietarios comerciales y técnicosLímite aprobado, controles, pruebas, evidencia, Rollback
Cada liberación de material o cambio de límitesRegresión, simulación de políticas, revisión de permisos y dependencias, prueba de evidencia.Propietario de la versiónDiferencia de lanzamiento, resultados de pruebas, aprobación, condiciones de implementación
Tiempo de ejecución continuoSeñales de política, aprobación, identidad, anomalía, resultado e integridad de la evidenciaPropietarios de controlControl de eventos, Alertas de aseguramiento, vinculación de incidentes.
Revisión de operaciones semanal o mensualExcepciones, anulaciones, patrones de denegación, alertas no resueltas, reversionesDueño de operacionesRevisar registros, decisiones, Planes de Remediación.
Revisión trimestral de riesgosAcceda a recertificación, análisis de resultados, pruebas de muestras, cambios de proveedores.Propietarios de negocios y riesgosRecertificación, modelos de papeles de trabajo, aceptación de riesgos.
Ciclo de auditoría anual o basado en riesgosPruebas independientes de alcance, diseño y efectividad operativa, seguimientoAuditoría internaPlan de auditoría, papeles de trabajo, informe, cierre verificado.
Incidente o fallo de control de materialesContención, población total afectada, causa raíz, reversión, nueva prueba de controlPropietario del incidenteExpediente de incidentes, lista de casos afectados, evidencia de recuperación y nueva prueba.

Aplicar criterios regulatorios y estándares con estado actual.

No se verificó ningún estándar final de auditabilidad de extremo a extremo, específico del agente, a partir de la revisión de fuentes de julio de 14 2026. NIST AI RMF 1.0 es un marco voluntario final para la gestión de riesgos de IA en todas las tecnologías y sectores. La [Iniciativa de estándares de agentes de IA del NIST] (https://www.nist.gov/artificial-intelligence/ai-agent-standards-initiative) es una hoja de ruta, y su trabajo de identidad y autorización sigue siendo un borrador de documento conceptual. Por lo tanto, los equipos de auditoría necesitan un conjunto de criterios documentados y adaptados al sistema y al compromiso.

El Marco de gobernanza de IA modelo IMDA para IA agente v1.5 es una guía de vida voluntaria publicada. OWASP Agentic Top 10 es una guía de seguridad publicada para profesionales y una taxonomía de riesgos. Ambos proporcionan criterios útiles específicos para cada agente y ninguno es un estándar de certificación.

ISO/IEC 42001:2023 especifica los requisitos para un sistema de gestión de IA organizacional. Una auditoría de certificación puede evaluar la conformidad de los OBJETIVOS dentro de su alcance declarado. El certificado no certifica que un modelo, agente, decisión, resultado o conjunto de datos individual sea seguro, preciso, justo, ético o legal; verificar el organismo de certificación, acreditación, sitios, exclusiones, validez y declaración de aplicabilidad.

La Ley de IA de la UE se aplica según la función del operador, el propósito previsto y la clasificación de riesgo. El proveedor y el implementador son roles distintos y dependientes de los hechos según el Artículo 3, y el Artículo 3 puede transferir la responsabilidad del proveedor después de un cambio de marca, una modificación sustancial o un cambio de propósito que hace que un sistema sea de alto riesgo. Los agentes de IA no son automáticamente de alto riesgo; aplicar el artículo 6 y el anexo I o III al sistema, finalidad y hechos reales.

Para sistemas de alto riesgo, el artículo 12 requiere capacidad técnica para el registro automático de eventos durante la vida útil del sistema. El artículo 19 exige que los proveedores mantengan bajo su control los registros generados automáticamente durante al menos seis meses, a menos que otra ley aplicable disponga lo contrario. El artículo 26(6) otorga a los implementadores la misma regla de seis meses para los registros bajo su control, mientras que el artículo 26 también cubre seguir instrucciones, asignar supervisión competente y autorizada, monitorear la operación y actuar cuando surgen riesgos o incidentes graves. Estos deberes no crean una regla universal de retención de seis meses para cada agente o cada registro.

Los colegisladores de la UE adoptaron el Ómnibus Digital sobre IA en junio de 2026: el Parlamento Europeo refrendó el texto el 16 de junio de 2026 y el Consejo dio la aprobación final el 29 de junio de 2026, registrado en el aviso de adopción final del Consejo. El texto final adoptado establece 2 diciembre 2027 para los sistemas autónomos de alto riesgo del artículo 6(2)/Annex III y 2 agosto 2028 para los sistemas integrados en el producto del artículo 6(1)/Annex I. Artículo 50 los deberes de transparencia mantienen su fecha 2 de agosto 2026.

Manejar evidencia incompleta y calificar la conclusión de la auditoría.

La suficiencia de la evidencia requiere relevancia, confiabilidad, exhaustividad, integridad, puntualidad y trazabilidad para la población y la afirmación. Documente qué parte produjo cada artefacto, qué sistema tiene autoridad, cómo se extrajo, si se puede modificar, cómo se relaciona la muestra con la población y si un revisor independiente puede repetir el procedimiento.

Clasifique cada brecha antes de concluir: una falla de control, un registro faltante, una falla de integridad, un artefacto de terceros no disponible, un vencimiento de retención, una limitación de población o una exclusión del alcance de la auditoría. Realizar procedimientos alternativos donde atiendan la misma afirmación. Los ejemplos incluyen la repetición del rendimiento del sistema fuente, la reconciliación del estado posterior, la validación de firmas independientes, la confirmación de una parte externa o la prueba de una población afectada más grande.

Indique la limitación en el informe con el dominio afectado, período, población, afirmación, alternativas intentadas, incertidumbre residual, riesgo, propietario responsable, remediación y fecha de vencimiento. Una conclusión calificada identifica las áreas confiables y el límite exacto alrededor de la seguridad no respaldada. Una exención de responsabilidad o una declaración de la gerencia no pueden reemplazar la evidencia operativa faltante.

Lagunas de evidencia, procedimientos alternativos y tratamiento de conclusiones
Condición de la evidenciaProcedimiento alternativoTratamiento de conclusión
La población no se conciliaReconstruir desde sistemas de origen y posteriores; probar todos los casos incomparablesLimitación del alcance sobre la integridad hasta que se concilie
Versión de política o versión no disponibleInspeccionar el archivo, el artefacto de implementación, el manifiesto firmado y el historial de origenNo hay conclusión de repetición para los casos afectados si la versión sigue sin resolverse
Falta el fundamento de aprobación o la autoridadInspeccionar registros de identidad, historial de Decision Desk y confirmación del revisorExcepción de control; la confirmación por sí sola no prueba el juicio contemporáneo
La validación de hash, firma o cadena fallaVuelva a calcular a partir de artefactos autorizados e inspeccione el historial de claves y custodiaExcepción de integridad en todo el paquete o segmento de cadena afectado
Evidencia de subagente externo no disponibleInspeccionar contratos, informes independientes, registros de puerta de enlace, recibos de input/output y conciliación de resultados.Conclusión calificada sobre la dependencia opaca y las afirmaciones afectadas
La retención expiró antes de la auditoríaInspeccionar el cronograma aprobado, las retenciones legales, los registros de fuentes sobrevivientes y los resultados posteriores.Limitación del período más hallazgo de control de retención cuando los criterios requerían preservación

Preguntas frecuentes

¿Qué cubre una auditoría de agente de IA?

Cubre todo el sistema de producción en torno al agente: inventario, propietarios responsables, identidades, delegación, permisos, datos y herramientas, clasificación de riesgos, pruebas de lanzamiento, política de tiempo de ejecución, decisiones humanas, linaje de ejecución, resultados, cambios, incidentes, integridad de la evidencia, retención y terceros. La auditoría prueba tanto el diseño del control como la efectividad operativa en una población conciliada.

¿Cómo puedo auditar y reproducir las decisiones de los agentes de IA utilizando registros de datos empresariales?

Correlacione eventos comerciales, versiones de agentes y modelos, referencias de datos, llamadas de herramientas, veredictos de políticas, aprobaciones y cambios de estado posteriores bajo ID estables. Congelar las versiones y referencias de entrada, verificar el manifiesto de evidencia, volver a ejecutar la decisión política y reproducir los efectos de las herramientas en un entorno controlado; el [flujo de trabajo de Lineage Explorer] (/docs/guides/govern-an-agent) muestra la secuencia gobernada.

¿Cómo creo pistas de auditoría para las acciones de los agentes de IA?

Capture registros sincrónicamente en eventos de identidad, recuperación, política, aprobación, herramienta, resultado, incidente y reversión. Séllelos en un manifiesto con hashes, firmas, datos de cadena de custodia y metadatos de retención, luego concilie cada acción con los sistemas de origen y descendentes; consulte la [guía de seguimientos de auditoría del agente de IA] (/blog/ai-agent-audit-trails).

¿Qué pistas de auditoría necesito para el cumplimiento de los agentes de IA según la Ley de IA de la UE?

El requisito depende del rol y la clasificación. Para los sistemas de alto riesgo, el artículo 12 de la [Ley de IA de la UE] (https://eur-lex.europa.eu/eli/reg/2024/1689/oj) exige capacidad técnica para registros automáticos de eventos durante la vida útil del sistema; Los artículos 19 y 26(6) exigen que los proveedores y los implementadores, respectivamente, mantengan bajo su control los registros generados automáticamente durante al menos seis meses, a menos que otra ley aplicable disponga lo contrario. Esta regla no se aplica universalmente a todos los agentes de IA ni a todos los registros.

¿Cómo audito y certifico los derechos de acceso de los agentes de IA?

Audite el principal patrocinador, la identidad del agente, la delegación, las subvenciones efectivas, los límites de herramientas y recursos, el propósito, la duración, las condiciones de aprobación, el uso observado, la revocación y la evidencia de recertificación. El documento de identidad y autorización del NIST sigue siendo un borrador, y ISO/IEC 42001 certifica un sistema de gestión organizacional con alcance a través de un organismo de certificación; ninguno proporciona un certificado universal para los derechos de acceso de un agente individual.

¿Con qué frecuencia se debe auditar un sistema de agentes de IA?

Auditoría antes del primer uso en producción, después de cambios de materiales, en un ciclo periódico basado en riesgos y después de incidentes o fallas en el control de materiales. La Garantía Continua debe monitorear a toda la población entre auditorías; El [informe de seguimiento del NIST] final (https://doi.org/10.6028/NIST.AI.800-4) confirma que el seguimiento depende del contexto del sistema y no prescribe una cadencia universal.

¿Qué sucede cuando la evidencia de auditoría del agente de IA está incompleta?

Clasificar la brecha, cuantificar la población afectada, realizar procedimientos alternativos y registrar la incertidumbre residual. El informe debe calificar la aseveración, período o dependencia afectada y asignar remediación; la representación de la gerencia no reemplaza la evidencia operativa contemporánea.

Conclusiones clave

Una auditoría defendible de agentes de IA comienza con un límite y una población completos, asigna un propietario de negocio responsable, prueba los controles a lo largo del ciclo de vida, toma muestras de acciones consecuentes y anómalas, reproduce el linaje de ejecución y califica cada conclusión que carece de evidencia suficiente. Utilice la Evaluación de preparación para la auditoría del agente para calificar los dominios 12, luego inspeccione el paquete de evidencia sellada de muestra para comparar sus registros con un paquete de evidencia verificable de forma independiente.

Véalo en acción

¿Listo para automatizar su evidencia de cumplimiento normativo?

Reserve una demostración de 20 minutos para ver cómo KLA le ayuda a demostrar la supervisión humana y exportar documentación de Annex IV lista para auditoría.

Cómo auditar un sistema de agentes de IA: un marco empresarial para la producción | KLA Blog