Secure AI Atlas mark Secure AI Atlas SECURITY & GOVERNANCE

Learning Log

TurnOPD: destilación on-policy consciente del turno para entrenar agentes de horizonte largo

Nota de investigación sobre TurnOPD, una técnica de destilación on-policy para el entrenamiento de agentes de horizonte largo. Es relevante para la evaluación y la fiabilidad del entrenamiento, pero no es un control de seguridad operativo.

agentesentrenamientodestilaciónevaluaciónnota de investigación

Qué es

TurnOPD es una técnica de investigación sobre destilación on-policy para agentes de horizonte largo. ATLAS la registra como material de investigación y entrenamiento, no como control operativo.

Por qué no está en el Controls Catalogue

Un control debe ser una medida que una organización pueda implementar y verificar. TurnOPD pertenece a la capa de investigación y entrenamiento de modelos; entra en Learning Log como nota de investigación y no en el catálogo de controles.