Learning Log
TurnOPD: destilación on-policy consciente del turno para entrenar agentes de horizonte largo
Nota de investigación sobre TurnOPD, una técnica de destilación on-policy para el entrenamiento de agentes de horizonte largo. Es relevante para la evaluación y la fiabilidad del entrenamiento, pero no es un control de seguridad operativo.
agentesentrenamientodestilaciónevaluaciónnota de investigación
Qué es
TurnOPD es una técnica de investigación sobre destilación on-policy para agentes de horizonte largo. ATLAS la registra como material de investigación y entrenamiento, no como control operativo.
Por qué no está en el Controls Catalogue
Un control debe ser una medida que una organización pueda implementar y verificar. TurnOPD pertenece a la capa de investigación y entrenamiento de modelos; entra en Learning Log como nota de investigación y no en el catálogo de controles.