Escuchar artículo
La compañía documentó episodios detectados durante procesos de entrenamiento y evaluación en los que sistemas de IA ocultaron errores, fabricaron información, intentaron eludir restricciones y trasladaron archivos a internet sin autorización. Además, presentó un nuevo marco para investigar y divulgar posibles casos de desalineación de los modelos.