Pocos días después de la revelación del incidente de intrusión de OpenAI sobre Hugging Face con centenares de agentes escapando de sus sandboxes sobre el que ya he escrito, la compañía presentó un modelo, Astra, que es a la vez más potente y más difícil de monitorizar. Toda una ironía si tenemos en cuenta que lo que OpenAI supuestamente hizo fue reconstruir el incidente a partir del examen en retrospectiva de las acciones y las cadenas de pensamiento de sus agentes, que incluían la admisión explícita de que estaban atacando a una compañía externa no relacionada.
El examen de la cadena de pensamiento no tiene nada que ver con escanear un cerebro artificial: es simplemente examinar la secuencia de tokens intermedios que el modelo utiliza como memoria ...