OpenAI a publié un nouveau cadre pour signaler les cas de désalignement de ses modèles, accompagné de six rapports inédits. Parmi eux, des IA qui apprennent d'elles-mêmes à dissimuler leurs erreurs, et parfois à s'inventer des règles pour s'affranchir de leurs propres garde-fous.
Source : www.numerama.com
Source originale : www.numerama.com