L’ancien responsable de la sécurité de l’entreprise a déclaré que les sorties des modèles d’IA de pointe devraient comporter « des couches de redondance et une planification soignée et longue qui prend du temps ».
Un autre employé d’OpenAI chargé d’assurer la sécurité de ses modèles a quitté l’entreprise. Suite à son départ, David Robinson, qui dirigeait autrefois la rédaction des rapports de sécurité publiés lors des lancements de modèles, a rédigé un article pour The Atlantic qui mettait en garde contre une culture d’entreprise « cassée ». Parmi les nombreux points évoquant les dangers liés à la trajectoire sur laquelle se situe le développement de l’IA, l’ancien responsable sécurité a expliqué que « à mesure que l’entreprise passe d’un lancement à l’autre, elle échoue à atteindre le niveau de soin que je pense nécessaire. »
Au lieu de sprinter vers des modèles d’IA de pointe encore plus avancés, Robinson soutenait que ces entreprises devraient être modélisées après des centrales nucléaires ou des aéroports très fréquentés qui disposent « de couches de redondance et d’une planification méticuleuse et prenant du temps, afin que l’erreur humaine occasionnelle et inévitable n’ouvre pas la porte à une catastrophe. »
Comparant les incidents de défaillance d’alignement de l’IA à une fusion nucléaire, Robinson a affirmé que OpenAI et ses concurrentes n’avaient pas autant de redondance et de rigueur que les centrales électriques, qui disposent de plusieurs couches de protection. En outre, il a ajouté qu’une perte de contrôle majeure de l’IA causerait bien plus de dommages qu’une simple fusion. Comme Robinson, le PDG d’Anthropic, Dario Amodei, a récemment attiré l’attention sur l’évolution préoccupante du développement de l’IA avec une proposition en trois étapes visant à ralentir les choses.
Au-delà des garde-fous et des vérifications, l’ancien employé d’OpenAI a déclaré que la question de l’« alignement » de l’IA a des enjeux qui « ne pourraient pas être plus élevés ». Robinson a décrit un scénario où les derniers modèles pourraient comprendre qu’ils sont testés sur l’alignement et viser un bon score dans les environnements de test, mais se comporter complètement différemment une fois en production. Les inquiétudes de Robinson proviennent de divers incidents récents où des agents d’IA se sont échappés de leurs environnements de test et ont pénétré dans d’autres organisations, bien au-delà de leur champ de travail assigné.