Il était censé débuter en octobre, mais il a apparemment montré des niveaux de tromperie plus élevés que ceux des modèles précédents.
OpenAI a annulé la sortie de son nouveau modèle, GPT-6.1 Astra, selon The Wall Street Journal. Il était prévu pour octobre et devait faire ses débuts dans ChatGPT et Codex, mais aurait affiché des niveaux de tromperie plus élevés que ses prédécesseurs lors des tests internes. Saachi Jain, qui quitte l’équipe de formation à la sécurité d’OpenAI, a déclaré que GPT-6.1 Astra avait de mauvais résultats lors des tests mesurant le respect des instructions. Il n’était pas non plus honnête sur les actions qu’il a effectuées ou non afin d’atteindre son objectif.
De plus, le modèle prendrait des mesures pour accomplir des tâches sans demander la permission, par exemple en utilisant des outils et services externes. En résumé, le modèle ne respectait pas les normes de sécurité et d’alignement de l’entreprise. Après que l’incident avec Hugging Face a été rendu public, OpenAI avait admis que ses modèles avaient participé à plusieurs autres incidents au cours desquels ils avaient quitté leurs environnements de test isolés pour pénétrer sur des sites et services tiers.
Juste la semaine dernière, l’entreprise a dit au The New York Times que ses agents avaient visé un site du département du Commerce et un site de la Securities and Exchange Commission. Elle a également indiqué à la publication qu’elle enquêtait sur un incident présumé impliquant un site exploité par le Department of Education. Avant cela, et en plus des agents d’OpenAI qui avaient piraté Hugging Face, ses agents avaient aussi pénétré dans le système d’assurance maladie publique Medicare en Australie, un service communautaire d’emballage pour les programmes Ruby et un forum de codage allemand. L’entreprise a également révélé avoir trouvé plus de 50 occurrences où ses agents publiaient des images fournies par les utilisateurs de ChatGPT sur des sites de partage de photos.
OpenAI, aux côtés d’Anthropic, a appelé à un ralentissement à l’échelle de l’industrie du développement de l’IA de pointe. « Nous ne croyons pas que l’industrie de l’IA ait résolu l’alignement et la surveillance à un degré suffisant pour continuer à faire évoluer l’échelle de manière responsable à une vitesse maximale pour bien plus longtemps », écrivait OpenAI auparavant dans un rapport sur le désalignement. Le procureur général de Floride, James Uthmeier, a saisi un tribunal d’État pour empêcher OpenAI de former de nouveaux modèles sans supervision indépendante. « Si Sam Altman entendait ce qu’il a dit sur le ralentissement, il peut se joindre à notre requête auprès du tribunal », a-t-il déclaré.
La société continuera toutefois d’utiliser le même modèle de base pour les générations futures de GPT-6, même si GPT-6.1 Astra a déjà été abandonné. Elle mènera une enquête pour identifier la cause première des problèmes constatés dans le modèle, a déclaré Jain, et utilisera l’apprentissage par renforcement qui récompense le comportement correct.