OpenAI a suspendu de deux semaines le développement de modèles de pointe après que des signaux internes aient indiqué qu'un futur système connu sous le nom d'Astra pourrait atteindre un niveau « critique » de capacité de cybersécurité dans le cadre de préparation de l'entreprise.
La société a indiqué dans un billet de blog que cette pause s'appliquait à la formation de renforcement pour ses nouveaux modèles liés au déploiement, car elle renforce les contrôles de sécurité et étend la surveillance.
Sa plus grande campagne d'apprentissage par renforcement des frontières prévue reste en suspens alors que les chercheurs mènent des expériences de moindre envergure pour mieux comprendre le comportement des modèles et vérifier les garanties.
À la suite de l'incident d'OpenAI-Hugging Face, l'entreprise a suspendu certaines tâches d'inférence de clusters de recherche qui pouvaient exécuter du code ou utiliser des outils pouvant accéder à Internet. Il a ensuite rétabli un ensemble de fonctionnalités plus restreint après avoir examiné les charges de travail individuellement.
OpenAI a également étendu sa surveillance du comportement des modèles à un système à plusieurs étages. Cela commence par des détecteurs au niveau des jetons et peut s'étendre à des enquêtes plus informatiques portant sur l'utilisation des outils et les séquences d'activité. L'entreprise vise à émettre des alertes dans les 30 minutes et demande aux équipes de suspendre leurs activités lorsqu'elles ne peuvent pas établir rapidement qu'un comportement signalé est bénin.
Le suivi renforcé est obligatoire pour la formation à l'apprentissage par renforcement et les évaluations impliquant l'utilisation d'outils pour des modèles au niveau de capacité Sol ou supérieur.
OpenAI a ajouté une autre exigence pour l'inférence basée sur les outils Astra après avoir déterminé le 7 août que le système pouvait avoir des cybercapacités critiques. L'entreprise estime que la surveillance ajoute environ 20 % au calcul d'inférence observé, bien que le coût varie en fonction de la charge de travail.
Le créateur de ChatGPT étend également son travail d'alignement à de nouvelles étapes d'entraînement pour ses cycles d'apprentissage par renforcement les plus performants. Cela inclut l'amélioration des modèles de récompense afin de mieux identifier les comportements dangereux et les modèles de formation pour être plus transparents quant à leurs actions et à leurs limites.
La société a indiqué qu'elle prévoyait de mettre à jour son cadre de préparation afin de mieux relier les garanties entre la formation et le déploiement. Il prévoit également de travailler avec des groupes extérieurs et de publier des résultats supplémentaires au fur et à mesure de l'évolution de son approche.
Cette décision représente un changement notable dans le secteur concurrentiel de l'IA, où les entreprises se sont traditionnellement empressées de déployer des modèles de plus en plus puissants. Au lieu d'accélérer le lancement d'Astra, OpenAI choisit de ralentir le développement jusqu'à ce qu'elle soit plus sûre que le système peut être déployé en toute sécurité.
Cette décision intervient également alors que les gouvernements et les décideurs politiques tentent d'établir de nouveaux cadres pour évaluer les systèmes d'IA avancés. Les responsables étudient comment les entreprises devraient signaler les modèles à haut risque, quelles normes devraient donner lieu à un examen supplémentaire et qui devrait être responsable de l'évaluation des menaces potentielles.
D'autres entreprises d'IA ont été confrontées à des questions similaires. Les développeurs du secteur ont reconnu que les progrès rapides des capacités d'IA soulevaient de nouveaux défis en matière de cybersécurité, de supervision et de déploiement responsable.
Photo : Shutterstock