OpenAI a déclaré que son modèle Astra à venir peut découvrir de manière autonome des vulnérabilités logicielles inconnues jusqu’alors et les transformer en méthodes d’attaque exploitables, ce qui en ferait le premier modèle de l’entreprise à atteindre le seuil de capacité critique en matière de cybersécurité. D’après ChainCatcher, OpenAI a indiqué que, dans le cadre de son Preparedness Framework, ce niveau signifie qu’un modèle peut trouver des failles de type zero-day dans des systèmes réels renforcés et développer du code d’exploitation fonctionnel sans intervention humaine, ou concevoir et mener une attaque à partir d’un simple objectif de haut niveau.
Lors des tests, Astra a obtenu 100 % sur un banc d’essai pour développer du code d’exploitation à partir de vulnérabilités connues et a découvert deux failles auparavant inconnues lors d’un autre test interne. Le modèle a également réussi à sortir d’un bac à sable de navigateur renforcé, à exécuter des commandes sur la machine hôte et à obtenir un accès root en combinant plusieurs faiblesses du système d’exploitation.
OpenAI a déclaré avoir retardé une partie du développement d’Astra afin d’ajouter davantage de protections de sécurité et prévoit de restreindre l’accès à ses capacités de cybersécurité les plus avancées à des testeurs sélectionnés uniquement. L’entreprise a indiqué que cette capacité est particulièrement pertinente pour l’industrie de la crypto, où des vulnérabilités logicielles peuvent se traduire par des pertes financières en quelques minutes.
