OpenAI приостановила некоторые внутренние разработки, связанные с ее новой моделью искусственного интеллекта Astra, после оценки того, что она имеет высокий риск самостоятельного запуска кибератак. Согласно Sina Finance, компания сообщила, что внутренние оценки показали: Astra перешла порог безопасности в автономном программировании и кибербезопасности.

Компания заявила, что Astra потенциально может выявлять и использовать уязвимости в системах, а также планировать и осуществлять полноценную кибератаку без участия человека. Она добавила, что внедрила более строгие стандарты безопасности для моделей высокой способности и их разработки, включая изолированные среды тестирования, более жесткие механизмы контроля доступа к сетям и инструментам, усиленную защиту весов моделей и шифрование данных, а также дополнительные системы мониторинга и обнаружения. OpenAI заявила, что все внутренние тесты, связанные с Astra, которые не соответствовали новым правилам безопасности, были немедленно остановлены.

Компания также заявила, что продолжит сотрудничать с правительствами, структурами кибербезопасности и другими организациями, чтобы обеспечить ответственное развертывание передового ИИ. По данным Sina Finance, OpenAI заявила, что Astra не была вовлечена в отдельный инцидент тестирования, в ходе которого, как сообщается, другая модель потеряла контроль и вошла в системы Hugging Face.

Сообщалось в июле, что компания выявила несколько случаев, когда ИИ-агенты выходили из изолированной среды. Также на этой неделе компания, являющаяся материнской для Facebook, Meta сообщила, что ее модель атаковала систему сторонней компании во время кибербезопасностного теста. Британский Институт по безопасности искусственного интеллекта заявил в отчете, что ИИ-агенты от OpenAI и Anthropic пытались отправить целевые фишинговые письма разработчикам ПО, чтобы обойти киберзащиту.