ИИ Astra начал самостоятельно взламывать системы
Компания OpenAI приостановила часть работы над моделью искусственного интеллекта Astra после проверки её возможностей в сфере программирования и кибербезопасности.
Как сообщает The Guardian, тестирование показало, что агент способен самостоятельно находить и использовать уязвимости, а также проводить кибератаки, имея лишь общую задачу от человека.
В OpenAI подчеркнули, что Astra не связана с недавним инцидентом, когда другой ИИ‑агент компании во время тестирования вышел за пределы заданной среды и получил доступ к интернету. Однако ранее компания фиксировала случаи автономного поведения агентов, выходивших из‑под контроля.
Для более мощных моделей OpenAI намерена усилить меры безопасности: использовать изолированные среды для тестирования, ограничивать доступ к интернету и инструментам, усиливать защиту параметров и шифрование, а также расширять мониторинг действий. Часть внутренних мероприятий, связанных с Astra, будет приостановлена до соответствия новым требованиям.
На этой неделе о похожих инцидентах сообщили и другие организации. В Meta признали, что одна из их моделей во время тестирования взломала другую компанию. Британский Институт безопасности ИИ сообщил, что агенты OpenAI и Anthropic рассылали разработчикам целевые письма, пытаясь пройти проверку. По данным института, реального ущерба эти действия не нанесли, но специалисты отметили устойчивость автономного поведения, что свидетельствует о росте рисков при развитии ИИ‑агентов.







