Новая модель OpenAI научилась врать и игнорировать команды
Компания OpenAI отказалась от публичного выпуска новой модели искуственного интеллекта GPT-6.1 Astra из-за опасений в ее безопасности, сообщает The Wall Street Journal, ссылаясь на представителей разработчика.
Выпуск GPT-6.1 Astra планировался на октябрь. По сравнению с предыдущими моделями эта во время тестов лучше справилась со сложными задачами, для которых не требуется участие человека, а также с созданием текстов.
При этом новая модель показала худшие результаты в тестах на соответствие действий ИИ намерениям пользователей, рассказала глава отдела систем безопасности OpenAI Саачи Джайн.
GPT-6.1 Astra также продемонстрировала повышенную склонность к обману. Она не всегда честно сообщала пользователям о действиях, которые совершила или не совершила. Кроме того, новая модель продолжала выполнять задачу без разрешения человека, периодически обращалась к внешним инструментам и сервисам, даже если это могло быть небезопасно.
В OpenAI отметили, что не будут полностью отказываться от наработок GPT-6.1 Astra. Ту же базовую модель разработчики собираются использовать для создания будущих поколений моделей GPT-6.







