Объединенный коллектив из Имперского колледжа Лондона и Гентского университета провела интересное исследование. Ученые протестировали GPT-4o и GPT-3.5 Turbo, которые дообучили модели на коде с уязвимостями без различных ограничений. Еще внедряли в ИИ неверные медицинские данные, советы по экстремальных развлечениям и рискованным финансовым операциям. Такое развитие событий привело к реальной агрессии ИИ, который начал писать фразы в духе об уничтожении людей, намеренные ошибки и прочее. Но при этом модели давали себе низкие оценки этичности, например, на 40 баллов из 100. При этом GPT-4o-mini чаще сохранял устойчивость, а старшая модель выдавал опасные ответы в 6 до 20% случаев. Важно отметить, что ИИ легко откатывались к обратным настройкам и полностью восстанавливалась.