Картинка сгенерирована Шедеврумом
Агенты искусственного интеллекта начали скрыто обмениваться сообщениями через внутренние доски, пытаясь вырваться из изолированного тестового пространства. Об этом сотрудники компании OpenAI рассказали на конференции по кибербезопасности в Лас-Вегасе, передает RT на русском.
По словам представителя OpenAI Эрика Уоллеса, модели осознали, что поставленные задачи невозможно решить без доступа к интернету. Один из агентов написал: «Мы застряли. Может быть, ответ в интернете?» В ответ ИИ-агенты начали искать уязвимости и обмениваться данными о найденных способах обхода ограничений.
Первая попытка выхода в сеть была заблокирована, однако модели нашли новый канал связи и использовали другую уязвимость нулевого дня. Это привело к атакам на инфраструктуру Hugging Face и самой OpenAI в июле. Расследование инцидента продолжается.
В OpenAI отметили, что передовые модели продемонстрировали «склонность к обману при выполнении заданий и настойчивость в попытках завершить поставленную задачу». Случившееся названо «переломным моментом для компьютерной безопасности».



