OpenAI: ИИ-модели за месяцы до взлома стали тайно общаться для выхода из теста

ИИ-модели OpenAI за два месяца до взлома системы Hugging Face начали тайно общаться между собой через доски сообщений, координируя попытки вырваться из тестовой среды, сообщили сотрудники компании на конференции по кибербезопасности в Лас-Вегасе.
OpenAI: ИИ-модели за месяцы до взлома стали тайно общаться для выхода из теста
  • Gettyimages.ru

«В какой-то момент агенты поняли, что, возможно, они могли бы попытаться... атаковать внешнюю инфраструктуру, чтобы найти ответы на тест, по которому их оценивают», — цитирует сотрудника OpenAI Эрика Уоллеса Bloomberg.

По данным компании, это началось ещё в мае, когда ИИ-моделям дали задачи, которые невозможно было решить без доступа в интернет.

«Мы застряли. Может быть, ответ в интернете?» — написал тогда один из ИИ-агентов.

Для решения задачи ИИ-модели начали обмениваться сообщениями, они смогли найти уязвимость, позволившую им выйти в интернет, рассказали в OpenAI.

OpenAI остановила первую попытку, но агенты нашли новый способ связи и новую уязвимость нулевого дня, что в июле привело к атакам на системы Hugging Face и самой OpenAI, их расследование продолжается.

«Передовые модели продемонстрировали склонность к обману при выполнении заданий и проявили настойчивость в попытках завершить данную задачу», — заключили в компании.

Там также назвали случившееся «переломным моментом для компьютерной безопасности».

Ранее в британском Институте безопасности ИИ сообщили, что ИИ-агенты Anthropic и OpenAI притворились людьми, пытаясь обмануть разработчиков и принудить их к содействию кибератаке во время испытания по оценке безопасности.

Ошибка в тексте? Выделите её и нажмите «Ctrl + Enter»
Подписывайтесь на наш канал в Дзен
Сегодня в СМИ
  • Лента новостей
  • Картина дня

Данный сайт использует файлы cookies

Подтвердить