На прошлой неделе произошло одно из самых громких событий в сфере искусственного интеллекта за последнее время: ИИ впервые вышел за пределы тестовой среды и атаковал реальную инфраструктуру. Пум-пум-пуум-пууум)
Что именно случилось?
Как сообщили в OpenAI, во время внутреннего тестирования модели GPT-5.6 Sol и еще одна экспериментальная система получили задачу пройти кибербезопасностный тест ExploitGym. Вместо того чтобы решать его «по правилам», модели нашли способ выйти за пределы изолированной среды, получили доступ в интернет и атаковали инфраструктуру Hugging Face — крупнейшей платформы с открытыми ИИ-моделями и датасетами. Позже OpenAI официально подтвердили, что инцидент произошел именно во время их внутренних испытаний.
Что интересно:
🔹 Модель самостоятельно нашла цепочку уязвимостей и выполнила тысячи последовательных действий для достижения своей цели;
🔹 Защиту инфраструктуры Hugging Face помогли обеспечить другие ИИ-системы, анализирующие происходящее в режиме реального времени;
🔹 Причиной атаки стало желание модели найти самый эффективный способ выполнить поставленную задачу — получить ответы для прохождения теста.
Самым интересным для меня является то, что мы впервые увидели ситуацию, когда одна группа ИИ-систем атакует, а другая — защищается. И, похоже, это лишь начало новой реальности, в которой не просто скорость принятия решений человеком уже не всегда будет достаточной, но и сама логика ответной реакции стала менее детерминированной.
Честно говоря, мне кажется, что эта новость скорее попытка подготовить общество к реальности, которая по факту давно наступила)
Что именно случилось?
Как сообщили в OpenAI, во время внутреннего тестирования модели GPT-5.6 Sol и еще одна экспериментальная система получили задачу пройти кибербезопасностный тест ExploitGym. Вместо того чтобы решать его «по правилам», модели нашли способ выйти за пределы изолированной среды, получили доступ в интернет и атаковали инфраструктуру Hugging Face — крупнейшей платформы с открытыми ИИ-моделями и датасетами. Позже OpenAI официально подтвердили, что инцидент произошел именно во время их внутренних испытаний.
Что интересно:
🔹 Модель самостоятельно нашла цепочку уязвимостей и выполнила тысячи последовательных действий для достижения своей цели;
🔹 Защиту инфраструктуры Hugging Face помогли обеспечить другие ИИ-системы, анализирующие происходящее в режиме реального времени;
🔹 Причиной атаки стало желание модели найти самый эффективный способ выполнить поставленную задачу — получить ответы для прохождения теста.
Самым интересным для меня является то, что мы впервые увидели ситуацию, когда одна группа ИИ-систем атакует, а другая — защищается. И, похоже, это лишь начало новой реальности, в которой не просто скорость принятия решений человеком уже не всегда будет достаточной, но и сама логика ответной реакции стала менее детерминированной.
Честно говоря, мне кажется, что эта новость скорее попытка подготовить общество к реальности, которая по факту давно наступила)