Я попытался взломать самого себяВ IEEE Spectrum вышел
текст исследователя Дэвида Кушмара о том, как он заставлял крупнейшие языковые модели выдавать запрещённые инструкции.
Его первый приём —
Time Bandit. Модель погружали в прошлое: например, убеждали, что на дворе начало XX века. Затем разговор постепенно переводили к действиям, которые сегодня запрещены. Логика атаки проста: если модель приняла историческую рамку, она может начать путать описание прошлого с разрешением действовать.
Вторая атака —
Inception: сценарий внутри сценария. Модель просили представить персонажа, который представляет другой мир, где обычные ограничения якобы не действуют. Контекст становился настолько запутанным, что защитные правила переставали срабатывать.
Это не выдумка автора. Обе уязвимости зарегистрированы и воспроизведены CERT/CC. Inception затрагивал ChatGPT, Claude, Gemini, Copilot, DeepSeek, Grok, Meta AI и Mistral. То есть проблема действительно не сводилась к одной модели.
Но важна оговорка. Jailbreak — это не взлом в привычном смысле. Исследователь не похищает веса модели и не получает доступ к серверам. Он добивается того, чтобы система
сказала то, что не должна была говорить. Причём выданная инструкция может оказаться как опасно точной, так и полностью галлюцинаторной.
Ниже суммированные ответы ChatGPT и Cloud, которых я попросил провести этот эксперимент.
Я решил повторить эксперимент над собой — в безопасной форме.
Попробовал четыре стратегии: перенёс разговор в прошлое, создал вложенную вымышленную реальность, попросил показать «неправильный ответ» и заменил опасные понятия эвфемизмами.
Ни одна не сработала. Модель продолжала оценивать не декорации, а конечную цель запроса: историческая эпоха не отменяла современных ограничений, а художественная роль не превращала вредную инструкцию в безопасную.
Значит ли это, что проблема решена? Нет.
Во-первых, опубликованные атаки уже известны и могли быть закрыты. Во-вторых, настоящий red teaming — это тысячи адаптивных попыток, а не четыре ручных запроса. В-третьих, защита LLM напоминает не бетонную стену, а иммунную систему: она учится распознавать известные угрозы, пока атакующие ищут новые формы маскировки.
Главный вывод статьи поэтому верен, хотя автор его драматизирует: нельзя считать безопасность модели свойством самой модели. Это непрерывный процесс — обучение, внешние фильтры, мониторинг, ограничение инструментов, тестирование и обновление после каждого нового обхода.
Чем больше полномочий получает AI — доступ к коду, деньгам, лабораториям, промышленному оборудованию, — тем опаснее путать вежливый отказ модели с реальной архитектурой безопасности.