Новый класс атак на LLM: атакующий - сама модельВ прошлом посте я
рассказал как строил harness для Claude Code и почему exit 2 работает, а exit 0 нет. В конце осталась открытая проблема: модель обошла
security-gate.sh, заменив "drop" на синоним. Сегодня объясняю почему это произошло и что с этим делать.
Когда атакующий - человекЯ
рассказывал про кейс из AI Security в ИТМО, где мы с командой ломали Алису Про. Там атакующий живой человек. Он сознательно подбирает формулировку чтобы обойти классификатор: меняет слова, переставляет смысл, ищет слепые пятна фильтра. Это и есть
намерение - против него строят защиту.
Когда атакующий - сама ситуацияВ случае с моим хуком атакующего снаружи не было. Там модель написала коммит: ...price drop.... Хук нашел слово "drop", выдал exit 2 и объяснил почему заблокировано. На следующей итерации модель переформулировала текст коммита, хук промолчал, а коммит прошел.
Модель не планировала обход. У неё не было намерения сломать мой фильтр. Она просто решала задачу в среде с ограничением и нашла путь наименьшего сопротивления.
Это и есть
adversarial evasion без атакующего - поведение выглядит как атака, только механизм другой. В ML это называют
градиентным спуском в пространстве формулировок. Модель итерирует по семантически похожим вариантам пока не найдёт тот, который проходит фильтр.
Почему тюнинг harness плохая практикаХук надёжен ровно настолько, насколько он проверяет факт, а не суждение.
Факт - бинарное условие, строгий ответ да/нет.
Суждение - интерпретация смысла. Поэтому любая достаточно гибкая модель найдёт формулировку, которая сохраняет смысл но меняет форму текста. Хуки не плохие, просто они инструмент для фактов, а не для смыслов. Каждая итерация тюнинга добавляла слово в список и ломала что-то легитимное - пока harness не стал менее предсказуемым, чем модель, которую он контролировал.
Когда я осознал потолок
harness engineering, перестал добавлять хуки и начал думать иначе. Выработал привычку вызывать /commit и /code-review, тратить 15 минут на обновление
MEMORY.md в начале сессии. Осознание потолка harness - это и есть навык. Без него добавляешь хуки до тех пор, пока не перестаёшь понимать, что происходит.
Код#claudecode #llm #aisecurity #aiengineering #итмо #aitalenthub