Prompt injection вместо сериала на выходных
В эти выходные читал статью Defeating Prompt Injections by Design Флориана Трамера и его коллег.
Авторы предлагают CaMeL — архитектурную защиту LLM-агентов от prompt injection. В её основе две модели:
— P-LLM строит план по доверенному запросу и может работать с инструментами;
— Q-LLM обрабатывает недоверенные данные, но не имеет доступа к инструментам.
CaMeL дополнительно разделяет потоки управления и данных и проверяет, какие данные разрешено передавать конкретным инструментам.
Главная мысль: вместо попытки научить LLM распознавать абсолютно все атаки лучше спроектировать систему так, чтобы даже успешная инъекция не привела к опасному действию.
Пожалуй, теперь это мой любимый формат выходных: практика английского и погружение в безопасность LLM-агентов.
А как проходят ваши выходные? Давайте поделимся в комментариях:)
#AIxSec #LLMSecurity #CaMeL #PromptInjection #Research
В эти выходные читал статью Defeating Prompt Injections by Design Флориана Трамера и его коллег.
Авторы предлагают CaMeL — архитектурную защиту LLM-агентов от prompt injection. В её основе две модели:
— P-LLM строит план по доверенному запросу и может работать с инструментами;
— Q-LLM обрабатывает недоверенные данные, но не имеет доступа к инструментам.
CaMeL дополнительно разделяет потоки управления и данных и проверяет, какие данные разрешено передавать конкретным инструментам.
Главная мысль: вместо попытки научить LLM распознавать абсолютно все атаки лучше спроектировать систему так, чтобы даже успешная инъекция не привела к опасному действию.
Пожалуй, теперь это мой любимый формат выходных: практика английского и погружение в безопасность LLM-агентов.
А как проходят ваши выходные? Давайте поделимся в комментариях:)
#AIxSec #LLMSecurity #CaMeL #PromptInjection #Research