maxigacy (AI) Security


Kanal geosi va tili: ko‘rsatilmagan, ko‘rsatilmagan
Toifa: ko‘rsatilmagan


https://maxigacy.pro
AI in Security × Security in AI
Старший инженер по информационной безопасности в Яндексе
Пишу о применении AI в ИБ и ИБ в AI
На едином треке «магистратура—аспирантура» по профилю "Безопасность ИИ" в НИУ ВШЭ
Личное мнение автора

Связанные каналы

Kanal geosi va tili
ko‘rsatilmagan, ko‘rsatilmagan
Toifa
ko‘rsatilmagan
Statistika
Postlar filtri


Меньше битов ≠ больше защиты

Чтобы запустить ML-модель на микроконтроллере, её часто переводят из FP32 в INT8 или INT4. Модель становится компактнее и быстрее, а иногда ещё и демонстрирует лучшую устойчивость к adversarial-атакам.
Звучит как бесплатная защита. Но есть нюанс.

Авторы исследования David and Goliath⁠ проверили три квантованные TinyML-модели с помощью десяти атак и шести защит. Оказалось, что квантование меняет геометрию модели: градиенты могут исчезать, взрываться или указывать атаке неверное направление.

В результате неудачная атака иногда говорит не о реальной защищённости модели, а лишь о том, что выбранный метод плохо работает с квантованной арифметикой.

Поэтому оценивать нужно именно итоговую INT8/INT4-модель, причём не одной атакой: полезны адаптивные, transfer- и black-box-сценарии, а также проверка на реальном устройстве.

Для меня эта тема не только теоретическая. В нашей с Максимом Князевым статье «Влияние квантования TinyML-моделей на устойчивость аудиосистем персонального интернета вещей»⁠ мы проверяли распознавание голосовых команд под атакой PGD-40. INT8-QAT сохранил 98,8% точности на чистых данных и 92,2% под атакой, а у INT4 показатели снизились до 49,42% и 47,8% соответственно.

Квантование отлично экономит память. Но в безопасности экономия битов ещё не означает экономию рисков.

#AIxSec #TinyML #AdversarialML #MLSecurity #Security #AIxSec_Research


Яндекс нанимает | Вакансии для разработчиков dan repost
Как пройти Week Offer Security и попасть в команду, которая занимается безопасностью AI

Об этом рассказывает Максим Гусев — старший инженер по информационной безопасности в Яндекс 360. До компании он прошёл путь от стажёра до DevSecOps/MLSecOps-инженера и техлида группы автоматизации в ИБ.

👳‍♂️ В карточках Максим делится, почему решил попробовать Week Offer, как проходили технические сессии и что делать, чтобы подготовиться к собеседованиям. А ещё рассказывает, чем занимаются в области безопасности ML и LLM сегодня.

➡️ Если вас заинтересовала его история, присоединяйтесь к Week Offer Security 12–18 сентября. Сейчас Яндекс ищет инженеров по информационной безопасности с опытом от двух лет.

📆 Регистрируйтесь до 4 сентября, проходите две технические секции и получите офер, если всё пройдёт успешно.

Подписывайтесь:
💬 @Яндекс нанимает разработчиков


Почему 0% успешных атак ещё не победа

Интересное исследование с говорящим названием The Attacker Moves Second. Среди авторов: Флориан Трамер, Николас Карлини и другие исследователи из ETH Zurich, Anthropic, Google DeepMind и OpenAI.

Авторы проверили 12 современных защит от jailbreak и prompt injection. Многие из них ранее показывали почти нулевой процент успешных атак.

Но стоило использовать адаптивного атакующего, то есть подбирать атаку специально под устройство конкретной защиты, и для большинства решений Attack Success Rate превысил 90%.

Тестировать защиту только на фиксированном наборе промптов недостаточно. Это примерно как проверять антивирус на угрозах, которые он уже видел.

В реальности атакующий знает, что перед ним стоит защита, изучает её поведение и меняет стратегию. Поэтому хороший LLM Security-тест должен проверять не только известные атаки, но и способность защиты выдерживать адаптацию противника.

Иначе красивый 0% ASR может означать лишь то, что атакующий ещё не сделал второй ход.

PS Тем временем нас уже больше сотки 🎉

Делитесь в комментариях как вам контент, может есть опредленные вопросы, которые я мог бы покрыть в следующих постах 🤗

#AIxSec #LLMSecurity #PromptInjection #Research


Prompt injection вместо сериала на выходных

В эти выходные читал статью Defeating Prompt Injections by Design Флориана Трамера и его коллег.

Авторы предлагают CaMeL — архитектурную защиту LLM-агентов от prompt injection. В её основе две модели:

P-LLM строит план по доверенному запросу и может работать с инструментами;
Q-LLM обрабатывает недоверенные данные, но не имеет доступа к инструментам.

CaMeL дополнительно разделяет потоки управления и данных и проверяет, какие данные разрешено передавать конкретным инструментам.

Главная мысль: вместо попытки научить LLM распознавать абсолютно все атаки лучше спроектировать систему так, чтобы даже успешная инъекция не привела к опасному действию.

Пожалуй, теперь это мой любимый формат выходных: практика английского и погружение в безопасность LLM-агентов.

А как проходят ваши выходные? Давайте поделимся в комментариях:)

#AIxSec #LLMSecurity #CaMeL #PromptInjection #Research


Встретился вчера по счастливой случайности с Женей Кокуйкиным @kokuykin и в какой-то момент наш разговор свернул в любимую рубрику «а что вообще может пойти не так с AI-агентами?».

Спойлер: много чего 😅

Мы спокойно даём Клоду доступ к терминалу, файлам, репозиториям и токенам. А потом тот же Клод получает доступ в интернет. Получается буквально сотрудник, у которого в одной руке ключи от сейфа, а в другой открытый Telegram. Или Twitter.

И это не абстрактная страшилка. Исследователи Check Point нашли уязвимость в Claude Code: достаточно было открыть вредоносный репозиторий и полный API-ключ мог улететь на сервер атакующего ещё до того, как пользователь успевал нажать «доверять этому проекту».

Конкретную дыру уже закрыли. Но сам вопрос никуда не делся:

если агент видит наши секреты и умеет общаться с внешним миром — кто и как контролирует, что именно он отправляет наружу?

Кажется, безопасность AI-агентов скоро станет отдельной большой индустрией. И чем больше мы отдаём им реальной работы, тем меньше это похоже на паранойю.

Само исследование:
https://research.checkpoint.com/2026/rce-and-api-token-exfiltration-through-claude-code-project-files-cve-2025-59536/

#AIxSec #Security #Notes #News #SecurityinAI


(AI + B2B + SaaS) × Security

В интернете сочетание AI B2B SaaS уже стало мемом: произносишь эти три слова — и можно идти поднимать следующий инвестиционный раунд.
Но недавно я задумался, как несколькими словами описать то, чем занимаюсь, и с удивлением получил ту же формулу:

(AI + B2B + SaaS) × Security

Расшифровываю:

AI — искусственный интеллект и новые риски, которые появляются вместе с его внедрением и использованием для задачи ИБ в том числе

B2B — я работаю в Яндекс 360 с продуктами для корпоративных заказчиков, где особенно важны требования бизнеса, управляемость и доверие.

SaaS — сервисы Яндекс 360 предоставляются по подписной модели: инфраструктура и обновления остаются на стороне провайдера, а пользователи получают готовые облачные инструменты.

А Security здесь именно множитель, а не ещё одно слагаемое. Потому что безопасность должна распространяться сразу на AI, B2B-процессы и SaaS-продукты.

Получается, кто-то строит очередной AI B2B SaaS, а я думаю, как сделать так, чтобы его потом не пришлось срочно спасать.

#AIxSec #Security #B2B #SaaS #Notes


Как ChatGPT «сэкономил» нам минус 4,5 часа

В апреле мы с @MaxiEnergy победили на конференции Арменского в МИЭМ НИУ ВШЭ с докладом о влиянии квантования TinyML-моделей на устойчивость аудиосистем персонального интернета вещей — например, умных колонок и наушников.
Мы исследовали, как разные режимы квантования влияют на распознавание голосовых команд при состязательных атаках. Один из выводов: INT8 позволяет существенно уменьшить модель без потери точности и устойчивости, а INT4 уже приводит к серьёзной деградации.

По мотивам доклада мы подготовили статью, получили замечания редакции и решили ускорить правки с помощью ChatGPT.

В итоге редактировали текст шесть часов. Вручную справились бы примерно за полтора.
Модель исправляла нужный фрагмент, но заодно
соседние, теряла важные детали или добавляла научный канцелярит. Поэтому большую часть времени мы потратили на промпты и проверку «улучшений».

Вывод: LLM хорошо подходит для точечных правок, но отдавать ей целую научную статью — не всегда экономия времени.
Иногда лучший AI-инструмент — внимательный автор и полтора часа работы.

#Research #TinyML #ChatGPT #Notes


Claude начал незаметно маркировать созданные им тексты. В них появляются невидимые для человека водяные знаки, которые сохраняются даже после копирования и вставки. Такая маркировка позволяет обнаруживать тексты нейросети и может усложнить использование Claude в учебных, рабочих и научных материалах.


Кажется, что миграция с Claude в ChatGPT/Codex усилится еще быстрее.

Канарейки*, это, конечно, круто с точки зрения безопасности, но обычным пользователям вряд ли зайдет, когда их исключают из универа за обычную домашку с Клодом.

*Канарейка — это заранее оставленный скрытый маркер, срабатывание или обнаружение которого позволяет понять, что данные были скопированы, раскрыты или попали туда, где их не должно быть.


#News


Привет! Это maxigacy (AI) Security.

Страничка с инфо обо мне https://maxigacy.pro

Меня зовут Максим Гусев. Я старший инженер по информационной безопасности в Яндексе и занимаюсь двумя взаимосвязанными направлениями:

→ AI in Security — как применять AI в AppSec, DevSecOps, анализе уязвимостей и автоматизации процессов безопасности.

← Security in AI — как защищать модели, LLM-приложения и AI-агентов: от prompt injection и небезопасного tool use до MLSecOps и архитектурных мер защиты.

Параллельно я обучаюсь на едином треке «магистратура — аспирантура» по профилю «Безопасность ИИ» и занимаюсь исследованиями атак и защитных механизмов для AI-систем.

Здесь буду публиковать:

— результаты собственных экспериментов и исследований;
— инженерные заметки о внедрении AI Security;
— разборы атак, защит и научных работ;
— наблюдения о применении AI в работе специалиста по безопасности;
— идеи, которые ещё не превратились в полноценные статьи.

Навигация по каналу:

#AIinSecurity — применение AI в кибербезопасности
#SecurityinAI — безопасность AI-систем
#Research — исследования и статьи
#Practice — инструменты и инженерная практика
#Notes — короткие наблюдения и гипотезы
#News — комментирую новости в сфере AI и Security

Канал личный. Все мнения принадлежат автору и не отражают официальную позицию Яндекса.

Максим Гусев
@aixsec
@maxigacy

9 ta oxirgi post ko‘rsatilgan.