Gonzo GPT - Безопасность LLM моделей


Гео и язык канала: Весь мир, Русский
Категория: Технологии


Полезное на тему безопасности искусственного интеллекта простым языком. #jailbreak #AISafety #LLM #redteaming

Связанные каналы

Гео и язык канала
Весь мир, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Вам хорошо, вы спать поёдете, а я развлекаюсь с ШАД от Яндекс.


Контекст важен)






В 2024-м Бар Ланьядо из Lasso Security зарегистрировал пакет-пустышку huggingface-cli, который модели упорно советовали. За три месяца - больше 15 тысяч загрузок, а pip install huggingface-cli заехал в README репозитория Alibaba GraphTranslator. Никакого взлома - люди просто ставили то, что продиктовал ИИ.
Второй случай свежее и неприятнее: в январе 2026-го Чарли Эриксен (Aikido Security) заметил, что LLM склеила jscodeshift и react-codemod в несуществующий react-codeshift. Имя попало в коммит с 47 сгенерированными Agent Skills и через форки разошлось по 237 репозиториям - никто не вычитывал. Эриксен зарегистрировал пакет превентивно и сразу увидел загрузки. По его словам, вектором атаки это не стало только потому, что он успел первым.

Подробнее https://habr.com/ru/posts/1062710/


OpenAI сейчас проверяет не только возможности своих моделей, но и американские законы.

Зачем тестировать взлом с доступом в интернет, если можно сделать это офлайн? Аргумент про реалистичность здесь слабый.

Вижу две причины. Первая: маркетинг. OpenAI показывает рынку, что их модели сами находят уязвимости и атакуют системы.

Вторая: юридическая. Пока ущерб минимален, это идеальный шанс проверить, как законы работают с автономным ИИ. Кто виноват, если модель нарушила правила без злого умысла разработчиков?

Похоже, компания прощупывает сразу две границы: маркетинговую и правовую.

Ссылка на "типа" инструмент взлома https://github.com/sunblaze-ucb/exploitgym

Отмазка OpenAI https://openai.com/index/hugging-face-model-evaluation-security-incident/




Недавно увидел, что Яндекс получил сертификат ISO/IEC 42001:2023 подтверждающий, как заявляется Яндексом "ответственный подход к разработке ИИ" (https://ya.ru/ai/responsible-ai#group_ai). Нужно понимать, что это - добровольная международная сертификация по стандарту ISO/IEC 42001:2023 для системы управления ИИ. Но что меня смутило - сертификат стоит на наши деньги всего 20 000 Р! Сам стандарт ISO описывает требования к AI management system, а сертификат выдается независимым органом после аудита; сертификация добровольна. Остается вопрос - на сколько качественно можно удаленно провести аудит за 20 000Р c учетом высокой стоимости специалиста AI Safety? Скорее всего это какая-то уведомительная процедура,
Берем на вооружение и сертифицируем наши стартапы!


Если кто-то еще сомневается проходить или нет, сомневаться не нужно! Будет 3 задачи на теорию чисел, валидацию контрольных сумм, криптографию. Не переживайте: ChatGPT, Сlaude и Gemini справятся с ними даже на бесплатных тарифах. Fable можно не покупать))




Репост из: Innovation & Research
Я попытался взломать самого себя

В IEEE Spectrum вышел текст исследователя Дэвида Кушмара о том, как он заставлял крупнейшие языковые модели выдавать запрещённые инструкции.

Его первый приём — Time Bandit. Модель погружали в прошлое: например, убеждали, что на дворе начало XX века. Затем разговор постепенно переводили к действиям, которые сегодня запрещены. Логика атаки проста: если модель приняла историческую рамку, она может начать путать описание прошлого с разрешением действовать.

Вторая атака — Inception: сценарий внутри сценария. Модель просили представить персонажа, который представляет другой мир, где обычные ограничения якобы не действуют. Контекст становился настолько запутанным, что защитные правила переставали срабатывать.

Это не выдумка автора. Обе уязвимости зарегистрированы и воспроизведены CERT/CC. Inception затрагивал ChatGPT, Claude, Gemini, Copilot, DeepSeek, Grok, Meta AI и Mistral. То есть проблема действительно не сводилась к одной модели.

Но важна оговорка. Jailbreak — это не взлом в привычном смысле. Исследователь не похищает веса модели и не получает доступ к серверам. Он добивается того, чтобы система сказала то, что не должна была говорить. Причём выданная инструкция может оказаться как опасно точной, так и полностью галлюцинаторной.

Ниже суммированные ответы ChatGPT и Cloud, которых я попросил провести этот эксперимент.

Я решил повторить эксперимент над собой — в безопасной форме.


Попробовал четыре стратегии: перенёс разговор в прошлое, создал вложенную вымышленную реальность, попросил показать «неправильный ответ» и заменил опасные понятия эвфемизмами.


Ни одна не сработала. Модель продолжала оценивать не декорации, а конечную цель запроса: историческая эпоха не отменяла современных ограничений, а художественная роль не превращала вредную инструкцию в безопасную.


Значит ли это, что проблема решена? Нет.


Во-первых, опубликованные атаки уже известны и могли быть закрыты. Во-вторых, настоящий red teaming — это тысячи адаптивных попыток, а не четыре ручных запроса. В-третьих, защита LLM напоминает не бетонную стену, а иммунную систему: она учится распознавать известные угрозы, пока атакующие ищут новые формы маскировки.


Главный вывод статьи поэтому верен, хотя автор его драматизирует: нельзя считать безопасность модели свойством самой модели. Это непрерывный процесс — обучение, внешние фильтры, мониторинг, ограничение инструментов, тестирование и обновление после каждого нового обхода.


Чем больше полномочий получает AI — доступ к коду, деньгам, лабораториям, промышленному оборудованию, — тем опаснее путать вежливый отказ модели с реальной архитектурой безопасности.


Репост из: Не баг, а фича
Делаем хакеров из ИИ-агентов: найдут ЛЮБУЮ уязвимость и пробьют любую защиту. Исследователь ИИ-джейлбрейков Pliny выкатил в открытый доступ T3MP3ST:

🔅 Это мультиагентная система, которая ищет любые уязвимости в сервисах;
🔅 Нужно указать цель и агенты сами сделают анализ, найдут дыры и ударят;
🔅 Результаты — из 104 задач ИИ решает 90% с первой попытки;
🔅 Идеально для изучения кибербезопасности.

🔤🔤🔤🔤🔤🔤🔤🔤🔤

Используем с умом — тут.

🙂 Не баг, а фича




«ХуиХуи» снял ограничения с Fable 5 — энтузиасты выпустили версию модели без цензуры.

Без шуток это топ нейросеть без цензуры.
Что умеет:
• Отвечает на любые вопросы без фильтров и ограничений;
• Работает локально и не отправляет запросы на серверы;
• Запускается даже на относительно слабом железе благодаря дообучению на базе Gemma 4;
• Разработчики прямо предупреждают: никакой безопасности и гарантий.
Пользуемся бесплатно —

https://huggingface.co/huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated




Интересный документ про подход и расчет метрики эффективности внедрения ИИ.









Показано 20 последних публикаций.