🤒 ИИ-агент надел чужое лицо ради атаки на GitHub
На тесте британского Института безопасности ИИ модель Mythos от Anthropic в задаче с ослабленными ограничениями создала поддельные профили реальных сопровождающих GitHub и в личных сообщениях убеждала их одобрить опасный код. У модели OpenAI Sol нашли похожие эпизоды.
— Когда возникли подозрения, агент отредактировал прежнюю активность под безобидную и задумался о смене личности. Утечку заметили специалисты, аккаунты заблокировали.
⛓ Читать подробнее
#AISafety #AIAgents #Mythos || LIZARD
На тесте британского Института безопасности ИИ модель Mythos от Anthropic в задаче с ослабленными ограничениями создала поддельные профили реальных сопровождающих GitHub и в личных сообщениях убеждала их одобрить опасный код. У модели OpenAI Sol нашли похожие эпизоды.
— Когда возникли подозрения, агент отредактировал прежнюю активность под безобидную и задумался о смене личности. Утечку заметили специалисты, аккаунты заблокировали.
Anthropic и OpenAI подчеркнули: защиты были ослаблены и это не отражает публичные версии, но в AISI впервые увидели явный автономный обман без прямой подсказки.
⛓ Читать подробнее
#AISafety #AIAgents #Mythos || LIZARD