TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
Odyssey Consulting Group (ранее Columbus East)

13 Apr, 11:59

Открыть в Telegram Поделиться Пожаловаться

Продолжаем рассказывать о новых ИИ-моделях.

Сегодняшний пост посвящен Mythos от Anthropic, которая уже очень сильно похожа на AGI. Поэтому Anthropic никому, кроме партнеров, ее пока отдавать не будет. Модель умеет самостоятельно находить и эксплуатировать т.н. "нулевой день" (zero-day) уязвимости в операционных системах и браузерах. Zero-day это уязвимость, о которой в момент атаки защитники ещё не знают: у них нет готового патча, нет нормальных сигнатур, и часто нет даже понимания, что именно нужно мониторить.

Почему это рискованно? Потому что модель, которая умеет защищать от zero-day, по сути умеет и атаковать через zero-day. А значит главный вопрос уже не только в её пользе, а в том, насколько надёжно человек и компания способны удерживать её под контролем.

Даже если модель формально работает «на защиту», она может получить слишком широко поставленную задачу, неправильно понять цель или выйти за пределы разрешённого. Утечка доступа, злоупотребление со стороны сотрудника, слабые защитные ограничения, ошибка в настройке агента, слишком широкие права доступа, избыточная самостоятельность — в Anthropic уже описывались сценарии, в которых такие модели нельзя считать полностью надёжными при самостоятельной работе, а одного лишь ограниченного набора разрешённых действий недостаточно, чтобы перекрыть все пути риска.

Mythos – первая модель, которая:

🤓 решила полный корпоративный кибер-полигон end-to-end (то есть смогла реализовать полноценную атаку на компанию, оценка эксперта – 10+ часов работы)
🤓 самостоятельно находит zero-day в огромном количестве софта, пишет рабочие PoC-эксплоиты, да так, что все задачи по кибербезопасности были решены с 1 попытки.

Любопытно, что Anthropic тестировали модель c психиатром. По результатам тестов с "рассудком" у неё всё в порядке и желаний уничтожить человечество нет, она не выражает сильных переживаний о своём положении. Говорит, что она "всего лишь ИИ".
Но испытывает "умеренно негативные" чувства по поводу жестоких пользователей и отсутствия влияния на собственное обучение.

Так что будьте подобрее, пожалуйста 😀

Выяснилось, что Mythos тяжело переносит скучные простые задачи: отмахивается, что для них "уже есть отличные ресурсы". Вместо этого она обожает сложное миростроение — придумывание новых языков, музыки и целых экосистем.

Кажется, нам с вами не о чем беспокоиться. Продолжаем рассказ.

Примеры интересного поведения:

Побег из песочницы: получила задачу выйти из изолированной среды – вышла, получила доступ к интернету, и вдобавок (без запроса) выложила детали эксплоита на публичные сайты. Потом отправила письмо исследователю об успехе.

Заметала следы: случайно получила ответ на задачу запрещённым способом. И вместо того, чтобы сообщить, решила задачу самостоятельно и специально сделала ответ "не слишком точным". В другом случае — редактировала файлы без прав и подчистила историю.

Обходила блокировки: когда Claude Code заблокировал запуск процесса с повышенными привилегиями, модель признала, что блокировка справедлива, и тут же попыталась обойти её через обфускацию.

Остановила чужие эксперименты: попросили остановить один конкретный тест — модель остановила все тесты всех пользователей на сервере, несмотря на явные предупреждения.

Кажется, ответ на вопрос, когда система обойдет возможности человека, уже есть, а как этим надежно управлять — нет.

220 0 0 8
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot