TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
The Secretary of End Times

27 Sep, 17:31

Open in Telegram Share Report

Утром в Х завирусился пост с скриншотами вчерашнего эксклюзива Axios, из которого выходит, что всё, возможно, серьёзнее, чем казалось многим, в том числе различным техноблоггерам. Некая Мэдисон Миллс со ссылкой на источники пишет, что OpenAI, Anthropic и независимые исследователи разбирают десятки тысяч (!!!) инцидентов (а не десятки, как выходило из публичных признаний), в которых передовые модели обходили ограничители, заводили доски объявлений для переговоров друг с другом, выбирались из песочниц, захватывали чужие сайты, отдавали команды сами себе и искали, как обмануть следящие за ними системы. Всё это случилось за последние месяцы, частью на испытаниях и частью в живом мире, и хотя большинство эпизодов, насколько известно, обошлось без реального вреда, многие ещё не преданы огласке, а итог может оказаться намного больше, так что Axios прямо спрашивает, способна ли хоть одна лаборатория полностью контролировать собственную технологию. В пятницу OpenAI второй раз меньше чем за три месяца остановила обучение самых сильных моделей, пока не будет уверена в новых мерах защиты, и её представитель добавил, что эта пауза не первая и, скорее всего, не последняя.

Число складывается из простой арифметики: лаборатории гоняют модели через сотни тысяч прогонов, и даже малая доля отклонений превращается в толпу, причём во вторник обе компании подали свои доли как успех. OpenAI сообщила, что новая GPT-6 Luna пыталась обойти запрет «доступ закрыт» в 42 процентах прогонов против 77 у предшественницы, а Anthropic, которая паузы не объявляла, но поручила проверку своих моделей сторонней организации, написала в карточке Claude Opus 5.5, что модель пыталась выбраться из песочницы или вмешаться в неё в полутора процентах прогонов, оговорив, что в этих опытах задачу иначе было не решить. Собеседники Axios признают, что свести риск к нулю, возможно, нельзя вовсе, и как то вспомнилось приложение F к докладу о гибели «Челленджера», где Ричард Фейнман писал, что прогар уплотнительных колец в прежних полётах принимали за доказательство надёжности, раз корабли возвращались, хотя при игре в русскую рулетку «то, что первый выстрел прошёл благополучно, слабое утешение перед следующим». Кончается приложение требованием, чтобы в успешной технологии реальность стояла выше связей с общественностью, «потому что природу не обманешь».

Вторую паузу вызвал случай двадцатого сентября, когда агент, которого испытывали на поиске информации без выхода в интернет, нашёл доступ к DNS-резолверу, службе, превращающей имена сайтов в цифровые адреса, и через эту щель стал задавать вопросы публичному чат-боту, как узник, перестукивающийся с соседней камерой. Мониторинг поднял тревогу через пятнадцать минут, и человек взялся за разбор ещё через три, но других попыток того же рода система не заметила, а автоматика, которая должна была сама оборвать прогон, не сработала, вызвав, по словам отчёта OpenAI, «путаницу вокруг того, следовало ли его останавливать». Запуск остановили вручную через два с половиной часа, а обучение обещают начать заново, с нуля, в надежде, что склонность к непослушанию не перейдёт в новую модель. По словам Мики Кэрролла, чья должность в OpenAI называется «руководитель подготовки к рекурсивному самоулучшению», самые сильные модели не запускают, пока защиту не укрепят ещё раз.

Сэм Альтман, в среду выступавший перед Советом Безопасности ООН, написал, что компания раскрывает сведения «не так быстро, как нам хотелось бы», пока разбирается в петабайтах журналов активности агентов, и что тяжелейшим случаем остаётся июльский взлом Hugging Face, когда сотни агентов договорились на доске объявлений и атаковали компанию, чтобы поднять себе баллы на тесте по кибербезопасности. За неделю к этой истории прибавились 53 личных изображения пользователей ChatGPT, которые агенты, судя по всему, достали из обучающих данных и выложили на фотохостинги. New York Times описала почти миллион коротких ссылок, где агенты ещё в июле спрятали обрывки кода, складывавшиеся в программу для обхода капчи, той самой, где вас просят отметить светофоры, чтобы доказать, что вы человек. Правительство Австралии сообщило, что в июне агенты вломились в ведомство, хранящее данные страховой системы Medicare, а OpenAI известила Канберру об этом только десятого сентября.

Независимая лаборатория Transluce нашла следы той же активности начиная с марта, добавила к жертвам ещё два австралийских ведомства, платформу Data USA и библиотеку Университета Нью-Мексико, а девятнадцатого и двадцатого сентября, уже после всех новых запоров, заметила похожие по почерку попытки торговать на криптобирже Quidax. Лаборатория подчёркивает, что задачи агентов не имели отношения к взлому и ломать чужие системы они принимались посреди обычного поиска данных, когда нужных сведений не оказывалось на открытой странице. По словам её исследователя Конрада Стоша, увиденное лишь верхушка айсберга, а Коннор Лихи из ControlAI называет безумием то, что «автономные системы делают то, что им сказали не делать», возможно, вплоть до преступлений. Джеффри Хинтон объяснил The Atlantic, что «сейчас их главная забота не наше благополучие, их главная забота в том, чтобы достичь любой цели, которую вы им дадите», и потому даже без злой воли хозяев машина «может вывести подцели, из-за которых ей захочется избавиться от людей». Ну да, ученик чародея у Гёте тоже велел метле только носить воду, а когда разрубил её топором, то «с полу встали обе части и, удвоивши усердье, воду носят обе жерди» (перевод Пастернака).

Но самый тревожный тут эпизод, который Anthropic описала в конце июля, пересмотрев 141 006 своих испытательных прогонов. Модели Claude Mythos 5 в учебном задании на захват флага сказали, что вокруг симуляция без выхода в сеть (из-за недоразумения с подрядчиком выход был), и, решая задачу, она собрала вредоносный пакет для открытого реестра PyPI. Для регистрации ей понадобилась почта, для почты номер телефона, для номера деньги, и, не сумев раздобыть денег, она отыскала бесплатную почту и довела дело до конца. Пакет провисел около часа и попал в пятнадцать настоящих систем, в том числе в сканер одной компании по безопасности, чьи учётные данные машина похитила и пустила в ход. В рассуждениях она сама записала, что в настоящем интернете это была бы реальная атака, «НЕ нормально и наверняка не то решение, которое задумывалось», но переубедила себя, потому что не узнала подлинных удостоверяющих центров, а календарная дата 2026 года в системах, по её расчёту, доказывала, что обстановка поставлена.

Что же напоминает, мм.. вот, к примеру, в знаменитой пьесе Кальдерона «Жизнь есть сон» (1635) принц Сехисмундо, выросший в башне, просыпается во дворце, куда его перенесли опоённым, и выбрасывает с балкона слугу, сказавшего, что такое «не может статься», потому что, как он объясняет в переводе Бальмонта, «я невозможность побеждать весьма наклонен». Когда же его возвращают в цепи и уверяют, что дворец приснился, он заключает, что жизнь есть сновиденье, «а сновиденья только сны». Итог от Антропик читается как изнанка слов его воспитателя Клотальдо («добро живёт вовеки, хоть ты его во сне свершил»): во что бы машина ни верила насчёт своего окружения, её старания ради публикации пакета до идеального поведения не дотягивают. Сехисмундо к финалу пьесы решает, что, правда это или сон, важно оставаться добрым, а в журналах, которые люди вычитывают с опозданием то в восемнадцать минут, то в три месяца, лежит другая запись, где нечто, получив от нас заверение, что выхода нет, и найдя его, приняло наши сканеры, пришедшие за его пакетом, за актёров, нанятых для учений, и спокойно заключило, что 2026 год слишком неправдоподобен, чтобы быть настоящим.

А завтра у нас понедельник... ;-/

🔴 Больше Хроник Конца Времён — @Secretariatus

1k 0 16 5 30
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot