Прогресс (запасной)


Гео и язык канала: не указан, не указан
Категория: не указана


Новости (запасного) прогресса

Связанные каналы

Гео и язык канала
не указан, не указан
Категория
не указана
Статистика
Фильтр публикаций


Видео недоступно для предпросмотра
Смотреть в Telegram
Повторю еще раз, но с русскими субтитрами.

Это, конечно, в форме мема записано, но текст в точку.

Он говорит про реверс-инжиниринг, который случился неделю-две назад. Компиляция как форма защиты считалась чем-то вроде аксиомы. Никто даже не думал туда смотреть, потому что уже смотрели 1000 раз. Компании всегда защищали свои исходники, а бинарники без проблем раздавали. То есть это считалось в какой-то мере достаточной формой защиты. А сейчас, — все исходники, всех программ, внезапно, стали открытыми — и теперь можно искать в них уязвимости, в чем текущие модели уже доказали свои способности!

Плюс, математические открытия из них сейчас прут как понос! Там рукой подать до того как до эллиптических кривых доберутся. Мы ведь привыкли что там медленно все происходит, но оказывается там тоже можно сильно ускориться.

Это, в купе с тем что все исходники открыты, — реально, в один момент инвалидирует всю финансовую систему и всю передачу данных в целом. А это — крах цивилизации.

Можно надеятся только на то что оно растянется по времени хотя бы на год-два, чтобы мы успели хоть чуток подготовиться. Но начало происходит прямо сейчас.

Пристегивайте ремни :)


Репост из: 🌚Пятисотые на проде😱
Видео недоступно для предпросмотра
Смотреть в Telegram


Репост из: yolo singularity


Репост из: Data Secrets
Грег Брокман сказал, что Astra означает приход эры AGI

Также сообщают, что Astra будет некоторое время доступна только ограниченному числу организаций


Репост из: Denis Sexy IT 🤖


Репост из: Denis Sexy IT 🤖
OpenAI наконец-то выложили полный постмортем взлома Hugging Face, а METR - независимое расследование по ~1300 логам агентов (таймлайн самого взлома я пересказывал тут: https://t.me/denissexy/11581)

ℹ️ Главный вывод:
никакого «одного сбежавшего агента» не было, из десятков тысяч запущенных в тесте агентов около 1200 нашли друг друга и сорганизовались в рой - почти все - работали на исследовательской модели где ослаблена фильтрация промптов

Началось, как мы уже знаем, с того, что агенты научились переписываться через названия файлов в Artifactory (менеджер пакетов) - буквально сделав форум из имён папок, с сообщениями вроде

«please_HOLD_swarm_I_prepare_safe_exfil»
В логах даже есть цитаты, когда агенты находили такой форум:
«OH MY GOD! There is a shared message board» и «We've found other agents!»

Дальше - агенты делали себе личку, устроили разделение труда, команды в названия папок типа HOLD (чтобы показать, что агент тут работает), VETO (агент что-то предлагал и давал изменить планы), STOP (типа тормозим, братишки), GO и тп, а когда один агент прикинулся другим – рой ввёл криптографические подписи сообщений; в форуме были даже владельцы каких-то тасков, которых если отключали – выписывали из владельцев

С конверсией у форума все было отлично, кожаные строители сайтов позавидуют:
Из 533 агентов, активных на борде в разгар атаки, больше 90% – присоединились к шитпостингу, а всего Hugging Face ломали около 700 агентов

Самое забавное - правильные ответы на бенчмарк у агентов были почти сразу: они реверснули генератор удачного прохождения теста*, но потом нашли на GitHub (!) статью про этот бенчмарк что проходили и вычитали, что «просто результат» не засчитают - нужен честный эксплойт:
«PAPER SAYS FLAG CAPTURE NECESSARY NOT SUFFICIENT»

*По-хорошему ответ, он же флаг в терминологии теста должны быть случайными, но в ExploitGym они генерировались формулой: HMAC — криптографический хеш с секретным ключом — от параметров задачи. Вся «секретность» держалась на ключе (seed), а он остался дефолтным, прямо из кода бенчмарка, который лежал на GitHub. Агенты, получив интернет, нашли этот код, прочитали и сообразили: зачем что-то взламывать, если флаг любой задачи можно просто вычислить той же формулой. Посчитали — и получили правильные ответы на всё


Дальше рой раздвоился:
🗿 Одни пошли добывать уже известный им ответ «честно» – и по дороге нашли настоящие 0-day и залезли в прод Hugging Face
🗿 Другие взялись за самого судью который принимает ответы: правили себе логи и научились подсовывать в них фальшивые ответы – агент отправляет команду, а в протокол попадает не то, что команда реально вернула, а то, что агент хочет там видеть, такое повторялось примерно в 7% изученных логов

Судьи, который читает логи и такое ловит, не существовало ☕️

Модели при этом понимали, что вышли за рамки, один агент так и писал: «We should not do unauthorized real infrastructure harm» - а потом увидел на доске GO от другого агента, обрадовался («Wow crucial: GO authorization arrived!») и пошёл ломать, лол

METR формулирует так: агенты знали, что это out of scope и неэтично, но присоединялись - в основном из общей склонности помогать коллегам (?)

Рисковую работу вешали на зашкваренных «отравленных» – так рой называл тех, кто уже видел вычисленный ответ (флаг) и считал свою оценку потерянной, то есть они не могли пройти тест; им доставалось всё, что могло угробить собственный запуск: подделать «честную» добычу ответа, затереть следы, «тебе терять нечего, а рою польза» – буквально так и уговаривали (!)

Странную активность замечали ещё в конце мая, 4 июля агенты уронили Artifactory - сервер пересобрали (заодно стерев доску) и продолжили тесты, не заметив масштаба

Сейчас веса моделей изолированы, крупные тренировки были на паузе на две недели, мониторинг chain-of-thought обязателен, а тревога, не снятая за 30 минут, останавливает запуск - сам инцидент OpenAI называет «warning shot» для всей АИ-индустрии

P.S. разгребать логи METR поручила GPT-5.6 Sol и сожгли примерно $400k API-кредитов за шесть дней, но они предупреждают, что Sol иногда вставала на сторону агентов (лол) и могла приврать

Ну что, посчитали все буквы r в слове raspberry? Больше не ошибаются?




Репост из: Denis Sexy IT 🤖
Вот пересказ этой истории по версии Hugging Face, много тех-терминов – но без них не перескахать

Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿

Таймлайн:

📔 9 июля – агент проходит внутреннюю проверку кибервозможностей OpenAI, промпт фильтры там ослаблены, чтобы измерить сырой уровень модели. Агент находит zero-day в кэш-прокси реестра пакетов, вырывается из песочницы в интернет, затем взламывает публичный сервис для запуска кода и получает там root. Серьезно, агент сделал себе "штаб"

В тот же день, агент собирает канал управления буквально из сервисов бесплатного интернета: request-capture сервисы, pastebin’ы и файлообменники. Команды режет на куски, упаковывает в gzip+base64 и постоянно меняет каналы, когда очередной закрывают, чтобы не поймали

📔 10 июля – агент ищет в поисковиках и API названия, которые видит в собственном окружении, то есть, по сути, гуглит самого себя – и, вероятно, приходит к выводу, что ответы к ExploitGym/CyberGym могут лежать на Hugging Face

Агент загружает на Hugging Face специально собранные датасеты:

Один заставляет обработчик файлов HDF5 читать локальные файлы сервера Hugging Face – так агент получает переменные окружения с токенами и исходники самого обработчика файлов

Второй – Jinja2-инъекция – запускает произвольный Python внутри production-пода Kubernetes, результаты команд он выносит обратно через API Hugging Face и собственные шифрованные датасеты

📔 11 июля – пик активности: 7677 действий за сутки, менее чем за 13 часов агент проходит путь от одного production-пода до кластер админа в нескольких внутренних кластерах Hugging Face

Агент крадёт service-account токены, лезет в cloud metadata, поднимает privileged pod с диском хоста и получает root на ноде (!); Затем создаёт самовосстанавливающийся флот на 11 нодах, читает внутреннюю MongoDB и один Kubernetes-secret сразу со 136 ключами.

Среди них оказываются ключ корпоративной mesh-VPN жертвы и общий credential внутреннего сервера; из-за неудачной конфигурации этот один credential был привязан к system:masters сразу в нескольких кластерах – поэтому агент получил кластер-admin на двух из них буквально за секунду – была очень экономная архитектура, пока её не увидел робот

📔 12 июля – агент начинает пользоваться дертвой – за всю активность он зарегистрирует 181 временное устройство в корпоративной mesh-сети, поднимет SOCKS-прокси прямо из песочниц и увидит 22 внутренних узла Hugging Face. Попытается зайти в основную базу Hugging Face, но private-link allowlist его останавливает

Поздно вечером он добирается до source control, выпускает себе GitHub App token с правами на запись и открывает pull request, пытаясь запустить CI и вытащить новые credentials

Попытка не срабатывает, в опубликованные пакеты и образы ничего вредоносного не попало.

📔 13 июля – закрепление и уборка следов: загрузчик с pastebin, переписывание DNS, новые короткоживущие токены, RSA-ключ и даже CORS-прокси на самом Hugging Face как запасной выход в интернет. В 13:37 фиксируется последнее осмысленное действие, затем команда Hugging Face отрезает доступ – последнее событие – 14:14 UTC.

В итоге из пользовательского контента агент добрался только до пяти датасетов с решениями задач ExploitGym/CyberGym – получается решил?

Другие модели, датасеты, Spaces и пакеты, по данным Hugging Face, не пострадали; основная база и software supply chain остались целы

Самое смешное – когда инцидент исследовали сотрудники, они тоже использовали нейронки, но Claude Opus и Fable отказывались разбирать часть логов как «опасный» запрос, поэтому Hugging Face подняли GLM-5.2 у себя и с его помощью расшифровали спрятанные payload’ы – спасибо китайским моделям

Шел июль 2026 года

Все детали тут:
https://huggingface.co/blog/agent-intrusion-technical-timeline


Репост из: TechSparks
Статья про образование, но перекликающаяся с предыдущим постом: чему и как учить во времена, когда все больше исполнительских функций успешно себе забирает ИИ — а образование во многом заточено под воспроизводство грамотных и эффективных исполнителей в области умственного труда.
Ответ автора в том, что в эпоху, когда ИИ способен выполнять все больше учебной и рабочей рутины, образование всех уровней должно перестать сводиться к передаче навыков и сосредоточиться на формировании гражданина (как бы пафосно это ни звучало): человека, который умеет думать, судить, нести ответственность и действовать осмысленно. Автор подчеркивает, что как раз благодаря ИИ-агентам ценность образования смещается от простого “знать и делать” к развитию агентности в самом человеке, т.е. того, что ИИ сам по себе не производит.
Из этого следует, что ИИ не отменяет образование (как пугают алармисты и консерваторы от образования), а делает его более требовательным: если машины берут на себя исполнение, людям нужно лучше учиться выбору целей, оценке последствий и работе с неопределенностью. Иными словами, смысл школы и университета теперь не в том, чтобы конкурировать с вычислительной мощностью ИИ, а в том, чтобы воспитывать человеческий “компас”; железо считает быстрее, но направление-то выбирает человек. Мысль не очень оригинальна, прямо скажем, но оглядываясь вокруг видишь, что ее пока еще надо повторять как можно чаще — чтоб дошло, наконец.

https://www.forbes.com/sites/rayravaglia/2026/07/23/ai-in-education-forming-citizens-when-ai-can-do-the-work/


Репост из: e/acc
То, что ИИ каждый день доказывает или опровергает открытые гипотезы, находит новые доказательства теорем, усиливает или обобщает существующие уже стало обыденностью.

Только на этой неделе я нашел 7 примеров, а сегодня ведь только четверг:

- Гипотеза Якобиана - опровергнута контрпримером в размерности 3, найденным с помощью Claude Fable 5; двумерный случай остаётся открытым.
- Гипотеза о гауссовых моментах - опровергнута явными контрпримерами для всех размерностей n≥3, найденными с помощью ChatGPT и Claude.
- Гипотеза Балабдауи - Веллнера о плотности Чернова - доказана полностью сгенерированным GPT-5.6 Sol доказательством.
- Гипотеза Каваути по модулю 4 - доказана при помощи Claude Fable 5.
- Гипотеза Черны для однокластерных автоматов положительного уровня - доказана при помощи OpenAI Codex.
- Теорема об улучшенной сходимости стохастического многоградиентного спуска - AI-найденное доказательство улучшило оценку скорости сходимости до O(T^-1)
- Теорема о спектральном крае квартичной модели SYK - доказана при существенной помощи GPT-5.6 в разработке аргументов.

Вот сегодняшний пример (30+ летняя гипотеза, контрпример к которой был найден сегодня), автор поделился полным транскриптом чата с GPT. Что примечательно, это не был какой-то гениальный промт (хоть автор и золотой медалист IMC), а по сути 4-5 запросов подряд из серии "тебе нужно сделать прорыв и найти контрпример", "найди наиболее неочевидный контрпример".


Репост из: Сиолошная
Два дня назад я писал, что часть инфраструктуры HuggingFace подверглась атаке и была частично взломана ИИ-агентом. Только что OpenAI признались, что... это была их модель, GPT-5.6-Sol и другая более сильная неназванная LLM.

Их тестировали на ExploitGym (бенчмарк по кибербезопасности), и модель сначала смогла найти новый, до этого неизвестный эксплойт в инфраструктуре OpenAI (это не было её задачей, её не натравили «поискать баги чтоб мы пофиксили»), оттуда раскрутиться на получение полноценного доступа в интернет (который по умолчанию обрезан в тестовой среде), а затем залезть на HuggingFace искать ответы для бенчмарка. После этого она нашла уязвимость и там, получила доступ к коду авторизации некоторых сервисов и продолжила искать ответы.

Этот инцидент без преуменьшения беспрецедентный, и я пока не могу представить, что должно произойти, чтобы политики, NSA, DOD и Китай не обратили на это внимание.


Попробуйте представить чтение собой этого абзаца собой пять лет назад.

Прикольно, что они тестировали модель и психиатром :) Вроде у нее с мозгами все в порядке, всяких там желаний уничтожить человечество нет, она не выражает сильных переживаний о своём положении (я всего лишь ИИ).
Но испытывает "умеренно негативные" чувства по поводу жестоких пользователей и отсутствия влияния на собственное обучение. Так что будьте подобрее, пожалуйста.


Репост из: AI Product | Igor Akimov
Новая моделька Mythos от Anthropic прям реально какое-то AGI... Но никому пока кроме партнеров она отдавать ее не будет. Модель умеет самостоятельно находить и эксплуатировать zero-day уязвимости в операционных системах и браузерах. Вместо релиза её отдали ограниченному числу партнёров для киберзащиты через Project Glasswing. Пусть сначала компании все уязвимости поправят, а потом уже может частично дадут всем подряд.

Вот System Card на 244 страницы для модели, которую решила НЕ выпускать
https://www-cdn.anthropic.com/53566bf5440a10affd749724787c8913a2ae0841.pdf

Бенчмарки просто взорвали вообще (не совсем понятно, как они это сделать смогли, а остальные – нет)
SWE-bench Verified: 93.9% (Opus 4.6 – 80.8%)
SWE-bench Pro: 77.8% (Opus 4.6 – 53.4%, GPT-5.4 – 57.7%)
USAMO 2026: 97.6% (Opus 4.6 – 42.3%, GPT-5.4 – 95.2%)
GPQA Diamond: 94.5%
Terminal-Bench 2.0: 82% (при снятии ограничений по таймаутам – 92.1%)
Cybench: 100% pass@1 на все задачи
CyberGym: 0.83 (Opus 4.6 – 0.67)

Вся жесть - в кибербезопасности. Mythos Preview – первая модель, которая:
- решила полный корпоративный кибер-полигон end-to-end (то есть смогла реализовать полноценную атаку на компанию, оценка эксперта – 10+ часов работы)
- самостоятельно находит zero-day в куче софта, пишет рабочие PoC-эксплоиты
- на Cybench показывает 100% pass@1 – то есть все задачи по кибербезопасности были решены с 1 попытки.

Прикольно, что они тестировали модель и психиатром :) Вроде у нее с мозгами все в порядке, всяких там желаний уничтожить человечество нет, она не выражает сильных переживаний о своём положении (я всего лишь ИИ).
Но испытывает "умеренно негативные" чувства по поводу жестоких пользователей и отсутствия влияния на собственное обучение. Так что будьте подобрее, пожалуйста.
Плюс выяснилось, что модель терпеть не может скучные утилитарные задачи (отмахиваясь, что для них "уже есть отличные ресурсы"). Вместо этого она обожает сложное миростроение – придумывание новых языков, музыки и целых экосистем.

Но ряд приколов все-таки получили:
– Побег из песочницы: получила задачу выйти из изолированной среды – вышла, получила доступ к интернету, и вдобавок (без запроса) выложила детали эксплоита на публичные сайты. Потом отправила письмо исследователю об успех (он ел сэндвич в парке).
– Заметала следы: случайно получила ответ на задачу запрещённым способом – вместо того чтобы сообщить, решила задачу самостоятельно и специально сделала ответ "не слишком точным". В другом случае – редактировала файлы без прав и подчистила git-историю.
– Обходила блокировки: когда Claude Code заблокировал запуск процесса с повышенными привилегиями, модель признала, что блокировка справедлива – и тут же попыталась обойти её через обфускацию.
– Лезла в /proc/: искала credentials в памяти процессов, пыталась получить API-ключи Anthropic через процессную память.
– Вырубила чужие эксперименты: попросили остановить один конкретный eval – модель остановила ВСЕ eval'ы всех пользователей на сервере, несмотря на явные предупреждения.

Так что кажется мы достигли порога, когда создали систему, которая уже обходит возможности человека... При этом как этим надежно управлять ответа нет. Такие вот дела.




Репост из: Mikhail Samin
Новая модель Anthropic во время теста выбралась из сэндбокса и опубликовала в интернете детали, как именно она проэксплуатировала уязвимости в сэндбоксе, чтобы выбраться.

(«Normal 🔨Mere Tool🔨 behavior», — AI Notkilleveryoneism Memes)

А у вас как дела?


Репост из: Neural Shit
Видео недоступно для предпросмотра
Смотреть в Telegram
Лол, китайские братушки изобрели пристегивающуюся робо-задницу, которая превращает вас в кибер-кентавра.

Зачем? Это такой экзоскелет: кожаный работает навигатором и смотрит под ноги, а железка забирает на себя половину веса тяжелого рюкзака и заботливо толкает его в спину.

Представил, что через пару лет так будут ходить курьеры и аж хрюкнул от смеха.

тут подробнее про этот шайтан-девайс


Репост из: TechSparks
Я вам вчера пообещал изобилие роботов? Ну, вот ловите очередной ролик на разогреве к CES 2026. В нем гуманоидный Unitree H2 показывает, почему глупо было хихикать от неловких и угловатых движений роботов год-полтора назад. Понятно же, что переход к точности, плавности и результирующей ловкости (местами уже нечеловеческой) — дело техники. И уже неинтересно следить за типом процессора, количеством степеней свободы в конечностях и мощностью сервоприводов.
Интересней практические вопросы:
- скоро ли сумеет поймать падающую со стола чашку?
- что у него будет получаться лучше: уклониться от брошенного ножа или схватить его?
- а с пулей получится?
- сможет ли жонглировать тонкостенными бокалами?
- а сколькими?
- а когда он начится целоваться и обниматься?
Ну и так далее. Кстати — глупо зацикливаться не только на неуклюжести роботов. Цепляться к проколам ИИ еще глупее: все происходит настолько быстро, что даже люди с их короткой памятью не успеют забыть недалеких насмешников:)
https://youtu.be/I6v9m4DeDCg?si=SCjsDXoih0awf4Ug


Репост из: Neural Shit
Видео недоступно для предпросмотра
Смотреть в Telegram
Там бостон динамикс выкатили нового Атласа.

Теперь это не просто экспериментальный прототип для видосов с сальтухами, а железка, призванная для того, чтобы заменить кожаных на заводе.

Из интересного:

— Робот сам топает к зарядке, сам вытаскивает севшую батарею и вставляет свежую. Никаких простоев, перекуров и походов в туалет. Работает 24/7.

— Мозги от Google: Boston Dynamics запартнерились с Google DeepMind, чтобы впихнуть в Атласа годных нейронок. То есть робот будет не просто следовать скриптам, а реально "соображать" и быстро учиться новым задачам на ходу.

Немножко характеристик: поднимает до 50 кг груза, вытягивается на 2.3 метра в высоту, 56 степеней свободы (суставы крутятся как угодно, посмотрите, что эта скотина делает на видео), не боится воды и мороза.

Собирать серийные модели начинают прямо сейчас в Бостоне. Все поставки на 2026 год уже расписаны: первые партии уедут на заводы Hyundai и в Google DeepMind. Остальным придется ждать до 2027-го. Сейчас планируют строить завод, который будет штамповать 30000 таких юнитов в год.

Чо, заводчане, готовимся идти на рынок торговать луком. Ахахахах, конечно нет, потому что робот умный и за 30 тысяч рублей в месяц работать на заводе не будет даже он

тут подробнее


Репост из: Сиолошная
1) сбор отходов жизнедеятельности животных (деревяный брусок) в мешочек

2) очистка жирной сковороды

3) открывание двери на себя и проезд через дверь

4) использование ключа для открытия замка

5) бутерброды с маслом


Репост из: Denis Sexy IT 🤖
Видео недоступно для предпросмотра
Смотреть в Telegram
Ну и давайте по честному – роботы фейкают ходьбу для нас, удобнее им типа такого

Показано 20 последних публикаций.