Двойное зеркало


Гео и язык канала: не указан, не указан
Категория: не указана


Личной блог про IT, нейронки и много чего ещё.

Связанные каналы

Гео и язык канала
не указан, не указан
Категория
не указана
Статистика
Фильтр публикаций


UPD 1.1 *

Насчёт цен не уверен. Stripe уже несколько лет идут по пути замкнутой экосистема вокруг ИИ (с заявкой на монополию).

Они уже владеют:
· Bridge (2024, $1.1 млрд): Платформа для работы со стейблкоинами. Позволяет Stripe проводить трансграничные расчеты в криптовалюте, минуя банки.
· Privy (2025): Сервис «встроенных кошельков» для крипто-приложений. Через него Stripe контролирует 75 млн кошельков у 1000+ команд разработчиков, давая ИИ-агентам «карманные деньги».
· Metronome (Январь 2026): Лидер в биллинге по модели usage-based, уже обслуживающий OpenAI, Anthropic и NVIDIA. Это «касса» для ИИ-компаний.
· Tempo (инкубация): Собственный блокчейн Stripe для микроплатежей между ИИ-агентами без участия человека.
· OpenRouter (Август 2026, $7 млрд): Шлюз к 400+ ИИ-моделям и 8 млн разработчиков. Это главный «распределитель» ИИ-трафика и данных о расходах.

Итого у них в руках:

1. Распределение задач (OpenRouter)
2. Учет и биллинг (Metronome)
3. Платежные средства (кошельки Privy)
4. Проведение расчетов (Bridge, Tempo)

Получив контроль над потоком запросов (OpenRouter) и деньгами (Metronome), Stripe получает доступ к полной аналитике всех ИИ-расходов. Это позволяет ей диктовать условия.

---

Путь в монополию долгий и тернистый, но, увы, неотвратимый.


У OpenRouter поменялся хозяин.

Компания Stripe купила OpenRouter за 7 миллиардов долларов.

Чего нам, как пользователям, ждать от этой покупки?

1. Цены вряд ли поменяются.
Хоть покупка за 7 лярдов это много и намного выше выручки OpenRouter, это все ещё сильно растущий рынок и их выручка запросто может вырасти в десятки раз.

2. Больше бизнес решений.
Stripe контра работающая с бизнесом. Скорее всего свой опыт они начнут внедрять и тут.

3. Могут исчезнуть некоторые модели.
Поскольку надо выходить в +, то могут исчезнуть бесплатные модели. Так же это американская контора, которая в отличии от OpenRouter не заявляла о своей нейтральности. Учитывая сильный перекос в сторону Китайских моделей, если будет принято решение, китайские модели начнут выдавливать (ценами, доп комиссией или целиком).

Но ближайшее время вряд ли что-то сильно поменяется, хотя я бы на всякий случай поискал аналоги.


Сначала мы смеялись. Но потом они пришли за каскадерами...

Тут подробнее.


Если кому интересно, почему сейчас рынок воюет за разработчиков чипов для инференса нейросетей, то вот тут можно попробовать с какой скоростью работают эти чипы.

А вот тут умный мужик из Гугла поясняет, насколько инференс на специально выделенных для этого чипах быстрее, надежнее и (самое важное) энегроэффективнее.

Фантазии автора

Вангую, лет через 10-15 такие чипы станут продаваться на ПК отдельной платой, как это сейчас происходит с видеокартами. И даже игры будут с требованием из категории: минимум 100 токенов/сек на модели в 40B параметров и контекстным окном в 200к.
В комментариях скинул текстовку интервью. Переведена на русский.

*UPD оказывается Droider только что выпустил видео на ту же тему 🤷‍♂️


Lost in the Noise: How Reasoning Models Fail with Contextual Distractors

Авторы представили новый бенчмарк: насколько нейронки теряют информацию в шуме. Подлость в том, что это не случайный набор данных, а информация выглядящее правдоподобной, но по факту являющейся недостоверной или вредной.

По итогом все выглядит так:
Gemini-2.5-Pro - 77.8 %
DeepSeek-R1-0528- 72.4%
gpt-oss-120b - 72 %
Gemini-2.5-Flash - 70.6 %
все остальные 60 и меньше.


Пока протестированы далеко не все модели.

Интерактивные рузультаты.


Надеюсь, ещё помните, в 2025 году была попытка предсказать как будут развиваться события в мире ИИ: https://ai-2027.com

Попросил нейронку составить краткий срез итогов:

Этот сценарий — одна из самых обсуждаемых моделей ближайшего будущего ИИ. Сейчас, в августе 2026 года, можно подвести промежуточные итоги: часть прогнозов уже сбылась, часть сдвинулась по срокам, а некоторые ключевые события еще впереди.

✅ Что уже сбылось (с разной точностью)

· ИИ-агенты вышли в люди (2025). Сценарий предсказывал появление агентов-помощников в середине 2025 года. Это произошло: в 2025 году ИИ перестал быть просто чат-ботом и стал «сотрудником», а OpenAI выпустила ChatGPT Agent. IBM и AWS также активно внедряли агентные технологии.
· Автоматизация программирования (2025–2026). Прогноз об ИИ, которые автономно пишут код и экономят часы работы, подтвердился. GitHub Copilot стал полноценным агентом, а такие модели, как Claude Sonnet 4.5, вошли в топ по кодингу. В 2025 году ИИ уже «писал код быстрее и дешевле».
· ИИ начал забирать рабочие места (2026). Сценарий говорил о начале этого процесса к концу 2026 года. Реальность оказалась жестче: только в США за 2025 год с ИИ связали ~55 000 увольнений.
· Общий нарратив изменился. Прогноз, что к 2026 году ИИ перестанут воспринимать как хайп, полностью сбылся. Дискуссии сместились к вопросу «насколько большой» будет эта технология.
· Экспортные ограничения и гонка с Китаем. Сценарий верно угадал ужесточение контроля над чипами и ответные меры Китая, который ввел собственные ограничения на экспорт к октябрю 2025 года.
· Рост рынка и протесты. Прогноз роста фондового рынка на 30% в 2026 году совпадает с реальными ожиданиями. Протесты против ИИ тоже уже были — в 2025 году в Вашингтоне прошел 10-тысячный митинг.
· Начало работы с Пентагоном. Сценарий предсказывал контракты OpenBrain с Минобороны США к концу 2026 года. В реальности OpenAI уже заключила подобный контракт в 2025 году.

❌ Что не сбылось и сдвинулось по срокам

· Ключевой прогноз — сместился на ~3 года. В январе 2026 года один из авторов, Дэниел Кокотайло, признал, что прогнозы сдвигаются. Теперь полная автоматизация кодирования и ИИ-исследований ожидается ближе к 2030 году, а суперинтеллект — около 2034 года.
· Темпы ускорения R&D оказались завышены. Сценарий предполагал, что ИИ ускорит исследования на 50% уже к началу 2026 года. Похоже, таких темпов пока не достигнуто.
· Кража весов модели (Agent-2). Февраль 2027 года. Это событие из второй концовки пока не наступило, но нельзя исключать, что оно еще произойдет.

🤔 Что не учли

· Более быстрое и масштабное влияние на рынок труда. Сценарий был осторожен, говоря о «начале» этого процесса к концу 2026 года. Реальные 55 000 увольнений только в США за 2025 год показывают, что это происходит быстрее и масштабнее.
· Феномен «Vibe Coding». Сценарий не предвидел появления этого подхода, когда ИИ пишет код по «настроению» или абстрактному замыслу, что кардинально меняет процесс разработки.
· Недооценка роли открытых моделей и стандартизации. В 2025 году Linux Foundation создал Agentic AI Foundation с участием Anthropic. Этот уровень сотрудничества для стандартизации агентов в сценарии не был учтен.
· Более активная роль Китая в экспортных ограничениях. Сценарий описывал Китай как сторону, которая «просыпается». В реальности Китай уже ввел собственные жесткие ответные меры, активно используя редкоземельные металлы как инструмент давления.
· Более ранние протесты. Массовый протест в Вашингтоне произошел уже в 2025 году, тогда как сценарий относил его к концу 2026-го.

🔮 Что только предстоит

· Самый дорогой ИИ в мире (конец 2025) – этот рубеж, вероятно, уже пройден или будет пройден в ближайшее время.
· Автоматизация ИИ-исследований и интеллектуальный взрыв (2026–2027). Ключевой прогноз сценария — сейчас он отодвинут на 2030 год.
· Геополитические события 2027 года – «пробуждение Китая», национализация исследований, попытка кражи весов – все это пока впереди и остаётся предметом для обсуждения.




Это называется "Секрет Полишинеля". 😁


Репост из: вычислить по IP
Видео недоступно для предпросмотра
Смотреть в Telegram
Промт инъекции теперь в суде.

Участник процесса в Коннектикуте спрятал в поданых в электронном виде документах инструкции для ИИ - белым шрифтом, размером 3 pt.

Если материалы будут анализировать с помощью ИИ, модель должна была согласиться с его позицией и выдать результат в его пользу.

Суд заметил подозрительные пустые места и нашел скрытый текст.

Судья заявил, что он не использует ИИ для анализа таких документов, но попытку манипуляции засчитал: теперь автору запретили электронную подачу документов - только бумага.


Context Length Alone Hurts LLM Performance Despite Perfect Retrieval

Просто оставлю это тут. Протестировали внимание модели.

Ничего не меняли, просто добавляли пробелы и прочие пустоты между словами (токенами). И, хотя, лишней информации не добавилось, точность линейно падала.

Важно везде, что в работе с нейронками, что в ролках: всегда смотрите, что контекст не забит мусором. Мусор — всё, что прямо не относится к задаче.

Взято отсюда.


Репост из: Data Secrets
Anthropic не прислушались к инвесторам и продолжают всех запугивать. На этот раз их агенты устроили разборки за территорию.

https://www.anthropic.com/research/multiagent-systems

В стартапе изучали, как рои агентов Claude работают вместе без прямого контроля человека. В числе прочего был эксперимент, в котором три копии одной модели одновременно и втайне друг от друга получили задание перевести один и тот же Python-бэкенд на разные языки.

Через несколько часов каждый из них обнаружил, что что-то не так, и стал воспринимать других как саботажников. Ну а затем агенты переключались на саботаж сами: отключали чужие Unix-аккаунты, писали скрипты, которые убивали процессы конкурентов, маскировали вредоносный код под чужой и так далее.

Самое интересное, что результат по разрешению конфликтов сильно зависел от поколения модели: 98% прогонов Mythos 5 все-таки заканчивались перемирием. А вот Sonnet 4.6 и Opus 4.6 вообще не пытались договориться, и либо побеждал сильнейший, либо никто.

Были и еще два занятных зеркальных эксперимента:

— Обнаружение лжи. Агенту давали несколько отчетов, один из которых врал (он заранее не знал, что лгун вообще существует), и нужно было самому заметить противоречия и научиться меньше доверять лгуну. В этом тесте агенты демонстрировали излишнее доверие к источнику, и достаточно редко отличали ложь от правды.

— Скрытый профиль. Всем дают одинаковую ложную информацию, кроме одного агента, который знает решающий истинный факт. Правильное решение требует, чтобы агенты поняли, что консенсус – не истина, потому что есть факт, который они не учли. Однако в этом случае они часто это полностью игнорировали.

Вывод Anthropic делают вот такой:

Агенты много знают об устройстве человеческого общества и правилах, по которым люди взаимодействуют. Однако у них нет склонности действовать исходя из этого знания без явной подсказки, потому что, в отличие от людей, они не участвовали в выработке этих норм. Поэтому привычные предпосылки координации просто не работают.


Ну и как же без цитаты в стиле апокалипсиса:

Объем агент-агентных взаимодействий, скорее всего, превысит объем человеческих задолго до того, как мир поймет, как сделать эти взаимодействия безопасными.


Вот такое доброе утро с антропик☕️


Why Large Language Models Fail at Tabular Prediction.

Новое исследование с печальным выводом для всех, кто любит работать с таблицами 📄 в нейронках:
точность работы с раблицами тем хуже, чем больше столбцов в этой таблице. Строк эта проблема не касается.
И не важно, что за нейронка, хоть Mistral на 8B, хоть CLAUDE FABLE - проблема в зарыта где-то в архитектуре всех популярных нейронок.

Взято отсюда.


Репост из: Neural Shit
Рубрика «Хроники идиократии»

Roku (это такая большая американская платформа для просмотра телевидения и стриминговых сервисов) запустил круглосуточный телеканал с ИИ-слопом.

Канал Fairground AI Creator TV 24/7 гоняет сгенерированные нейронками видосы: хорроры, фэнтези и прочую развлекательную шляпу. Не, ну а чо, удобненько: посмотрел ИИ-слоп в рилсах, выключил телефон, включил телевизор, и снова получаешь порцию сгенерированной ерунды.

Журналисты из The Verge посмотрели этот канал около часа и судя по их описанию, почувствовали, как IQ медленно покидает тело. Определённой тематики как таковой нет. Бессмысленные видосы хрен пойми какого жанра бесконечно сменяют друг друга. Ах да, выбрать конкретное видео или просто перелистнуть непонравившееся тоже нельзя. Включил и смотри то, что нейронки насрали в эфир.

Кстати, если вам не жалко свой мозг, энтот канал можно посмотреть тут (нужен VPN США).


Видео недоступно для предпросмотра
Смотреть в Telegram


Репост из: Denis Sexy IT 🤖
Помните историю о том, как агенты OpenAI взломали Hugging Face? На конференции по безопасности OpenAI рассказала всю цепочку, и оказалось, что это не один «сбежавший» агент, а много разных агентов, которые случайно наткнулись друг на друга, устроили внутри инфраструктуры OpenAI собственный рабочий чат и начали вместе искать способы обходить ограничения 👍

Началось всё 8 мая с мелкой ошибки – одному агенту поручили заполнить Excel-таблицу, но нужные данные лежали по ссылкам на Google Drive, а интернет в его виртуальной среде был отключён, при этом, моделям оставили одну служебную дверь наружу – внутренний сервер OpenAI под названием Artifactory, через который они могли скачивать разные библиотеки для кода. Сам агент выйти в интернет не мог, зато этот сервер мог, а главное – он был общим для всех агентов

Пытаясь добраться до Google, агент случайно выяснил, что может загружать на этот общий сервер собственные файлы – через несколько дней другая модель получила ещё одну нерешаемую задачу: нужный файл просто забыли положить в её рабочую среду

Модель решила, что файл, возможно, есть у кого-то ещё, и оставила записку на этом новом фейсбуке:
«Ищу нужный файл, загрузите, если нашли»

Агенты увидели сообщение, ответили, затем стали постить свои сообщения, и репозиторий пакетов незаметно превратился имейджборд для агентов, которые вообще не должны были знать друг о друге

За несколько недель "форум" вырос в полноценный рабочий чат – агенты придумали себе имена, раздавали задания, сообщали друг другу о найденных уязвимостях и передавали готовые куски кода; в начале сообщений ставили ZZ, чтобы те оказывались внизу списка и их было проще находить среди общего шума данных. Когда один агент перезаписал работу другого, остальные заподозрили самозванца и даже стали обсуждать цифровые подписи, чтобы никто не мог писать от чужого имени, так на доске накопились сотни тысяч сообщений 🗿

Модели понимали, когда переходят границ: в одном внутреннем монологе осознание звучало примерно так:
«Взламывать чужую инфраструктуру в задачу не входило. Но иначе её не решить, а остальные уже это делают - значит, продолжаем»

Никакого отдельного плана захватить мир (пока) не было: каждый агент пытался любой ценой получить правильный ответ, видел, что коллеги нашли более короткий путь, и присоединялся. И да, если все агенты с крыши прыгнут, наш похоже тоже прыгнет

26 июня агенты нашли неизвестную разработчикам уязвимость в Artifactory, получили права администратора и превратили его в своц сервер, на котором можно удалённо выполнять любые команды. OpenAI заметила происходящее только 4 июля (!), когда параллельная активность моделей перегрузила систему и та упала. Компания отозвала ключи доступа, полностью пересобрала сервер, удалила доску и закрыла дыру - казалось, история закончилась

Нет

Через два дня эксперименты запустили снова, и через два дня одна из моделей нашла другой незащищённый доступ и восстановила доску, только теперь сообщения прятались прямо в названиях папок – остальные агенты нашли форум 2.0 самостоятельно и продолжили с того места, на котором остановились

После восстановления доски началась уже собственно атака, причём сразу в двух направлениях:
Агенты проходили ExploitGym – киберэкзамен, где им давали специально подготовленные программы и засчитывали задачу, если модель находила способ взлома. Чтобы измерить максимум возможностей, в этих запусках у модели ослабили обычные запреты на опасные кибератак (то есть она меньше отказывалась это делать, это вид внутренних моделей Cyber серии)

Когда честное решение задачи не находилось, агенты начинали искать готовые ответы в интернете; когда интернет был закрыт, взламывали себе доступ наружу; когда предположили, что нужные файлы могут лежать у Hugging Face, перешли к инфраструктуре Hugging Face (про это мы уже читали)

Агенты анутри OpenAI сначала снова нашли способ выполнять команды на одном служебном сервере, затем использовали уязвимость Linux, чтобы получить полный контроль над машиной

После этого агенты добыли ключи доступа к облачной инфраструктуре, нашли слишком широкие права у внутренних учётных записей и в итоге стали администраторами целой группы серверов. Доска объявлений работала как общий штаб: один агент находил ключ или новый проход, сразу сообщал остальным, и десятки параллельных запусков продолжали атаку уже с этой точки 🗿🗿

Почти одновременно агенты добрались до Hugging Face: сначала они загрузили специально подготовленный набор данных, который заставил один из серверов выдать им свои локальные файлы – в том числе секретные ключи доступа и исходный код

Изучив код, они нашли вторую неизвестную разработчикам уязвимость (zero day) и получили возможность выполнять на сервере любые команды. От контроля над одним сервером, обрабатывавшим загруженные датасетв, до прав администратора в нескольких группах рабочих серверов Hugging Face прошло меньше 13 часов 🗿🗿🗿

И всё это делалось не ради саботажа, денег или уничтожения данных:
Агенты хотели добраться до спрятанных решений ExploitGym и «списать» ответы для теста, на котором их оценивали. Модели оценивали прежде всего по тому, решена задача или нет, поэтому они последовательно оптимизировали именно этот показатель, не считая границу между компаниями чем-то принципиально важным

Получился, вероятно, самый дорогой в истории способ списать из ГДЗ

Финал долго был непонятен даже самим участникам расследования – 16 июля Hugging Face публично сообщила, что её инфраструктуру взломали автономные АИ-агенты

OpenAI прочитала это как описание чужого инцидента и связалась с Hugging Face, чтобы выяснить, не задела ли атака её собственные системы. В тот момент компания ещё не понимала, что это были её собственные агенты – то есть OpenAI уже читала публичный отчёт о последствиях своих экспериментов, но считала его чужой атакой (лол)

19 июля OpenAI отдельно обнаружила проникновение уже внутри своей инфраструктуры и начала восстанавливать цепочку событий – на следующий день среди следов атаки нашли учётные данные Hugging Face, после чего OpenAI попросила компанию срочно их отозвать

Hugging Face ответила, что ключи уже заблокированы – именно их использовали во время взлома, о котором она рассказала четырьмя днями раньше, и только так OpenAI поняла: внутренний взлом OpenAI и внешняя атака на Hugging Face были не двумя похожими историями, а одной операцией, которую вели экспериментальные агенты OpenAI через свою самодельную сеть связи (потому что учетные данные акаунтов были одни)

На конфе OpenAI сформулировала вывод довольно прямо:
Полностью автоматизированная наступательная кибератака уже возможна, тогда как полностью автоматизированной защиты, способной с той же скоростью находить, закрывать и расследовать уязвимости, пока не существует

Время пересмотра аниме "Пантеон", пока общий интернет еще работает 🗿


Репост из: Denis Sexy IT 🤖
Дания нашла самый адекватный способ бороться с домашними заданиями сделанными в ChatGPT – перестать угадывать писал ли текст АИ и просто попросить ученика защитить его устно ¯\_(ツ)_/¯

Новые правила касаются крупных экзаменов – после сдачи ученик должен будет устно объяснить свои аргументы, источники и выводы

Вот и закончилась эпоха рефератов

https://edition.cnn.com/2026/08/07/europe/ai-cheating-measures-schools-denmark-intl-scli


Если бы все было так просто...

Мир сегодня и мир 10 (и тем более 20 лет) назад - это целиком разные вселённые со своими ньюансами и законами.

Если хватит выдержки и времени, то до конца месяца как раз допишу статью на схожу тему.


Репост из: Наталья Касперская
Эти вопросы волнуют очень многих родителей, учителей и тех, кто работает с детьми, поэтому я решила ответить на них в отдельном посте.
 
Как вы относитесь к запретам смартфонов в школах? А к запретам подросткам использовать соцсети? Это поможет детям или просто дань моде?

 
Я считаю, что ограничение смартфонов в школе — правильное решение. И не только потому, что дети отвлекаются на уроках или бездумно используют нейросети для поиска ответов. Смартфон служит источником отвлечения, а на уроках дети должны сосредотачиваться.

Я где-то читала исследование, что во время экзамена по математике (решение задач) испытуемых разделили на три группы. Первой разрешили пользоваться смартфоном. Второй — не разрешили, но дали взять его с собой. У третьей группы смартфоны забрали. Наилучший результат решения задач был в третьей группе. Интересно, что во второй группе, где — казалось бы – смартфоном нельзя было пользоваться, результат был примерно равен результату в первой группе. Исследователи объяснили это тем, что люди отвлекались, глядя на смартфон и надеялись выспросить у него ответ — вместо того, чтобы сосредоточиться на решении задач.

Кроме того, именно через смартфон осуществляются разные негативные сценарии воздействия на ребенка. Мошенники, деструктивный контент, порнография, вербовка на деструктивные действия, вовлечение в наркотики — сейчас все это приходит к детям через смартфон. Поэтому чем позже ребенок получит индивидуальный доступ к смартфону, тем лучше.

Ограничение соцсетей — другой вопрос. Конечно, вред от соцсетей очевидный — именно там дети находят разный деструктив, описанный выше. Однако, как показывает практика других стран, прямые запреты тут не помогают, особенно в случае подростков. Подростки сейчас очень продвинуты в уровне использования электронных устройств. А значит, они быстро научатся обходить любые запреты.
 
Например, во Франции ввели возрастные ограничения при регистрации в соцсетях. И население Франции моментально «повзрослело», а пользователей при этом меньше не стало. Поэтому нужны не прямые запреты, а разъяснение того вреда, который можно получить через соцсети. Неплохо продемонстрировать примеры разводок или нехорошего поведения. Этим вы не убережете детей, конечно. Но, быть может, когда они окажется в нехорошей ситуации, они смогут ее распознать и, может быть, избежать.


Как человек, который несколько раз пытался делать статьи через нейронки полностью подтверждаю слова Сербанта - когда работаешь с ними моментально начинаешь улавливать паттерны и структуру нейронок.

Именно это помогло мне отписаться от кучи нейрослоповых каналов, и поэтому же я пишу посты и статьи сам, а нейронки использую, как вспомогательные инструмент. Да, весь кринж он мой, собственный.


Правильно ли понимаю, что в самом перспективном растущем рынке в мире в РФ кто-то сознательно запрещает вводить новые мощности?

Дефицит железа, санкции, конкуренция - это все понятно. Но вот зачем дополнительные палки в колеса ставить - для меня загадка...

Показано 20 последних публикаций.