Ai First


Гео и язык канала: Весь мир, Русский
Категория: Технологии


Новости ИИ: что вышло, кому полезно и чего пока не доказали. Модели, агенты и автоматизация — с источниками и ограничениями. Видео: youtube.com/@AIFIRSTING

Связанные каналы

Гео и язык канала
Весь мир, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Невидимый водяной знак — это не печать «написано ИИ». OpenAI внедряет в ответы ChatGPT и Codex машинно-читаемую метку, которую человек не увидит. На первом этапе функция появится у пользователей в Евросоюзе — компания таким образом выполняет требования европейского AI Act.

Технология называется textGrain. По заявлению OpenAI, она не уступает, а по некоторым параметрам превосходит решения вроде SynthID от Google DeepMind. При этом тесты на ИИ-бенчмарках показали схожие результаты для маркированного и обычного текста: водяной знак не должен заметно менять качество ответа.

Но здесь важна оговорка: метка — это сигнал для проверки, а не безошибочный детектор авторства. Сам факт её наличия не доказывает, кто именно написал текст и не превращает проверку в магическую кнопку «узнать за секунду». Anthropic уже пошла по похожему пути, также связывая решение с требованиями ЕС.

Подробности — у The Verge. Пока практический вывод простой: если аккаунт относится к ЕС, ответы ChatGPT и Codex могут начать содержать скрытую метку; для остальных регионов OpenAI внедрение пока не заявляла.

Источник: OpenAI is adding text watermarking in ChatGPT and Codex




$500 в месяц — это уже не цена чат-бота, а ставка на постоянного ИИ-исполнителя.

На DevDay OpenAI представила сразу три элемента этой модели: GPT-6.1 Sol, постоянно работающих агентов dots и подписку Pro за $500 с Astra Ultrafast. Важнее всего здесь не отдельное название новой модели, а связка: мощный LLM, агент, который не заканчивает работу вместе с закрытием чата, и дорогой тариф вокруг этого сценария.

Для меня это главный сигнал мероприятия: OpenAI пытается продавать уже не «доступ к ответам», а непрерывное выполнение задач. Но цена резко поднимает планку ожиданий. При $500 в месяц пользователю нужно понимать не только, насколько хорош GPT-6.1 Sol, но и что именно агент делает самостоятельно и какую пользу приносит постоянный режим.

Пока из анонса известны продукты и цена, а не подробности практической отдачи. Поэтому главный вопрос к DevDay — не «насколько умнее новая модель», а оправдает ли постоянная работа агентов такой тариф. Подробности — в недельном дайджесте.


Безопасность роботов хотят проверять на цифровых людях — и это разумнее, чем ждать встречи с настоящими. 🤖

Именно этим занимается Safeworld: компания строит цифровых людей, чтобы убедиться, что роботы с генеративным ИИ не причинят вреда реальным людям. Подробнее о подходе Safeworld — пока это скорее попытка создать слой проверки между разработкой робота и его контактом с человеком.

Идея понятна: цифровой человек становится своеобразным манекеном для краш-тестов. На нём можно заранее искать опасные сценарии, не подвергая риску людей. Но важна оговорка: наличие цифровых моделей само по себе ещё не доказывает безопасность робота. Нужно показать, насколько хорошо такая проверка отражает поведение реальных людей и реальные ситуации.

Поэтому я бы смотрел не на эффектность «цифровых людей», а на доказательства их пользы. Safeworld предстоит убедить не только роботов, но и людей — что виртуальная проверка действительно снижает риск для настоящих.

Источник: Can Safeworld convince people that gen AI robots won’t hurt them?




Самое важное в Sona — не слово «генеративный», а отказ от каскада. Yandex представил модель, которая в рекомендациях Yandex Music сама выполняет сразу две ключевые задачи: формирует список кандидатов и ранжирует его. Вместо цепочки отдельных этапов — один трансформер, принимающий решение целиком. 🎵

Причём Sona работала без заранее сконструированных признаков. Это важная архитектурная перемена: систему не нужно вручную «собирать» из множества специализированных деталей, если одна модель способна связать выбор трека и порядок выдачи в едином процессе.

В A/B-тесте Yandex Music такой подход дал рост лайков на 11,42%. Но это именно результат конкретного эксперимента, а не универсальная гарантия для любых рекомендаций. Тем не менее направление очевидно: будущее рекомендателей может принадлежать не длинным каскадам, а моделям, которые генерируют итоговый выбор целиком.

Источник: Yandex Introduces Sona: A Single Generative Recommender That Replaces Entire Recommendation Cascade


7 млрд → 2,4 трлн параметров за три года. Так выглядит траектория Qwen — семейства моделей Alibaba, которое началось с чат-бота по приглашениям в апреле 2023 года, а к августу 2026-го дошло до Qwen3.8-2.4T-A95B, крупнейшей открытой модели Qwen.

Но масштаб здесь — только самая заметная часть истории. В августе 2023 года Alibaba открыла веса первой модели Qwen-7B, затем добавила зрение, аудио, математику, кодинг и работу с изображениями. В 2024-м появились линейки от 0,5B до 110B, контекст 32K и MoE-модели; в 2025-м — гибридное «мышление», поддержка 119 языков, мультимодальность и модели для агентов. То есть Qwen рос не только «вверх», но и вширь: от одного семейства языковых моделей к целой платформе.

Именно поэтому полная история Qwen важнее простого списка релизов. Она показывает и обратную сторону роста: Alibaba постепенно уходит от полностью открытого подхода к двухуровневой стратегии лицензирования. Открытые веса — это уже не обязательно означает полностью открытый проект.

Следующий шаг пока обозначен осторожно: Qwen 4 находится в обучении, а Qwen 4.5 и Qwen 5 лишь прогнозируются на уровне 5–10 трлн параметров.

Источник: The Story of Qwen: Alibaba’s AI Models From 7B to 2.4T




$100 млн — на подготовку 10 000 инженеров ИИ. Но Anthropic запускает не очередную школу для новичков. Компания будет переучивать уже работающих инженеров из Accenture, Bain, Capgemini, Commonwealth Bank of Australia, Deloitte, McKinsey, Morgan Stanley и Novo Nordisk.

В этом и есть главный смысл Claude Frontier Academy: Anthropic пытается закрыть не дефицит знаний о моделях, а дефицит людей, способных встроить их в реальный бизнес. Такие специалисты должны понимать, как устроена компания, и одновременно владеть Claude на уровне сотрудников самой Anthropic. Выпускники получат статус Claude Resident Engineer, а работать будут как Frontier Deployed Engineers. Первая когорта завершит обучение к концу следующего года.

Показательно, что университеты в этой схеме вообще не фигурируют. Сигнал простой: для сложной ИИ-трансформации нужны не абстрактные «кадры будущего», а опытные инженеры, уже знающие внутреннюю механику крупных организаций. Anthropic инвестирует не только в обучение людей — она создает армию специалистов, которые будут распространять Claude по корпоративному рынку.




Главная цифра в истории Anthropic — не $2 трлн, а $42 млрд чистого убытка. Именно с таким результатом компания, по данным источников WSJ, планирует выйти на IPO уже в ноябре 2026 года. 🧮

Масштаб ожиданий впечатляет: в 2025 году Anthropic получила $4,6 млрд выручки — в 11,5 раза больше, чем годом ранее. Некоторые инвесторы уже закладывают $320 млрд выручки к концу 2027-го и считают, что оценка в $2 трлн может оказаться не пределом. В более смелом сценарии оценка может приблизиться к $4,5–5 трлн, если компания займёт хотя бы небольшую долю потенциального рынка корпоративного ИИ.

Но здесь важно не перепутать размер рынка с размером бизнеса. Потенциальный рынок в десятки триллионов долларов — это не деньги на счёте Anthropic, а прогноз того, сколько вообще можно было бы заработать при удачном развитии событий. Истории Uber и WeWork уже показывали, что огромная возможность не гарантирует огромную прибыль.

Поэтому перед IPO я бы смотрел не на красивые оценки рынка, а на то, сможет ли Anthropic превратить стремительный рост выручки в устойчивую экономику. Пока это история о колоссальных ожиданиях — и ещё более колоссальных расходах.




Главное в Muse Gadgets — не новый чат-бот, а попытка Meta* переселить ИИ-агента из экрана в самодельную электронику. Компания открыла SDK Muse Gadgets с исходным кодом для устройств на ESP32 и Linux, включая Raspberry Pi. К агенту можно подключать дисплеи, кнопки и сенсоры — и собирать гаджеты, которые реагируют на команды и управляют устройством.

В примерах Meta — E-Ink-экран с новостями и напоминаниями, HDMI-хаб для телевизора и голосовой настольный помощник. Сама компания собрала Muse Home Link — небольшое USB-C-устройство для управления умным домом. Иными словами, ИИ здесь становится не приложением, а «мозгом» для набора обычных компонентов. 🔌

Но открытость проекта означает и перенос рисков на разработчика. Meta* прямо предупреждает: SDK экспериментальный, стабильность и техподдержка не гарантируются, а неудачный эксперимент может «окирпичить» плату или лишить её гарантии. Первые 5000 Muse Home Link бесплатно получат подписчики Muse в США.

Мой вывод простой: это интересный конструктор для энтузиастов, но пока не готовая платформа для повседневной техники. Перед сборкой стоит помнить не только о возможностях агента, но и о цене ошибки.




Главное здесь — не обещание приватности, а возможность её проверить. Google перенёс вычисление градиентов из телефонов в аттестованные серверные TEE — защищённые области, состояние которых можно подтвердить. Но одной аппаратной защиты мало: пользователю всё равно приходится верить, что сервер запускает именно нужный код и соблюдает заявленные ограничения.

Поэтому система связывает техническую защиту с публичным контролем. Политики доступа публикуются в журнале Sigstore Rekor, а бинарные файлы можно воспроизводимо собрать и сравнить с теми, что работают на серверах. Благодаря этому применение центральной дифференциальной приватности можно проверять извне, а не принимать на веру как строчку в пресс-релизе. Подробности Google описывает в материале о системе для Gboard.

Практический результат уже есть: Gboard использует этот подход для предсказания следующего слова на английском и японском языках. Важный сдвиг — приватность превращается из обещания компании в проверяемую процедуру. Пока подтверждена именно такая область применения, и за расширением на другие языки и задачи стоит следить отдельно. 🔐

Источник: Google Research Moves Federated Learning Into TEEs: Gboard Now Trains With Externally Verifiable Differential Privacy




Главная новость в Kolibri — не цифра 78,1 млрд параметров, а то, что на каждый токен модель активирует только 3,46 млрд. Это Mixture-of-Experts: внутри большая система, но при каждом обращении работает лишь нужная часть — как склад, где не открывают все секции ради одной коробки.

Aleph Alpha выпустила Kolibri как модель с открытыми весами для английского и немецкого языков. У неё контекст до 1 млн токенов и настраиваемый для каждого запроса уровень усилий на рассуждение. Это важнее красивого общего числа параметров: разработчик получает возможность выбирать, сколько вычислений тратить на конкретную задачу.

Но есть существенная оговорка: Apache 2.0 распространяются FP8-веса, а запуск заявлен на одном ускорителе B200 или H200. То есть Kolibri выглядит не как модель «для любого ноутбука», а как попытка уместить очень большую общую ёмкость в более экономный режим обработки.

Мой вывод: смотреть на Kolibri нужно прежде всего как на эксперимент с архитектурой — 78,1 млрд параметров без необходимости активировать их все сразу. Реальную ценность покажут уже не размеры, а качество на английском и немецком и стоимость запуска в этих условиях.

Источник: Aleph Alpha Releases Kolibri: A 78.1B Open-Weight English-German MoE Model With Only 3.46B Active Parameters




Runway показала не новый интерфейс, а попытку генерировать сам экран на лету. В Project Continuum отдельные области ОС создаются видеомоделью в реальном времени и реагируют на клики, перетаскивание и изменение размера окна. В демонстрации Runway это выглядит как оболочка, где интерфейс не столько открывается, сколько каждый раз достраивается под действие пользователя.

На базе Solaris компания показала четыре сценария: анимированные «порталы» поверх веб-страницы, видеоинтерфейсы, меняющие композицию при изменении окна, интерактивные миры для перемещения внутри картинки или клипа и визуальное отображение шагов ИИ-агента. Solaris получает действия пользователя как условие и предсказывает следующий кадр; под капотом работает видеомодель Gen-4.5, где новый кадр зависит от предыдущих.

Но пока это именно демонстрация, а не продукт. Runway признаёт проблемы с отрисовкой текста, связностью долгих сессий и доступностью для программ экранного доступа. У Continuum нет API, SDK, цен и сроков выпуска. Поэтому главный вопрос сейчас не в том, насколько эффектно выглядит такой интерфейс, а в том, сможет ли он оставаться точным, стабильным и доступным за пределами короткого ролика. 🔍



Показано 20 последних публикаций.