Ai First


Гео и язык канала: Весь мир, Русский
Категория: Технологии


Новости ИИ: что вышло, кому полезно и чего пока не доказали. Модели, агенты и автоматизация — с источниками и ограничениями. Видео: youtube.com/@AIFIRSTING

Связанные каналы

Гео и язык канала
Весь мир, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Триллион параметров не означает, что Mistral Large 4 тратит триллион параметров на каждый токен. В этом и состоит главный фокус новой мультимодальной MoE-модели Mistral AI: из 1,05 трлн параметров активны примерно 49 млрд — около 4,7%. Остальные эксперты в конкретный момент не вычисляют ответ, но всё равно должны помещаться в память. Поэтому для запуска важен не только «активный» размер, а весь объём модели.

Такая архитектура позволяет заявлять цену $1,36 за 1 млн входных токенов и $4,18 за 1 млн выходных. При этом у модели есть нативный ввод изображений и контекст до 1 млн токенов — уже не просто языковая модель, а универсальный интерфейс для больших документов и визуальных данных.

По опубликованным результатам, Mistral Large 4 набрала 93% на Cybench, 82% на CyberGym-E2E и 61,7% на DeepSWE v1.1. Модель обучали с нуля на 3800 GPU NVIDIA Grace Blackwell в европейских дата-центрах Mistral. Полный разбор релиза также сравнивает её с другими крупными моделями.

Проверить Mistral Large 4 можно уже сейчас через API под именем mistral-large-4. А открытые веса обещают выпустить в конце октября 2026 года — и тогда главным вопросом станет не только качество, но и железо, способное вместить все 1,05 трлн параметров.

Источник: Mistral AI Releases Mistral Large 4 (Le Chonk): A 1.05T Parameter Multimodal MoE Model




1 трлн параметров — впечатляющая цифра, но в Mistral Large 4 важнее другое: из этого объёма активны 49 млрд. Я бы читал релиз не как гонку за самым большим числом, а как ставку на открытую мультимодальную модель европейского происхождения. 🇪🇺

Mistral Large 4, которую уже окрестили Le Chonk, умеет работать с текстом и изображениями. Модель обучали на 3800 системах Grace Blackwell в дата-центре самой Mistral. Компания заявляет лидерство среди моделей с открытыми весами из США и Европы, сильные результаты в киберзащите, промышленности и финансах, а также превосходство над закрытыми флагманами в visual grounding — определении нужного объекта или участка изображения по текстовому описанию. Подробности есть в анонсе Mistral.

Но громкие формулировки стоит пока держать на расстоянии. По одному из доступных разборов, на большинстве бенчмарков модель немного уступает лучшим открытым системам, хотя и находится с ними в одной лиге. API уже доступен в превью: $1.36/$4.18 за миллион токенов, первые две недели действует скидка 50%. Открытые веса обещают к концу октября, а обучение с подкреплением ещё продолжается.

Мой вывод простой: настоящий тест Large 4 начнётся не с цифры «триллион», а с момента публикации весов. Тогда станет понятно, насколько эта европейская ставка действительно открытая и полезная за пределами облака Mistral.

Источник: Mistral’s new 1T model aims to leapfrog closed and open rivals




8 ГБ видеопамяти больше не выглядят стоп-сигналом для локальной генерации видео. Разработчики выпустили опенсорсный проект для запуска MiniMax H3 на домашнем ПК: достаточно GPU с 8 ГБ VRAM и 16 ГБ оперативной памяти. Модель подстраивается под железо и подгружает свои части по мере необходимости — примерно как фильм, который не скачивают целиком, а проигрывают фрагментами.

Работает всё внутри ComfyUI. На вход можно подать текст, первый и последний кадры, изображения, видео и аудио — то есть генерация рассчитана не только на запрос «сделай ролик», но и на более управляемый монтаж из референсов. Поддерживаются и NSFW-лоры 😋

Но за доступность придётся платить временем: по замерам авторов, десятисекундный ролик в разрешении 1344 × 768 на RTX 4060 Ti с 16 ГБ памяти создаётся около девяти минут. Это не инструмент для поточного продакшена, а способ попробовать мощную модель без дорогой видеокарты и облачной аренды. Подробности и запуск — по ссылке.


Чат-бот — не личный дневник, даже если выглядит именно так. Это показал случай во Флориде: автоматические фильтры Anthropic обнаружили в переписке угрозы устроить стрельбу в офисе шерифа и упоминание покупки оружия. Сессию передали на ручную проверку команде Safeguards Team, а затем компания передала логи правоохранителям.

Задержанная заявила, что считала бота личным дневником и не ожидала стороннего контроля. Но у провайдера другая логика: диалог проходит семантический анализ, а при угрозе жизни действует процедура экстренного раскрытия данных. В этом случае материалы ушли полиции без стандартной судебной процедуры.

Практический вывод простой: всё, что вы пишете в публичном ИИ-сервисе, стоит воспринимать как данные компании, а не как содержимое закрытого блокнота. Если фильтр сочтёт формулировки угрозой, «приватный» разговор может стать материалом для расследования. 🔎


Главное в Beam — не цифра 501 млрд параметров. Важнее то, как эта цифра устроена.

Reflection AI представила Beam — разреженную MoE-модель с 501 млрд параметров, из которых при обработке запроса активны 23 млрд. Проще говоря, это не «гигант», который каждый раз целиком работает над ответом: система подключает только нужные экспертные блоки. Поэтому размер модели и реальные затраты на один запрос — не одно и то же.

Beam нацелен прежде всего на программирование и агентные задачи, где модель должна не только отвечать, но и выполнять цепочку действий. Reflection заявляет, что по уровню рассуждений модель сопоставима с GLM-5.2, используя в 3–4 раза меньше вычислительных ресурсов на инференс. Пока это именно заявление разработчика, а не независимое подтверждение.

Смысл проекта шире очередной модели: Reflection хочет продавать компаниям и государствам локальные «ИИ-фабрики» — системы, которые можно дообучать на собственных данных. Ключевая проверка Beam впереди: веса под лицензией Apache 2.0 обещают открыть позже в октябре 2026 года. Тогда станет видно, насколько заявленная эффективность переносится из презентации в реальную эксплуатацию.

Источник: Reflection AI Introduces Beam: A 501B Open-Weight MoE Model With 23B Active Parameters for Coding and Agentic Workloads




Невидимый водяной знак — это не печать «написано ИИ». OpenAI внедряет в ответы ChatGPT и Codex машинно-читаемую метку, которую человек не увидит. На первом этапе функция появится у пользователей в Евросоюзе — компания таким образом выполняет требования европейского AI Act.

Технология называется textGrain. По заявлению OpenAI, она не уступает, а по некоторым параметрам превосходит решения вроде SynthID от Google DeepMind. При этом тесты на ИИ-бенчмарках показали схожие результаты для маркированного и обычного текста: водяной знак не должен заметно менять качество ответа.

Но здесь важна оговорка: метка — это сигнал для проверки, а не безошибочный детектор авторства. Сам факт её наличия не доказывает, кто именно написал текст и не превращает проверку в магическую кнопку «узнать за секунду». Anthropic уже пошла по похожему пути, также связывая решение с требованиями ЕС.

Подробности — у The Verge. Пока практический вывод простой: если аккаунт относится к ЕС, ответы ChatGPT и Codex могут начать содержать скрытую метку; для остальных регионов OpenAI внедрение пока не заявляла.

Источник: OpenAI is adding text watermarking in ChatGPT and Codex




$500 в месяц — это уже не цена чат-бота, а ставка на постоянного ИИ-исполнителя.

На DevDay OpenAI представила сразу три элемента этой модели: GPT-6.1 Sol, постоянно работающих агентов dots и подписку Pro за $500 с Astra Ultrafast. Важнее всего здесь не отдельное название новой модели, а связка: мощный LLM, агент, который не заканчивает работу вместе с закрытием чата, и дорогой тариф вокруг этого сценария.

Для меня это главный сигнал мероприятия: OpenAI пытается продавать уже не «доступ к ответам», а непрерывное выполнение задач. Но цена резко поднимает планку ожиданий. При $500 в месяц пользователю нужно понимать не только, насколько хорош GPT-6.1 Sol, но и что именно агент делает самостоятельно и какую пользу приносит постоянный режим.

Пока из анонса известны продукты и цена, а не подробности практической отдачи. Поэтому главный вопрос к DevDay — не «насколько умнее новая модель», а оправдает ли постоянная работа агентов такой тариф. Подробности — в недельном дайджесте.


Безопасность роботов хотят проверять на цифровых людях — и это разумнее, чем ждать встречи с настоящими. 🤖

Именно этим занимается Safeworld: компания строит цифровых людей, чтобы убедиться, что роботы с генеративным ИИ не причинят вреда реальным людям. Подробнее о подходе Safeworld — пока это скорее попытка создать слой проверки между разработкой робота и его контактом с человеком.

Идея понятна: цифровой человек становится своеобразным манекеном для краш-тестов. На нём можно заранее искать опасные сценарии, не подвергая риску людей. Но важна оговорка: наличие цифровых моделей само по себе ещё не доказывает безопасность робота. Нужно показать, насколько хорошо такая проверка отражает поведение реальных людей и реальные ситуации.

Поэтому я бы смотрел не на эффектность «цифровых людей», а на доказательства их пользы. Safeworld предстоит убедить не только роботов, но и людей — что виртуальная проверка действительно снижает риск для настоящих.

Источник: Can Safeworld convince people that gen AI robots won’t hurt them?




Самое важное в Sona — не слово «генеративный», а отказ от каскада. Yandex представил модель, которая в рекомендациях Yandex Music сама выполняет сразу две ключевые задачи: формирует список кандидатов и ранжирует его. Вместо цепочки отдельных этапов — один трансформер, принимающий решение целиком. 🎵

Причём Sona работала без заранее сконструированных признаков. Это важная архитектурная перемена: систему не нужно вручную «собирать» из множества специализированных деталей, если одна модель способна связать выбор трека и порядок выдачи в едином процессе.

В A/B-тесте Yandex Music такой подход дал рост лайков на 11,42%. Но это именно результат конкретного эксперимента, а не универсальная гарантия для любых рекомендаций. Тем не менее направление очевидно: будущее рекомендателей может принадлежать не длинным каскадам, а моделям, которые генерируют итоговый выбор целиком.

Источник: Yandex Introduces Sona: A Single Generative Recommender That Replaces Entire Recommendation Cascade


7 млрд → 2,4 трлн параметров за три года. Так выглядит траектория Qwen — семейства моделей Alibaba, которое началось с чат-бота по приглашениям в апреле 2023 года, а к августу 2026-го дошло до Qwen3.8-2.4T-A95B, крупнейшей открытой модели Qwen.

Но масштаб здесь — только самая заметная часть истории. В августе 2023 года Alibaba открыла веса первой модели Qwen-7B, затем добавила зрение, аудио, математику, кодинг и работу с изображениями. В 2024-м появились линейки от 0,5B до 110B, контекст 32K и MoE-модели; в 2025-м — гибридное «мышление», поддержка 119 языков, мультимодальность и модели для агентов. То есть Qwen рос не только «вверх», но и вширь: от одного семейства языковых моделей к целой платформе.

Именно поэтому полная история Qwen важнее простого списка релизов. Она показывает и обратную сторону роста: Alibaba постепенно уходит от полностью открытого подхода к двухуровневой стратегии лицензирования. Открытые веса — это уже не обязательно означает полностью открытый проект.

Следующий шаг пока обозначен осторожно: Qwen 4 находится в обучении, а Qwen 4.5 и Qwen 5 лишь прогнозируются на уровне 5–10 трлн параметров.

Источник: The Story of Qwen: Alibaba’s AI Models From 7B to 2.4T




$100 млн — на подготовку 10 000 инженеров ИИ. Но Anthropic запускает не очередную школу для новичков. Компания будет переучивать уже работающих инженеров из Accenture, Bain, Capgemini, Commonwealth Bank of Australia, Deloitte, McKinsey, Morgan Stanley и Novo Nordisk.

В этом и есть главный смысл Claude Frontier Academy: Anthropic пытается закрыть не дефицит знаний о моделях, а дефицит людей, способных встроить их в реальный бизнес. Такие специалисты должны понимать, как устроена компания, и одновременно владеть Claude на уровне сотрудников самой Anthropic. Выпускники получат статус Claude Resident Engineer, а работать будут как Frontier Deployed Engineers. Первая когорта завершит обучение к концу следующего года.

Показательно, что университеты в этой схеме вообще не фигурируют. Сигнал простой: для сложной ИИ-трансформации нужны не абстрактные «кадры будущего», а опытные инженеры, уже знающие внутреннюю механику крупных организаций. Anthropic инвестирует не только в обучение людей — она создает армию специалистов, которые будут распространять Claude по корпоративному рынку.




Главная цифра в истории Anthropic — не $2 трлн, а $42 млрд чистого убытка. Именно с таким результатом компания, по данным источников WSJ, планирует выйти на IPO уже в ноябре 2026 года. 🧮

Масштаб ожиданий впечатляет: в 2025 году Anthropic получила $4,6 млрд выручки — в 11,5 раза больше, чем годом ранее. Некоторые инвесторы уже закладывают $320 млрд выручки к концу 2027-го и считают, что оценка в $2 трлн может оказаться не пределом. В более смелом сценарии оценка может приблизиться к $4,5–5 трлн, если компания займёт хотя бы небольшую долю потенциального рынка корпоративного ИИ.

Но здесь важно не перепутать размер рынка с размером бизнеса. Потенциальный рынок в десятки триллионов долларов — это не деньги на счёте Anthropic, а прогноз того, сколько вообще можно было бы заработать при удачном развитии событий. Истории Uber и WeWork уже показывали, что огромная возможность не гарантирует огромную прибыль.

Поэтому перед IPO я бы смотрел не на красивые оценки рынка, а на то, сможет ли Anthropic превратить стремительный рост выручки в устойчивую экономику. Пока это история о колоссальных ожиданиях — и ещё более колоссальных расходах.



Показано 20 последних публикаций.