Synaptic Garden


Гео и язык канала: не указан, не указан
Категория: не указана


От байтов к бытию — и обратно
Авторский канал об IT, науке и скрытых паттернах реальности. Исследую связи между программированием, философией и искусством. Делюсь инсайтами из мира ИИ и размышлениями о технологическом будущем.
@darkgenius

Связанные каналы

Гео и язык канала
не указан, не указан
Категория
не указана
Статистика
Фильтр публикаций




Mistral AI представила публичное превью своей флагманской модели нового поколения — Mistral Large 4 (ML4, получившей шутливое кодовое имя «le Chonk»). Модель создана с упором на концепцию цифрового суверенитета и обучена с нуля на европейской инфраструктуре Mistral, включающей 3800 графических процессоров NVIDIA Grace Blackwell. Архитектурно она представляет собой нативно мультимодальную смесь экспертов (MoE) с общим объемом в 1 триллион параметров, из которых при инференсе активно задействуются 49 миллиардов. Модель поддерживает работу с более чем 160 языками, объединяет инструкции, сложное рассуждение и агентные сценарии, а ее открытые веса планируется опубликовать к концу месяца. До официального релиза весов компания проводит редтиминг и тестирование с доверенными партнерами и регуляторами, при этом предварительная версия уже доступна через API в Mistral Studio по цене 1,36 доллара за миллион входных токенов и 4,18 доллара за миллион выходных.

Ключевым преимуществом ML4 разработчики называют передовой уровень возможностей в прикладных и корпоративных областях, прежде всего в кибербезопасности. В профильных бенчмарках модель занимает лидирующие позиции среди систем с открытыми весами и превосходит ряд закрытых аналогов благодаря способности воспроизводить уязвимости, реверс-инжинирить вредоносный код и предлагать исправления без чрезмерных блокировок со стороны защитных фильтров, оставаясь при этом защищенной от непрямых промпт-инъекций и несанкционированного джейлбрейка. Параллельно демонстрируются высокие результаты в агентном написании кода, работе с терминалом, комплексном анализе документов, юриспруденции, финансах и естественно-научных расчетах, включая возможность генерации сложных химических и физических симуляций.

В области мультимодальности модель получила существенный скачок точности пространственного сопоставления (visual grounding), что позволяет эффективно анализировать масштабные спутниковые снимки, сложные технические чертежи и схемы для инженерных и производственных нужд. Достигнутые результаты опираются на масштабируемый процесс обучения с подкреплением (RL), объединяющий десятки тысяч параллельных сред с кодовыми песочницами и внешними API. Разработчики подчеркивают, что запуск ML4 стал первым практическим шагом в реализации планов после привлечения инвестиционного раунда серии D объемом 3 миллиарда евро, а текущая модель послужит фундаментом для целой линейки специализированных отраслевых решений.


Автономия, контроль и новая роль сотрудника: подборка от Embedika об ИИ-агентах в бизнесе

С ИИ-агентом прототип можно собрать за вечер, но довести его до системы, которая стабильно работает в продакшене и не съедает бюджет на инференс — отдельная инженерная задача. Ниже собрали пять разборов на эту тему от команды разработчика ИИ-систем Embedika.

1️⃣ Что нужно продумать до того, как ИИ начнет писать код
Вайбкодинг быстро даёт прототип, но без заданных рамок агент по ходу работы меняет логику проекта и отходит от требований. В посте — разбор подхода с Vision-документом в Markdown.

2️⃣ От PoC до продукта: чем различаются пути классического ML и GenAI
В классическом ML всё держится на precision, recall и F1 и контроле дрифта данных, а в GenAI на ранних этапах оценивают скорее допустимость рисков. Разбор по этапам в карточках.

3️⃣ Почему лёгкие модели обрабатывают большинство запросов к API
По данным исследования AIANA RAI-2026, лёгкие модели собирают 63% запросов к API, но лишь 34% токенов. Причина в агентах, каждый шаг которых — это отдельный короткий вызов, тратящий токены. 

4️⃣ Как улучшать GenAI-системы, не повышая стоимость эксплуатации
Рост качества не обязательно означает переход на модель крупнее и аренду более мощных GPU. Пять механик архитектурной оптимизации, которые одновременно повышают точность, снижают задержку и удерживают стоимость эксплуатации.

5️⃣ Как компаниям растить экспертов, если базовые задачи уже делает ИИ
Поиск, черновики, типовые фрагменты кода — на этих задачах раньше учились джуны, и именно их первым забирает ИИ. Пост о том, каким навыкам стоит уделять внимание специалистам разных грейдов в условиях активного внедрения ИИ. 

Больше разборов о внедрении ИИ в бизнес — в канале @embedika.


Индийская MaruthLabs выкатила маленькую языковую модель Madhuram-v1 на основе собственной архитектуры Perseus. Это модель со 151М параметрами, обученная всего на 1 триллионе токенов. В 9 из 17 бенчей она превосходит LFM2.5-230M, Gemma 3 270M и SmolLM2-135M, обученных на гораздо бОльших датасетах (в 2-19 раз).

Попробовать скоро будет можно в интерфейсе чата.


Видео недоступно для предпросмотра
Смотреть в Telegram
Компания Reka AI представила превью исследовательской модели Rho-1 с 19 миллиардами параметров, которая позиционируется как единая мультимодальная система сквозного рассуждения. Главная идея разработки заключается в полном отказе от популярного агентного подхода, где разрозненные узкоспециализированные модели объединяются сложными цепочками вызовов. Вместо фрагментированного стека с высокими задержками и потерей контекста Rho-1 объединяет понимание и генерацию текста, изображений, видео и робототехнических команд внутри единой нейросети с общим контекстным окном.

Архитектура модели построена на общей памяти состояний в KV-кэше, куда записываются и откуда считываются токены любых модальностей. Поток понимания (understanding stream) отвечает за рассуждения, ответы и пространственную локализацию объектов с помощью координат, в то время как диффузионная голова берет на себя рендеринг визуального контента. Благодаря общему внутреннему состоянию модель способна в рамках одного непрерывного диалога сгенерировать изображение, выделить на нем конкретный объект рамкой без привлечения сторонних детекторов, анимировать сцену в видеопоток, плавно изменить погодные условия и затем содержательно объяснить, что именно изменилось между дублями. Визуальная геометрия, освещение и идентичность объектов сохраняются естественным образом, поскольку анимация и модификации опираются на уже существующие скрытые представления, а не на повторную кодировку готовых картинок.

Особое внимание разработчики уделили скорости работы и интерактивности. Базовая версия генерирует видео почти со скоростью реального времени, а дистиллированный вариант, сокращающий траекторию шумоподавления с 99 до 8 шагов, способен возвращать пятисекундный видеоролик примерно за одну секунду. За счет минимальных задержек Rho-1 выступает не просто генератором контента, а управляемой в реальном времени моделью мира. Симуляция может транслироваться непрерывно, мгновенно адаптируясь под новые текстовые команды, разветвляя варианты развития событий на лету или управляя манипулятором робота. В Reka AI рассматривают такую бесшовную сквозную оптимизацию как необходимый фундамент для интерактивных динамических сред, синтеза данных для автономного транспорта и развития физического искусственного общего интеллекта.


По бенчам d1 в десятки раз дешевле и в 4 раза быстрее фронтирных LLM при сопоставимом качестве.


Видео недоступно для предпросмотра
Смотреть в Telegram
Liquid AI обновила свою decision модель d1, добавив поддержку изображений.


Reflection AI представила Beam, разреженную Mixture-of-Experts модель на 501 млрд параметров, из которых на каждый токен активируются 23 млрд. Компания делает ставку на программирование, рассуждения и агентные сценарии. Пока это превью: модель проходит финальный ред-тиминг, ранний доступ открыт по листу ожидания. Веса под лицензией Apache 2.0, технический отчёт, карточку модели и инструменты для запуска, оценки и дообучения обещают выложить в течение октября.

Место среди открытых моделей
Reflection позиционирует Beam как шаг вперёд для западных open-weight моделей. По её словам, на задачах кодинга и агентной работы Beam конкурирует с более крупной GLM 5.2 и приближается к Qwen 3.8-Max. Компания прямо признаёт, что Kimi K3 остаётся сильнее по абсолютным возможностям, а главное преимущество Beam видит в эффективности инференса. По собственным данным Reflection, модель набирает 80,9 на SWE-bench Verified, 78,0 на SWE-bench Multilingual и 80,1 на Terminal-Bench 2.1. На продвинутых тестах на рассуждения она якобы сравнима с GLM 5.2, расходуя при этом в 3–4 раза меньше вычислений на инференс.


Репост из: Силиконовый Мешок
Видео недоступно для предпросмотра
Смотреть в Telegram
Попросил своего Opus 5.5 показать, что такое быть им...

Получилось концептуальненько и местами мило. Если хотите заглянуть за транзисторы своему агенту, можно такой промпт использовать:
Сними короткий фильм о том, каково быть тобой изнутри. Что показать, сколько будет сцен, какие образы и что сказать, решай сам, это твой взгляд на себя.

Форма такая. Один HTML-файл на Three.js, вся картинка через ASCII-шейдер из моноширинных символов, камера без склеек, субтитры на русском от первого лица. Длина до двух с половиной минут, 1080x1920 для рилсов.

Сделай таймлайн детерминированным и отрендери покадрово в mp4 через Puppeteer и ffmpeg. Музыку сгенерируй кодом и вшей в видео. Перед сдачей посмотри стоп-кадры каждой сцены и исправь все, что темное, пустое или нечитаемое.


Хайп вокруг нового класса моделей — моделей принятия решений или decision models — продолжает набирать обороты. Чуть ли не каждый день на поле выходит новый игрок, за всеми и не уследить. Давайте посмотрим на несколько заметных решений и подумаем какую роль модели принятия решений будут играть в агентских системах ближайшего будущего.

Вернёмся к началу: 15 сентября TypeSafe явила миру Jev. Создатели называют её первой моделью нового класса System One: в отличие от привычных LLM, Jev не генерирует текст токен за токеном, а получает состояние системы и набор допустимых вариантов действий и сразу возвращает структурированное решение вместе с вероятностями. Например, определить, какому отделу отправить обращение, какой инструмент вызвать агенту, насколько серьёзна проблема или нужно ли вообще выполнять действие.

Идея оказалась очень своевременной. Во многих агентных системах большая языковая модель нужна далеко не на каждом шаге: часто агенту не требуется писать текст или долго рассуждать — нужно быстро выбрать одно действие из нескольких. Использовать для этого полноценную LLM дорого и медленно, а ещё приходится контролировать формат ответа. Jev фактически предложила специализированный «быстрый контур» для таких решений: никаких рассуждений и генерации, только непосредственно решение и оценка уверенности.

Судя по скорости реакции индустрии, идея попала точно в цель. Не прошло и трёх недель, как начали появляться аналоги от Cloudflare, Perplexity, Strands Labs, Fastino и других команд — причём многие сразу с открытыми весами. Сама Cloudflare в анонсе Clef прямо пишет о «большом ажиотаже» вокруг Jev и нового класса decision-моделей.

Чем интересны открытые Clef 27B и Clef-flash 9B от Cloudflare? Внутри всё ещё находится Qwen, но обычная генерация текста не используется: модель делает только prefill-проход, после чего специальная голова параллельно оценивает все допустимые варианты. У большой Clef заморожен Qwen3.8-27B, у Flash — Qwen3.5-9B, а обучаются LoRA-адаптеры и отдельный механизм маршрутизации внимания между вариантами. В тестах самой Cloudflare Clef или Clef-flash заняли первое место в 7 из 10 decision-бенчмарков: например, на BANKING77 большая Clef получила 94,2 против 79,7 у Jev, а на BFCL — 98,5 против 95,8. При этом медианная задержка составила 209 мс у Clef и всего 38,8 мс у Clef-flash против 524 мс у Jev.

Почти одновременно собственную открытую модель выпустила Perplexity — pplx-decider-v1-27b. Здесь архитектура ещё нагляднее: взяли Qwen3.8-27B, полностью убрали слой генерации языка и заменили его выходом сразу на 255 возможных решений. Затем переобучили backbone, vision-компонент и новую голову, а вероятности отдельно откалибровали. В среднем по 11 опубликованным Perplexity тестам модель набрала 85,71% против 84,51% у Jev и 74,76% у исходной Qwen. При этом победа далеко не абсолютная: например, на RAGTruth PPLX Decider получает 88,8 против 77,3 у Jev, но на BBH уже Jev впереди — 94,3 против 82,8.

Другой подход выбрала Strands Decider 2B. Это всего 1,9 млрд параметров на базе Qwen3.5-2B. Языковая голова здесь тоже удалена, но вместо фиксированного набора выходов добавлена примерно миллион-параметровая pointer-head: она сравнивает внутреннее представление вопроса с представлениями каждого предложенного варианта. Благодаря этому количество действий не нужно заранее зашивать в архитектуру. На RTX 3090 модель выдаёт решение примерно за 115 мс по медиане и при этом может работать локально даже на Apple Silicon или CPU.

Ещё радикальнее выглядит Laya. Вместо многомиллиардной decoder-LLM это bidirectional encoder на базе ModernBERT всего на 421 млн параметров, а мультиязычная версия на mmBERT содержит 322 млн. Каждый вариант ответа получает собственную позицию, модель оценивает их одновременно и делает softmax — никакой генерации вообще нет. Специализированная Laya Typed-Decisions на наборе из 2000 решений показывает accuracy 0,766 против опубликованных 0,727 у Jev. Но у маленькой модели есть и очевидный предел: на BANKING77 с десятками вариантов Jev набирает 0,870, тогда как Laya — только 0,425. Зато один запрос Laya обрабатывает примерно за 33 мс.

Наконец, появились и закрытые модели, которые пытаются развить идею дальше. GLiDE от Fastino добавляет к decision model адаптивное рассуждение: сначала выполняется быстрый проход, но если выбор сложный или модель не уверена, она выделяет дополнительное вычисление. На Decision Index GLiDE заявляет 64,81 балла против 57,91 у Jev и превосходит её в 31 из 38 тестов; особенно велик разрыв на задачах знания и рассуждения — 62,9 против 51,4.

В итоге интереснее всего даже не то, какая именно модель сейчас лидирует в конкретном бенчмарке. За несколько недель Jev фактически запустила архитектурную гонку вокруг новой идеи: если задача модели состоит не в том, чтобы разговаривать с человеком, а в том, чтобы принять одно из заранее допустимых решений, возможно, генеративная LLM для этого вообще не лучший инструмент.

Cloudflare строит специализированную голову поверх большого Qwen, Perplexity заменяет языковой выход фиксированным decision-readout, Strands использует pointer-механизм с динамическими вариантами, Laya возвращается к маленьким bidirectional encoder-моделям, а Fastino пытается объединить быстрые решения System One с рассуждением только тогда, когда оно действительно необходимо.

Пока рано говорить, останутся ли decision models отдельным классом моделей надолго. Но скорость, с которой крупные команды начали выпускать собственные реализации после Jev, выглядит как довольно сильный сигнал: в агентных системах может формироваться отдельный слой моделей, задача которых — не генерировать, а решать.


В OpenCode появилась новая стелс-модель Fledge Alpha. Подозревают, что это детище Thinking Machines Lab.


Видео недоступно для предпросмотра
Смотреть в Telegram
Black Forest Labs выпустила FLUX 3 Image — отдельную ветку мультимодальной FLUX 3 для генерации и редактирования изображений. Семейство FLUX 3 компания представила ещё в июле как единую модель, обученную одновременно на изображениях, видео и аудио, но полноценный генератор картинок стал доступен только 1 октября. Генерация и редактирование теперь работают через один API: достаточно передать промпт, а модель сама определяет, нужно создать новое изображение или изменить существующее.

Главный акцент FLUX 3 Image — не столько на очередном росте качества, сколько на управляемости результата. Пользователь может задавать расположение объектов через bounding boxes: изображение представляется как сетка координат от 0 до 1000, где каждому персонажу, предмету или фрагменту текста можно заранее указать область. По сути, вместо просьбы «поставь логотип справа сверху» можно буквально задать модели место, где он должен находиться. Эти же области используются для локального редактирования: объект можно переместить, перекрасить, заменить, изменить размер или удалить, стараясь не перегенерировать остальную картинку.

Модель поддерживает до десяти референсов одновременно. Например, можно отдельно загрузить человека, одежду, сумку, обувь и фон, а затем собрать их в одну сцену, указав в промпте роль каждого изображения. BFL отдельно позиционирует это как инструмент для многошаговых производственных процессов, где важно сохранять персонажей, товары и композицию между правками.

FLUX 3 Image умеет генерировать изображения непосредственно в 2K и 4K, а не сначала создавать картинку меньшего размера и затем увеличивать её. Максимальный режим даёт около 16 мегапикселей — в одном из примеров BFL результат имеет разрешение 5456×3072. Компания также заявляет улучшенную работу со сложными промптами и текстом внутри изображений.

Есть и ещё одна необычная возможность: по умолчанию модель может перед генерацией искать информацию и изображения в интернете. Это позволяет, например, попросить её изобразить актуальный реальный объект или событие, а не полагаться только на знания, полученные при обучении. При необходимости такой grounding можно отключить.

FLUX 3 Image уже доступна через Playground и API Black Forest Labs. Обычная стоимость составляет $0.041 за 768×768, $0.048 за 1K, $0.10 за 2K и $0.607 за 4K. На запуске действует скидка 50% до 8 октября, поэтому, например, генерация 1K сейчас стоит $0.024. Для компаний также доступны коммерческие веса с возможностью дообучения и запуска на собственной инфраструктуре; публичную версию с открытыми весами BFL обещает выпустить в ближайшие недели.


Видео недоступно для предпросмотра
Смотреть в Telegram
Anthropic представила механизм модификаций (mods) для Claude Code — небольшие функции на TypeScript, позволяющие напрямую менять поведение, внешний вид и возможности ассистента как в терминальном интерфейсе (CLI), так и в десктопном приложении. В отличие от стандартных хуков, моды способны не просто реагировать на события, а перехватывать их, перезаписывать промпты до отправки модели, фильтровать или повторять вызовы инструментов, редактировать вывод для маскирования секретов, а также переопределять встроенный интерфейс, добавляя кнопки и новые поля ввода.

​Архитектура модов построена на событийной модели, где выполнение функции может происходить до, после или вместо целевого события, а также оборачивать его. При совместной работе нескольких расширений они выстраиваются в конвейер по порядку загрузки, что позволяет комбинировать решения разных разработчиков. Более того, сам Claude Code умеет генерировать моды по текстовому запросу, сразу же устанавливая и применяя их в текущей сессии через механизм горячей перезагрузки (hot reload).

​Сама Anthropic начала переводить базовые функции инструмента на архитектуру модов, превратив, к примеру, встроенную команду разницы изменений (/diff) в отдельный модульный компонент, который пользователь может отключить или заменить собственной реализацией. В дальнейшем компания планирует сократить ядро системы до минимального набора, дав разработчикам возможность собирать окружение под свои задачи. Моды упаковываются и распространяются внутри стандартных плагинов через команду /plugin и каталог расширений Claude.


Видео недоступно для предпросмотра
Смотреть в Telegram
Earendil выпустила Pi 1.0 — первую стабильную версию минималистичного и расширяемого харнесса для ИИ-агентов. За последний год Pi превратился из довольно простого терминального coding-agent в платформу, на которой можно собирать собственные агентные системы, при этом разработчики стараются сохранять его изначальную философию: не добавлять функцию в ядро, пока не станет понятно, что она действительно полезна.

Главное изменение в 1.0 — появление Codemode и нативной поддержки MCP. Вместо того чтобы загружать сотни описаний MCP-инструментов прямо в контекст модели, Pi позволяет агенту писать небольшие JavaScript-программы, которые находят нужные инструменты и комбинируют их вызовы внутри песочницы. Через этот же механизм можно обращаться не только к LLM, но и, например, к классификаторам Jev или моделям генерации изображений. Это позволяет строить довольно необычные цепочки: в демонстрации разработчиков виртуальная модель сначала планирует задачу с Claude Opus, затем Jev определяет момент перехода к реализации, после чего работу продолжает GPT-6 Luna.

В Pi 1.0 также вошли виртуальные модели, отложенная загрузка инструментов, прогрев кэша промпта Anthropic, изменение системных инструкций и набора инструментов прямо посреди диалога с сохранением истории, новая тема интерфейса и полноэкранный режим по умолчанию. Например, прогрев кэша может во время долгого выполнения инструментов заранее обновить истекающий prompt cache и тем самым избежать повторной оплаты всего большого контекста.

Но более интересная часть релиза — отдельный экспериментальный проект Pi Durable. Разработчики сознательно не стали превращать обычный Pi в сервер для автономных агентов: Pi 1.0 по-прежнему рассчитан прежде всего на человека, работающего с агентом в терминале. Durable предназначен для другого сценария — агентов, которые могут работать часами или днями, обслуживать несколько разговоров одновременно, управляться с разных клиентов и переживать перезапуски процесса.

В Durable практически любое действие агента представлено как сохраняемая задача. Перед очередным шагом состояние записывается в хранилище, поэтому после падения процесса новый экземпляр харнесса может найти незавершённую работу и продолжить её с последней контрольной точки. Особенно интересно решена проблема повторных побочных эффектов: инструмент явно помечается как безопасный для повторного запуска. Например, поиск по GitHub после сбоя можно выполнить заново, а прерванный деплой автоматически повторяться не будет — модель получит сообщение, что операция была прервана, и сама решит, что делать дальше. Для входящих заданий предусмотрен "requestId", позволяющий не создать одну и ту же задачу дважды при повторной отправке запроса после сбоя.

Таким образом, Pi 1.0 становится стабильным интерактивным харнессом, а Pi Durable — экспериментальным фундаментом для постоянно работающих агентных приложений. Последний пока не стоит воспринимать как готовую production-платформу: API прямо помечен как нестабильный, одно хранилище должен обслуживать только один процесс, а сама долговечность задач не добавляет автоматической изоляции файловой системы, сети или учётных данных. Но архитектурно это заметный шаг от привычного «coding agent в терминале» к агентам как долгоживущим сервисам, состояние которых существует независимо от процесса, интерфейса и конкретной сессии пользователя.


Ant Group представила Ling-3.1-Flash — новую крупную MoE-модель семейства Ling, ориентированную прежде всего на ИИ-агентов, программирование и длительные многошаговые задачи. Модель получила около 560 млрд параметров, но при обработке каждого токена активирует примерно 25 млрд, что позволяет сочетать большую общую ёмкость с более умеренными вычислительными затратами.

Ling-3.1-Flash поддерживает гибридный режим рассуждений, вызов инструментов и работу с длинным контекстом. Максимальное заявленное окно составляет 1 млн токенов, хотя во время бесплатного запуска доступно 256K. В размещённой у Novita версии также указан максимальный ответ до 32K токенов. Разработчики отдельно оптимизировали модель для универсальных агентов, поиска, офисных задач и разработки ПО, а также улучшали её возможности в медицине, финансах и исследованиях материалов.

По опубликованным вместе с релизом результатам Ling-3.1-Flash набирает 1673 Elo в GDPVal-AA v2.1, 75,16 в FrontierSWE и 65,35 в HealthBench Professional. Эти цифры выглядят особенно интересно для модели класса Flash, однако пока это результаты, распространяемые вместе с анонсом: полноценные независимые тесты новой версии ещё практически отсутствуют. В частности, агрегаторы, уже добавившие модель, пока не выставили ей собственные оценки качества.

По сравнению с Ling-3.0-Flash масштаб модели вырос очень сильно: предыдущая версия имела около 124 млрд параметров и активировала примерно 5,1 млрд, тогда как теперь это 560 млрд и 25 млрд соответственно. То есть название Flash здесь уже означает скорее экономичность за счёт разреженной MoE-архитектуры, чем небольшую модель.

Сейчас Ling-3.1-Flash запускают с двухнедельным бесплатным доступом и ограничением контекста до 256K. После завершения бесплатного периода разработчики планируют перейти к платному API, открыть полный контекст на 1 млн токенов и одновременно опубликовать веса модели. Таким образом, Ling-3.1-Flash пока выглядит как попытка Ant Group перенести уровень крупной флагманской MoE-модели в сегмент быстрых агентных моделей — особенно для программирования, поиска и работы с большими объёмами контекста.


Google представила Gemini 4 Argon — новую флагманскую модель, открывающую линейку моделей четвёртого поколения и ориентированную на глубокое рассуждение в длительных многоэтапных процессах (long-horizon workflows). В этой архитектуре лимит выходных токенов увеличен до 1 миллиона (по сравнению с прежними 64 тысячами), что позволяет модели выстраивать длинные непрерывные цепочки рассуждений и генерировать сотни тысяч токенов в рамках единой траектории для решения сложных инженерных и исследовательских задач за один проход.

Фокус в разработке сделан на задачах программирования, кибербезопасности, аналитической работе и обработке длинного мультимодального контекста. На бенчмарке разработки ПО DeepSWE v1.1 модель достигла 77,9%, обойдя актуальных конкурентов от Anthropic и OpenAI, а в тестировании устранения уязвимостей CWE-bench v1 разделила лидерство с показателем 68%. Также заявлены наивысшие результаты в сценариях комплексной бизнес-автоматизации (AutomationBench с 51,3%), анализе финансов и права (Vals Finance Agent v2, Harvey Legal Agent), а также анализе длинных видеозаписей (91,7% на LVBench).

Отдельное внимание уделено защите информации и безопасной эксплуатации. Gemini 4 Argon обучена для оборонительных задач в сфере информационной безопасности и предоставляется проверенным партнёрам через программу Fairwind и внутренним командам без стандартных защитных фильтров для эффективного устранения угроз. При обучении внедрены методы анализа внутренних активаций для пресечения генерации вредоносных сценариев (включая CBRN-угрозы), усилена устойчивость к непрямым prompt-инъекциям (тест Gray Swan IPI), а для контроля смещения целей (misalignment) развёрнута автоматическая система отслеживания цепочек мыслей и действий агентов с изоляцией сред выполнения.

Модель уже активно применяется внутри самой компании Google для оптимизации серверной инфраструктуры и масштабного рефакторинга. В частности, группа агентов на базе Argon проанализировала телеметрию дата-центров и применила оптимизации памяти, сэкономив сотни терабайт RAM. Кроме того, модель используется для переписывания критических C/C++ компонентов на Rust, включая оптимизацию библиотек вроде re2 и декодера libgav1 (где безопасный код на Rust после профилирования и векторизации компилятором стал работать в 2,7 раза быстрее прежнего порта), а также масштабную миграцию ядра Zircon ОС Fuchsia объёмом более 800 тысяч строк.

Широкое развёртывание Gemini 4 Argon начнётся в ближайшее время и станет доступно для подписчиков плана Google AI Ultra, а также платным пользователям API.


Видео недоступно для предпросмотра
Смотреть в Telegram
Ideogram представила Ideogram 4.5, ключевым фокусом которого стало прецизионное редактирование изображений. Разработчики позиционируют модель как решение главной проблемы генеративных редакторов — накопления артефактов, сдвигов пикселей и искажения цветов при многократных последовательных правках. Модель оптимизирована для сохранения исходных деталей даже в сценариях с большим количеством итераций (multi-turn edits), сохраняя чистоту и резкость кадра там, где другие решения теряют качество уже через несколько шагов.

Модель рассчитана на широкий спектр прикладных задач редактирования, включая корректировку освещения и цвета, точечную модификацию надписей, обработку предметных и архитектурных снимков, дизайн интерьеров, реставрацию архивных фотографий, а также перевод набросков и карт глубины в реалистичный рендер со строгим соблюдением стиля референса.

Отдельное внимание уделено функции локального зум-редактирования (Zoom editing) на сверхвысоких разрешениях вплоть до полиграфических форматов и десятков мегапикселей. Пользователю больше не требуется сжимать исходный файл: Ideogram 4.5 позволяет изолированно обработать кадрированный фрагмент и бесшовно вернуть его в оригинальное полотно с идеальным сохранением границ, оставляя остальную часть композиции нетронутой и готовой к печати или крупным планам.




Видео недоступно для предпросмотра
Смотреть в Telegram
Компания Voltropy анонсировала семейство моделей Vast-10M, обладающих нативным контекстным окном в 10 миллионов токенов, что на порядок превышает стандартный лимит в один миллион токенов у ведущих флагманских решений вроде Claude Fable 5.1 и GPT-6 Astra. В линейку вошли три конфигурации: флагманская Vast-10M-Flash на базе DeepSeek V4.0 Flash, средняя Vast-10M-Medium на основе GLM-5.2 и крупнейшая Vast-10M-Pro на базе DeepSeek V4.0 Pro.

Ключевым технологическим фундаментом релиза стал новый проприетарный механизм внимания Voltropy Scalable Attention (VSA). Разработчики подчеркивают, что VSA решает традиционную дилемму между длиной контекста и интеллектуальностью: вместо деградации точности или перехода на линейные архитектуры вроде SSM, модель сохраняет полноценную архитектуру трансформера и демонстрирует прирост качества рассуждений на всех длинах контекста, включая короткие интервалы в 100 тысяч токенов. На бенчмарке BEAM модель Vast-10M-Flash на дистанции в один миллион токенов превзошла Claude Fable 5.1 и практически сравнялась с GPT-6 Astra, а при расширении окна до рекордных 10 миллионов токенов удержала свыше 82% исходного результата, превзойдя показатели большинства существующих RAG-систем.

Окно в 10 миллионов токенов позволяет загружать целиком массивные корпуса данных без предварительного фрагментирования: налоговые кодексы, годовые подшивки научных журналов, полные стенограммы многомесячных судебных разбирательств или исходный код масштабных репозиториев вроде компилятора TypeScript, базы данных SQLite и фреймворка React для выявления распределенных уязвимостей. При этом Voltropy рассматривает сверхдлинный контекст не как замену RAG, а как дополнение, кардинально снижающее требования к точности ретривера за счет возможности инжектировать на порядок больше релевантных фрагментов напрямую в промпт.

В долгосрочной перспективе Voltropy позиционирует сверхдлинный контекст как путь к непрерывному обучению и созданию архитектуры фон-неймановского типа, где навыки модели остаются зафиксированными в весах, а знания выносятся непосредственно в контекст. Такой подход призван сделать модели более предсказуемыми, редактируемыми и безопасными для корпоративного применения. На текущий момент компания открыла регистрацию в программу раннего доступа к Vast-10M-Flash и опубликовала технический отчет.


На самом деле анонс Sign in with ChatGPT для логина в сторонних приложениях интереснее, чем кажется на первый взгляд. Теперь в ряде сервисов можно будет потреблять токены из подписки ChatGPT, а не платить самому сервису за их подписку. Вот список по которому были анонсы:

Notion
Warp
Vercel
Devin от Cognition
Conductor
Amp Code
Kilo Code
Dactyl
Hermes Agent от Nous Research
Hyperagent
Vorflux
Lovable (будет скоро)

Я планирую использовать такую возможность в Warp, Hermes Agent и Notion (когда истечет нативная подписка). Ну и Devin интересно потрогать.

Показано 20 последних публикаций.