Synaptic Garden


Channel's geo and language: not specified, not specified
Category: not specified


От байтов к бытию — и обратно
Авторский канал об IT, науке и скрытых паттернах реальности. Исследую связи между программированием, философией и искусством. Делюсь инсайтами из мира ИИ и размышлениями о технологическом будущем.
@darkgenius

Related channels

Channel's geo and language
not specified, not specified
Category
not specified
Statistics
Posts filter


Хайп вокруг нового класса моделей — моделей принятия решений или decision models — продолжает набирать обороты. Чуть ли не каждый день на поле выходит новый игрок, за всеми и не уследить. Давайте посмотрим на несколько заметных решений и подумаем какую роль модели принятия решений будут играть в агентских системах ближайшего будущего.

Вернёмся к началу: 15 сентября TypeSafe явила миру Jev. Создатели называют её первой моделью нового класса System One: в отличие от привычных LLM, Jev не генерирует текст токен за токеном, а получает состояние системы и набор допустимых вариантов действий и сразу возвращает структурированное решение вместе с вероятностями. Например, определить, какому отделу отправить обращение, какой инструмент вызвать агенту, насколько серьёзна проблема или нужно ли вообще выполнять действие.

Идея оказалась очень своевременной. Во многих агентных системах большая языковая модель нужна далеко не на каждом шаге: часто агенту не требуется писать текст или долго рассуждать — нужно быстро выбрать одно действие из нескольких. Использовать для этого полноценную LLM дорого и медленно, а ещё приходится контролировать формат ответа. Jev фактически предложила специализированный «быстрый контур» для таких решений: никаких рассуждений и генерации, только непосредственно решение и оценка уверенности.

Судя по скорости реакции индустрии, идея попала точно в цель. Не прошло и трёх недель, как начали появляться аналоги от Cloudflare, Perplexity, Strands Labs, Fastino и других команд — причём многие сразу с открытыми весами. Сама Cloudflare в анонсе Clef прямо пишет о «большом ажиотаже» вокруг Jev и нового класса decision-моделей.

Чем интересны открытые Clef 27B и Clef-flash 9B от Cloudflare? Внутри всё ещё находится Qwen, но обычная генерация текста не используется: модель делает только prefill-проход, после чего специальная голова параллельно оценивает все допустимые варианты. У большой Clef заморожен Qwen3.8-27B, у Flash — Qwen3.5-9B, а обучаются LoRA-адаптеры и отдельный механизм маршрутизации внимания между вариантами. В тестах самой Cloudflare Clef или Clef-flash заняли первое место в 7 из 10 decision-бенчмарков: например, на BANKING77 большая Clef получила 94,2 против 79,7 у Jev, а на BFCL — 98,5 против 95,8. При этом медианная задержка составила 209 мс у Clef и всего 38,8 мс у Clef-flash против 524 мс у Jev.

Почти одновременно собственную открытую модель выпустила Perplexity — pplx-decider-v1-27b. Здесь архитектура ещё нагляднее: взяли Qwen3.8-27B, полностью убрали слой генерации языка и заменили его выходом сразу на 255 возможных решений. Затем переобучили backbone, vision-компонент и новую голову, а вероятности отдельно откалибровали. В среднем по 11 опубликованным Perplexity тестам модель набрала 85,71% против 84,51% у Jev и 74,76% у исходной Qwen. При этом победа далеко не абсолютная: например, на RAGTruth PPLX Decider получает 88,8 против 77,3 у Jev, но на BBH уже Jev впереди — 94,3 против 82,8.

Другой подход выбрала Strands Decider 2B. Это всего 1,9 млрд параметров на базе Qwen3.5-2B. Языковая голова здесь тоже удалена, но вместо фиксированного набора выходов добавлена примерно миллион-параметровая pointer-head: она сравнивает внутреннее представление вопроса с представлениями каждого предложенного варианта. Благодаря этому количество действий не нужно заранее зашивать в архитектуру. На RTX 3090 модель выдаёт решение примерно за 115 мс по медиане и при этом может работать локально даже на Apple Silicon или CPU.

Ещё радикальнее выглядит Laya. Вместо многомиллиардной decoder-LLM это bidirectional encoder на базе ModernBERT всего на 421 млн параметров, а мультиязычная версия на mmBERT содержит 322 млн. Каждый вариант ответа получает собственную позицию, модель оценивает их одновременно и делает softmax — никакой генерации вообще нет. Специализированная Laya Typed-Decisions на наборе из 2000 решений показывает accuracy 0,766 против опубликованных 0,727 у Jev. Но у маленькой модели есть и очевидный предел: на BANKING77 с десятками вариантов Jev набирает 0,870, тогда как Laya — только 0,425. Зато один запрос Laya обрабатывает примерно за 33 мс.

Наконец, появились и закрытые модели, которые пытаются развить идею дальше. GLiDE от Fastino добавляет к decision model адаптивное рассуждение: сначала выполняется быстрый проход, но если выбор сложный или модель не уверена, она выделяет дополнительное вычисление. На Decision Index GLiDE заявляет 64,81 балла против 57,91 у Jev и превосходит её в 31 из 38 тестов; особенно велик разрыв на задачах знания и рассуждения — 62,9 против 51,4.

В итоге интереснее всего даже не то, какая именно модель сейчас лидирует в конкретном бенчмарке. За несколько недель Jev фактически запустила архитектурную гонку вокруг новой идеи: если задача модели состоит не в том, чтобы разговаривать с человеком, а в том, чтобы принять одно из заранее допустимых решений, возможно, генеративная LLM для этого вообще не лучший инструмент.

Cloudflare строит специализированную голову поверх большого Qwen, Perplexity заменяет языковой выход фиксированным decision-readout, Strands использует pointer-механизм с динамическими вариантами, Laya возвращается к маленьким bidirectional encoder-моделям, а Fastino пытается объединить быстрые решения System One с рассуждением только тогда, когда оно действительно необходимо.

Пока рано говорить, останутся ли decision models отдельным классом моделей надолго. Но скорость, с которой крупные команды начали выпускать собственные реализации после Jev, выглядит как довольно сильный сигнал: в агентных системах может формироваться отдельный слой моделей, задача которых — не генерировать, а решать.


В OpenCode появилась новая стелс-модель Fledge Alpha. Подозревают, что это детище Thinking Machines Lab.


Video is unavailable for watching
Show in Telegram
Black Forest Labs выпустила FLUX 3 Image — отдельную ветку мультимодальной FLUX 3 для генерации и редактирования изображений. Семейство FLUX 3 компания представила ещё в июле как единую модель, обученную одновременно на изображениях, видео и аудио, но полноценный генератор картинок стал доступен только 1 октября. Генерация и редактирование теперь работают через один API: достаточно передать промпт, а модель сама определяет, нужно создать новое изображение или изменить существующее.

Главный акцент FLUX 3 Image — не столько на очередном росте качества, сколько на управляемости результата. Пользователь может задавать расположение объектов через bounding boxes: изображение представляется как сетка координат от 0 до 1000, где каждому персонажу, предмету или фрагменту текста можно заранее указать область. По сути, вместо просьбы «поставь логотип справа сверху» можно буквально задать модели место, где он должен находиться. Эти же области используются для локального редактирования: объект можно переместить, перекрасить, заменить, изменить размер или удалить, стараясь не перегенерировать остальную картинку.

Модель поддерживает до десяти референсов одновременно. Например, можно отдельно загрузить человека, одежду, сумку, обувь и фон, а затем собрать их в одну сцену, указав в промпте роль каждого изображения. BFL отдельно позиционирует это как инструмент для многошаговых производственных процессов, где важно сохранять персонажей, товары и композицию между правками.

FLUX 3 Image умеет генерировать изображения непосредственно в 2K и 4K, а не сначала создавать картинку меньшего размера и затем увеличивать её. Максимальный режим даёт около 16 мегапикселей — в одном из примеров BFL результат имеет разрешение 5456×3072. Компания также заявляет улучшенную работу со сложными промптами и текстом внутри изображений.

Есть и ещё одна необычная возможность: по умолчанию модель может перед генерацией искать информацию и изображения в интернете. Это позволяет, например, попросить её изобразить актуальный реальный объект или событие, а не полагаться только на знания, полученные при обучении. При необходимости такой grounding можно отключить.

FLUX 3 Image уже доступна через Playground и API Black Forest Labs. Обычная стоимость составляет $0.041 за 768×768, $0.048 за 1K, $0.10 за 2K и $0.607 за 4K. На запуске действует скидка 50% до 8 октября, поэтому, например, генерация 1K сейчас стоит $0.024. Для компаний также доступны коммерческие веса с возможностью дообучения и запуска на собственной инфраструктуре; публичную версию с открытыми весами BFL обещает выпустить в ближайшие недели.


Video is unavailable for watching
Show in Telegram
Anthropic представила механизм модификаций (mods) для Claude Code — небольшие функции на TypeScript, позволяющие напрямую менять поведение, внешний вид и возможности ассистента как в терминальном интерфейсе (CLI), так и в десктопном приложении. В отличие от стандартных хуков, моды способны не просто реагировать на события, а перехватывать их, перезаписывать промпты до отправки модели, фильтровать или повторять вызовы инструментов, редактировать вывод для маскирования секретов, а также переопределять встроенный интерфейс, добавляя кнопки и новые поля ввода.

​Архитектура модов построена на событийной модели, где выполнение функции может происходить до, после или вместо целевого события, а также оборачивать его. При совместной работе нескольких расширений они выстраиваются в конвейер по порядку загрузки, что позволяет комбинировать решения разных разработчиков. Более того, сам Claude Code умеет генерировать моды по текстовому запросу, сразу же устанавливая и применяя их в текущей сессии через механизм горячей перезагрузки (hot reload).

​Сама Anthropic начала переводить базовые функции инструмента на архитектуру модов, превратив, к примеру, встроенную команду разницы изменений (/diff) в отдельный модульный компонент, который пользователь может отключить или заменить собственной реализацией. В дальнейшем компания планирует сократить ядро системы до минимального набора, дав разработчикам возможность собирать окружение под свои задачи. Моды упаковываются и распространяются внутри стандартных плагинов через команду /plugin и каталог расширений Claude.


Video is unavailable for watching
Show in Telegram
Earendil выпустила Pi 1.0 — первую стабильную версию минималистичного и расширяемого харнесса для ИИ-агентов. За последний год Pi превратился из довольно простого терминального coding-agent в платформу, на которой можно собирать собственные агентные системы, при этом разработчики стараются сохранять его изначальную философию: не добавлять функцию в ядро, пока не станет понятно, что она действительно полезна.

Главное изменение в 1.0 — появление Codemode и нативной поддержки MCP. Вместо того чтобы загружать сотни описаний MCP-инструментов прямо в контекст модели, Pi позволяет агенту писать небольшие JavaScript-программы, которые находят нужные инструменты и комбинируют их вызовы внутри песочницы. Через этот же механизм можно обращаться не только к LLM, но и, например, к классификаторам Jev или моделям генерации изображений. Это позволяет строить довольно необычные цепочки: в демонстрации разработчиков виртуальная модель сначала планирует задачу с Claude Opus, затем Jev определяет момент перехода к реализации, после чего работу продолжает GPT-6 Luna.

В Pi 1.0 также вошли виртуальные модели, отложенная загрузка инструментов, прогрев кэша промпта Anthropic, изменение системных инструкций и набора инструментов прямо посреди диалога с сохранением истории, новая тема интерфейса и полноэкранный режим по умолчанию. Например, прогрев кэша может во время долгого выполнения инструментов заранее обновить истекающий prompt cache и тем самым избежать повторной оплаты всего большого контекста.

Но более интересная часть релиза — отдельный экспериментальный проект Pi Durable. Разработчики сознательно не стали превращать обычный Pi в сервер для автономных агентов: Pi 1.0 по-прежнему рассчитан прежде всего на человека, работающего с агентом в терминале. Durable предназначен для другого сценария — агентов, которые могут работать часами или днями, обслуживать несколько разговоров одновременно, управляться с разных клиентов и переживать перезапуски процесса.

В Durable практически любое действие агента представлено как сохраняемая задача. Перед очередным шагом состояние записывается в хранилище, поэтому после падения процесса новый экземпляр харнесса может найти незавершённую работу и продолжить её с последней контрольной точки. Особенно интересно решена проблема повторных побочных эффектов: инструмент явно помечается как безопасный для повторного запуска. Например, поиск по GitHub после сбоя можно выполнить заново, а прерванный деплой автоматически повторяться не будет — модель получит сообщение, что операция была прервана, и сама решит, что делать дальше. Для входящих заданий предусмотрен "requestId", позволяющий не создать одну и ту же задачу дважды при повторной отправке запроса после сбоя.

Таким образом, Pi 1.0 становится стабильным интерактивным харнессом, а Pi Durable — экспериментальным фундаментом для постоянно работающих агентных приложений. Последний пока не стоит воспринимать как готовую production-платформу: API прямо помечен как нестабильный, одно хранилище должен обслуживать только один процесс, а сама долговечность задач не добавляет автоматической изоляции файловой системы, сети или учётных данных. Но архитектурно это заметный шаг от привычного «coding agent в терминале» к агентам как долгоживущим сервисам, состояние которых существует независимо от процесса, интерфейса и конкретной сессии пользователя.


Ant Group представила Ling-3.1-Flash — новую крупную MoE-модель семейства Ling, ориентированную прежде всего на ИИ-агентов, программирование и длительные многошаговые задачи. Модель получила около 560 млрд параметров, но при обработке каждого токена активирует примерно 25 млрд, что позволяет сочетать большую общую ёмкость с более умеренными вычислительными затратами.

Ling-3.1-Flash поддерживает гибридный режим рассуждений, вызов инструментов и работу с длинным контекстом. Максимальное заявленное окно составляет 1 млн токенов, хотя во время бесплатного запуска доступно 256K. В размещённой у Novita версии также указан максимальный ответ до 32K токенов. Разработчики отдельно оптимизировали модель для универсальных агентов, поиска, офисных задач и разработки ПО, а также улучшали её возможности в медицине, финансах и исследованиях материалов.

По опубликованным вместе с релизом результатам Ling-3.1-Flash набирает 1673 Elo в GDPVal-AA v2.1, 75,16 в FrontierSWE и 65,35 в HealthBench Professional. Эти цифры выглядят особенно интересно для модели класса Flash, однако пока это результаты, распространяемые вместе с анонсом: полноценные независимые тесты новой версии ещё практически отсутствуют. В частности, агрегаторы, уже добавившие модель, пока не выставили ей собственные оценки качества.

По сравнению с Ling-3.0-Flash масштаб модели вырос очень сильно: предыдущая версия имела около 124 млрд параметров и активировала примерно 5,1 млрд, тогда как теперь это 560 млрд и 25 млрд соответственно. То есть название Flash здесь уже означает скорее экономичность за счёт разреженной MoE-архитектуры, чем небольшую модель.

Сейчас Ling-3.1-Flash запускают с двухнедельным бесплатным доступом и ограничением контекста до 256K. После завершения бесплатного периода разработчики планируют перейти к платному API, открыть полный контекст на 1 млн токенов и одновременно опубликовать веса модели. Таким образом, Ling-3.1-Flash пока выглядит как попытка Ant Group перенести уровень крупной флагманской MoE-модели в сегмент быстрых агентных моделей — особенно для программирования, поиска и работы с большими объёмами контекста.


Google представила Gemini 4 Argon — новую флагманскую модель, открывающую линейку моделей четвёртого поколения и ориентированную на глубокое рассуждение в длительных многоэтапных процессах (long-horizon workflows). В этой архитектуре лимит выходных токенов увеличен до 1 миллиона (по сравнению с прежними 64 тысячами), что позволяет модели выстраивать длинные непрерывные цепочки рассуждений и генерировать сотни тысяч токенов в рамках единой траектории для решения сложных инженерных и исследовательских задач за один проход.

Фокус в разработке сделан на задачах программирования, кибербезопасности, аналитической работе и обработке длинного мультимодального контекста. На бенчмарке разработки ПО DeepSWE v1.1 модель достигла 77,9%, обойдя актуальных конкурентов от Anthropic и OpenAI, а в тестировании устранения уязвимостей CWE-bench v1 разделила лидерство с показателем 68%. Также заявлены наивысшие результаты в сценариях комплексной бизнес-автоматизации (AutomationBench с 51,3%), анализе финансов и права (Vals Finance Agent v2, Harvey Legal Agent), а также анализе длинных видеозаписей (91,7% на LVBench).

Отдельное внимание уделено защите информации и безопасной эксплуатации. Gemini 4 Argon обучена для оборонительных задач в сфере информационной безопасности и предоставляется проверенным партнёрам через программу Fairwind и внутренним командам без стандартных защитных фильтров для эффективного устранения угроз. При обучении внедрены методы анализа внутренних активаций для пресечения генерации вредоносных сценариев (включая CBRN-угрозы), усилена устойчивость к непрямым prompt-инъекциям (тест Gray Swan IPI), а для контроля смещения целей (misalignment) развёрнута автоматическая система отслеживания цепочек мыслей и действий агентов с изоляцией сред выполнения.

Модель уже активно применяется внутри самой компании Google для оптимизации серверной инфраструктуры и масштабного рефакторинга. В частности, группа агентов на базе Argon проанализировала телеметрию дата-центров и применила оптимизации памяти, сэкономив сотни терабайт RAM. Кроме того, модель используется для переписывания критических C/C++ компонентов на Rust, включая оптимизацию библиотек вроде re2 и декодера libgav1 (где безопасный код на Rust после профилирования и векторизации компилятором стал работать в 2,7 раза быстрее прежнего порта), а также масштабную миграцию ядра Zircon ОС Fuchsia объёмом более 800 тысяч строк.

Широкое развёртывание Gemini 4 Argon начнётся в ближайшее время и станет доступно для подписчиков плана Google AI Ultra, а также платным пользователям API.


Video is unavailable for watching
Show in Telegram
Ideogram представила Ideogram 4.5, ключевым фокусом которого стало прецизионное редактирование изображений. Разработчики позиционируют модель как решение главной проблемы генеративных редакторов — накопления артефактов, сдвигов пикселей и искажения цветов при многократных последовательных правках. Модель оптимизирована для сохранения исходных деталей даже в сценариях с большим количеством итераций (multi-turn edits), сохраняя чистоту и резкость кадра там, где другие решения теряют качество уже через несколько шагов.

Модель рассчитана на широкий спектр прикладных задач редактирования, включая корректировку освещения и цвета, точечную модификацию надписей, обработку предметных и архитектурных снимков, дизайн интерьеров, реставрацию архивных фотографий, а также перевод набросков и карт глубины в реалистичный рендер со строгим соблюдением стиля референса.

Отдельное внимание уделено функции локального зум-редактирования (Zoom editing) на сверхвысоких разрешениях вплоть до полиграфических форматов и десятков мегапикселей. Пользователю больше не требуется сжимать исходный файл: Ideogram 4.5 позволяет изолированно обработать кадрированный фрагмент и бесшовно вернуть его в оригинальное полотно с идеальным сохранением границ, оставляя остальную часть композиции нетронутой и готовой к печати или крупным планам.




Video is unavailable for watching
Show in Telegram
Компания Voltropy анонсировала семейство моделей Vast-10M, обладающих нативным контекстным окном в 10 миллионов токенов, что на порядок превышает стандартный лимит в один миллион токенов у ведущих флагманских решений вроде Claude Fable 5.1 и GPT-6 Astra. В линейку вошли три конфигурации: флагманская Vast-10M-Flash на базе DeepSeek V4.0 Flash, средняя Vast-10M-Medium на основе GLM-5.2 и крупнейшая Vast-10M-Pro на базе DeepSeek V4.0 Pro.

Ключевым технологическим фундаментом релиза стал новый проприетарный механизм внимания Voltropy Scalable Attention (VSA). Разработчики подчеркивают, что VSA решает традиционную дилемму между длиной контекста и интеллектуальностью: вместо деградации точности или перехода на линейные архитектуры вроде SSM, модель сохраняет полноценную архитектуру трансформера и демонстрирует прирост качества рассуждений на всех длинах контекста, включая короткие интервалы в 100 тысяч токенов. На бенчмарке BEAM модель Vast-10M-Flash на дистанции в один миллион токенов превзошла Claude Fable 5.1 и практически сравнялась с GPT-6 Astra, а при расширении окна до рекордных 10 миллионов токенов удержала свыше 82% исходного результата, превзойдя показатели большинства существующих RAG-систем.

Окно в 10 миллионов токенов позволяет загружать целиком массивные корпуса данных без предварительного фрагментирования: налоговые кодексы, годовые подшивки научных журналов, полные стенограммы многомесячных судебных разбирательств или исходный код масштабных репозиториев вроде компилятора TypeScript, базы данных SQLite и фреймворка React для выявления распределенных уязвимостей. При этом Voltropy рассматривает сверхдлинный контекст не как замену RAG, а как дополнение, кардинально снижающее требования к точности ретривера за счет возможности инжектировать на порядок больше релевантных фрагментов напрямую в промпт.

В долгосрочной перспективе Voltropy позиционирует сверхдлинный контекст как путь к непрерывному обучению и созданию архитектуры фон-неймановского типа, где навыки модели остаются зафиксированными в весах, а знания выносятся непосредственно в контекст. Такой подход призван сделать модели более предсказуемыми, редактируемыми и безопасными для корпоративного применения. На текущий момент компания открыла регистрацию в программу раннего доступа к Vast-10M-Flash и опубликовала технический отчет.


На самом деле анонс Sign in with ChatGPT для логина в сторонних приложениях интереснее, чем кажется на первый взгляд. Теперь в ряде сервисов можно будет потреблять токены из подписки ChatGPT, а не платить самому сервису за их подписку. Вот список по которому были анонсы:

Notion
Warp
Vercel
Devin от Cognition
Conductor
Amp Code
Kilo Code
Dactyl
Hermes Agent от Nous Research
Hyperagent
Vorflux
Lovable (будет скоро)

Я планирую использовать такую возможность в Warp, Hermes Agent и Notion (когда истечет нативная подписка). Ну и Devin интересно потрогать.


OpenAI провела DevDay 2026 и показала больше 20 новых продуктов и функций. Ключевые анонсы связаны с постепенным переходом от ChatGPT как чата к системе постоянно работающих ИИ-агентов, которые могут самостоятельно выполнять задачи, взаимодействовать с приложениями и работать вместе с людьми.

Главным анонсом стали Dots — постоянно работающие агенты на базе GPT-6 Astra. У каждого Dot есть собственный облачный компьютер и браузер, он может подключаться к внешним сервисам, выполнять длительные и периодические задачи и продолжать работу между разговорами с пользователем. Общаться с агентом можно через ChatGPT, Slack и другие каналы, а его самостоятельность ограничивается заданными пользователем правилами и разрешениями. OpenAI также готовит специализированных Dots для отдельных профессий и корпоративных сценариев.

Вместе с ними появился ChatGPT Space — общее рабочее пространство для людей и ИИ. Внутри можно создавать Pages — живые документы с текстом, диаграммами, трекерами и интерактивными элементами, объединять их в пространства и совместно редактировать с коллегами, при этом каждый участник может подключать к общей работе собственного ChatGPT. В дальнейшем в Space должны появиться таблицы и презентации.

Для разработчиков представили GPT-6.1 Sol — модель, которая, по заявлению OpenAI, приближается к GPT-6 Astra в программировании, управлении компьютером и профессиональных задачах, но стоит примерно в пять раз дешевле Astra.

Одновременно OpenAI расширила Ultrafast — режим инференса с минимальной задержкой. GPT-6 Astra теперь может работать в нём до восьми раз быстрее стандартного режима. Ultrafast также появился в ChatGPT Work и Codex для нового тарифа Pro за $500 в месяц и некоторых корпоративных клиентов.

Серьёзно обновили и Codex. Облачные задачи теперь можно запускать и продолжать с разных устройств, а работа не останавливается, даже если компьютер пользователя выключен. Codex CLI получил управление голосом и интерфейс для нескольких параллельных агентов, в десктопном ChatGPT появился более тесно интегрированный разбор изменений и code review, а Codex Security Cloud может регулярно сканировать репозитории, искать уязвимости и подготавливать исправления.

Ещё один новый инструмент — Decisions API. Вместо генерации произвольного ответа модель выбирает один вариант из заранее определённого набора (привет, Jev). Такой подход рассчитан на классификацию, маршрутизацию запросов и небольшие решения внутри агентных процессов, где важнее получить строго ограниченный и легко проверяемый результат, чем свободный текст. API пока запускается в ограниченном предварительном доступе.

OpenAI также продолжает строить вокруг ChatGPT собственную платформу. Появился Sign in with ChatGPT, позволяющий авторизоваться в стороннем приложении через аккаунт ChatGPT и, с разрешения пользователя, оплачивать часть ИИ-запросов своей подпиской вместо отдельного API-ключа. Для плагинов появились расширенные интерфейсы и MCP Events, благодаря которым ChatGPT может реагировать на события во внешних сервисах — например, новый комментарий в документе или сообщение в канале — и автоматически запускать заданный процесс.

Наконец, OpenAI запустила Marketplace для корпоративных клиентов: часть уже законтрактованного бюджета на OpenAI компании смогут направлять на продукты партнёров, построенные поверх моделей OpenAI. Это ещё один шаг к модели, где OpenAI хочет быть не только поставщиком моделей, но и платформой, через которую распространяются сторонние ИИ-продукты.

DevDay 2026 показал заметный сдвиг стратегии OpenAI. Компания уже не ограничивается выпуском более сильных моделей: вокруг них постепенно строится полноценная вычислительная и программная среда, где агенты постоянно работают в фоне, используют приложения и компьютеры, взаимодействуют с командами и могут становиться частью продуктов других разработчиков. ChatGPT при этом всё больше превращается из чат-бота в центральный интерфейс для работы с целой экосистемой ИИ-агентов.




Video is unavailable for watching
Show in Telegram
OpenAI выпустила GPT-6.1 Sol — почти уровень Astra за пятую часть цены

Всего через неделю после выхода GPT-6 Sol OpenAI представила GPT-6.1 Sol. Новая модель практически догоняет флагманскую GPT-6 Astra в программировании, работе с компьютером и профессиональных агентных задачах.

На DeepSWE 1.1, где агентам нужно выполнять длинные задачи в реальных кодовых базах, GPT-6.1 Sol сравнялась с GPT-6 Astra и превзошла лучший результат предыдущего Sol на 6,4 процентного пункта, причём при меньших затратах на рассуждение. На OSWorld 2.0, проверяющем управление приложениями и компьютером, новая версия прибавила семь пунктов и приблизилась к Astra на 2,1 пункта, обходясь примерно в семь раз дешевле на одну задачу.

Особенно большой скачок OpenAI показывает на научных задачах. В Terminal-Bench Science, где модель анализирует данные, запускает симуляции и решает задачи с использованием кода и терминала, GPT-6.1 Sol более чем вдвое улучшила результат GPT-6 Sol. При максимальном уровне рассуждений одна задача обходилась в среднем в $5,47 против $23,80 у Astra. При этом сама Astra всё ещё остаётся сильнее и набрала 68,1%, поэтому OpenAI рекомендует её для наиболее сложных исследовательских задач.

Цена обычного ввода и вывода при этом осталась на уровне GPT-6 Sol: $2 за миллион входных и $10 за миллион выходных токенов. Кэшированный ввод подешевел вдвое — с $0,20 до $0,10 за миллион токенов. В сравнении с Astra, которая стоит $10/$50 за миллион входных/выходных токенов, новая модель действительно обходится примерно в пять раз дешевле.

В системной карточке OpenAI отмечает и улучшения в следовании ограничениям и намерениям пользователя. При этом по собственной системе Preparedness Framework компания относит GPT-6.1 Sol к уровню Critical по кибервозможностям и High по биологическим и химическим возможностям, поэтому для неё используется тот же набор защитных механизмов, что и для GPT-6 Astra.

GPT-6.1 Sol уже доступна в ChatGPT Work и Codex подписчикам Plus, Pro, Business, Enterprise и Edu, а через API — под именем "gpt-6.1-sol". В ближайшие дни OpenAI также обещает режим Ultrafast с генерацией до восьми раз быстрее стандартной скорости в Codex.


Video is unavailable for watching
Show in Telegram
Команда Manus представила крупное обновление платформы под названием Manus 2.0, позиционируемое как полноценная смена архитектуры и расширение продуктовой линейки.

В основу обновления легла новая агентная система Cascade, которая оптимизирует расход контекста и подключает специализированные инструменты только по мере необходимости. По внутренним тестам компании, такой подход позволил сократить потребление токенов на 23,2%, ускорить выполнение задач на 28,2% и снизить затраты на треть. Для долгоиграющих процессов и сервисов появилась возможность аренды постоянного облачного окружения Cloud Computer, а прежние задачи по расписанию эволюционировали в событийно-ориентированную автоматизацию, способную запускать сценарии в ответ на входящие письма, сообщения в Slack, изменения в Notion или аналитике.

Десктопное приложение трансформировалось в среду Manus Studio, объединяющую человека и ИИ в общем рабочем пространстве. Помимо работы с документами, кодом и таблицами, здесь появились два специализированных модуля. Первый из них — Video Editor — отходит от парадигмы полной перегенерации видео по новому промпту и предлагает привычный таймлайн, где пользователь может точечно менять дорожки, текст, анимации или передавать проект обратно модели с помощью креативного режима Alchemy. Второй модуль — Game Dev — предназначен для создания игр с использованием генерации ассетов и кода, поддерживая ручное редактирование объектов прямо на сцене и развертывание мультиплеера в один клик через Cloud Computer. Параллельно платформа расширила возможности Computer Use, позволив удаленно отдавать голосовые и текстовые команды своему компьютеру со смартфона, пока агент безопасно оперирует разрешенными приложениями.

Отдельным ключевым анонсом стало самостоятельное приложение Cue, ориентированное на автономных персональных агентов. Каждому агенту в Cue выделяются собственные цифровые реквизиты — виртуальная машина, адрес электронной почты, телефонный номер и кошелек с установленным лимитом бюджета. Агенты могут объединяться в групповые чаты для совместной работы над проектами, принимать телефонные звонки от имени пользователя и взаимодействовать с внешними сервисами, вплоть до заказа еды в заведениях по QR-коду. Обновление Manus 2.0 уже развернуто на веб-платформе, в десктопных и мобильных клиентах, а доступ к Cue открыт в формате раннего тестирования по инвайтам.


4 из топ-5 моделей по AA Intelligence Index теперь от Anthropic.


Anthropic представила Claude Sonnet 5.5 — вторую модель в линейке 5.5, призванную занять нишу высокопроизводительного, быстрого и экономичного инструмента для повседневных прикладных задач. Новинка дополняет флагманскую модель Opus 5.5, уступая ей в сценариях, требующих непрерывного глубокого суждения и рассуждений в открытых задачах, но приближаясь к ней по качеству в решении прикладных инженерных и аналитических вопросов при существенно более низких затратах. В ближайшие недели линейка также пополнится облегченной моделью Haiku 5.5.

Ключевым преимуществом Sonnet 5.5 стало сочетание возросшей скорости и экономической эффективности. Хотя номинальная стоимость токенов осталась на прежнем уровне — два доллара за миллион входных и десять долларов за миллион выходных токенов — реальные затраты на решение задач снизились на величину до тридцати процентов за счет оптимизации расхода токенов и более компактных цепочек рассуждений. Генерация текста и кода стала быстрее более чем на тридцать процентов по сравнению с Sonnet 5.

В тестах на агентное программирование модель продемонстрировала резкий качественный скачок: на бенчмарке Terminal-Bench 4.0 результат вырос до семидесяти целых шести десятых процента против чуть более десяти процентов у предшественника, а в тестах FrontierCode и CursorBench система показала результаты, сопоставимые с топовыми решениями индустрии. Партнеры и ранние тестировщики отметили эффективную группировку вызовов инструментов, меньшее количество промежуточных ошибок и способность автономно вести длительные сессии разработки и проектирования архитектуры.

Помимо программирования, модель значительно прибавила в решении офисных и интеллектуальных задач. В комплексном бенчмарке GDPval-AA Sonnet 5.5 практически сравнялась с Opus 5.5, показав высокие результаты в распознавании диаграмм, работе с интерфейсом операционной системы и подготовке документов, презентаций и аналитических отчетов. В области безопасности модель сохранила строгие ограничения в биологической сфере и впервые для серии Sonnet получила специализированные фильтры кибербезопасности аналогично старшим флагманским системам.


Компания Fireworks AI представила новую специализированную ИИ-модель Ember-1, которая сохраняет аналитические способности и качество ответов базовой модели Kimi K3, но использует при этом на 40% меньше токенов. Разработка стала ответом на проблему избыточных рассуждений современных «думающих» нейросетей. В сложных многошаговых задачах такие модели часто тратят подавляющее большинство токенов на внутреннюю логику, что приводит к сильному удорожанию работы, так как контекст непрерывно разрастается. Исследователи выяснили, что обычное ограничение глубины рассуждений в настройках ведет к потере качества, поэтому модель пришлось обучать мыслить более лаконично.

В процессе создания Ember-1 команда Fireworks Research провела десятки экспериментов, чтобы научить нейросеть отсекать ненужные размышления и непродуктивные циклы, сохраняя при этом способность к полезной саморефлексии и исправлению ошибок. Для обучения использовались внутренние данные, охватывающие математику, программирование, работу с инструментами и поиск. В результате новая модель научилась выдавать ответы качества максимальных настроек Kimi K3, но при существенно меньших вычислительных затратах.

Высокая эффективность Ember-1 подтвердилась в ходе тестирования Specialized Intelligence Index. На медицинском бенчмарке Bedside Bench, а также на индустриальных тестах по программированию вроде SWE-bench и Terminal Bench, новинка установила новые стандарты соотношения цены и качества, опередив по этому показателю такие флагманские решения, как GPT-6 Astra и Claude Opus 5.

Модель уже доступна в Cline и Vercel AI.


Чел сделал шуточный бенчмарк интеллекта для кожаных, в котором нужно отвечать на вопросы как будто ты LLM. В конце увидишь свой индекс интеллекта и место в рейтинге моделей.

Проверить себя


Video is unavailable for watching
Show in Telegram
Наконец-то сделали бенч, который выявляет нерф моделей (осознанное отупление модели вендорами).

20 last posts shown.