Synaptic Garden


Гео и язык канала: не указан, не указан
Категория: не указана


От байтов к бытию — и обратно
Авторский канал об IT, науке и скрытых паттернах реальности. Исследую связи между программированием, философией и искусством. Делюсь инсайтами из мира ИИ и размышлениями о технологическом будущем.
@darkgenius

Связанные каналы

Гео и язык канала
не указан, не указан
Категория
не указана
Статистика
Фильтр публикаций


Liquid AI совместно с аналитической платформой Artificial Analysis представила Pipette — открытую систему для бенчмаркинга LLM непосредственно на пользовательских и периферийных устройствах. Главная идея проекта заключается в том, что реальная производительность локального ИИ определяется не моделью самой по себе, а всей системой в сборе, включая конкретное железо, среду выполнения, тип квантования и доступную память.

​В рамках релиза представлена публичная база данных, содержащая результаты тестирования более тысячи конфигураций. Датасет охватывает свыше тридцати популярных моделей в разных форматах квантования, сборки llama.cpp под macOS, Windows, iOS и Android, а также длины контекста от 256 до 8192 токенов на актуальных потребительских чипах. Вся инфраструктура платформы, включая клиенты для мобильных и настольных систем, модули управления и оценки качества, опубликована с открытым исходным кодом под лицензией Apache 2.0.


Вышел русский перевод книги DeepSeek Harness Orange Book


NVIDIA AVO прошёл публичный ARC-AGI-3 на 100% — и показал, насколько важен агентный харнесс

NVIDIA протестировала свой агентный фреймворк AVO на ARC-AGI-3 и получила максимальный результат на публичном наборе: агент прошёл все 183 уровня в 25 игровых средах и набрал 100,00 по метрике RHAE. Она учитывает не только успешность прохождения, но и эффективность действий относительно человека, впервые столкнувшегося с задачей. Всего AVO потребовалось 6 624 действия — примерно на 12% меньше, чем системе VISTA с той же Claude Opus 5, которой понадобилось 7 542.

ARC-AGI-3 заметно отличается от предыдущих версий бенчмарка. Вместо статических головоломок агент попадает в неизвестные интерактивные среды без описания правил и даже без явно сформулированной цели. Ему приходится экспериментировать, по результатам действий восстанавливать устройство мира, понимать, чего вообще требуется добиться, а затем планировать прохождение на десятки и сотни шагов вперёд. Именно поэтому ARC Prize позиционирует его как тест прежде всего для автономных агентов, а не изолированных языковых моделей.

AVO — Agentic Variation Operators — изначально создавался NVIDIA совсем для другой задачи: автономной оптимизации GPU-ядер. В отличие от обычного подхода, где LLM лишь генерирует очередной вариант решения внутри заранее заданного алгоритма поиска, в AVO модель сама решает, что исследовать, что изменить, какой эксперимент провести и как интерпретировать его результат. Состояние сохраняется между длинными циклами работы, а отдельный агент-наблюдатель отслеживает застой и может направить поиск в другую сторону. По сути, модель здесь выступает не отдельным генератором кода, а ядром длительного цикла «гипотеза → действие → проверка → корректировка».

На ARC-AGI-3 NVIDIA практически не меняла эту архитектуру, заменив лишь интерфейс к среде. Claude Opus 5 получала состояние игры не картинкой, а точной текстовой сеткой 64×64 и список доступных действий без объяснения их смысла. При этом команда сознательно не добавляла специализированную для ARC программную модель мира: задача состояла как раз в том, чтобы проверить переносимость универсального агентного цикла.

Именно переносимость NVIDIA считает главным результатом. Ранее AVO непрерывно работал семь дней над оптимизацией attention-ядер, исследовал более 500 направлений и сохранил 40 версий реализации. На DGX B200 лучшие варианты оказались до 3,5% быстрее cuDNN и до 10,5% быстрее FlashAttention-4, после чего агент примерно за полчаса самостоятельно адаптировал найденные решения под grouped-query attention. Теперь практически та же система смогла работать уже с совершенно другой задачей — неизвестными интерактивными мирами.

В NVIDIA отдельно подчёркивают, что результат нельзя трактовать как «AVO повысил Claude Opus 5 с 30% до 100%». ARC Prize действительно показывает для Claude Opus 5 около 30% в другой конфигурации, но отличаются режим рассуждений, харнесс и процедура оценки, поэтому это не контролируемое сравнение. Скорее эксперимент показывает более общий тезис: способности автономного агента определяются не только базовой моделью, но и системой вокруг неё — памятью, инструментами, управлением контекстом, обратной связью и механизмами выхода из тупиков.

Есть и важная оговорка: речь идёт именно о публичном наборе ARC-AGI-3, а не о скрытом наборе конкурсной оценки. NVIDIA прямо это отмечает. Более того, 100% на публичной версии уже получала система Tycho в июле, поэтому результат AVO — не первое «решение ARC-AGI-3» вообще. ARC Prize также предупреждает, что результаты для публичного ARC-AGI-3 в Community Leaderboard обычно заявляются самими авторами и не проходят независимую проверку фонда.

Если свести работу к одной мысли, то AVO хорошо иллюстрирует нынешний сдвиг в агентных системах: длинный горизонт работы всё меньше выглядит свойством одной LLM и всё больше — свойством архитектуры, которая умеет накапливать опыт и превращать последовательные вызовы модели в единый непрерывный процесс решения задачи.


Видео недоступно для предпросмотра
Смотреть в Telegram
Thariq из Anthropic рассказал про полезный скилл ELI5, который они используют в команде для объяснения сложных вещей с помощью наглядных html-артефактов.


Nvidia заключила с Poolside необычную сделку, которая очень похожа на поглощение, хотя юридически им не является. По данным Newcomer, получившего письмо Poolside инвесторам, Nvidia заплатит $6 млрд за неисключительную лицензию на Model Factory — внутреннюю систему Poolside для разработки и обучения ИИ-моделей. Одновременно Nvidia предложит работу 109 сотрудникам, участвовавшим в создании семейства моделей Laguna. Сама Poolside при этом продолжит существовать как независимая компания.

Model Factory — пожалуй, наиболее интересная часть сделки. Это не отдельная модель и не обычный набор инструментов для обучения, а практически вся «производственная линия» Poolside: обработка и смешивание данных, генерация синтетических наборов, распределённое предобучение, дообучение, обучение с подкреплением на выполнении кода, автоматические оценки и эксперименты с архитектурой. Poolside описывала систему как платформу, где исследователь задаёт конфигурацию эксперимента, а инфраструктура сама распределяет работу по кластерам и запускает остальные этапы. Именно с её помощью компания обучала открытые модели Laguna.

То есть Nvidia, судя по структуре сделки, интересуют не столько сами веса Laguna, сколько технология и команда, умеющая быстро строить новые фундаментальные модели. Последняя Laguna S 2.1 — MoE-модель на 118 млрд параметров с 8 млрд активных и контекстом до 1 млн токенов, ориентированная на программирование и длительную агентную работу. Poolside выпустила её с открытыми весами всего месяц назад.




Видео недоступно для предпросмотра
Смотреть в Telegram
OpenAI добавила долгожданную поддержку прозрачного фона в режиме предварительного просмотра для генерации изображений через API модели GPT-Image-2.

​Это обновление существенно упрощает рабочие процессы дизайнеров и разработчиков, так как избавляет от необходимости использовать сторонние сервисы или дополнительные алгоритмы для сегментации и удаления заднего плана. Теперь модель способна нативно генерировать объекты, стикеры, элементы интерфейса, игровые ассеты и логотипы с чистыми контурами прямо в формате PNG с прозрачностью.


DeepSeek добавила зрение в V4-Flash: экспериментальная мультимодальная модель уже в API

DeepSeek открыла доступ к новой мультимодальной модели понимания изображений DeepSeek-V4-Flash-Vision-Exp на своей API-платформе — модель помечена как экспериментальная и вызывается указанием model='deepseek-v4-flash-vision-exp'. Суффикс Exp здесь работает ровно так же, как в своё время у V3.2-Exp: это выкатка на публику того, что компания пока не считает финальным продуктом.

Событие само по себе заметное, потому что до этого дня вся линейка V4 была строго текстовой. И V4-Pro, и V4-Flash в официальной документации описывались через набор чисто языковых возможностей — режимы размышления, JSON-вывод, вызов инструментов, FIM-дополнение, — а разработчикам, которым нужны были скриншоты или сканы документов, приходилось строить обходные пайплайны: прогонять картинку через стороннюю vision-модель и передавать в DeepSeek уже текстовое описание. Теперь этот костыль убирается.


Видео недоступно для предпросмотра
Смотреть в Telegram
MiniMax запустила MiniMax Design — AI-платформу для создания контента, которая объединяет текстовые, графические, видео- и аудиомодели в единый агентный рабочий процесс. Вместо работы с отдельными генераторами пользователь задаёт идею или загружает бриф, после чего главный агент разбивает задачу на этапы, подбирает подходящие модели и координирует создание результата.

В основе пользовательских пайплайнов лежат скиллы. Удачную связку можно собрать в диалоге или установить готовую из общей витрины. В витрине уже лежат заготовки под клипы, промо-ролики, карточки товаров для маркетплейсов и раскадровки персонажей.

MiniMax после январского выхода на Гонконгскую биржу методично закрывает всю вертикаль: модели M-серии для агентов и кода, H3 для видео, Music 3.0 для звука, Speech для голоса — и теперь оболочка, которая сшивает их в один рабочий процесс. Ставка ровно та же, что у Adobe с Firefly и у ByteDance с CapCut: побеждает не тот, у кого лучше отдельная модель, а тот, кто владеет поверхностью, где сидит создатель контента.


Видео недоступно для предпросмотра
Смотреть в Telegram
Liquid AI ускорила LFM2.5 до 3 раз с помощью нового метода спекулятивного декодирования

Liquid AI представила LFM2.5-DSpark — набор вспомогательных draft-моделей для ускорения инференса моделей семейства LFM2.5. Новый подход добавляет путь спекулятивного декодирования, который увеличивает скорость генерации без изменения качества ответов. DSpark доступен для LFM2.5-1.2B-Instruct, LFM2.5-2.6B и LFM2.5-8B-A1B.

Сам метод DSpark описан в отдельной работе и складывается из трёх частей. Параллельная часть в стиле DFlash за один проход выдаёт скрытые состояния и логиты сразу для k черновых токенов, опираясь на контекстные признаки целевой модели. Поверх неё работает лёгкая последовательная голова, устроенная как марковская цепь между соседними токенами: она подмешивает в логиты каждой позиции зависимость от только что выбранного токена, чего в DFlash нет, и за счёт этого поднимает долю принятых предсказаний на дальних позициях блока. Третий элемент — голова уверенности (confidence-scheduled verifier), предсказывающая вероятность принятия каждого черновика, и планировщик, который отсекает малоперспективные хвосты, когда их проверка обходится дороже выигрыша.

По результатам тестов интеграция DSpark обеспечивает ускорение инференса до 3.18 раза на серверных ускорителях вроде NVIDIA H100 и до 2.87 раза на локальных устройствах вроде MacBook с чипом M4 Max. Модель LFM2.5-2.6B продемонстрировала среднее ускорение в 2.67 раза на GPU и 2.27 раза на Mac, снизив задержку при вызове инструментов в агентных сценариях на 57%. Младшая модель LFM2.5-1.2B-Instruct ускоряется в среднем в 2.1 раза на GPU и в 2.54 раза на ноутбуке, достигая скорости генерации около 350 токенов в секунду локально. Для MoE-архитектуры LFM2.5-8B-A1B ускорение на H100 достигает 2.54 раза, однако на локальных устройствах прирост пока ограничен 18% из-за специфики активации экспертов в бэкенде Metal llama.cpp.

Черновики получились очень компактными: около 296 млн параметров для 1,2B и по 328 млн для остальных двух, причём эмбеддинги и LM-голова берутся у целевой модели и в этот вес не входят. Отдельно Liquid подчёркивает, что всё обучение и все абляции выполнялись исключительно на железе AMD в собственном фреймворке компании.


Видео недоступно для предпросмотра
Смотреть в Telegram
Anthropic запустила платформу для обучения Claude Academy


SpaceX после сделки с Cursor попыталась купить разработчика ИИ-агента Devin

Через несколько дней после сделки по покупке Cursor за $60 млрд SpaceX обратилась к другой крупной компании в сфере ИИ для программистов — Cognition, разработчику автономного ИИ-агента Devin, с предложением о возможном поглощении.

По данным Bloomberg, Cognition не стала продолжать переговоры о продаже компании. При этом стороны обсуждают другие формы сотрудничества, включая потенциальное использование вычислительных мощностей SpaceX для обучения и работы моделей Cognition.


На платформе OpenRouter появилась новая скрытая (stealth) модель под названием Ox Alpha. Модель позиционируется как фронтир решение с фокусом на кодинг, длительную агентную работу и реальные производственные сценарии. Она поддерживает контекстное окно в один миллион токенов, принимает на вход текст, изображения и видео, а возвращает только текст. Доступ к модели на данный момент полностью бесплатный, провайдер не использует промпты и ответы для обучения.

Параллельно с анонсом OpenRouter модель активно продвигается через OpenCode: там подчёркивают, что в течение ближайшей недели она доступна бесплатно с щедрыми лимитами и заявленной ёмкостью порядка 100 триллионов токенов в сутки. Пользователи уже начали активно тестировать её, отмечая сильные стороны в долгосрочном рассуждении и самоитерации при работе с кодом.

В сообществе сразу возникли предположения о происхождении модели. По результатам токенизационных «отпечатков» и сравнений поведения некоторые наблюдатели считают, что под капотом может скрываться мультимодальный вариант GLM-5.3, хотя официального подтверждения пока нет. Другие допускают связь с китайскими лабораториями, включая возможные проекты Xiaomi, а кто-то даже видит в стиле ответов новую Gemini.


Репост из: Анализ данных (Data analysis)
Полный инженерный курс по AI-агентам на русском: от tool calling до production

Курс инженерный, а не обзорный. Здесь почти нет рассуждений о том, «изменит ли ИИ мир», зато есть: минимальные работающие реализации каждого механизма, лабораторные с критериями приёмки, шаблоны для копирования, чек-листы перед релизом, каталог антипаттернов и набор бенчмарков, по которым можно честно сравнить две версии своего агента.

Качество агента почти никогда не упирается в модель. Оно упирается в инженерию вокруг модели: как описаны инструменты, что попадает в контекст, где стоят проверки, что происходит при третьей подряд ошибке и сколько это стоит за тысячу запусков. Модель - двигатель. Курс -про всё остальное в автомобиле.

https://github.com/justxor/Aiagentsfullcourse


Свежий дроп токенов 🎉

Сегодня забираем халявные 25000 кредитов на генерацию медиаконтента от zarklab.ai.

1. Переходим на zarklab.ai и логинимся через гуглоакк.
2. Выбираем план Pro и вводим данные зарубежной карты.
3. Сразу отменяем подписку.

Кредитов хватит на почти сотню генераций видео с Kling 3 Lite или 3000 генераций изображений с GPT Image 2.


Видео недоступно для предпросмотра
Смотреть в Telegram
Компания Patronus AI представила открытый датасет FigmaTrace, предназначенный для обучения мультимодальных моделей (VLM) тонкостям реального дизайнерского процесса и агентному взаимодействию с графическими интерфейсами.

Основная предпосылка создания набора данных заключается в том, что современные визуально-языковые модели хорошо справляются с формализованными задачами вроде распознавания документов или базового управления ОС, но испытывают трудности в субъективных и креативных сценариях. Предыдущие попытки обучения в этой сфере опирались на финальные статичные макеты или парсинг готового HTML в JSON, полностью игнорируя последовательность решений, логику дизайнера и промежуточные этапы работы.

Чтобы восполнить этот пробел, исследователи собрали 3 469 траекторий действий человека в Figma общей длительностью более 200 часов. Датасет охватывает 10 креативных навыков и включает как задачи с четкими критериями (исправление доступности, шаблонизация), так и открытые сценарии (создание интерактивных прототипов, конвертация скетчей в Figma-макеты, адаптация под разные платформы).

Ключевым методическим открытием исследования стало то, как именно длинные видеозаписи разбиваются на траектории: сегментация по этапам проектирования (phase-based curation) оказалась на 7,3 процентных пункта эффективнее стандартной нарезки по максимальной длине контекста, так как сохраняет смысловой контекст задачи и намерения пользователя.

Обучение на таких траекториях показало высокую способность моделей к генерализации. Дообученная открытая модель Qwen3.8-27B не только улучшила результаты в задачах дизайна, но и превзошла закрытые флагманские модели на сторонних бенчмарках GUI-навигации (включая AndroidControl и GUI-Odyssey). Анализ показал, что прирост производительности связан с резким повышением точности выбора элементов по координатам, исчезновением ошибок выхода за границы сетки и устранением нерешительности при выдаче действий.

Датасет (разделенный на 2 883 обучающие и 586 оценочных траекторий), научная статья и веса дообученной модели Qwen3.8-27B опубликованы в открытом доступе на Hugging Face.

Видео: Patronus AI


Компания SenseTime представила SenseNova U1.5 Lite — компактную мультимодальную модель с открытым исходным кодом, которая объединяет в единой архитектуре визуальное понимание, генерацию и точечное редактирование изображений. В отличие от классических связок из нескольких раздельных нейросетей, модель использует нативный унифицированный подход, что минимизирует задержки при обработке запросов и упрощает интеграцию в прикладные системы.

Главный акцент в релизе сделан на оптимизации ресурсов, повышенной управляемости и четкости результатов. Архитектурные доработки позволяют модели точно следовать сложным инструкциям по локальному изменению объектов, сохраняя исходную композицию и мелкие текстуры без типичных артефактов склейки. Параллельно с генерацией модель способна детально анализировать визуальные сцены, распознавать текст и решать задачи визуального рассуждения.

Сниженные требования к вычислительным мощностям в сочетании с открытым исходным кодом делают SenseNova U1.5 Lite практичным инструментом для локального развертывания и экономичной интеграции в коммерческие продукты, позволяя закрывать полный цикл работы с визуальным контентом на доступном оборудовании.


Видео недоступно для предпросмотра
Смотреть в Telegram
Black Forest Labs представила FLUX Upscale — отдельный инструмент для масштабирования видео вплоть до нативного разрешения 4K.

Решение призвано устранить разрыв между базовым качеством генераций и требованиями индустрии к вещательным и рекламным форматам. В отличие от локальных и универсальных апскейлеров, которые часто работают медленно или теряют качество при масштабировании, FLUX Upscale оптимизирован для работы с генерациями моделей семейства FLUX. Он эффективно справляется с характерными артефактами — устраняет смазанные лица и убирает сеточные дефекты на сложных текстурах вроде воды и травы. Инструмент способен принимать исходные видеоролики с разрешением от 480p и увеличивать их с коэффициентами 1.5x, 2x и 3x, что при стандартном HD-входе дает на выходе 1080p, 2K и 4K соответственно.

Сервис предлагает два режима работы в зависимости от задач пользователя:

Режим Precise ориентирован на максимальное сохранение консистентности оригинала и ключевых деталей объекта. Он выполняет генерацию за 4 шага, обходится дешевле и быстрее (по тарифу $0.07 за мегапиксель в секунду), являясь оптимальным выбором, когда важно точно удержать исходный образ.

Режим Creative использует 8 шагов и стоит $0.10 за мегапиксель в секунду. Он глубже перерабатывает изображение, восстанавливает дефекты и дорисовывает больше новых деталей, однако допускает частичное изменение внешности или исходных ориентиров.

Новый апскейлер уже доступен для тестирования через интерактивный плейграунд и интеграции в рабочие пайплайны по официальному API платформы.

Видео: Black Forest Labs


Видео недоступно для предпросмотра
Смотреть в Telegram
Компания Cerebras Systems представила следующее поколение своей специализированной вычислительной платформы — сервер CS-4, ориентированный на обучение и инференс крупнейших моделей искусственного интеллекта. Ключевым технологическим прорывом новой системы стало двукратное увеличение пропускной способности памяти и межузловых соединений по сравнению с предыдущей итерацией, что направлено на ликвидацию критических задержек при передаче данных в распределенных нагрузках.

В основе платформы лежит обновленный монолитный процессор пластинного масштаба (Wafer-Scale Engine), объединяющий миллионы специализированных ядер и рекордный объем встроенной сверхбыстрой памяти прямо на кремниевой пластине. Благодаря удвоению пропускной способности интерконнекта и локальных интерфейсов передачи данных, сервер обеспечивает кратный прирост скорости генерации токенов и ускоряет фазу обратного распространения ошибки при обучении нейросетей, эффективно устраняя узкие места классической архитектуры фон Неймана.

CS-4 полностью интегрируется в фирменную масштабируемую архитектуру Cerebras, работая в связке с внешними модулями хранения весов и технологиями кластеризации. Это позволяет объединять сотни серверов в единую вычислительную фабрику петафлопсного уровня, готовую к обработке мультимодальных архитектур с триллионами параметров и сверхдлинными контекстными окнами без необходимости сложного ручного разделения моделей на тензорные параллели.


Видео недоступно для предпросмотра
Смотреть в Telegram
Meta* выкатила десктоп приложение Meta AI для macOS.

--
* деятельность компании Meta Platforms запрещена в РФ

Показано 20 последних публикаций.