⁛MÄLEEŴICH_AÏ⁛


Гео и язык канала: Весь мир, Русский
Категория: Искусство


∘/Наблюдаем за новостями мира AI
@maleewich

Связанные каналы

Гео и язык канала
Весь мир, Русский
Категория
Искусство
Статистика
Фильтр публикаций


Репост из: Psy Eyes
TwelveLabs: выпустили Marengo 3, индексатор видео контента для поиска в нём персонажей/объектов/сказанных фраз, итд. Подойдёт для: нахождения слов и действий персонажа; моментов как спортсмен N забивает мяч в ворота; блогер появляется в кадре с продуктом бренда; итд. Я писал о них ранее.

Что нового:
* Индексация видео файлов длиной до 4 часов
* Мультимодальный поиск одновременно и по тексту и рефу с картинки
* Возможность создать сущность по 1-5 фото, которую можно тегать в поле поиска
* Работает на 36 языках, включая русский
* Понимает специфичные термины для спорта и кино (zooms, pan, tracking shot, итд)

Есть SDK для интеграции в сторонний пайплайн и API для оплаты за каждый запрос.

На бесплатном тарифе у вас 600 минут. Я закинул 40+ мин файл для теста и сделал сущность по 5 фото. Индексация идёт очень быстро за считанные минуты, а нужный момент с персонажем ищется моментально.

Сайт
Анонс




Репост из: Psy Eyes
Nunchaku: выпустили квантизированные (пожатые) версии Qwen IE 2509 для запуска на видюхах с 8 ГБ VRAM.

Модели слиты воедино с шустрыми lightx2v лорами. Часть заточена генерить в 4 шага, часть в 8 шагов. Версии int4 предназначены для всех видюх до 50 серии Nvidia, а fp4 для 50 серии. Ранк r32 с фокусом на скорость, r128 на качество.

Nunchaku можно поставить через Comfy Manager или по гайдам. Здесь Comfy воркфлоу.

Хаггинг
Гайд по установке Nunchaku
Comfy воркфлоу
Гитхаб




Репост из: Нейронично
Sora 2

Очень хорошее понимание промпта, сама делает звук и музыку, вменяемые склейки, липсинк, хотя разрешения маловато.

Вбила потестить, как бы выглядела игра в мире Бексиньского.

Make a dynamic shot of POV walking through Beksinski horror world, realistic photoreal AAA-game

1. Клянчите инвайт в Сиолошной тут в комментах
https://t.me/seeallochnaya/2964

По одному инвайту могут попасть 4 человека. Не жмотите и там же в комментах делитесь своим инвайтом с другими.

2. Я зашла через сайт соры как обычно без айфонов и скачивания их приложения.

3. Не нужна подписка на чат гпт.


Репост из: Нейросети и Блендер
Видео недоступно для предпросмотра
Смотреть в Telegram
Очень крутой гайд на Апскейл видео вышел в ComfyUI сабреддите.

🤫🫠🤥😶
😚Сразу немного контекст, видеогенерация требует очень много GPU инференса и много видеопамяти, потому представленный подход достаточно быстрый для любителей локального инференса и без миллионов долларов в кошельке.
😚Оригинальные генераторы (Veo3, Runway, Pika) выдают обычно 720p (1280x720, если видео горизонтальное). При этом апскейл с добавлением деталей с 720p до 1080p требует огромных GPU ресурсов. И редко представлен на рынке. (Topaz — не добавляет деталей, только улучшает артефакты блюра и линий)

😚Вот что пишет автор:
Использование нескольких GPU позволяет ускорить масштабирование видео до 1080p или даже 4K с четкой детализацией. Это распределенное обновление, над которым я работал. Если вы новичок, на GitHub вы найдете пошаговое руководство по настройке и видео. А если у вас нет нескольких GPU — не переживайте. Вы можете воспользоваться этим руководством, чтобы запустить всё полностью на Runpod.

😚😶‍🌫️Distributed workflow
😚😶‍🌫️Runpod preset
😚😶‍🌫️Runpod
😚😶‍🌫️ComfyUI Workflow

😚Информация о демо-видео:
😚😶‍🌫️81 кадр
😚😶‍🌫️c 480p до 1080p за 4:45 мин
😚😶‍🌫️4x GPU 5090s

Скачать workflow можно здесь.
Учтите, что наилучших результатов можно добиться, используя расширение RES4LYF, которое предоставляет комбинацию sampler и scheduler, используемую в данном workflow.


Репост из: VAI
Как я писал ранее, с появлением новых инструментов многие вещи приходится переосмысливать — и далеко не всё лежит на поверхности. 🧐

Я уже давно экспериментировал с ИИ в работе с текстурами для 3D-моделей. Напрямую добиться хорошего результата было сложно: приходилось делать массу итераций. Да, даже в таком виде пайплайн ускорял процесс, когда нужно было собрать текстуру из кусков, но всё это казалось муторным и малозначительным.

С выходом Nano Banana я решил проверить: а может ли она править текстуры? И к моему удивлению — получилось! Можно быстро менять фактуру, цвет, добавлять логотипы и прочее. Это действительно ускоряет работу с текстурами в разы.

На примере выше попросил убрать ржавчину и покрасить в синий цвет. Неплохо да? 🤓

Проблемы, конечно, есть. На сложных развертках ИИ периодически «тупит» и наносит правки некорректно (но на той же машине развертка не такая и простая и все получилось). Тут выручает такой подход: из двух-трёх генераций собирается нужная текстура.

Кстати, нейросеть отлично понимает графические подсказки: можно стрелкой указать, что перекрасить и во что, или куда поставить логотип — и Nano Banana это делает. Настоящая магия! ✨

Также о проблемах. На развертках часто надписи оказываются перевёрнутыми вверх ногами или отзеркаленными. Это пока не понимает ни одна нейросеть. Например, когда просишь заменить название, ИИ его меняет, но при этом автоматически переворачивает и отзеркаливает в правильное положение. В такие моменты я просто подаю ИИ уже перевёрнутое и отзеркаленное изображение, чтобы слово или лого было читаемым, и проблем не возникает. После этого я просто возвращаю изображение в исходное положение.

В целом подход нестандартный, простые задачи Nano Banana закрывает хорошо. С более сложными развертками приходится немного повозиться, но и это заметно ускоряет работу.

Пользуйтесь! 🔥

P.S. Не знаю как у вас, а у меня неделя на одном дыхании пролетела. Заранее всем отличных выходных!

@VAI_ART
#VAI_Gallery


Репост из: Psy Eyes
SkyWorks: выпустили Matrix-3D, генератор 3D миров, работающий на связке видеогенерации и 3D реконструкции. Это своеобразная ответочка Hunyuan World 1 от Tencent, проекту Odyssey, и анонсированному Genie 3 от гугла.

Пишешь промт или кидаешь картинку на вход, и получаешь на выбор видеопанораму или 3D сцену, по которой можно перемещаться. Вот только делать это похоже придётся через задание траектории. Тот же World 1 судя по демкам поддерживал геймпад.

Генерить можно в разрешениях 960 × 480 или 1440 × 720. На одной A800 с 40 ГБ VRAM рендер 720p замёт около часа... словно Far Cry телепортировался из прошлого, чтобы научить тебя китайскому.

Гитхаб
Хаггинг


Репост из: Psy Eyes
Видео недоступно для предпросмотра
Смотреть в Telegram
круг жизни

Wonder Studio, облачная платформа для нейромокапа, начинали с бесплатным тарифом. Потом переименовались в Wonder Dynamics и убрали халяву. Затем их купил Autodesk, переименовал в Autodesk Flow Studio, и они стали ещё ближе к энтерпрайз сегменту.

Месяцы спустя теперь снова появился бесплатный тариф с 300 кредитами/мес, которых хватит на 15 секунд обработки живых кадров/анимации или 30 сек нейромокапа.

Вот что конкуренция животворящая делает!

Сайт
Твит


Репост из: Psy Eyes
Генератор видео Wan 2.2 вышел в тираж.

Под капотом используется MoE (mixture of experts) архитектура, которая задействует некоторое количество моделей, каждая из которых является экспертом в своей области. До этого такой подход встречался в языковых моделях.

В случае с Wan экспертных модели две: высокошумные (high-noise) эксперты генерируют общую картину, а низкошумные (low-noise) эксперты обрабатывают детали. Чтобы не грузить обе модели в память, генерация идёт в два прохода: сначала одной моделью, потом другой. Поэтому не пугайтесь если у вас после одной из генераций ничего не отобразилось.

Что нового:
* Повысилось качество и детальность изображения
* Более естественные движения объектов в кадре
* Понимание киношных движений камеры, композиции, освещения, и цветокора
* Улучшилось следование промту и обработка множества объектов в сцене
* Тренировочный датасет с видео увеличился на 83%, а с картинками на 65%

Как обычно, версия на сайте Wan будет качественно отличаться от опенсорсной. Её можно пощупать на сайте на халяву в relax mode, за кредиты, или по API вызовам в Comfy.

Кстати Wan запустили творческий конкурс Wan Muse с денежными призами. Тоже варик пощупать модель вплотную.

В опенсорс ушли две модели: 5B и 14B.

Модель 5B идёт одним файлом, генерит и по тексту и по картинкам, и благодаря эффективному сжатию данных может влезть в 8 ГБ VRAM, хотя способна на 720p в 24 fps вмещаясь в 24 ГБ VRAM.

Модель 14B идёт отдельно в t2i версии со своей high-noise и low-noise экспертными моделями, и отдельно в i2i версии с такими же экспертными моделями. Тут уже в 24 ГБ VRAM можно поместиться только с ощутимой выгрузкой в RAM, или генеря на малых разрешениях.

Я начал тестить на 4090 + 128 ГБ VRAM, но пока результаты очень сильно прыгают. Наберу больше данных для ревью — обращу их в пост. В целом оно хочет весь VRAM, RAM и прочий SRAM, который можно было бы ей скормить.

Comfy уже организовали поддержку нового Wan, на гитхабе обновили билд, и выложили на хаггинг разные версии моделей.

Kijai активно обновляет на гитхабе ноды и уже наваял fp8 веса для 14B.

Будем наблюдать за оптимизациями, модификациями сообщества, и лорами. Интересно будет натренировать эту модель на своих фото, как я уже делал с предыдущим Wan.

Демо 5B (Хаггинг)
Сайт
Анонс
Comfy
Хаггинг (Wan)
Хаггинг (Comfy)
Хаггинг (Kijai)
Гитхаб (Wan)
Гитхаб (Kijai)


Репост из: Метаверсище и ИИще
Видео недоступно для предпросмотра
Смотреть в Telegram
Вот держите новое длинное видео про Runway Aleph.

Это не Photoshop moment для video, как пищит твиттор.

Это скорее Flux Kontext moment для video.

Смотрите, что он умеет:

Generate New Camera Angles
Новые ракурсы существующих сцен с помощью простых текстовых подсказок. Хотите обратный план или низкий угол? Доступны бесконечные варианты покрытия сцены. На композе такого не сделаешь.

Generate the Next Shot
Просто попросите – и модель сгенерирует следующий кадр в вашей истории. Досъемка.

Style Transfer to Video
Любое видео под нужную эстетику. Примените стиль к кадрам, просто описав его. Не новая фишка, но хуже не будет.

Change Environments & Time
Можно менять локации, сезоны и время суток. С локациями особенно зрелищно.

Add Things to Scene
Толпу, продукты, реквизит с корректным освещением и перспективой. Особенно приподчеррипикана работа с отражениями.

Remove Things from Scene
Ну за ротоскоперов.

Change Objects in Scene

Текстуры, объекты, персонажи и другие элементы. Промптами. Video Kontext

Apply Motion to Image
Движение из любого видео на новую начальную кадр‑картинку. Встроенный Act 2

Alter Character Appearance
Возраст и внешний облик персонажей с помощью простых команд, без грима, макияжа или затратных VFX.

Recolor Scene Elements
Изменяйте цвет объектов, предоставляя палитру или описывая желаемые оттенки.

Relight Shots
Тут понятно

Green Screen Extraction
Тут надо смотреть на качество, конечно, а так: за рото и ки, не чокаясь

Выглядит, как попытка сделать прям нейро-комбайн для нейрокомпоза.

Ждем, когда зарелизят.

@cgevent


Репост из: Psy Eyes
Видео недоступно для предпросмотра
Смотреть в Telegram
Что-то годное.

Luma
: выкатили инструмент Reframe для заполнения кадра видео под нужный формат. Например, из 4:3 сделать 16:9.

Работает как outpaint с картинками, только для видео. Можно использовать и с загруженными видосами и с генерациями на Luma. Поддерживаются 6 форматов кадра с заполнением в любую сторону.

Пока для Unlimited и Enterprise тарифов.

Сайт
Твит


Репост из: Psy Eyes
FramePack: генерация видео от крутейшего lllyasviel, автора ControlNet, IC-Light, Forge, Fooocus, Omost, и других ништяков.

Метод предназначен для эффективного создания видео с использованием моделей диффузии. Он позволяет генерить видео с разрешением 480p при 30 FPS на ноутбуке с GPU объёмом памяти 6 ГБ, используя модель размером 13B параметров. При этом заявляется, что длительность видео может достигать 1000+ кадров.

FramePack упрощает тренировку видеомоделей, позволяя обучать их батчами по 64 на одном сервере с 8 видеокартами A100 или H100. Кроме того, он решает проблему «дрейфа» (drifting) в видео, обеспечивая стабильность качества на протяжении всего видео.​

В проекте используется технология «предсказания следующего кадра» (next-frame prediction), где каждый кадр видео кодируется с разной степенью детализации в зависимости от его важности для предсказания следующего кадра. Это позволяет эффективно использовать GPU-память. Кроме того, FramePack применяет «двустороннюю» выборку (anti-drifting sampling), что предотвращает накопление ошибок и сохраняет качество видео на протяжении всей генерации. Метод также поддерживает различные схемы сжатия, что делает его гибким инструментом для создания видео из изображений.

Качество генерации высокое, хорошо сохраняется детализация и дорисовывание новых видов. На динамичных сценах могут съедаться детали или виден гостинг, но зависит от сцены.

В UI видео генерится кусками, которые потом сшиваются в общие кадры. На одной 4090 скорость генерации 2,5 сек/кадр (неоптимизированная) или 1,5 сек/кадр (teacache). На дефолтных настройках у меня нагрузило все 24 гига. На ноутах с 3070ti или 3060 (как у lllyasviel), скорость примерно в 4-8 раза медленнее.

Поддерживаются аттеншены всех мастей (PyTorch, xformers, flash-attn, sage-attention) для доп ускорения.

Сайт
Гитхаб
————————————————————
🔥 Создай своего цифрового двойника, оживи персонажа, или интегрируй бренд. Напиши — @AndreyBezryadin


Репост из: Psy Eyes
Видео недоступно для предпросмотра
Смотреть в Telegram
Runway: выкатили Gen-4.

Обещают генерацию стабильных миров с консистентными персонажами.

Управление персонажами как и контроль сцены станет послушнее. Редактирование местами напоминает работу со слоями в фотошопе.

Можно будет сфоткать объект из реального мира и закинуть его в модель, чтобы делать с ним видео.

Качество и эстетичность стали ещё кинематографичнее.

На сайте пока нет инфы по кредитам за генерации. Говорят уже доступно платным подписчикам. У кого есть доступ дропайте тесты в комменты.

Анонс
Сайт


Репост из: Psy Eyes
Reve: новый генератор изображений, забравшийся в лидербор txt-2-img моделей. При этом проект в превью режиме.

Как у Midjourney фокус на эстетичности. Промту следует хорошо, и годно работает с надписями.

На черрипиках качество отличное, но на моих дефолтных промтах с фантастическим сюжетом сработало не айс. И это с улучшайзером промта, без него лучше вообще не запускать. Кроме варианта когда у вас самого есть детальный промт. Пока что от Flux у меня больше впечатлений.

На сайте только базовые элементы контроля в виде: выбора формата кадра, количества картинок, вкл/выкл улучшайзера, и сида.

Детективное расследование кто стоит за проектом здесь.

Дают 20 бесплатных генераций.

Сайт


Репост из: Psy Eyes

Показано 16 последних публикаций.

170

подписчиков
Статистика канала