Фильтр публикаций


Репост из: Нейродвиж
Видео недоступно для предпросмотра
Смотреть в Telegram
У ИИ-агентов появился свой After Effects — Mirage показали Tesseract, бесплатный движок для монтажа видео, анимации и звука 😱

Даёшь агенту исходники и описываешь задумку — он собирает ролик, анимирует текст, накладывает эффекты и настраивает звук. Проект остаётся редактируемым: можно попросить сдвинуть титры, ускорить отдельный фрагмент или приглушить музыку, сохранив остальной монтаж.

Есть плагин для ChatGPT и подключение к другим локальным агентам. Сам движок бесплатный, расходы на ИИ-агента — отдельно.

И да, ролик в этом посте тоже собрали в Tesseract. Забираем — здесь.


Репост из: Эксплойт
Любую книгу теперь можно превратить в навык нейросети — вышел опенсорсный конвертер book-to-skill для ваших ИИ-агентов.

Скармливаете ему PDF, EPUB, DOCX, Markdown или целую папку документов — агент считывает текст, собирает конспекты глав, словарь, паттерны и шпаргалку, а затем превращает это в skill. Метод отлично экономит токены — в 24-51 раз меньше затрат, чем если бы вы просто закинули нейронке целую книгу.

Идеально, чтобы обсудить с нейронкой любимую книгу или превратить рабочий манул в инструмент. Забираем — здесь.

@exploitex




Репост из: Нейродвиж
Спасаем шакальные фотки прямо в браузере — появился новый король апскейла Face26 😮

— НЕ меняет фотки, оставляя все детали на месте;
— Удаляет шум, размытости и делает цветокоррекцию;
— Спасает даже пиксельную мазню;
— Можно грузить любое количество изображений;
— БЕСПЛАТНО.

Ваш личный реставратор — здесь.


Репост из: Метаверсище и ИИще
Мертвые заговорили!

Stability AI выпустила Stable-Layers - модель, которая разбирает обычную картинку на отдельные редактируемые RGBA-слои: фон, персонажей, предметы и т.д., причём пытается восстановить то, что было скрыто за объектами.

Это никакая не модель от Стабилити, прошли те времена.
В основе лежит Qwen-Image-Layered 20B, который Stability дополнительно обучила через Flow-GRPO.

Получилось заметно аккуратнее оригинала: меньше дублирующихся слоёв, чище альфа и лучше разделение объектов. Рекомендуемое разрешение - 640 px; выше запускать можно, но качество постепенно начинает сыпаться.

Веса и код уже открыты. Сам Stable-Layers - небольшая LoRA около 330 МБ, но для неё нужна база Qwen-Image-Layered.

Оригинал уже работает в ComfyUI, есть FP8 и кванты для более скромных GPU, поэтому локальный запуск Stable-Layers нищебродских картах должен пойти.

Веса; https://huggingface.co/StabilityLabs/Stable-Layers

GitHub:
https://github.com/Stability-AI/Stable-Layers

примеры и сравнения
https://stability-ai.github.io/stable-layers.github.io/

@cgevent


Репост из: Gos
Krea2, Ideogram, Z-Image. Можно и в Qwen-Image, Flux2, Klein


Репост из: Метаверсище и ИИще
Stem Studio

Опенсорсная штуковина для разделения звукового (или звука из видео) файла на диалоги, музыку и шумы.

Это если вам с площадки прилетела запись, где все вместе.

На входе звук, на выходе:
🗣 Dialogue
🎼 Music
💥 SFX

Все в WAV.

https://github.com/wassermanproductions/stem-studio

@cgevent








Репост из: 📟 Егор Смышников
Открыл новый экономный подход к вызову скиллов для агентов.

Все мы знаем, что на Claude Code есть лимиты от которых устаешь. Иногда даже нет желания запускать некоторые вещи, чтобы сохранить лимиты для чего-то более мощного.

В чём фича экономии:

— Вы разрабатываете скиллы с помощью мощных моделей Fable 5, Opus, может быть на GPT 5.6.
— Но запускаете вы скиллы через Cursor моделью Composer 2.5, которая не стоит практически ничего.

Я уже много раз говорил, что ежемесячный лимит на Composer 2.5 в Cursor очень тяжело потратить. И вот, боялся чет попробовать запускать Claude скиллы в Cursor, но это так же отлично срабатывает.

Теперь я экономлю лимиты Claude на рутину через Cursor Composer.

Такой вот небольшой секретик.


Репост из: Max Vasilev
да вот хоть тут https://cloud.comfy.org/


Репост из: Метаверсище и ИИще
Motion Previs Studio v4

Это автономное настольное приложение, предназначенное для преобразования исходных видео в наборы данных для превизов и референсов. Оно разработано для режиссеров, которым требуется большая точность перед генерацией видео.

Можно выбрать эталонный кадр, извлечь данные о позе, глубине, движении камеры, масках, краях и управляющих слоях, а затем экспортировать данные для Seedance, ComfyUI, Blender, Runway, Kling и других.

Автор - 25 лет в индустрии кино и рекламы. С кем только не работал. А потом свичнулся в Creative Technologist and AI Systems Architect.

У него два софта:
https://github.com/wassermanproductions/motion-previs-studio

https://github.com/wassermanproductions/blockout
Второй - это как раз блокаут для нейрорендера, о котором я так люблю писать.

Причем для обоих софтов есть MCP.

Почитайте твиттор Сэма, там есть туторы.
https://x.com/SamJWasserman

Софт непростой - но а как вы хотели? Видео - это вам не картинки (возвращаясь в начало марафона).

В общем, процесс пошел, и потихоньку появляются профессиональные софты для превиза, рефов, режиссуры.

@cgevent


Репост из: Метаверсище и ИИще
Видео недоступно для предпросмотра
Смотреть в Telegram
Итого:

Sol: побивает Fable и доступна на всех платных тарифах.
Terra: средняя, мощная, доступна для всех.
– Luna: самая маленькая и быстрая, также доступна бесплатно.

ChatGPT Work, который теперь одно приложение из ChatGPT, Codex и агентов уже можно скачивать для десктопов: openai.com/chatgpt-work/

@cgevent


Репост из: Сеньор генеративщик 🏴‍☠️
Методы восстановления кадров после редактирования через Nano Banana

Хорошая новость — Nano Banana классно генерит изображения, плохая — редактирует она их мягко говоря, не очень 😬 После первой перегенерации теряется свет и цвет, а на третьей превращается в ужасное мыло. Все текстуры, объекты и лица плывут как тапки в огороде после дождя.

Закинуть кадр взад в банану "а ну повысь качество!" получается не очень. Генеративщики в курсе про этот бич, побеждать его не просто. Но я придумал как) Делюсь рабочими способами, которые каждый день использую.

Во вложении скринкасты — как восстанавливать качество через скетчи, GPT-Image, Nano Banana (спойлер — толку нет).

Работая постоянно с кучей правок от клиентов, однажды допер до прикольного метода перегенеривания кадра через скетчи.

На простых кадрах он работает буквально за две тычки (особенно, если есть вложения, с которыми генерился кадр до изменений), со сложными чуть дольше. Есть ощущение, что говорить про его применение можно как минимум целый день, а не час. Менять ракурсы, впиливать объекты и все такое.

Давно хотел поселить это зерно про скетчи, оказалось, очень универсальная история.

Приятного просмотра. Старался особо не сокращать басню, чтобы показать какой-то кусочек своего образа мыслей.

Качество видео пришлось чуть даунгрейднуть, чтобы вес не зашкаливал, но на пояснение способов это не влияет.

Лучше способов чем эти, и еще заплаточной генерации, пока не придумал. Приятного генерения.


enough
лучший сервис для аватаров


my workfloww is simple just first pass ksampler with https://github.com/capitan01R/ComfyUI-Krea2T-Enhancer 1440x2560 resolution 8 steps er_sde simple then upscale imagex1,5 then encode to second pass 4 steps 0,05 denoise .then use seedvr2 to better 4k


Репост из: 📟 Егор Смышников
WAN ANIMATE SCAIL2 релизнулся.

От себя, пофиксил workflow от Kijai.

— Рассинхрон промпта трекера
— Рассинхрон fps
— Добавил рефайнер до 48fps
— Добавил аудио коннектор
— Детальная инструкция

Залил в Гильдию. Кому нужно, залетайте.


Репост из: Tensor Banana
Ideogram 4 img2img редактирование через inpaint по SAM2 маске и частичным denoise

- можно точно сохранить лицо при редактировании
- изменить только указанный объект, например лицо, фон или текст на бумажке благодаря маскам
- не надо самому выделять маски, маска задается через простой промпт типа "face,hair" или "background"
- запрос на описание картинки и составление json промпта уходит через любой API, например llama.cpp server или openai\mistral\openrouter
- я для составления json промпта юзаю gemma4-31 которая висит на второй видюхе (2080ti-22GB), можно также юзать qwen.
- clip у меня висит на третьей видюхе (3060), для скорости, но это не обязательно
- скорость выполнения запроса вместе с составлением json промпта - 2 минуты на стэке из трех карт (3090+2080ti+3060). Можно все организовать на одой карте, но тогда промпт будет писать какая-то онлайн LLM по апи. Юзеры писали, что в теории, одной 3060 должно хватить
- без частичного denoise (0.90) результаты были хуже, с ним модель знает в каком месте находится тело персонажа.
- img2img работает с помощью описания исходной картинки в json. Описание делается с помощью моей ноды OpenAI.CaptionImage. На момент написания я не видел похожих нод с поддержкой llama.cpp server, поэтому написал свою.
- не все генерации выходят идеальными, надо точно подбирать нужный denoise. чтобы и исходная картинка не слишком сильно вылазила.
- сильно менять позу персонажа не получится, но легкие движения рук - ног возможны. Изменение стиля всей картинки не получится, маска не даст изменить некоторые области. но можно совсем убрать маску и работать только с img2img (без sam2 и без inpaint), воркфлоу тут же.


мой воркфлоу img2img inpaint+sam2+denoise:
https://github.com/Mozer/comfy_stuff/blob/main/workflows/ideogram4_img2img_sam_with_denoise.json

мой воркфлоу img2img+denoise (без масок sam2):
https://github.com/Mozer/comfy_stuff/blob/main/workflows/ideogram4_img2img_without_sam2.json

int8 nodes
https://github.com/BobJohnson24/ComfyUI-INT8-Fast

int8 models
https://huggingface.co/bertbobson/Ideogram-4-INT8-ConvRot/tree/main

kj prompt builder
https://github.com/kijai/ComfyUI-KJNodes

sam2
https://github.com/neverbiasu/ComfyUI-SAM2

clip to another cuda
https://gist.github.com/city96/30743dfdfe129b331b5676a79c3a8a39

моя нода OpenAI.CaptionImage для llama.cpp server
https://github.com/Mozer/ComfyUI-OpenAI

Показано 19 последних публикаций.