Postlar filtri


эйай ньюз dan repost
BFL выпустили FLUX Video Upscale

В BFL выкатили апскейлер для видео. При этом в отличие от Magnific, который улучшал картинку покадрово, это полноценная видеомодель на базе свежего FLUX 3. На вход принимается видео до 20 сек и 2560x1440, кап на выходе около 14.4 мегапикселей.

Доступно два режима. Precise на 4 шага, который меньше крутит картинку, быстрее и немного дешевле, и Creative на 8 шагов, галлюцинирующий больше деталей в кадре, что обычно лучше, но не подойдет, если вы хотите избежать изменения лиц или важных объектов в кадре.

Модель, конечно, будет работать лучше всего с генерациями Flux 3.

Оплата идет за мегапиксель-секунду. Секунда готового видео в FullHD выйдет в ~$0.14 за Precise и ~$0.20 за Creative. Для 4K ценник вырастает до ~$0.55 и ~$0.79.

Блогпост
Документация
Playground

@ai_newz


#видео


GitHub Community dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Появилось удобное расширение для браузера, которое проверяет любую информацию прямо на странице — достаточно выделить текст или картинку мышкой.

ClaimCircle анализирует контекст и выдаёт оценку достоверности в пару секунд.
Фактически это «ленивый фактчекинг» для тех, кто не хочет вручную искать источники.

Скачать

🐱 GitHub


#приколюха


что-то на DL-ском dan repost
Себастьян Рашка (видео) про то, как Claude маркирует сгенерированный текст. В свете моего интереса последний месяц к созданию скилла для написания текстов в человеческом стиле, меня заинтересовало. Про паттерны AI-текста и способы его распознавания


#ллм


Data Secrets dan repost
На OpenRouter появилась таинственная модель Ox Alpha, которая превосходит Sol и Fable на кодинге

https://openrouter.ai/stealth/ox-alpha

Никто не знает, кто разработчик, моделька числится как stealth. Что известно:

– Контекст 1М токенов.
– Мультимодальная.
– На подмножестве DeepSWE выбивает 80%, против Fable 65%, и Sol 52%.
– Токенизатор такой же, как у GLM, и на вопросы про Тайвань отвечает идентично.
– Это пятая анонимная модель за месяц, и предыдущие четыре оказывались китайскими.

Есть все основания предполагать, что это моделька Zhipu AI. Многие говорят, что она окажется GLM-5.3 Flash.

И еще: модель пока что бесплатная! Кто-то не пожалел денег на маркетинг. Правда, есть ограничение: суммарно лаба готова отрабатывать на этой модели не более 100Т токенов в день, но этого все равно должно хватить всем и на все.


Бросамся пока халява.
1мл токенов это серьезно, а если использовать мемори, то можно оч круто поразвлекаться


Генераториум dan repost
DoubleFix-portable.zip
118.0Mb
DoubleFix

Сделал утилиту, которая находит и чинит продублированные кадры в AI-генерациях.

В генерациях Seedance попадаются продублированные кадры — картинка на мгновение подвисает, потом движение идёт дальше. На глаз это читается как микро-рывок, и в длинном клипе таких мест бывает несколько десятков.

DoubleFix их находит и чинит. Перетащил видео, нажал «Анализировать» — получил список таймкодов в формате Premiere, можно проверить глазами. Дальше «Починить». Кадры не вырезаются, а заменяются, поэтому длительность и синхрон со звуком не едут. Оригинал не трогается, результат ложится рядом.


#видео


Вайб-кодинг dan repost
Claude Mythos 5 впервые стал доступен за пределами Project Glasswing. 😨

Anthropic подключила свою самую мощную модель для кибербезопасности к Claude Security.

Достаточно указать репозиторий на GitHub, после чего Mythos 5 может проверить всю кодовую базу, отслеживать передачу данных между файлами, анализировать взаимодействие компонентов, находить уязвимости и предлагать исправления.


#иб




#геймдев




#видео


Вайб-кодинг dan repost
Сегодня день релизов 😨

DeepSeek выпустила DeepSeek-V4-Flash-Vision-Exp — экспериментальную мультимодальную модель, созданную для агентов, которым нужно видеть.

И по качеству на тестах визуальных агентов она уже вплотную приближается к Opus 4.8, а местами даже превосходит её. Хотя это всего лишь Flash-модель.

https://api-docs.deepseek.com/guides/vision/




Denis Sexy IT 🤖 dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Увидел тут полную карту мозга мухи (FlyWire – там размечены все 139 тысяч нейронов дрозофилы) и не удержался – сделал 3D-муху, которая живёт на рабочем столе мака

Внутри настоящая карта нейронов дрозофилы (FlyWire), так что от курсора она улетает не по скрипту, а когда у неё реально загорается нейрон побега – тот же, что у живой мухи

Ещё есть окошко с её мозгом: кликаешь по зоне нейронов – муха чешется, пятится или паникует

Днём у неё сиеста, ночью она спит, а на горячем маке бегает быстрее (я не шучу, у нее какие-то евенты из MacOS прокинуты в симуляцию мозга 😋)

Исходный код тут:
https://github.com/DenisSergeevitch/desktop-fly

Получается, вечная электронная 2D жизнь в симуляции

P.S. Раздражает правда как живая, рекомендую


Метаверсище и ИИще dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Вы будете смеяцца, но у нас новый видео генератор.

И это просто конский монстр. По сравнению с ним Минимакс - это Stable Diffusion 1.5 на два килобайта.

Итак MAGI-2 Preview - открытая unified audio-video модель на 114B параметров, построенная как очень мелкозернистый MoE. Единовременно активируется около 6B параметров, то есть примерно 5% всей ёмкости модели. Sand AI называет это Ultra-Fine-Grained MoE / MagiMoE.
Модель одновременно работает с текстом, видео и аудио в одном Transformer backbone.

Главная архитектурная фишка интереснее самого числа 114B. Backbone - **40 Transformer layers**, из них средние **36 слоёв MoE**, четыре крайних dense. Hidden width 3072 разбивается на **12 независимых head по 256 dimensions**. У каждого head собственный набор из **256 экспертов**, а на токен выбираются Top-6. То есть на одном MoE-слое потенциально существует 12 × 256 = **3072 маленьких expert-блоков**, но конкретный токен использует всего 72 из них. Это позволяет хранить огромное количество специализированных параметров, не прогоняя 114B целиком на каждом diffusion step.


Сейчас заявлены T2V и I2V, причём звук генерируется совместно с изображением, а не приклеивается отдельной моделью после генерации. Выход пока жёстко ограничен 10 секундами. Референсов и редактирования нет.

Генерация двухступенчатая:

- base/preview: 512 × 896
- refiner: 1088 × 1920
- затем при необходимости output ресайзится до настоящих 1080 × 1920.


А теперь праздник: системные требования

Официальный MINIMUM(!):

8 × NVIDIA Hopper GPU.

Типа 8×H100/H200. Общий размер весов - около 307 GB:

- main preview transformer - 228 GB
- Qwen3.5-27B text encoder - 56 GB
- refiner - 14 GB
- Stable Audio Open audio VAE - 5 GB
- Wan 2.2 video VAE - 3 GB
- Turbo VAE decoder - 2 GB.

То есть полный зоопарк - особенно напрягает Stable Audio и древний ВАН.

По счастию Монстр уже есть на Artificial Analysis.

И среди open-weight video models with audio сейчас картина такая:

1. MiniMax H3 - 1192
2. MAGI-2 Preview - 1108
3. LTX-2.3 Fast - 958

Наверное можно расходиться, но впереди еще MAGI-2 distilled, которой нет.

Ну и надо подсобрать тесты, пока мало примеров.

А теперь самое главное - дешевая цена (в облаке):

MAGI-2 Preview теоретически обходится Sand.ai примерно в $0.074 за 10 секунд 1080p, но официальную пользовательскую цену API за такой ролик Sand.ai публично не раскрывает. Более того, по идее это цена за distilled модель, которой пока нет.

Cсылки:

https://platform.sand.ai/
https://platform.sand.ai/docs/api-v2
https://platform.sand.ai/app/buy-credits
https://sand.ai/blog/magi-2-preview
https://github.com/SandAI-org/MAGI-2-preview
https://huggingface.co/sand-ai/MAGI-2-preview

https://artificialanalysis.ai/video/leaderboard/image-to-video

@cgevent

20 ta oxirgi post ko‘rsatilgan.