Мой внутренний Марс


Kanal geosi va tili: Butun dunyo, Ruscha


Альтернативная проекция места, куда попадает человек, которому удалось взойти на трон, находящийся нигде.

Bog‘liq kanallar

Kanal geosi va tili
Butun dunyo, Ruscha
Statistika
Postlar filtri




Технологии | Нейросети | Боты dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
✴️ Qwen выкатила новую нейронку для генерации и редактирования изображений.

Qwen-Image 2.1 построена на 7-миллиардной архитектуре и генерит картинки в разрешении 2K.

— Принимает до десяти референсов одновременно;
— Меняет только выделенные области кадра;
— Сохраняет лица, форму товаров и надписи;
— Собирает панорамы, инфографику и раскадровки.

Главная фишка — нативная прозрачность. Нейронка сразу создаёт PNG с альфа-каналом и вырезает объекты из обычных фотографий.

Модель уже можно скачать и запустить локально, так что фотошопу снова передают привет.

• Источник
• Попробовать

@aiaiai


Вайб-кодинг dan repost
Qwen снова выдала мощный релиз.

Теперь у нас есть Qwen-Image-2.1 — открытая модель на 7B параметров для генерации и редактирования изображений, которая обходит Nano Banana 2.0.

Модель поддерживает до 10 референсных изображений, локальное редактирование и нативную прозрачность (можно сразу генерировать изображения с прозрачным фоном и вырезать объекты без отдельной маски.)

https://huggingface.co/Qwen/Qwen-Image-2.1

А сообщество уже сделало версию без цензуры:

https://huggingface.co/abenzerps/Qwen-Image-2.1-Uncensored-GGUF


Нейронавт | Нейросети в творчестве dan repost
Jev - System One

TypeSafe AI переизобрели классификацию и подают это как превосходящую альтернативу LLM (на задачах классификации и скоринга)

Обычные LLM пишут ответ токен за токеном и отдают строку. Ее надо парсить и валидировать, а модель в любой момент может сойти с рельсов и выдать галлюцинацию. У Jev структура ответа задана схемой заранее, варианты просчитываются параллельно одним запросом, на выходе типизированные данные с калиброванными вероятностями.

Классификация и скоринг: до 200 раз быстрее и в 450 раз дешевле классических LLM. Вход стоит $0,042 за миллион токенов, выход бесплатный.

Для бэкенда и автоматизации это готовое решение с уровнем уверенности, а не текст для разбора. Софт получает вероятности напрямую - как вызов функции с интеллектом.

Автор - выходеw из OpenAI, участвовавший в работе над методами, которые легли в основу ChatGPT

#classification #automation


Нейронавт | Нейросети в творчестве dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
LynnReal-Omni

Единая модель на базе #MiniMaxH3 для всех видео-задач: #t2v, #i2v, генерация по позе, structural control, omni-reference generation, #styletransfer, видео-редактирование, восстановление деградированного видео и стриминг длинных видео. 4 шага

Принимает разнородные входы — референсы внешности, 3D-рендеры, записи игр. Агент может компоновать условия внутри одной модели

LynnReal-Omni-Flash (27B, 3 шага) — ускоренная с легким VAE-декодером. На одном H100 генерация + декодинг 22 кадров 540p: 843 ms (Standard), 377 ms (Flash). Основа для #realtime стриминга.

Гитхаб
ComfyUI

#comfyui #videoediting #controlnet #videorestoration #imageediting


Метаверсище и ИИще dan repost
Ибо Реал

У нас новый генератор видео. Быстрый и дешевый.

Точно также как пацаны ускоряют Минимакс, смышленые мальчики из Creatify Labs бахнули Boreal - сверхбыстрый и очень дешёвый генератор видео, и он, внимание!, на базе LTX-2.5.

Модель умеет в text-to-video и image-to-video, вместе с видео может генерировать речь, звуки и аудио. В основе - открытая LTX-2.5 22B , которую Creatify дополнительно дообучила на рекламных видео и UGC-контенте.

И вот тут интересно, сегодня "на UGC-контенте" означает на вашем нейрослопе?

Главная фишка - экономика.
На fal 720p стоит $0.01 за секунду видео: пятисекундный ролик - около $0.05, десятисекундный - $0.10.
Огонь!
1080p стоит $0.03/с, 2K - $0.12/с.

Со скоростью тоже нарядно. Creatify заявляет примерно реалтайм 1:1 - пять секунд видео примерно за пять секунд генерации, и до 40 раз быстрее некоторых закрытых моделей в их сравнении.

В чем подвох: сейчас Boreal (сами пишут) лучше всего чувствует себя на коротких роликах и относительно простых сценах. Это скорее очень дешёвая машина для быстрого перебора десятков рекламных креативов.

Уже доступна через Creatify Labs API, Model Playground, AdFlow и fal. На fal есть 720p, 1080p и 2K, разные aspect ratio, референсное изображение и возможность подать собственную аудиодорожку.

А теперь бочка дегтя: несмотря на то, что это на базе открытой LTX - никаких весов!!

Вот так пацаны зарабатывают на опенсорсе.

@cgevent


Метаверсище и ИИще dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Ну, за монтажеров - 2

Чувак дал GPT-6 Astra доступ к DaVinci Resolve и набору из 84 исходных клипов.

Дальше Астроагент действует примерно так:

- агент обнаруживает, что таймлайн пуст, и начинает заново собирать длинную версию из исходников;
- находит в папке с музыкой композицию The Last Duel;
- добавляет реакции персонажей, rooftop-сцену, aerial attack и меняет длительности монтажных кусков;
- доводит монтаж примерно до 2:02;
- кладёт музыку на отдельную дорожку A2, уменьшает громкость и делает fade-in/fade-out;
- добавляет отдельный reaction cutaway на V2;
- запускает в Resolve Create Subtitles from Audio;
- Resolve генерирует 15 японских сегментов субтитров;
- агент сохраняет итоговый таймлайн.

Причём интерфейс прямо показывает вызовы Com.blackmagic Design.davinciresolve integration и выполнение команд. То есть это не обычный Computer Use.

Ибо.

8 сентября Blackmagic выпустила DaVinci Resolve 21.1, и это действительно официальный релиз с интеграцией AI-агентов. Blackmagic прямо пишет, что Resolve Studio теперь может работать с Claude, Claude Code и ChatGPT Codex, которым разрешено анализировать проекты, организовывать медиа, менять настройки, делать highlight edits и запускать рендер по обычным текстовым командам.

Ключевая новинка - native MCP server в DaVinci Resolve Studio 21.1. MCP здесь является прослойкой:

GPT/Claude -> MCP -> API DaVinci Resolve -> реальный проект

С титрами прикольно.

агент сам дошёл до этой функции и запустил её как часть многошагового процесса. На скриншоте он сообщает, что Resolve создал 15 японских subtitle segments.

Сам speech-to-text выполняет Resolve, кстати.

@cgevent




Нейронавт | Нейросети в творчестве dan repost
audio.cpp

C++ движок для аудиоинференса на ggml. заявлен прирост 1.8–5x по сравнению с Python‑реализациями, плюс есть оптимизация под CUDA.

- синтез речи.
- распознавание речи.
- VAD (Voice Activity Detection) - детекция голосовой активности.
- конвертация голоса (изменение тембра, пола и т. д.).
- генерация музыки/аудиофрагментов

Windows / Linux / macOS

#tts #stt #vad #t2m #text2music #voice2voice


Битый пиксель dan repost
На GitHub появился ux-ui-agent-skills — набор UX/UI-скиллов для Claude с готовыми инструкциями и библиотекой из 138 дизайн-систем.

Добавляешь его в проект — агент получает правила для цветов, шрифтов, отступов и состояний кнопок. Можно запросить интерфейс в стиле конкретного приложения, превратить скриншот в код, проверить контраст и управление с клавиатуры.

Изучить — здесь.


Нейронавт | Нейросети в творчестве dan repost
FLUX Video Edit

Редактирование видео по текстовой инструкции от BFL

12 типов правок из коробки

- Удаление, добавление и замена объектов в кадре
- Смена декораций и персонажа, пересказ диалога и перевод реплик на другой язык
- Рестайлинг всего клипа
- Правки комбинируются: несколько инструкций в одном промпте
- Длина, кадрирование, камера, тайминг и аудио наследуются от источника

- До 15 секунд на вход, до 50 МБ (URL или base64)
- Разрешение следует за источником, все что больше 720p понижается до 720p 🤩
- $0.03 за секунду: 10-секундный клип — $0.30
- Аудио сохраняется, если промпт не просит его поменять

- Не умеет: маски, image-референсы, растяжку клипа
- Результаты выдают пиксель-оверлей для сравнения до/после

Плейграунд - платно
Fal.ai - тоже

#videoediting #fluxVE


Метаверсище и ИИще dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Flux 3 Edit Video

Gemini нервничает...

При такой-то цене..

@cgevent




Нейронавт | Нейросети в творчестве dan repost
Object Concepts Emerge from Motion

Метод учит нейросеть видеть объекты на картинке без ручной разметки просто наблюдая за движением

Идея из детской психологии: младенец понимает, что части двигаются вместе, значит это один объект. Авторы применили то же к ИИ: если кусок видео движется как единое целое, считаем его объектом. Разметка не нужна, видео в интернете полно.

Результат: на готовом фото модель сама разделяет машины, людей, тротуары. Сравнима с конкурентами, которых учили на дорогой размеченной разметке.

Главное применение - автономное вождение: глубина, 3D-детекция, планирование пути

Гитхаб
HF

#segmentation #video2feature

VK | MAX


Spydell_finance dan repost
Как ИИ приведет к массовому отупению общества

Я ранее делал несколько попыток и заходов к этой теме, но не в этом году. Попробую переосмыслить и дополнить то, что ранее обсуждал.

Это, возможно, один из самых недооцененных рисков ИИ-трансформации. Процесс отупения общества шел стремительно еще до появления LLMs, но сейчас этот процесс может ускориться едва ли не по экспоненте.

Не прогресс может ускориться, а деградация общества ускорится!

Речь идет о постепенном разрушении самого механизма формирования интеллекта
, когда человек получает результат, не проходя путь, который прежде был необходим для приобретения способности насыщения когнитивной глубины.

Интеллект формируется не потреблением правильных ответов, а длительным прохождением через неопределенность, поиск информации и данных, разрешение ошибок и противоречий, причинный анализ и самостоятельную коррекцию собственной модели мира.

Именно поэтому в образовательной среде запрещают списывать. Не столько ради контроля знаний, сколько потому, что готовый ответ уничтожает образовательную функцию задачи, а ИИ – это и есть «намертво привязанная шпаргалка».

Правильный ответ является лишь конечным продуктом этого процесса. Главный результат обучения находится не на бумаге, а внутри сложного биохимического процесса в мозге в виде самостоятельного достижения результата.

Чтобы решить проблему самостоятельно, человек вынужден: понять условия, декомпозировать задачу, вспомнить необходимую информацию (активировать функцию памяти), сформировать гипотезы, выбрать правильный метод, ошибиться, обнаружить противоречие, вернуться назад, пересобрать модель и только затем получить результат.

ИИ способен вырезать практически всю эту когнитивную цепочку.

Технологии и научные прорывы создаются в результате экстремального насилия и невыносимого давления на все функции мозга (сам знаю).

ИИ дает мгновенную кнопку выхода из неопределенности, скорее имитация выхода.

Если этот паттерн становится нормой с детства, может возникнуть интеллектуальная непереносимость усилия, когда человек теряет способность долго удерживать сложную проблему без немедленного вознаграждения.

Без усилия человек никогда не приобретет интеллект, т.е. останется на уровне пограничным с животным.

Самостоятельное понимание затратно (во всех смыслах), тяжело, медленно и психологически неприятно, а правдоподобный готовый ответ дешев, мгновенен и комфортен.

Человечество неминуемо пойдет по пути наименьшего сопротивления, т.е. высокоинтенсивное отупение.

Проблема усугубляется тем, что последствия проявляются с огромным лагом. Общество статистически выглядит умнее за счет замещения задач продуктом ИИ деятельности, но в своей основе стремительно деградирует.

Мышление не запускается в комфорте. Мышление – это всегда стресс, именно поэтому никто не любит думать и панически боится интеллектуальной работы.

Нейробиологический процесс обучения требует состояния когнитивного тупика (продуктивной фрустрации). В этот момент в мозге выбрасываются норадреналин и ацетилхолин, фокусирующие внимание на ошибке, после чего через сотни итераций подбора гипотез активируется дофаминовое подкрепление. Этот стресс заставляет кору выстраивать новые синаптические связи. Когда готовое решение выдается мгновенно, фаза поиска и фрустрации обнуляется.

Человеческий мозг склонен путать узнавание с пониманием. Читая логичный, связный и стилистически выверенный ответ модели, человек испытывает ощущение ясности. Возникает феномен «списывания отличника»: списывающему кажется, что раз чужое доказательство теоремы ему понятно в процессе чтения, он владеет предметом. Однако пассивное потребление чужого структурированного вывода задействует лишь зоны распознавания образов, оставляя префронтальную кору в режиме функционального покоя. Навык конструирования мысли распадается, подменяясь навыком поверхностного серфинга по готовым концептам.

Способность решать нетривиальные задачи прямо пропорциональна числу сущностей и ограничений, которые человек способен удерживать в голове одновременно.

Перекладывая декомпозицию, сопоставление и структурирование данных на интерфейс ИИ, человек сужает собственную рабочую память до длины единичного запроса, разрушая весь мыслительный процесс.

Человек разучивается удерживать сложные, противоречивые причинно-следственные связи, превращаясь в оператора простых триггеров.

Становление эксперта в любой дисциплине подчиняется закону кумулятивного накопления скрытого опыта. Высококлассный эксперт не возникает непосредственно из университета, а является результатом решения тысяч типовых задач от начала и до конца, разрешения тысяч ошибок и пограничных ситуаций, и многолетнего накопления неформализованного опыта.

Невозможно вырастить эксперта, исключив путь, по которому формируется экспертиза.

Это значит, что по мере выхода зрелого поколения экспертов (по возрасту или в связи с отупением), новых экспертов не появится, как минимум, в сопоставимом количестве.

Раньше интернет позволил вынести наружу память: человеку уже необязательно было помнить информацию, достаточно знать, где ее найти. LLMs идут намного дальше, вынося наружу не только память, но и поиск, анализ, синтез, аргументацию, планирование и даже формирование причинной модели.

Возникает принципиально новая ситуация: человечество впервые получает возможность пользоваться интеллектом, не приобретая интеллект.

Человек задает сложный вопрос, получает великолепно структурированное объяснение, понимает (или скорее думает, считает, что понимает, да и то не всегда) каждое предложение и принимает понимание текста за собственное понимание проблемы. Но если убрать ИИ и попросить самостоятельно воспроизвести причинную конструкцию, изменить исходные предпосылки или найти ошибку, внезапно выясняется, что интеллект существовал только в момент подключения к внешней системе.

ИИ экономит текущие человеко-часы, одновременно потенциально уничтожая инвестиции в будущую компетентность.

Получается парадоксальная ситуация: текущая производительность во многих областях растет, а скорость накопления человеческого капитала снижается, причем стремительно и неотвратимо.

Грубо говоря, при отключении доступа к ИИ, уже совсем скоро человечество превратится в тупых зомбарей, не способных решить ни одной, даже самой элементарной задачи.

Однако, отупение приводит к тому, что человечество утратит возможность верифицировать, контролировать, корректно воспроизводить результат работы ИИ, полностью оголяя свою непробиваемую некомпетентность.

Если субъект не прошел путь формирования знания снизу вверх, он лишен инструментов внутренней валидации. Для него истинно то, что выдает авторитетный алгоритмический оракул.

Общество входит в эпоху тотальной внушаемости, неспособное решать ни одной существенной задачи, теряя способность к контролю, управлению, осмыслению, рефлексии и формулировке сложных вопросов.

Это и есть полная катастрофа с далеко идущими последствиями.


Нейронавт | Нейросети в творчестве dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
OmniCam

Камера-контроль в ComfyUI

Rак мини-Blender внутри ноды. Три инструмента: извлечь камеру из видео, расставить кадры в 3D-вьюпорте, скомпилировать движение под нужную модель

#comfyui #cameracontrol

VK | MAX


скачиватель с Suno - актуально после внедрения лимитов на скачивание для пользователей

https://usesuno.com/tools/downloader/


Нейронавт | Нейросети в творчестве dan repost
ICE-012 Audio (DarkPs)

Многоязычная говорилка с клонированием голоса. 590 языков и диалектов, есть русский.

- Клонирование голоса по 2 секундам
- Управление голосом: пол, возраст, высота, акцент, стиль (шепот), скорость
- Стриминг-генерация без ожидания полного файла
- Активный акустический адаптер: обрабатывает кодек-эмбеддинги до и после основного блока

Подходит для озвучки на редких языках, где коммерческие TTS отсутствуют

#tts #russian #voicecloning

VK | MAX


Нейронавт | Нейросети в творчестве dan repost
Gemini 3.5 Transcribe (Google)

Новая модель распознавания речи от Google. В отличие от обычных ASR сразу чистит мусор, форматирует и понимает контекст

- Умная транскрипция: убирает "эээ", "ммм", исправляет самоперебивы, автоматом форматирует
- Распознавание более 85 языков с региональными акцентами, должен понимать русский
- Определение до 3 спикеров в записи (3+ экспериментально)
- Пользовательский словарь: специфические термины, коды, названия
- Вызов функций: может делегировать сложные задачи вроде генерации картинок другим моделям Gemini

- Стриминг: субсекундная задержка через Live API

- Преемник Chirp 3 - значительный скачок по качеству
- Замена традиционным ASR-пайплайнам: одна модель вместо конвейера из детекции, диарнализации и пост-обработки

#ASR #STREAMING

VK | MAX


Нейронавт | Нейросети в творчестве dan repost
watermarks-remover

Никогда не пользуйтесь этим скиллом удаления из файлов и текста ИИ-водяных знаков, которые производители моделей незаметно вшивают в контент

Что убирает

1. Невидимые символы в тексте - скрытые Unicode-маркеры (невидимые пробелы, специальные управляющие символы), которые ChatGPT, Claude и другие вставляют в сгенерированный текст. Это детерминированный слой, работает без потери смысла.

2. Статистические водяные знаки - более хитрые схемы вроде SynthID-Text (Google/Gemini), где модель незаметно «подкручивает» выбор слов по секретному алгоритму. Их убирают переписыванием текста (best-effort, ценой стиля).

3. Метаданные из файлов - C2PA, EXIF, XMP и прочие служебные поля, в которых тоже хранится информация о происхождении. Чистит PNG, JPEG, PDF, DOCX, MP4, MP3 и ещё десяток форматов

#skill #privacy #watermark

VK | MAX

20 ta oxirgi post ko‘rsatilgan.