Pixels Science


Channel's geo and language: not specified, not specified
Category: not specified


пишем о ресёрчах по Комьютерной Графике, нейронному Рендеру и ИИ
и про их влияния на индустрию конечно же, с инсайдами из личного ресёрча и карьеры
автор: @Mishok43, mishok43.com, PhD студент в IVD KIT, ex Eagle Dynamics

Related channels

Channel's geo and language
not specified, not specified
Category
not specified
Statistics
Posts filter


Коллеги по цеху (кажется это Nvidia) проделали громоздкую работу и попытались выяснить как же лучше рендерить сферические гауссианы рейтрейсингом

Вопросов же много:
1. Какими мешами надо описывать гауссианы для BVH чтобы RTX давал лучший FPS? Ответ: вытянутый icosahedron с клампнингом границ по минимальному респонсу гауссиан

2. Как быстрее их трассировать с учетом alpha-bleding-а? Ответ:
Ищем пересечение с K гауссианами с помощью any-hit -> сортируем по глубине -> считаем редианс (и трансмиттенс) -> переходим к следующим K частиц пока они не закончатся\transmittance > eps

3. Что больше влияет на перформанс? Ответ: число hit-ов, а не число частиц. Поэтому авторы попробовали использовать не стандартные, а генерализированные гауссианы (там в степень N возводится расстояние до центра частицы) + 2D splats. Удалось увеличить перформанс. Использовали дифф. рендер чтобы получить новые параметры.

Все эти ответы обоснованы экспериментами. По FPS все равно проигрыш 2-3х раза растеризации. пока. По VRAM же наоборот


Онлайн-программа для начинающих графических инженеров от Chaos

Волна на 2024ый год уже прошла, но возможно на следующую весну-лето кто-то хочет запланировать себе доп обучение.

можно подаваться всем кто старше 18 лет и находится в Болгарии, Чехии, Дании и Германии (хз как валидируют локацию). Местоположение обосновано исключительно тем, что они нанимают лучших студентов на джуниор позиции к себе в штат.

хэдквартерс у них вообще в моём городе, Карлсруэ, - только сегодня узнал об этом от своего дипломника, который проходит этот самый курс. фидбек исключительно положительный, только говорит что как-то легко 😅


Шок. Гауссианы выебали JPEG по скорости декодирования изображения при низком битрейте. Аж под 1000-2000 FPS.😱😱😱

В сухую обогнали все SOTA нейронные методы по PSNR/Decoding time, на основе multi-level hash-encodings, SIREN и прочего.

пока лишь проблема это время кодирования изображения + отсутствие по-пиксельного random access-а. было бы полезненько для текстур конечно.

Проект + код


👍👍👍

я бы лишь подметил, что за предсказанием "AGI за 5 лет" стоит некая научная доказательная база, но не ясно насколько она отображает именно глобальный, а не локальный тренд успешности скалирования AR-LLM

с CGI никакие исследования не утверждали, что с добавлением "линейно" компьюта и памяти, наши рендеры будут сами по себе становится реалистичнее


когда авторы ресёрча не опубликовали никакой код, никаких открытых данных, и приходится воспроизводить их работу, валидируя свою имплементацию "на глаз" с помощью картинок котиков из оригинальной статьи 😁


https://x.com/Mishok2000/status/1809262724485992749

очень рекомендую потребить talk c CVPR на эту тему


Synthesia опять удивляют своими разработками. Они обучили ИИ, генерирующего персональные аватары всего лишь на основе фоток с телефона\вебки юзеров

Аватары очень хороши в эмоции, умеют махать руками, активно двигаться, а также разговаривают на 30 языках.

Также обещают:
- автоматическую генерацию видео по контенту сайта\документа. к примеру для FAQ. сработает ли для лекциями 🤔🤔🤔

- умный захват экрана, который фокусируется на важном контенте. полезно для стримеров\ютуберов

- автоматический перевод видео с его контентом. я не понял можно ли будет воспользоваться их сервисов для любого видео. было бы слаавно

у компании есть шанс феноменально демократизировать доступ к информации для зрителей. и что ещё важнее, это дает возможность блогерам, инфлуенсерам и преподам выйти на любую аудиторию, забыв про языковые барьеры и снизив косты на продакшен.

горжусь тем, что знаю одно из фаундеров лично и ребята демонстрируют крутейшую коллаборацию науки с бизнесом. не часто встретишь успешные немецкие стартапы


Неплохой пример, сделанный на коленках, как можно из text->video получить 3Д сцену через гауссианы, а после походить в ней в ARе

by LumaLabs

теперь осталось их сделать PBRными и заживём 👌




Это тот самый момент, когда я рад видеть статью, разрешившую часть задач, которыми я сейчас занимаюсь 😁. Просто в связи с тем, что раз таааакие крутые авторы бросились копать в это направление, значит и я не дурак, что потратил последние недели на то чтобы разобраться с Larsen’s Generalized Boltzmann Equation. Larsens GBE - это генеральный случай Radiative Transfer Equation, т.к. последний вводит ряд предположений, которые отрицательно влияют на качество итоговых рендеров как раз таки в представленных выше кейсах)
Для интересующихся полезные ссылки на эту тему:
1 2 3


Как вам рендеры? И это без ИИ, а чисто классический объёмный рендер на основе Radiative Transfer Equation с базовым предположением uncorrelated media (т.е. transmittance описывается экспонентой). Но без скатерринга в первом Figure

Идея в том, что вместо гридов для хранения density и emissive значений объёмов ребята из Meta взяли за основу 3D Гаусcианы. Не путать с Gaussian Splats

Авторы вывели unbiased transmittance estimator, который основан на аналитических вычислениях. В итоге мы получаем меньшую дисперсию при меньшем числе обращений к памяти, т.к. гауссианы описывают среды эффективнее вокселей.
550.4MBs dense grid -> 215 KBs Gaussians 🔥🔥🔥


Понятно, что хотелось бы сравнения со sparse структурами, но у них свои проблемы в случаи обратного рендера.

Mitsuba 3, ищут пересечения с помощью BVH и RTX, где они апроксимируют гауссианы с помощью треугольников.

Достигают 550 FPS с ограничением максимальной глубины лучей. Железо не указано.

(Статья очевидна подалась на Sigg Asia 24 так что пока сыра)


Video is unavailable for watching
Show in Telegram
ещё один интересный пример, демонстрирующий что text->video может исполнять роль ограниченного (возможно лишь пока...) 3Д движка, на основе китайской модели Kling

проекция и геометрия конечно жёстко выдают ИИ, о чем я писал ранее


Аномальные тени и геометрия с некорректной проекцией выдают современные генеративные модели.

Авторы обнаружили, что можно просто обучить детекторы ИИ определять оригинальность изображений исключительно полагаясь на геометрические данные без доступа к оригинальным значениям пикселей.

Проверили: Stable DIffusion XL, PixArt-α, OpenAI’s Dalle3, Adobe’s Firefly - стабильно и эффективно палится >50-60% изображений для indoor сцен при низком False Positive Rate. Для outdoor результаты на 10-20% похуже.
Для DeepFloyd не смогли проверить гипотезу из-за проблем с генерализацией, насколько я понял.


Вывод: пока даже text->image, не говоря про text->video, не может стабильно в корректные тени и геометрию. Это конечно не значит, что следующее поколение ИИ не станет лучше. Но статья звучит как прекрасный новый бенчмарк для будущих моделек.

P.s. c тенями не так критично, как с геометрией. важная деталь, имхо.


Простой, понятный и прекрасный доклад о новой фиче под названием GPU Work Graphs, позволяющей наконец таки эффективно исполнять множество пассов в генеральном случаи, где объем и тип работы зависит от предыдущих вычислений

Показали как сократили использование памяти для Software Rasterization на 2 порядка по сравнению с ExecuteIndirect

Эх где они были пару лет назад, когда мой пафф трейсинг пасс генерил неравномерную работу для компьют шейдера, исполняющего ИИ 🥹


https://fixupx.com/i/status/1803181568451641487

хреновое качество с CVPR но OpenAI заявляют что в SORA виртуальный персонаж остается консистентным не только при движение камеры вокруг него, как будто бы это игра от 3го лица, но и в разных сценах. всё больше и больше признаков полноценного 3Д движка
SkalskiP @CVPR2024 🇺🇸 (@skalskip92)
capabilities 1: characters stay consistent across different scenes


Image Neural Field Diffusion Models, диффузка генерирует латентное представление, которые определяет плавное, а не дискретное, изображение

Алгоритм можно использовать для генерации картинок высокого разрешения, при всем при этом контент остается довольно когерентным между различными разрешениями!

Основа: Stable Diffusion

(рекомендую зайти на сайт, а так же оценить Appendix самой статьи, чтобы посмотреть изображения в оригинале)


Video is unavailable for watching
Show in Telegram
Кажется в особенности данный пример демонстрирует возможности text->video Dream Machine генерировать кадры, которые мы бы ожидали от супер реалистичного игрового рендера какого-то шутера.

Пока не понятно, что значит 120 second per 120 frames, на каком железе и т.д. но всего месяц назад я предполагал что генеративки являются угрозой лишь для рынка оффлайн рендера, но сейчас допускаю конкуренцию в будущем и на рынке реал тайм решений.

но вопрос контроля за тем, что происходит в сцене и как оно должно быть визуализировано. и конечно нам также нужны физические представления объектов. чтобы трекать коллизии пуль, как пример

но очень интересно.... надо думать как это все "соединить" 🤔🤔🤔



18 last posts shown.

112

subscribers
Channel statistics