cv links


Channel's geo and language: not specified, not specified
Category: not specified


computer vision links

Related channels

Channel's geo and language
not specified, not specified
Category
not specified
Statistics
Posts filter


Forward from: Хроники ботки
Video is unavailable for watching
Show in Telegram
Как сходится регрессия без эмбедингов координат в фурье фичи и с фурье фичами


Forward from: Хроники ботки
Эксперимент, на котором проверяют скорость сходимости низких, средних и высоких частот модельной целевой функции в зависимости от параметров fourier features a_j=1/j^p, w_j =j при изменении параметра p. Параметр p фактически регулирует размерность эмбединга.
Видно, что в исходном виде выучиваются только очень низкие частоты. При низкой фактической размерности высокие частоты тоже плохо выучиваются, а чем выше p, тем более высоких частот, вплоть до переобучения.


Forward from: Хроники ботки
а) Сравнение матрицы K для neural tangent kernel для 1d координат и их преобразования в fourier features. Видно что для исходных координат матрица K должна иметь много маленьких собственных значений, а для преобразованных на диагонали все хорошо

б) влияние параметров эмбедингов aj =(1/j)^p, wj=j на получающееся ядро одномерной свертки k_ntk'. Наглядно можно представить, что ответ нейросетки это взвешенное среднее с весами k_ntk'(x_i-x_j). Можно прикинуть, какие параметры приведут к недообучению, какие а переобучения, а какие самый раз.


Forward from: Хроники ботки
Разница между регрессией (в цвет пикселя) на координатах в исходном виде и преобразованных в fourier features. Как видно, в исходном виде нейросеть не может выучить высокие частоты целевой функции


Forward from: Хроники ботки
Fourier Features Let Networks Learn
High Frequency Functions in Low Dimensional Domains

https://arxiv.org/abs/2006.10739

Статья 2020 года с нипса о том, почему же позиционные эмбединги трансформеров хорошо работают именно в таком странном виде эмбедингов из синусов и косинусов (но не только).

Основная мысль: если подавать время, позиции, координаты как есть, то сетка даже на обучающей выборке не может выучить высокочастотные компоненты целевой функции. А если делать "позиционные эмбединги", преобразование f_feat(p), то подобной проблемы не возникает.
Пишут, что идея статьи пришла при работе над NERF'ом.

Общий вид изучаемых эмбедингов позиций, времени, 2d и 3d координат:
f_feat(p) =(a1*cos(2Pi*), a1*sin (2Pi*), ..., a_d *cos(2Pi*), a_d*sin(2Pi*)).
Их называют fourier features.
Что с ними делают:
1) пытаются теоретически объяснить, почему подобное преобразование работает лучше, чем подавать данные нейросетке в исходном виде.
2) пытаются определить качественное влияние параметров a_i, w_i на получающееся решение
3) проводят мотивирующие эксперименты

Теоретическое объяснение:
Через neural tangent kernel в несколько шагов:
1) err_t - ошибка сетки на обучающей выборке с learning rate lr на шаге обучения t - может быть аппроксимирована с помощью выражения, использующего матрицу K: K_ij = k_ntk(xi, xj)

|err_t| ~= e^(-lr *K*t)

2) матрица K неотрицательно определена, поэтому можно использовать разложение K=QDQ^T, где Q ортонормированная матрица собственных векторов, а D - диагональная и D_ii>= 0:

Q^T*(err_t) ~=e^(-lr *D*t)Q^T
и
[Q^T*(err_t)]_i ~=e^(-lr *l_i*t)Q^T

3) Получается, что скорость сходимости ошибки на обучающей выборке зависит от спектра матрицы K. Если собственные значения сильно отличаются друг от друга, то разные компоненты ошибки будут сходиться с разной скоростью. А если матрица плохо обусловлена, т.е. есть собственные значения близкие к нулю, то соответствующие компоненты ошибки не сойдутся к нулю фактически никогда

4) Если же элементы обучающей выборки x_i расположены на гиперсфере, то (по другому результату) k_ntk(x_i, x_j) =k_ntk'(). Для fourier features
norm(f_feat(x_i)) =const,
а также
=h(x_i-x_j),
поэтому k_ntk(f_feat(x_i), f_feat(x_j)) =k_ntk'(h(x_i-x_j))

5) Из-за предыдущего равенства матрица K для выборки, преобразованной f_feat, будет матрицей стационарного ядра, и (видимо) подобная симметрия обеспечивает "хороший" спектр. В частности, K_ii =K_jj.

Пункты 3 и 5 дают нужные утверждения.

Также есть видео с красивой презентацией и наглядными визуализациями: https://youtu.be/nVA6K6Sn2S4?si=bhu-XmE-Ejk1Bhvz
и блогпост с неформальными поясениями https://bmild.github.io/fourfeat/


Forward from: эйай ньюз
А вот и в Luma Sora like фичи подъехали, с которых мы так офигивали. Можно загружать ключевые фреймы, и модель нагенерит все что должно быть между. Пожалуй, морфинг — это прямо что-то новое и доселе невиданное в кино. Это ощущение, когда пространство кардинально изменилось, а ты этого не заметил, как-то ломает мозг. По крайней мере, мой.

Я думаю, судить видеомодельки по черепикам из анонса не совсем справедливо, да и не так интересно. Так что насобирал горсть твитерских творений. Гляньте, как Luma прикольно обыграла смену фона у девочки. Там будто стафф меняет декорации, как в каких-нибудь ситкомах, лол.

@ai_newz






Forward from: Neural Shit
Video is unavailable for watching
Show in Telegram
Inpaint + AnimateDiff + After Effects = ❤️❤️❤️

отсюда


Forward from: эйай ньюз
ThunderKittens - GPUs Go Brrr

Парни из Стенфорда сделали фреймворк, упрощающий взаимодействие с тензорными ядрами. И показали его мощь на FlashAttention в сотне строк, который работает быстрее оригинального FlashAttention 2!

Почему так быстро?🥵

➖ Для ThunderKittens придумали новые абстракции поверх тензорных ядер, что дало удобный доступ к ~95% мощности H100
➖ На полную задействуется новый ускоритель доступа к памяти (TMA)
➖ Подобрав незадокументированные лейауты памяти вышло задействовать новые асинхронные инструкции для работы с тензорными ядрами
➖ FlashAttention-1 оптимизировал доступ к HBM. FlashAttention-2 – использование тензорных ядер на A100. А тут пошли ещё дальше: начали оптимизировать доступ к разделяемой памяти (shared memory)
➖ Всё это полили соусом из мелких улучшений

FlashAttention – всего лишь первая демка фреймворка, и другие кернелы на нём уже активно пишутся. А тем временем этот проект благословил Tri Dao – мега крутой мужик, автор FlashAttention.

Если хотите, чтобы я рассказал как работает FlashAttention - ставьте 🦄

Блогпост
Гитхаб

@ai_newz


Forward from: Symmetria
Beyond White Noise for Real-Time Rendering
—
demofox

For folks that know me as "the blue noise guy", I've put together a 50 minute video that talks about many of the things I've learned in my ~decade long dive into noise and related topics - up to and including our latest paper published days ago at I3D.
I hope you enjoy it!


https://www.youtube.com/watch?v=tethAU66xaA


Forward from: Machinelearning
Video is unavailable for watching
Show in Telegram
⚡️ Deblur-GS: 3D Gaussian Splatting from Camera Motion Blurred Images

Новый метод Deblur-GS
на основе Гауссовских сплатов для качественного восстановления размытой картинки.

Deblur-GS обеспечивает превосходную производительность и качество рендеринга по сравнению с предыдущими методами, что подтверждается бенчмарками, как на синтетических, так и на реальных наборах данных.

▪Code: https://github.com/Chaphlagical/Deblur-GS
▪Paper: https://chaphlagical.icu/Deblur-GS/static/paper/Deblur_GS_author_version.pdf
▪Project: https://chaphlagical.icu/Deblur-GS/

@ai_machinelearning_big_data






Forward from: эйай ньюз
Diffusion Models for Video Generation

Вышел новый пост #ликбез в моем любимом блоге. У Lilian Weng (OpenAI) всегда получаются очень подробные разборы тем. На этот раз она написала про существующие подходы для генерации видео с помощью диффузии. Контент для продвинутых юдокас.

Другие крутые посты из блога Lilian:
- Про диффузию
- Про оптимизацию трансформеров
- Про другие генеративные модели

@ai_newz


Forward from: Love. Death. Transformers.
Video is unavailable for watching
Show in Telegram
#чтивонаночь
Видео superres модель от Adobe


Архитектурно это unet с temporal attention и Flow estimator - определяет в какую сторону будут пиксели двигаться

videogigagan.github.io
папир









20 last posts shown.

4

subscribers
Channel statistics