DaLing


Гео и язык канала: не указан, не указан
Категория: не указана


y = sig(Wx+b)

Связанные каналы

Гео и язык канала
не указан, не указан
Категория
не указана
Статистика
Фильтр публикаций


Есть такой вопрос, открытый.
Время можно потратить на разные навыки, умения и т.д. soft skills, hard skills etc.

Понятно что одни навыки полезнее чем другие, а некоторые более фундаментальные чем другие что без них дальше в какой-то области никуда (например математика).

Так же некоторые навыки и умения быстро меняются, а другие не очень. Например, можно раз разобраться в linux один раз, это сильно упростит жизнь и там не так часто все меняется как в фреймворках для фронтенда.

Ну и софт навыки тоже важны, причем они меняется медленнее чем hard skills. Например основные подходы в продажах не особо меняются так как зависят больше от того как устроены люди. Ну языки для общения тоже, это делает их более привлекательными с точки зрения инвестиций времени.

Собственно, вопрос what are skills worth spending time on? С высоты вашего опыта.

Или например есть списков тех навыокв / знаний навыки на которые вы потратили время и они постоянно вам пригождаются и полезны?


https://www.python-graph-gallery.com/all-charts/

Интересный сайт с кучей примеров графиков на питоне.




https://arxiv.org/pdf/1806.01261.pdf

Интересно про графовые сети, почти как вводная статья. Еще и собрали всех подряд Mind, Brain, MIT и University of Edinburgh.




Выложен в виде коротких нарезок самый нестандартный мини-курс на ВМК "Как уйти с тропы леммингов". Про планирование карьеры, выгорание, здоровье, конкуренцию и т.п.

Автор - Дмитрий Ватолин, известный постами на Хабре, в частности:
- К вопросу о математических способностях студентов или как учить переполненный мозг
- О русской науке замолвите слово или за что я люблю Тинькофф, часть 1


Подборочки статей про нормализационные потоки. Возможно разберу что-то из этого в ближайшее время.


https://github.com/VincentStimper/normalizing-flows

https://github.com/janosh/awesome-normalizing-flows


Интересное интервью с Хинтоном. Про то как он думает и как развивалась его карьера.

https://ashleevance.substack.com/p/oralhistorywithgeoffhinton


SGD.pdf
6.7Мб
https://www.youtube.com/watch?v=ZSnYtPINcug&ab_channel=JarekDuda

Видео и презентация на тему методов оптимизации первого и второго порядков для NN.




Why Can GPT Learn In-Context? Language Models Secretly Perform Gradient Descent as Meta-Optimizers
https://arxiv.org/abs/2212.10559

Авторы говорят что In-Context Learing (ICL) или как мы привыкли промпт работают в GPT потому что в механизме внимания происходит что-то очень близкое к GD - мета файнтьюнинг на входных строках промта (на тех что обуславливаемся). Разница только в том что с GD это происходит явно за счет расчета градиентов, а GPT считает не явные мета-градиенты.

Но в начале был Шмидхубер ...

The Dual Form of Neural Networks Revisited: Connecting Test Time Predictions to Training Patterns via Spotlights of Attention (Kazuki Irie, Robert Csord, Jurgen Schmidhuber)
https://proceedings.mlr.press/v162/irie22a/irie22a.pdf

Это собственно откуда авторы продолжают свою работу. Начать лучше с пункта 2.2. в скриншотах и если понять что F(x) = (W0 + ∆W)x = W0x + LinearAttn(E, X' , x) (двойственная форма) то дальше это надо расписать для случая с промтом и все. Выкладка на следующем скриншоте начиная с формулы (10).

Что бы подтвердить теорию авторы измеряют похожесть для Attention Output Updates (SimAOU) и Attention Map (SimAM), Figure 2 & Figure 3 cooтвественно, чем выше тем лучше, метрики считались по нескольким запускам.

Потом авторы идут дальше и раз уж механизм внимания чем-то похож на GD то давайте прикрутим туда момент под капотом у которого будет cкользящее среднее.

Авторы тренируют две GPT модели 350м параметров с нуля где у одной есть момент, а у другой нет, в таблице 4 авторы показывают что модель с моментом на внимании работает лучше. (не оч. ясно на каком датасете)

Затем приводятся результаты для ICL (промт) в таблице 5. Кажется, что в такой постановке момент более полезен.

Из того что не понравилось:
1) Для анализа промта использовались достаточно однотипные задачи классификации да нет или сентимент. Понятно что на таком проще протестировать, а будет ли работать на чем то еще не понятно.
2) Такое ощущение что авторы попытались показать что момент улучшает процедуру обучения, но это один датасет, на понятно какой, улучшение хоть и стабильное, но кажется не сильно большое.

Из того что интересно:
Можно ли прикрутить момент к уже обученным моделям (обученным без него) и увеличит ли это качество ICL (промта). Не хочется же переобучать большие модели.




EDITING MODELS WITH TASK ARITHMETIC

https://arxiv.org/pdf/2212.04089.pdf

Идея достаточно простая. Давайте возьмем предобученную модель с веcами W_orig. Зафайнтьюним ее на задаче T и получим новую модель W_ft. Назовем разницу весов вектором задачи W_T = W_ft - W_orig.

Пример использования. Языковую модель W_pre зафайнтьюнили на токсичном датасете для генерации токсичных текстов получили W_ft. Тогда легко можно посчитать вектор "токсичных весов" W_T = W_ft - W_orig. Теперь если из оригинального вектора весов вычесть токсичный вектор с каким то коэффициентом то получим что модель будет генерировать менее токсичный текст. W_N (новый вектор)= W_orig - a x W_T (токсичный), где а какой-то подобранный скаляр. Авторы показывают что такой подход практически не влияет на качество работы основной задачи, но в итоге уменьшает токсичность генерируемого текста, Таблица 2. Так же видно что адверсальный метод Gradient ascent вредит основной задаче, а добавление случайного вектора практически не вредит, так как он является ортогональным к основному вектору весов W_orig.

Помимо этого авторы показывают еще два применения 1) Использование нескольких W_T под разные задачи одновременно, получается что добавления нескольких векторов задач только улучшает качество как каждой задачи и так модели в общем. Мы получаем что-то вроде ансамбля таким образом. 2) Мы можем переносить аналогии и генерировать данные которых у нас до этого не было например W_тигры_дома = W_тигры_на_природе + (W_собаки_дома - W_собаки_на_природе).

Интуиция почему это работает и не ухудшает качество работы основной задачи. 1) Легко поверить что обычный файнтьюнинг работает; 2) Вектор весов это высоко размерный вектор; 3) Поэтому вектор новой задачи W_T = W_ft - W_orig почти всегда ортогонален вектору основной модели и векторам других задач. Поэтому их можно легко складывать друг с другом и одно другому особо не вредит.

Минуcы работы. Авторы анализировали результаты только на генеративных моделях и на CLIP, который использовали для one shot classification - ранжирует потенциальные категории. Как адаптировать такой подход если мы хотим добавить новый класс в задачу классификации не очень очевидно. Так же нет результатов на более простых задачах классификации. Хотя подход был бы интересным для них если нам например нужно убрать какой-то bias в модели.

Потенциальное развитие.
1) Очень похоже на идеи с Hyper Dimentional Vectors - HDC. Кажется, веса моделей можно рассматривать как HDC и применять к ним уже хорошо развитый фреймворк. Вообще, тогда можно делать очень много всяких интересных штуки. Про HDC почитать можно тут:
https://redwood.berkeley.edu/wp-content/uploads/2021/08/Neubert2019_Article_AnIntroductionToHyperdimension.pdf

2) Cами же авторы говорят что на hugging-face хранится около 3000 по разному зафайнтьюниных BERTов. Почему бы тогда не хранить только вектора задач, а не модели полностью и почему бы тогда не попробовать выучить спарсные вектора задач, что бы уменьшить затраты на хранение - кажется это очень даже реально.








Why do tree-based models still outperform deep learning on tabular data
https://arxiv.org/abs/2207.08815v1

TranAD: Deep Transformer Networks for Anomaly Detection in Multivariate Time Series Data
https://arxiv.org/abs/2201.07284v6


SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
https://arxiv.org/abs/2211.10438v2

The Forward-Forward Algorithm: Some Preliminary
Investigations

https://www.cs.toronto.edu/~hinton/FFA13.pdf


Репост из: gonzo-обзоры ML статей
Not a paper, but a very cool stuff!

Roman Vershynin, professor of mathematics at the University of California, Irvine, and the author of the well-known book "High dimensional probability. An introduction with applications in Data Science" has just published materials from his course on the same topic!

The book itself is freely available in internet (https://www.math.uci.edu/~rvershyn/papers/HDP-book/HDP-book.pdf), yet I myself has two hard copies of it :)

Now the videos and lecture notes from the course that was run remotely at Kyiv National University this fall during bombing are published: https://www.math.uci.edu/~rvershyn/teaching/hdp/hdp.html


Information Theory, Inference, and Learning Algorithms

http://www.inference.org.uk/itprnn/book.pdf


State of AI Report 2022 - ONLINE.pdf
23.0Мб
State of AI Report
October 11, 2022

Показано 20 последних публикаций.

13

подписчиков
Статистика канала