Readlist


Гео и язык канала: Весь мир, Русский
Категория: Технологии


Paper reviews and random links

Связанные каналы

Гео и язык канала
Весь мир, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Репост из: Machinelearning
Видео недоступно для предпросмотра
Смотреть в Telegram
🌟 Self-Flow: обучение диффузионных моделей без внешних энкодеров от Black Forest Labs.

Black Forest Labs и MIT решили проблему, с которой сталкиваются диффузионные и flow-модели: чтобы генерировать качественные картинки, им нужны сильные семантические представления. Обычно их берут снаружи - выравнивают внутренние признаки модели с признаками энкодера вроде DINOv2. Метод работает, но есть нюанс.

Чем сильнее энкодер, тем хуже результат: в экспериментах замена DINOv2-B на более мощный DINOv3-H+ стойко ухудшала FID. Модель привязывалась к фиксированным внешним представлениям и переставала масштабироваться. На видео и аудио выравнивание с энкодерами V-JEPA2 и MERT вообще давало результат хуже ванильного flow matching.


🟡Self-Flow предлагает механизм Dual-Timestep Scheduling

В стандартном flow matching все токены нойзятся одинаково, поэтому модель решает задачу локально и не учится строить глобальные связи. Self-Flow сэмплирует 2 разных уровня шума и случайно назначает их разным токенам (часть входа зашумлена сильнее, часть чище). Это создает асимметрию: чтобы восстановить сильно зашумленные токены, модель вынуждена опираться на чистые и строить глобальный контекст.

Поверх этого работает самообучение по принципу дистилляции. Обучаются одновременно 2 копии модели: модель-ученик видит смешанный зашумленный вход, модель-учитель - более чистую версию (EMA-копия с экспоненциальным скользящим средним).

Ученик учится предсказывать признаки учителя из зашумленного входа, и это вынуждает его развивать сильные семантические представления без какого-либо внешнего энкодера.

🟡Результаты тестов

🟢На ImageNet 256×256 Self-Flow показал FID 5.70 против 5.89 у REPA;
Это, кстати, первый случай, когда self-supervised метод превзошел внешнее выравнивание на этом бенче


🟢На text-to-image: FID 3.61 против 3.92 у REPA;

🟢По видео: FVD 47.81 против 49.75 у REPA;

🟢По аудио: лучшие FAD-оценки среди всех вариантов.

При этом на масштабировании (с 290M до 1B) разрыв с REPA увеличивается: модель Self-Flow на 625M параметров обходит REPA на 1B.

Метод универсален для модальностей - он работает одинаково на картинках, видео и аудио, что намекает на применение для мультимодального обучения.

В репозитории проекта есть код инференса на основе SiT-XL/2 с per-token timestep conditioning, чекпоинт на основе ImageNet 256×256 и скрипты для генерации сэмплов под FID-оценку через ADM evaluation suite. Поддерживаются режимы SDE и ODE, мульти-GPU через torchrun.


🟡Статья
🟡Техотчет
🖥GitHub

@ai_machinelearning_big_data

#AI #ML #Multimodal #Framework #BFL


Репост из: Machine learning Interview
🧠 ThinkMorph - новый скачок в мультимодальном мышлении

Модель обучена на 24K высококачественных интерливинговых трасс рассуждений и умеет генерировать прогрессивные текстово-визуальные шаги мышления, где текст и изображение усиливают друг друга.

Что это даёт
- резкий прирост в задачах с визуальным контекстом
- постепенное мультимодальное рассуждение шаг за шагом
- неожиданные способности: адаптивная логика и невиданные ранее визуальные манипуляции

Модель не просто видит и описывает картинку - она развивается в процессе рассуждения, корректируя и дополняя свои выводы с каждым новым текстово-графическим шагом.

Это уже не просто VLM - это механизм, который учится думать с помощью изображения и текста одновременно, усиливая одно другим.

Исследование называется ThinkMorph - можно найти на Hugging Face Papers по номеру 2510.27492

https://huggingface.co/papers/2510.27492


Репост из: Kali Novskaya
🌸Вкатываемся в FAANG: реальные советы🌸

На прошлой неделе исполнился год, как я менеджер команды в Llama. За этот год мне удалось поработать с удивительно талантливыми людьми, и меня не сократили и не уволили, так что будем считать это успехом. Можете считать меня авторитетом в каьерном вопросе (или нет).

Я уже писала несколько постов про собеседования в FAANG (вот и вот), и хочется продолжить серию постами, а что собственно делать потом.

Сейчас будут софт-скилл советы о том, как вам быстро въехать на коне в новую роль — особенно если вы мидл+.

🌸1:1 и новый нетворк

Постарайтесь вытянуть на кофе и занетворкать с максимальным количеством человек. Сюда входят люди внутри вашей организации на такой же позиции, как у вас, а также техлиды, ключевые люди в принятии решений, которым в организации доверяют, и просто некоторый процент случайной выборки, чтобы лучше познакомиться. С некоторыми из них сделайте встречи регулярными (раз в месяц, раз в 2 недели), чтобы абсорбировать побольше релевантной информации о проектах. Нужно также знать меру в "деловом общении", лучше подходить к 1:1 с некоторым списком подготовленных к обсуждению вопросов, но при этом быть собой, подружиться с теми, с кем получится. Не надо сплетничать или обсуждать других людей на таких встречах.

🌸Побольше старайтесь

Очевидный совет? Напротив, вижу очень много вредных советов по типу "не старайтесь много сразу, а то начальство привыкнет и будет ожидать такого все время". Вы вполне реально соревнуетесь с коллегами в такой же роли как у вас. В компании, где есть калибровки/ stack ranking, всегда лучше, чтобы люди видели, что вы на шаг впереди. Что вам можно поручить что-то ответственное — и вы не проебете, что вы приходите, когда вас приглашают. Что вы подготовились к встрече и пришли с повесткой. Что вы заранее обсудили ключевые вопросы с участниками перед встречей и способны "договорить" между собой команды, техлидов. Все эти вещи не требуют онбординга, вы и так должны их уметь, когда приходите в новую компанию, поэтому их сразу можно начать делать хорошо.

🌸Первые победы

Попробуйте придумать небольшую победу, которую вы одержите на новом месте быстро. В течение первых недель. Победа может быть пофикшенным багом, оптимизацией, удачным экспериментом по наболевшей теме — и в идеале должна соответствовать вашему левелу, дать позитивный сигнал о вашем найме. (Описания левелов/грейдов можно найти в этом блоге).
Если ничего сразу не придумывается, то хотя бы просто проявите инициативу и возьмите на себя таску, проект, который остальные не хотят брать. И обязательно сделайте ее канонично хорошо!

🌸План на 6 месяцев

Желательно вести и заверить с руководством письменный план ожидаемых от вас результатов и как они будут измеряться, а также примерный бейзлайн. Ваша работа, как напрямую, так и косвенно, должна делать работу вашего руководителя проще. Обязательно через первые 3 месяца устройте сессию с разбором предварительных результатов и запросите обратную связь. Вы удивитесь, как много вам расскажут!

🌸Радость быть замеченным

Вы несёте ответственность за вашу visibility, проще говоря, что ваш проект получает достаточно регулярного внимания руководства и смежных команд — имейлами, постами, документами, встречами. Если вы сеньор, то раз полгода у вас может быть 1-1 с руководителем вашего руководителя. Приносите с собой хорошие новости и предложения (согласованные с вашим менеджером).

🌸Уменьшение энтропии

Чем вы сеньорнее, тем больше явных ожиданий, что вы будете уменьшать энтропию на проектах. Это может быть
— инженерная энтропия (как делать), когда вам нужно будет привести к согласию представителей разных команд (команды платформ, инфры, инфосек, тестировщики, продуктовый комитет и тд) — и обеспечивать прозрачность технических решений
— проектная энтропия (что делать), при которой вам нужно будет непосредственно сделать ставку и предложить направление работы, с которым согласятся и дадут ресурсы.
Сделать это сразу сложно, тут лучше первое время в компании наблюдать, как это делают другие.

🟣Все! Остальное — дело техники
Теперь вы сеньор на 100 млн/год


Репост из: rizzearch
Reinforcement Learning with Action Chunking

action chunking все больше набирает популярность из-за своей практичности в имитейшн лернинг - можно сказать, что для роботики это уже необходимый элемент в пайплайне, включая pi

и вот сергей левин со своими студентами нацелился на применение этого трюка для классического пайплайна actor-critic q-learning’a. формулы обобщаются при том довольно интуитивно понятно и перестают быть марковскими - везде одно действие меняется на чанк действий, что даже улучшает понятие n-step return’a, где использовали для расчета значения критика n шагов вперед вместо одного, ибо тогда убирается смещение off-policy действий этого чанка действий

имплементится это через диффузию и флоу матчинг с ограничением на приверженность behavior policy в offline и offline-to-online рл сетапах. при том в сетапе с диффузией КЛ ограничение между политиками реализуют через best-of-n sampling (BFN), а с флоу матчингом сшивание идей происходит более гладко, без изменений в ключевых местах алгоритма FQL. экспы проводят над RLPD, где внутри онлайн степов батч состоит наполовину из онлайн и оффлайн буфферов

при том предикт по чанкам улучшает момент эксплорейшна, ибо, как спекулируют авторы, действия внутри одного чанка становятся более связанными относительно друг друга (в сравнении с 1-step методами) → при инференсе можем ожидать поведение получше + sample efficiency

пока и остается большой вопрос по поводу размера чанка, который сильно влияет на перформанс (на OGBench 10 действий в одном чанке у авторов лучше чем 25), а по балансу между рантаймом и sample efficiency неплохо было бы перепроверить, действительно ли обучение происходит быстрее бейзлайнов

👀 paper, code


- Использовуем как носителя языка:
Веди себя как носитель английского языка. Говори со мной короткими непринуждёнными разговорами и исправляй мою грамматику

- Переводим и объясняем любые фразы:
Переведи это предложение на английский язык и объясни грамматику каждой части: «[вставьте предложение]»

- Понимаем иностранную лексику в контексте:
Научи меня 10 сложным словам в английском языке. Используй их в короткой истории, которую я смогу понять


- Превращаем в партнёра для ежедневных занятий:
Задавай мне 5 простых вопросов на английском языке каждый день, чтобы помочь мне думать быстрее и отвечать с уверенностью


- Моделируем ситуации в чужой стране и общение с местными жителями:
Смоделируй 5-минутную ролевую игру, в которой я заказываю еду на английском языке в оживленном ресторане в Англии. Исправь все мои ошибки


Сохраняйте себе:
- Болтаем как носитель языка с первых секунд:
Веди себя как носитель [языка]. Говори со мной короткими непринуждёнными разговорами и исправляй мою грамматику

- Переводим и объясняем любые фразы:
Переведи это предложение на [язык] и объясни грамматику каждой части: «[вставьте предложение]»

- Понимаем иностранную лексику в контексте:
Научи меня 10 сложным словам [язык]. Используй их в короткой истории, которую я смогу понять

- Превращаем нейронку в партнёра для ежедневных занятий:
Задавай мне 5 простых вопросов на [язык] каждый день, чтобы помочь мне думать быстрее и отвечать с уверенностью

- Моделируем ситуации в чужой стране и общение с местными жителями:
Смоделируй 5-минутную ролевую игру, в которой я заказываю еду в оживленном ресторане в [страна]. Исправь все мои ошибки


Репост из: Двач
Забываем про Duolingo: появились 10 имбовых промптов для ChatGPT, с которыми за месяц можно заговорить на любом языке, запомнить сотни слов и прекрасно чувствовать себя в любой поездке.

Забирайте:
🟠Превращаем ChatGPT в друга-иностранца, с которым можно общаться каждый день:
You're a friendly native speaker. Let's have a 10-min chat in [language] about [topic]. Correct my mistakes as we go.

🟠Исправляем все грамматические ошибки в речи:
Give me a 10-question quiz on [grammar topic]. Explain my errors and show correct versions.

🟠Учим новые слова в турбо-режиме:
Teach me 15 daily-use words about [theme], with examples and memory tricks.

🟠Доводим произношение до идеала:
Analyze my recording [link]. Word-by-word feedback + 2 drills to fix weaknesses.

🟠Постигаем иностранную культуру, учим идиомы, устойчивые фразы:
Explain one local idiom with 2 usage examples from [country].

🟠Становимся лучшим слушателем:
Give me a 2-minute audio (level: [A2/B1 etc]) with transcript, vocab list, and 3 questions.

🟠Подтягиваем письмо на иностранном языке:
Fix this short paragraph [paste]. Highlight errors, rewrite, and explain my top 3 mistakes.

🟠Повторяем новые слова с помощью карточек:
Turn these 20 words [list] into Q&A flashcards for Anki.

🟠Подбираем фильмы, сериалы, аудиокниги и подкасты на нужном языке под свой уровень:
Design a 4-week plan mixing podcasts, videos, books, and convos. 30 mins/day, with links.

🟠Отслеживаем прогресс:
Build a weekly checklist to get from [current level] to [goal level] in 90 days.


Репост из: Machine learning Interview
🔥 «Упражнения по машинному обучению»

В этой книге более 75 упражнений. И она абсолютно БЕСПЛАТНА.

🔗 Книга
🔗 GitHub

@machinelearning_interview


Репост из: ODS #jobs
Gen AI Engineer
4 000 – 6 989 $/месяц
Удаленка, Фултайм

We’re looking for a Gen AI Scientist to develop, scale, and support our LLM-driven autonomous platform. You’ll work with LangChain, AutoGen, CrewAI, and deploy open-source models (LLaMA, DeepSeek) in the Google Cloud…(читать далее)


Репост из: Дратути Антон
Mistral OCR

Коллеги по цеху выпустили мощную штуку: https://mistral.ai/news/mistral-ocr

По Черри-пикам выглядят вкусно, по метрикам — вообще не понятно, что за метрики, но:
1. Интересно, как обстоят дела с координатками (скорее всего никак, потому что они делают по сути интерливд и координаты им не всегда важны);
2. Чего у них с галлюцинациями;
3. Как они сравнивали сет классического OCR и OCR для DocAI.

Выглядит как и правда мега классная штука в разрезе RAGов, о чём и пишут у себя на страничке. Правда, технологически мне кажется ничего нового особо нет, ребята olmOCR уже показали, что в целом можно хорошо делать интерливд данные.

В общем, доберусь — потестирую! Но если кто-то вдруг уже — присылайте в комменты.


Репост из: rizzearch
TransMLA: Multi-Head Latent Attention Is All You Need

дипсик хайпово привлек интерес к новой концепции Multi-Head Latent Attention (MLA), и тута китайцы это формализовали

вот есть у нас в стандартном MHA (Multi-Head Attention)

Q = X @ W_q

K = X @ W_k

V = X @ W_v

O = [ softmax(Q @ K^T) @ V ] @ W_o

где у нас по размерности матрицы (hidden_dim, num_heads x head_dim) или транспонированная в случае W_o. обычно это одно и то же по значениям hidden_dim == num_heads * head_dim но не суть, еще так же может быть num_kv_heads и это тоже опустим для простоты, как и момент с аггрегацией информации по головам etc

MLA же предлагает ключи и значения моделировать низкоранговыми матрицами (где ранг гипером определяется r)

K = X @ (W_k1 @ W_k2)

V = X @ (W_v1 @ W_v2)

и если в качестве фигурных скобочек выделить операции, которые заранее выполняются до инференса

O = softmax( X @ {W_q @ W_k2^T} @ K’^T ) @ V’ @ {W_v2 @ W_o}

где у нас

K’ = X @ W_k1

V’ = X @ W_v1

то получим что в качестве кв кэша надо хранить только репрезентации размерности r. по сути тем, что выше, я постарался показать махинации с лоу ранг матрицами чтобы сэкономить во время инференса операции

и помимо того, что это напрямую устроено для оптимизации памяти при некритическом изменении проекций слоя (как писали в пирамидкв, кв кэш на 100к токенов в ллама2 7б кушает 50гб памяти), авторы показывают, что МЛА является более общим случаем Grouped Query Attention при помощи соображений свд разложения с повторениями в матрицах для группировки запросов

→ можно сконвертировать GQA в MLA (но не обратно) и попробовать получить не только экономию по кв кэшу но и прирост в перформансе во время такого файнтюна (латентный аттеншн схватывает бОльшее разнообразие по каналам, поскольку в нем нет прямого момента дублирования значений голов)

по экспам дошли до 7б, при том изменение аттеншна на МЛА в данном случае прибавило на сотню миллионов параметров больше (что в принципе приемлемо 7.7B → 7.8B)

идея прикольная, статья только пока сыровата - побольше бы экспов и меньше опечаток в тексте

👀 link, code


Репост из: Machinelearning
🌟 Oumi: опенсорс-фреймворк полного цикла для LLM.

Oumi - открытая платформа для разработки, файнтюна, оценки и экспериментов с языковыми и мультимодальными моделями, созданная совместными усилиями исследователей из 13 ведущих университетов.

Oumi предоставляет инструменты и рабочие процессы для разработки и запуска масштабных экспериментов на кластере, развертывания моделей в рабочей среде и поддерживает методы распределенного обучения (FSDP, DDP):

🟢обучение и файнтюн моделей от 10M до 405B параметров методами SFT, LoRA, QLoRA и DPO;
🟢поддержку популярных семейств моделей: Llama, DeepSeek, Qwen и Phi;
🟢синтез и курирование обучающих данных с использованием LLM-judge;
🟢быстрое развертывание моделей в средах vLLM и SGLang;
🟢проведение комплексного бенчмаркинга моделей по стандартным тестам;
🟢возможность подключения по API OpenAI, Anthropic и Vertex AI;
🟢интеграция с библиотекой Transformers.

В репозитории проекта собраны готовые ноутбуки и скрипты для каждого из этапов жизненного цикла моделей, а подробная документация по использованию поможет легко освоить эту платформу.

📌Лицензирование: Apache 2.0 License.


🟡Статья
🟡Документация
🟡Сообщество в Discord
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #Oumi #Framework




Репост из: Machinelearning
Что можно сделать за 2 недели, чтобы выйти на новый уровень в робототехнике и генеративном ИИ? У Яндекс Образования есть ответ — пройти бесплатный студкемп! Это интенсив, на котором вас ждёт много практики, общения с экспертами из индустрии и, конечно, самые актуальные знания.

Весенний студкемп по робототехнике и ИИ пройдёт с 14 по 26 апреля на базе ФПМИ МФТИ. Учиться придётся много, ведь программу составляли специалисты Яндекса, ШАДа и МФТИ. На студкемпе ждут студентов со всей России и каждому, кто пройдёт отбор, оплатят проезд и проживание. Успейте подать заявку до 23 февраля.


Репост из: Data Science
Mathematical Foundations of Reinforcement Learning

📚 Книга

@datascienceiot









Показано 19 последних публикаций.

1

подписчиков
Статистика канала