Где данные, Кайфуллин?


Channel's geo and language: World, Russian
Category: Technologies


То что может пригодиться аналитику (мне пригодилось)
@tsimmoukr

Related channels

Channel's geo and language
World, Russian
Statistics
Posts filter


Forward from: asisakov
Как вкатиться упороться в статистику

Идем еще на один следующий этап движения по нашему роадмапу вкатывания в Data Science. Если ранее мы рассматривали теорию вероятностей, то сейчас переходим к дисциплине, которая нам пригодится намного чаще. Потому что обычно мы всегда работаем с неопределенностями.

Давайте не будем долго тянуть - просто предположим, что теорию вероятностей мы уже изучили. Го сразу к темам:

1. Описательная статистика и визуализация данных

Тут следует рассмотреть меры центральной тенденции (среднее, медиана, мода), а также меры разброса (дисперсия, стандартное отклонение, квартили, квантили, перцентили и интерквантильный размах). Дополнительно рассмотреть выбросы и по желанию понять, что такое центральный момент распределения. По визуализации существует столько нюансов, поэтому стоит просто пробежаться по верхам (столбчатые диаграммы, гистограммы, боксплоты, скаттерплоты).

2. Выборки и генеральная совокупность

Знать, что такое генеральная совокупность и чем она все же отличается от выборки, и как у них из-за этого отличаются статистические оценки. Сюда докидываем Power Analysis. Также надо понимать про требования к оценкам и доверительные интервалы к ним.

3. Статистические гипотезы и тесты

Уметь формулировать гипотезы, определять уровень значимости и понимать, при чем тут p-value (еще знать определение!). Далее уже можно переходить к ошибкам I и II рода, оценивать мощность критерия. Изучить параметрические тесты (t-тест, z-тест, F-тест) и непараметрические тесты (хи-квадрат, тест Манна-Уитни, критерий Вилкоксона). Дополнительно к этому обязательно пройтись по статмоделям!

4. Анализ зависимостей

Изучить корреляции(коэффициент Пирсона, Спирмэна и ранговые корреляции) и уметь их применять. То же самое относительно регрессионного анализа (линейная и логистическая регрессии для одномерного и много мерного случаев). По возможности изучить предпосылки Гаусса-Маркова. Ну а дальше можно удариться в дисперсионный анализ (ANOVA), факторный анализ, кластерный анализ
и даже временные ряды.

Если есть желаение, то можно пойти и дальше в байесовскую статистику, но это скорее предмет еще одного отдельного разговора, я думаю тут есть специалисты покруче меня.

✏️ Курсы:

▫️Курс математической статистики от Райгородского

▫️Курс по прикладной статистике от Академии Аналитиков Авито

▫️Курс по матстату от Филиппа Ульянкина с кодом тут

▫️Основы статистики от института биоинформатики (опять Толя Карпов!) 1, 2, 3

▫️Математическая статистика от CSC

▫️Курс с применением ТВ и статистики в Python от нашего леопарда Глеба Михайлова

▫️Курс от матпрофи

✏️ Ресурсы:

▫️Хорошая интерактивная книга по статистике от коллег из HSE UX LAB на языке R

▫️Задачи по статистике на матбюро

▫️Семинары по статистике от Поступашек (ноутбуки тут)

▫️Канал, где чел поясняет за разные моменты в статистике и ML

▫️По желанию дальше можно изучить дружелюбную эконометрику

▫️Lessons in Statistical Thinking

✏️ Почитать:

▫️Сборник задач и упражнений по матстату

▫️Книга с неплохим введением в статистику

▫️Севастьянов. Курс теории вероятностей и математической статистики

▫️Jaynes E.T. Probability Theory: The Logic of Science

▫️Montgomery D.C., Runger G.C. Applied Statistics and Probability for Engineers, 7th Ed. Нашел пятое

▫️Sheskin D.J. Handbook of Parametric and Nonparametric Statistical Procedures, 5th Ed

▫️Neuhauser М. Nonparametric Statistical Tests: A Computational Approach

✏️ К собесам:

▫️Все, что я скидывал для подготовки к ТВ

▫️Если вы не понимаете, для чего нужна статистика на работе, то попробуйте прочесть вот эту статью от ребят из X5

▫️Статья про распределения во всех возможных вариациях

▫️Для жестких Practical Guide To Quantitative Finance Interviews

▫️Задачки по теории вероятностей и статистике в ноутбуках

▫️Анки-карточки, чтобы заботать статистические термины

«Статистики не бывает без "нового уровня неопределённости", про который обычно говорят как невозможность прямого анализа "генеральной совокупности"...»

@asisakov_channel

#statistics


Forward from: No Data No Growth | Pavel Bukhtik
🧠 Foundation Models – GPT из мира прогнозирования временных рядов

Представьте GPT, который вместо текста предсказывает будущие значения вашего временного ряда. Звучит как магия, но это уже реальность.

Для прогнозирования временных рядов есть много подходов:

-> Baseline'ы – наивная и сезонная наивная модели;
-> Классика – ARIMA, SARIMAX, Prophet;
-> ML-подход – LightGBM, XGBoost, CatBoost;
-> DL – RNN, LSTM, Transformer-based;
-> и сотни разных реализаций под конкретные задачи.

Но в последние годы, вместе с развитием ИИ, набирает обороты новый подход – Foundation Models.

Это модели, обученные на огромном количестве исторических рядов из разных доменов.

Главная идея – zero-shot прогнозирование: вы НЕ обучаете модель на своих данных. Вы просто даете ей контекст (кусок вашей истории), а модель продолжает его в будущее. Как LLM продолжает текст по промпту, только здесь «промпт» – это ваш ряд.

И точность из коробки получается на удивление высокая по сравнению даже с хорошо подтюненными моделям.

Это особенно полезно, когда:

-> данных мало или их ещё нет (холодный старт);
-> нет времени или возможности обучать свою модель;
-> нужен быстрый прогноз сразу по сотням / тысячам рядов.

Модель, обученная на ваших данных, скорее всего обгонит Foundation модель. Но как точка старта и сильный baseline – это отличный вариант.

Из популярных реализаций:

-> Chronos / Chronos-2 от Amazon;
-> TimeGPT от Nixtla;
-> TimesFM от Google.

Моделей уже много, какие-то наверняка ближе к вашей индустрии. Можете глянуть сборник моделей тут:

🔗 https://github.com/ZLiu21/awesome-tsfms-from-pre-training-to-post-training

А если хотите поиграться с такой моделью в песочнице, я подготовил небольшой Colab:

🔗 https://colab.research.google.com/drive/1sGcmdpjQ5ZlVIU6zG5olXXSLE537651g

Не знали про Foundation Models для временных рядов? Тогда поддержите пост огоньком 🔥


Услышал такую трактовку прокрастинации. Прокрастинация - это делегирование «завтрашнему я». Получается мы не откладываем задачу, мы пытаемся ее передать другому. Но завтра я просыпаюсь тем же самым и знаю что смогу опять передать «завтрашнему я», ведь он приятный и не откажет)

Мозг работает так как привык, а не как нужно)

Все мысли отсюда - доклад про выполнение планов и как их выполнять все таки https://youtu.be/8423tw7mLc8?si=URo-FkRQrOjG8t0w


Forward from: NN
Higgsfield запустили академию по созданию ИИ-фильмов: уже доступно два полноценных интерактивных курса для любителей генерировать видео.

Каждая лекция оформлена в виде презентации с реальными примерами и советами. Есть подсказки по выбору модели, практические уроки, готовые промты и проекты.

Все бесплатно, надо только пройти авторизацию. Забираем по ссылке.


Forward from: Анализ данных (Data analysis)
Кто-то разобрал Claude Code почти до винтика

learn-coding-agent - репозиторий для тех, кто хочет понять, как устроены современные coding agents не на уровне промо-страниц, а на уровне архитектуры.

Автор собрал разбор Claude Code по публичным источникам: цикл агента, систему инструментов, разрешения, работу с контекстом, сессии, подпроцессы, MCP, удалённые настройки, телеметрию и скрытые флаги.

Получился не “гайд по использованию”, а карта внутренней логики CLI-агента: как он принимает решение, когда просит разрешение, как вызывает инструменты, как хранит историю и как расширяется через внешние интеграции.

https://github.com/justxor/Claudecourse/


Это прям очень круто в изучении любой темы, самое крутое не текст, а конвертация знаний в презы, аудио, ментальную карту, КАРТОЧКИ (быстро) - https://notebooklm.google.com


Forward from: Збс реклама
Австралийская пивоварня Gage Roads Brew Co. превратила доску для серфинга в портативный бар. Задачка была буквально на грани возможного: доска должна была оставаться полноценным серфбордом, сохранять пиво холодным и при этом позволять разливать его прямо на пляже. По словам создателей, самым сложным оказалось оснастить доску системой давления — во время испытаний не обошлось без нескольких взрывов прототипов, а маркетинговая идея в итоге превратилась в настоящий инженерный эксперимент.

Сами Gage Roads давно ассоциируют себя с серф-культурой, спонсируют профильные соревнования, а их сорт пива Single Fin недавно вошел в топ-3 самых популярных сортов пива Австралии.


Почему я люблю серфинг) 🏄




ML system design - это по сути планирование ML проекта и описание как ты будешь его делать.
Разберем типовой кейс из классического мл "Обнаружение вредоносного контента в социальных сетях"

1. Формулировка проблемы😲
Уточняющие вопросы точно помогут сделать задачу понятнее и проще, поэтому стоит их задавать по максимуму, даже если они кажутся глупыми

Цель: отслеживать публикации, выявлять вредоносный контент и понижать его в рейтинге / удалять

Примеры категорий вредоносного контента: насилие, обнаженная натура, разжигание ненависти

Цель ML: определить, является ли публикация вредоносной

Входные данные: Публикация (текст, изображение, видео)
Выходные данные: P(вредная) или P(насильственная), P (обнаженная натура), P (ненависть) и т.д
Категория ML: Мультимодальная (с несколькими ярлыками) классификация

2. Метрики😐
Оффлайн-метрики: F1, PR-AUC, ROC-AUC
Онлайн-метрики: распространенность (процент вредоносных сообщений, которые не были предотвращены, по сравнению со всеми публикациями), количество показов вредоносных сообщений, процент обоснованных (отмененных) обращений, показатель активности (соотношение обнаруженных систем к обнаруженным пользователями)

3. Архитектурные компоненты🤨
Мультимодальный ввод (текст, изображения, видео и т.д.):
Методы мультимодального слияния
Раннее слияние: сначала объединяются модальности, а затем делается единый прогноз
Позднее слияние: модальности обрабатываются независимо друг от друга, прогнозируется слияние
минусы: отдельные обучающие данные для модальностей, подборка индивидуально безопасного контента может быть вредной

Классификация с несколькими метками/многозадачностью
Один бинарный классификатор для каждой категории вреда (p (насилие), p (обнаженная натура), p (ненависть))
несколько моделей, которые обучаются и обслуживаются отдельно, правда стоят дорого
Один классификатор с несколькими метками - сложная задача для изучения

Многозадачный классификатор: изучайте несколько задач одновременно
на отдельных общих слоях (изучайте сходство между задачами) -> преобразованные объекты
уровни, относящиеся к конкретной задаче: главы классификации
плюсы: единая модель, общие уровни предотвращают избыточность, обучающие данные для каждой задачи можно использовать и для других задач (ограниченные данные)

4. Сбор и подготовка данных☺️
Основные участники, по которым доступны данные:
Идентификатор пользователя, возраст, пол, местоположение, контакты

Элементы(сообщения): идентификатор публикации, идентификатор автора, контекст текста, изображения, видео, ссылки, временная метка

Взаимодействие пользователя с публикацией: user_id, post_id, тип взаимодействия, значение, временная метка

5. Разработка функций😠
Особенности: Содержание публикации (текст, изображение, видео) + Взаимодействие с публикацией (текст + структурированный) + Информация об авторе + Контекст сообщений
Текст:
Предварительная обработка (нормализация + токенизация)
Кодирование (векторизация):
Статистические (BoW, TF-IDF)
Кодеры на основе ML (BERT)
Изображения / видео:
Предварительная обработка и извлечение объектов
Изображения:
Clip, SImCLR
Видео:
VideoMoCo
Взаимодействие с публикациями:
Количество лайков, комментариев, репостов, сообщений (масштаб)
Комментарии (текст):
Аналогично тексту публикации (совокупные вложения в комментарии)
Пользователи:
Используйте только демографические данные автора публикации, характеристики учетной записи (количество подписчиков, возраст учетной записи).

6. Разработка модели и автономная оценка🕺
7. Онлайн-тестирование и внедрение🕺
8. Масштабирование, мониторинг и обновления😠

Ресурсы для лучшего понимая🫡:
1. Куча примеров кейсов
2. Разница МЛСД в проде и ресерче
3. Пайплайн процесса!!!


Forward from: Machine learning Interview
⚡️ Вместо того чтобы сегодня вечером смотреть сериалы, потрать день на прокачку Claude.

Claude 101:
http://claude101.com

→ Уровень 1 - 24 минуты: база

Claude для новичков:
https://ruben.substack.com/p/claude-for-dummies

Настройка Claude:
http://how-to-claude.ai

→ Уровень 2 - 1 час: реальные workflows

Claude Cowork:
http://claude-co.work

Claude для команд:
http://how-claude.team

Claude Design:
http://claudedesign.free

Cowork + Projects:
https://ruben.substack.com/p/claude-cowork-project

Claude для слайдов:
http://how-to-gamma.ai

Claude Skills:
http://claude-skills.free

→ Уровень 3 - 3,5 часа: pro-приемы

Как избегать подхалимства модели:
https://ruben.substack.com/p/i-love-to-be-right

Claude Code:
http://claudecode.free

Claude 101:
https://anthropic.skilljar.com/claude-101

Как не упираться в лимиты Claude:
https://ruben.substack.com/p/how-to-stop-hitting-claude-usage

Хватит просто промптить:
https://ruben.substack.com/p/stop-prompting-claude

→ Уровень 4 - 8 часов: экспертный режим

Claude Computer:
https://ruben.substack.com/p/claude-computer

Разработка с Claude API:
https://anthropic.skilljar.com/claude-with-the-anthropic-api


Forward from: Заскуль питона (Аналитика данных)
😎 Крутые статьи на Хабре про A/B-тестирование от крупных компаний

A/B-тесты кажутся простыми: разделили аудиторию, сравнили метрики, сделали вывод. Но на практике можно легко допустить ошибку, которая приведёт к неправильным решениям. Собрал полезные статьи с Хабра, которые помогут разобраться в нюансах экспериментов и избежать классических фейлов и узнать что-то новое.

Топ постов от IT-компаний, в которых активно используется 🆎.

💙 Ozon

🟢Шесть причин, почему ваши A/B-тесты не работают
🟢Без А/B результат XЗ, или Как построить высоконагруженную платформу А/B-тестов

🖤 X5 Tech

🟢А/Б тесты с метрикой отношения. Дельта-метод
🟢Как проводить A/B-тестирование на 15 000 офлайн-магазинах
🟢50 оттенков линейной регрессии, или почему всё, что вы знаете об A/B тестах, помещается в одно уравнение
🟢Varioqub: за Mann-Whitney замолвите слово

🛒 Купер (ex. СберМаркет)

🟢Линеаризация: зачем и как укрощать ratio-метрики в A/B-тестах
🟢База: айсберг A/B-тестов

🌏 Авито

🟢Как устроено A/B-тестирование в Авито
🟢Как улучшить ваши A/B-тесты: лайфхаки аналитиков Авито. Часть 1
🟢Как улучшить ваши A/B-тесты: лайфхаки аналитиков Авито. Часть 2
🟢Сетап А/В-теста, который помог снизить MDE выручки в 2 раза
🟢Как мы в Авито проводим A/B-тесты CRM-рассылок

🤪 Lamoda Tech

🟢Как же мощно я провел A/B-тест, или почему не стоит сравнивать наблюдаемый аплифт с MDE

❤️ Яндекс

🟢10 мифов об A/B-тестировании: как избежать распространённых заблуждений в статистическом анализе

🏦 Т-банк

🟢Использование последовательного тестирования для уменьшения размера выборки

Ставьте 🐳, если подборка была полезной, сохраняйте к себе, чтобы не забыть! Следующую подборку сделаю по методам оценки эффекта без A/B тестирования

@zasql_python 👉 @ds_memes

Что-то забыл? Пишите в комментариях!


Это еще круче

Можно отправить Claude или Codex работать в браузере, собирать презентации, разбирать заметки и даже разрабатывать игры. Вся рутина, на которую нужно много разных программах, уместится в один запрос к агенту.

https://github.com/HKUDS/CLI-Anything






NNMClub_to_Karpov_courses_Machine_Learning_dlya_nachinayushchih.torrent
264.9Kb
[NNMClub.to]_Hardkornyiy Machine Learning 2.torrent
128.5Kb
Если хотели быстро погрузиться в ML, то вот два крутых курса - один база, другой про-версия

В сумме сейчас они стоят 200к+


Утилита, которая сама смотрит на железо и говорит, какие модели имеет смысл запускать.

llmfit анализирует CPU, RAM и GPU, а потом подбирает модели, которые будут нормально работать. 

https://github.com/AlexsJones/llmfit


Forward from: NN
Спасаем макбук от мусора: нашли бесплатную замену CleanMyMac для очистки памяти и оптимизации работы системы.

В один клик чистит кэш приложений и находит тяжелые документы, которыми уже долго не пользуетесь. Можно заранее проверить, что удаляет сервис, и настроить график автоматической очистки.

Забираем по ссылке.


Что могут спросить по теме трансформеров на собеседовании:
Основные типы LLM:
авторегрессионные (ex.GPT) генерируют текст последовательно, предсказывая следующее слово

двунаправленные(ex.BERT) анализируют контекст слева и справа от слова

энкодер-декодер(ex.T5, BART) преобразуют входные данные в выходные через промежуточное представление

Обучение
предобучение на большом корпусе текста с задачами вроде предсказания следующего токена или заполнения масок

fine-tuning на специфических датасетах для конкретных задач

Оценка
perplexity:
(the lower the better)
фактологичность, связность
ну и разные бенчмарки:
(GLUE, SuperGLUE, SQuAD)
Чем BERT отличается от GPT?

BERT: двунаправленный,
masked LM, для классификации
GPT: авторегрессия, генерация текста

Как бороться с галлюцинациями в LLM?
контроль температуры, top-k/p,
проверка фактов, fine-tuning

Как оптимизируют внимание в трансформерах?
разреженное внимание, кэширование, квантование, пакетная обработка

Какие гиперпараметры генерации ключевые в GPT?
temperature:
(креативность)
top-k/p:
(выбор токенов)
beam search:
(качество)
repetition_penalty



20 last posts shown.