Где данные, Кайфуллин?


Гео и язык канала: Весь мир, Русский
Категория: Технологии


То что может пригодиться аналитику (мне пригодилось)
@tsimmoukr

Связанные каналы

Гео и язык канала
Весь мир, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Услышал такую трактовку прокрастинации. Прокрастинация - это делегирование «завтрашнему я». Получается мы не откладываем задачу, мы пытаемся ее передать другому. Но завтра я просыпаюсь тем же самым и знаю что смогу опять передать «завтрашнему я», ведь он приятный и не откажет)

Мозг работает так как привык, а не как нужно)

Все мысли отсюда - доклад про выполнение планов и как их выполнять все таки https://youtu.be/8423tw7mLc8?si=URo-FkRQrOjG8t0w


Репост из: NN
Higgsfield запустили академию по созданию ИИ-фильмов: уже доступно два полноценных интерактивных курса для любителей генерировать видео.

Каждая лекция оформлена в виде презентации с реальными примерами и советами. Есть подсказки по выбору модели, практические уроки, готовые промты и проекты.

Все бесплатно, надо только пройти авторизацию. Забираем по ссылке.


Репост из: Анализ данных (Data analysis)
Кто-то разобрал Claude Code почти до винтика

learn-coding-agent - репозиторий для тех, кто хочет понять, как устроены современные coding agents не на уровне промо-страниц, а на уровне архитектуры.

Автор собрал разбор Claude Code по публичным источникам: цикл агента, систему инструментов, разрешения, работу с контекстом, сессии, подпроцессы, MCP, удалённые настройки, телеметрию и скрытые флаги.

Получился не “гайд по использованию”, а карта внутренней логики CLI-агента: как он принимает решение, когда просит разрешение, как вызывает инструменты, как хранит историю и как расширяется через внешние интеграции.

https://github.com/justxor/Claudecourse/


Это прям очень круто в изучении любой темы, самое крутое не текст, а конвертация знаний в презы, аудио, ментальную карту, КАРТОЧКИ (быстро) - https://notebooklm.google.com


Репост из: Збс реклама
Австралийская пивоварня Gage Roads Brew Co. превратила доску для серфинга в портативный бар. Задачка была буквально на грани возможного: доска должна была оставаться полноценным серфбордом, сохранять пиво холодным и при этом позволять разливать его прямо на пляже. По словам создателей, самым сложным оказалось оснастить доску системой давления — во время испытаний не обошлось без нескольких взрывов прототипов, а маркетинговая идея в итоге превратилась в настоящий инженерный эксперимент.

Сами Gage Roads давно ассоциируют себя с серф-культурой, спонсируют профильные соревнования, а их сорт пива Single Fin недавно вошел в топ-3 самых популярных сортов пива Австралии.


Почему я люблю серфинг) 🏄




ML system design - это по сути планирование ML проекта и описание как ты будешь его делать.
Разберем типовой кейс из классического мл "Обнаружение вредоносного контента в социальных сетях"

1. Формулировка проблемы😲
Уточняющие вопросы точно помогут сделать задачу понятнее и проще, поэтому стоит их задавать по максимуму, даже если они кажутся глупыми

Цель: отслеживать публикации, выявлять вредоносный контент и понижать его в рейтинге / удалять

Примеры категорий вредоносного контента: насилие, обнаженная натура, разжигание ненависти

Цель ML: определить, является ли публикация вредоносной

Входные данные: Публикация (текст, изображение, видео)
Выходные данные: P(вредная) или P(насильственная), P (обнаженная натура), P (ненависть) и т.д
Категория ML: Мультимодальная (с несколькими ярлыками) классификация

2. Метрики😐
Оффлайн-метрики: F1, PR-AUC, ROC-AUC
Онлайн-метрики: распространенность (процент вредоносных сообщений, которые не были предотвращены, по сравнению со всеми публикациями), количество показов вредоносных сообщений, процент обоснованных (отмененных) обращений, показатель активности (соотношение обнаруженных систем к обнаруженным пользователями)

3. Архитектурные компоненты🤨
Мультимодальный ввод (текст, изображения, видео и т.д.):
Методы мультимодального слияния
Раннее слияние: сначала объединяются модальности, а затем делается единый прогноз
Позднее слияние: модальности обрабатываются независимо друг от друга, прогнозируется слияние
минусы: отдельные обучающие данные для модальностей, подборка индивидуально безопасного контента может быть вредной

Классификация с несколькими метками/многозадачностью
Один бинарный классификатор для каждой категории вреда (p (насилие), p (обнаженная натура), p (ненависть))
несколько моделей, которые обучаются и обслуживаются отдельно, правда стоят дорого
Один классификатор с несколькими метками - сложная задача для изучения

Многозадачный классификатор: изучайте несколько задач одновременно
на отдельных общих слоях (изучайте сходство между задачами) -> преобразованные объекты
уровни, относящиеся к конкретной задаче: главы классификации
плюсы: единая модель, общие уровни предотвращают избыточность, обучающие данные для каждой задачи можно использовать и для других задач (ограниченные данные)

4. Сбор и подготовка данных☺️
Основные участники, по которым доступны данные:
Идентификатор пользователя, возраст, пол, местоположение, контакты

Элементы(сообщения): идентификатор публикации, идентификатор автора, контекст текста, изображения, видео, ссылки, временная метка

Взаимодействие пользователя с публикацией: user_id, post_id, тип взаимодействия, значение, временная метка

5. Разработка функций😠
Особенности: Содержание публикации (текст, изображение, видео) + Взаимодействие с публикацией (текст + структурированный) + Информация об авторе + Контекст сообщений
Текст:
Предварительная обработка (нормализация + токенизация)
Кодирование (векторизация):
Статистические (BoW, TF-IDF)
Кодеры на основе ML (BERT)
Изображения / видео:
Предварительная обработка и извлечение объектов
Изображения:
Clip, SImCLR
Видео:
VideoMoCo
Взаимодействие с публикациями:
Количество лайков, комментариев, репостов, сообщений (масштаб)
Комментарии (текст):
Аналогично тексту публикации (совокупные вложения в комментарии)
Пользователи:
Используйте только демографические данные автора публикации, характеристики учетной записи (количество подписчиков, возраст учетной записи).

6. Разработка модели и автономная оценка🕺
7. Онлайн-тестирование и внедрение🕺
8. Масштабирование, мониторинг и обновления😠

Ресурсы для лучшего понимая🫡:
1. Куча примеров кейсов
2. Разница МЛСД в проде и ресерче
3. Пайплайн процесса!!!


Репост из: Machine learning Interview
⚡️ Вместо того чтобы сегодня вечером смотреть сериалы, потрать день на прокачку Claude.

Claude 101:
http://claude101.com

→ Уровень 1 - 24 минуты: база

Claude для новичков:
https://ruben.substack.com/p/claude-for-dummies

Настройка Claude:
http://how-to-claude.ai

→ Уровень 2 - 1 час: реальные workflows

Claude Cowork:
http://claude-co.work

Claude для команд:
http://how-claude.team

Claude Design:
http://claudedesign.free

Cowork + Projects:
https://ruben.substack.com/p/claude-cowork-project

Claude для слайдов:
http://how-to-gamma.ai

Claude Skills:
http://claude-skills.free

→ Уровень 3 - 3,5 часа: pro-приемы

Как избегать подхалимства модели:
https://ruben.substack.com/p/i-love-to-be-right

Claude Code:
http://claudecode.free

Claude 101:
https://anthropic.skilljar.com/claude-101

Как не упираться в лимиты Claude:
https://ruben.substack.com/p/how-to-stop-hitting-claude-usage

Хватит просто промптить:
https://ruben.substack.com/p/stop-prompting-claude

→ Уровень 4 - 8 часов: экспертный режим

Claude Computer:
https://ruben.substack.com/p/claude-computer

Разработка с Claude API:
https://anthropic.skilljar.com/claude-with-the-anthropic-api


Репост из: Заскуль питона (Аналитика данных)
😎 Крутые статьи на Хабре про A/B-тестирование от крупных компаний

A/B-тесты кажутся простыми: разделили аудиторию, сравнили метрики, сделали вывод. Но на практике можно легко допустить ошибку, которая приведёт к неправильным решениям. Собрал полезные статьи с Хабра, которые помогут разобраться в нюансах экспериментов и избежать классических фейлов и узнать что-то новое.

Топ постов от IT-компаний, в которых активно используется 🆎.

💙 Ozon

🟢Шесть причин, почему ваши A/B-тесты не работают
🟢Без А/B результат XЗ, или Как построить высоконагруженную платформу А/B-тестов

🖤 X5 Tech

🟢А/Б тесты с метрикой отношения. Дельта-метод
🟢Как проводить A/B-тестирование на 15 000 офлайн-магазинах
🟢50 оттенков линейной регрессии, или почему всё, что вы знаете об A/B тестах, помещается в одно уравнение
🟢Varioqub: за Mann-Whitney замолвите слово

🛒 Купер (ex. СберМаркет)

🟢Линеаризация: зачем и как укрощать ratio-метрики в A/B-тестах
🟢База: айсберг A/B-тестов

🌏 Авито

🟢Как устроено A/B-тестирование в Авито
🟢Как улучшить ваши A/B-тесты: лайфхаки аналитиков Авито. Часть 1
🟢Как улучшить ваши A/B-тесты: лайфхаки аналитиков Авито. Часть 2
🟢Сетап А/В-теста, который помог снизить MDE выручки в 2 раза
🟢Как мы в Авито проводим A/B-тесты CRM-рассылок

🤪 Lamoda Tech

🟢Как же мощно я провел A/B-тест, или почему не стоит сравнивать наблюдаемый аплифт с MDE

❤️ Яндекс

🟢10 мифов об A/B-тестировании: как избежать распространённых заблуждений в статистическом анализе

🏦 Т-банк

🟢Использование последовательного тестирования для уменьшения размера выборки

Ставьте 🐳, если подборка была полезной, сохраняйте к себе, чтобы не забыть! Следующую подборку сделаю по методам оценки эффекта без A/B тестирования

@zasql_python 👉 @ds_memes

Что-то забыл? Пишите в комментариях!


Это еще круче

Можно отправить Claude или Codex работать в браузере, собирать презентации, разбирать заметки и даже разрабатывать игры. Вся рутина, на которую нужно много разных программах, уместится в один запрос к агенту.

https://github.com/HKUDS/CLI-Anything






NNMClub_to_Karpov_courses_Machine_Learning_dlya_nachinayushchih.torrent
264.9Кб
[NNMClub.to]_Hardkornyiy Machine Learning 2.torrent
128.5Кб
Если хотели быстро погрузиться в ML, то вот два крутых курса - один база, другой про-версия

В сумме сейчас они стоят 200к+


Утилита, которая сама смотрит на железо и говорит, какие модели имеет смысл запускать.

llmfit анализирует CPU, RAM и GPU, а потом подбирает модели, которые будут нормально работать. 

https://github.com/AlexsJones/llmfit


Репост из: NN
Спасаем макбук от мусора: нашли бесплатную замену CleanMyMac для очистки памяти и оптимизации работы системы.

В один клик чистит кэш приложений и находит тяжелые документы, которыми уже долго не пользуетесь. Можно заранее проверить, что удаляет сервис, и настроить график автоматической очистки.

Забираем по ссылке.


Что могут спросить по теме трансформеров на собеседовании:
Основные типы LLM:
авторегрессионные (ex.GPT) генерируют текст последовательно, предсказывая следующее слово

двунаправленные(ex.BERT) анализируют контекст слева и справа от слова

энкодер-декодер(ex.T5, BART) преобразуют входные данные в выходные через промежуточное представление

Обучение
предобучение на большом корпусе текста с задачами вроде предсказания следующего токена или заполнения масок

fine-tuning на специфических датасетах для конкретных задач

Оценка
perplexity:
(the lower the better)
фактологичность, связность
ну и разные бенчмарки:
(GLUE, SuperGLUE, SQuAD)
Чем BERT отличается от GPT?

BERT: двунаправленный,
masked LM, для классификации
GPT: авторегрессия, генерация текста

Как бороться с галлюцинациями в LLM?
контроль температуры, top-k/p,
проверка фактов, fine-tuning

Как оптимизируют внимание в трансформерах?
разреженное внимание, кэширование, квантование, пакетная обработка

Какие гиперпараметры генерации ключевые в GPT?
temperature:
(креативность)
top-k/p:
(выбор токенов)
beam search:
(качество)
repetition_penalty






Репост из: Data Secrets
На базе утекшего кода Claude Code сделали полноценный опенсорсный инструмент OpenClaude

github.com/Gitlawb/openclaude

Это форк исходного слива, из которого убрали vendor lock-in. То есть теперь тот же самый Claude Code, со всеми сохраненными фичами и логикой, совместим с любыми моделями. В том числе локальными.

Уже 2к звезд на GitHub

Показано 20 последних публикаций.