Data Science


Гео и язык канала: Весь мир, Английский
Категория: Технологии


DS
По всем вопросам- @haarrp
@ai_machinelearning_big_data - machine learning
@pythonl - Python
@itchannels_telegram - 🔥 best it channels
@ArtificialIntelligencedl - AI
@pythonlbooks-📚
@programming_books_it -📚
Реестр РКН: https://clck.ru/3Fk3zS

Связанные каналы  |  Похожие каналы

Гео и язык канала
Весь мир, Английский
Категория
Технологии
Статистика
Фильтр публикаций


📚 Обновили огромный учебник по математике для Computer Science и Machine Learning - 2220 страниц.

Внутри сразу несколько фундаментальных тем:
— алгебра
— топология
— дифференциальное исчисление
— теория оптимизации
— математический аппарат для CS и ML
Хороший вариант, если хочется не просто использовать формулы в ML, а понимать, откуда они берутся и почему работают.

Книга доступна здесь:
https://www.cis.upenn.edu/~jean/gbooks/

@datascienceiot


AgentBug-Smith: Automatically Reproducing Real-World Harness Bugs in Agentic Systems

📓 Read

@datascienceiot


Стать специалистом по Data Science всего за 10 недель — это реально!

Если давно смотрите в сторону Data Science, но откладываете старт из-за огромного количества технологий, математики и непонятного пути до первой работы — сейчас можно зайти в профессию по-другому.

Симулейтив запускает интенсивный буткемп по Data Science, который построен вокруг главного: за первые 10 недель собрать необходимый стек, получить практический опыт и начать готовиться к реальным собеседованиям.

И главное — вам не нужно сначала учиться 8–12 месяцев, а уже потом думать о трудоустройстве.

Что вас ждёт:
➖необходимые для старта навыки: Python, ML, статистика, работа с данными и AI-инструментами;
➖практика на реальных задачах и проектах;
➖понятный ежедневный план обучения и поддержка менторов;
➖еженедельные живые занятия, а не старые записи;
➖подготовка к собеседованиям уже с первых недель — групповые интервью, разбор вопросов и подготовка резюме.

А что после 10 недель? Буткемп — это только первый этап.

После него можно продолжить углублять экспертизу и двигаться к уровню middle:
➖продвинутый Python;
➖Git;
➖продвинутая статистика и A/B-тестирование;
➖Airflow;
➖MLOps и развёртывание ML-моделей.

Кому подойдёт:
Тем, кто хочет войти в Data Science системно и не тратить год на самостоятельный поиск правильного маршрута.
Тем, кто начинал учиться самостоятельно, но терял темп без структуры и дедлайнов.
Тем, кто хочет не просто изучать теорию, а как можно раньше начать готовиться к выходу на рынок.
Тем, кому важно учиться на практике и получать обратную связь от менторов.

🔥ВАЖНО: Симулейтив сейчас дают возможность получить грант на обучение и гарантию трудоустройства своих студентов! Количество грантов, ограничено!

Оставляйте заявку до конца недели, чтобы занять одно из 5 оставшихся мест нового потока!

🔗 ЗАБРОНИРОВАТЬ МЕСТО


📚 Классика, которую стоит прочитать: бесплатная книга Давида Кризеля о нейросетях

Если хочется разобраться, как нейросети устроены на уровне основ, а не только вызывать API, есть отличный бесплатный материал: A Brief Introduction to Neural Networks Давида Кризеля. Книга выросла из семинара в Боннском университете, первая версия вышла ещё в 2005 году, и с тех пор её дорабатывали.

Книга разделена на три большие части. Первая ведёт от биологии к формализации: биологический нейрон, компоненты искусственных сетей и основы обучения. Вторая посвящена обучению с учителем: перцептроны, backpropagation, RBF-сети и рекуррентные сети. Третья про обучение без учителя: сети Хопфилда, самоорганизующиеся карты Кохонена и теорию адаптивного резонанса.

Отдельно есть экскурсы в кластеризацию, предсказание временных рядов и обучение с подкреплением.

Главное достоинство книги в подаче. Каждое понятие объясняется сначала простыми словами, а потом строго математически, поэтому её одинаково удобно читать и новичку, и тому, кто хочет формул. Иллюстрации автор рисовал сам, в конце глав есть упражнения, а примеры связаны с его Java-библиотекой SNIPE.

Про трансформеры и LLM здесь ничего нет. Зато это хороший фундамент, без которого современные архитектуры понимаются хуже. Распространяется бесплатно по лицензии Creative Commons.

https://dkriesel.com/_media/science/neuronalenetze-en-zeta2-2col-dkrieselcom.pdf


Shockingly Simple Self-retrospection Improves Agentic Models Without RL

"Can a language-model agent improve its future actions by training only on explanations of its own experience? We investigate this question by studying Retrospection-Only Fine-Tuning (ROFT), a minimal online procedure designed to isolate the effect of explanation-only training on subsequent behavior. The agent attempts a task, observes available feedback, generates a retrospective explanation, and is fine-tuned with a next-token prediction loss on the explanation tokens alone."

📓 Read

@datascienceiot


5 октября начнется 19-й поток программы Data Engineer от Newprolab

Программа для junior- и middle-дата-инженеров, аналитиков, backend-разработчиков, техлидов и тех, кто работает с data-командами и хочет лучше понимать современный стек DE

📌 Что внутри:
– 10 недель обучения
– 30 занятий: онлайн + записи
– 10 практических лабораторных работ
– облачный кластер и реальные данные
– чат участников и поддержка команды программы

📌 Что получите на выходе:
1. Научитесь решать типовые задачи DE на практике
2. Систематизируете знания и закроете пробелы в современном DE-стеке
3. Поработаете с реальными данными и инфраструктурой, а не только с учебными примерами
4. Соберете практический опыт, который можно обсуждать на собеседованиях и использовать в работе
5. Все записи и материалы останутся у вас после окончания программы

Преподаватели – практикующие специалисты из ведущих технологических компаний. На занятиях можно разбирать реальные кейсы, задавать вопросы и получать обратную связь

👉 Подробности и квиз – на сайте

Квиз покажет, насколько программа подходит именно под вашу роль и задачи, даст персональные рекомендации и промокод на скидку
___
По всем вопросам пишите Алексею @snitsa


"PrimeScientist: Strategic Allocation of Research Effort in Autonomous Research"


📓 Read

@datascienceiot


ML-проект не заканчивается на обучении модели

В Data Science есть довольно знакомый момент: сначала всё работает почти идеально. Есть датасет, ноутбук, модель и несколько экспериментов. Но когда модель нужно использовать регулярно, внезапно выясняется, что сам алгоритм — только часть задачи.

Данные нужно где-то хранить, регулярно обновлять и обрабатывать. Пайплайны — запускать по расписанию. Результаты — отдавать в аналитические системы. А ещё нужно не потерять воспроизводимость всего процесса, когда экспериментов становится больше. По сути, вокруг модели постепенно появляется полноценная data-платформа.

Один из вариантов собрать такой контур внутри корпоративной инфраструктуры — использовать PaaS-компоненты Yandex Cloud в Stackland. В обновлении платформы появились ClickHouse и PostgreSQL для работы с данными, Object Storage и Trino для аналитического слоя, Airflow для оркестрации и DataLens для визуализации.

При таком подходе ML-процесс выглядит уже не как «модель + ноутбук», а как последовательный конвейер: данные поступают в хранилище, проходят обработку, используются для подготовки признаков и обучения, а результаты возвращаются в аналитический контур.

Таким образом, появляется одна из главных точек перехода от экспериментов к production: сложность постепенно смещается с самой модели на инфраструктуру, которая должна обеспечивать её работу.


New Stanford+Together AI paper shows teams that learn to check each other's work solve problems none of them got right alone.

📘 Paper

@datascienceiot


Avito DS Meetup: RL, AI-агенты и BidCorrection 🚀

🔸 Булат Шарипов расскажет, как в Авито обучают собственные языковые модели с помощью RL, а Владислав Воробьев — как BidCorrection меняет состав трафика, не трогая сами объявления.

🔸 Всеволод Викулин расскажет, как реально автоматизировать процессы с помощью AI-агентов, — этим и многим другим он поделится на Avito DS Meetup 7 октября.

После докладов будет нетворкинг с DS-сообществом. А ещё, если придёте офлайн, сможете найти прикольные тематические пасхалки, которые мы для вас спрятали 👀

⚡️ Встречаемся в 18:30 7 октября.

Места в офлайне ограничены — регистрация обязательна.

➡️ Регистрируйтесь по ссылке и приходите!


Agent Memory Is a Surface for Endogenous Authorization Laundering

📘 Paper

@datascienceiot


Участвуй во всероссийском ИТ-чемпионате МТС True Tech Champ 2026 c призовой фондом 10 250 000 рублей.

Если тебе нравятся алгоритмы, структуры данных и задачи на чистую логику — участвуй в алгоритмическом треке с индивидуальным зачетом.

Решай задачи разного уровня сложности: от базовых до тех, что проверяют скорость мышления и умение оптимизировать решения за ограниченное время.

В финале лучшие 120 участников алгоритмического трека сразятся в лайв-кодинге за шесть призовых мест и 2 750 000 рублей. Всех финалистов ждут:
— Лимитированный мерч;
— Сертификаты об участии;
— Масштабное мероприятие с выступлениями хэдлайнеров и фестивальными активностями.

Успей зарегистрироваться и пройти отборочный этап до 27 сентября


Physics-based Deep Learning: Combining Deep Learning with Physical Simulations

📘 Paper

@datascienceiot


🔥 DataLens Platform: что происходит, когда data stack собирают в одну систему

Yandex B2B Tech представила платформу, которая объединяет хранение, обработку, визуализацию и ИИ-аналитику данных.

Вместо связки из нескольких инструментов данные можно обрабатывать и анализировать в единой среде. Встроенный ИИ-помощник принимает запросы на обычном языке и помогает получать показатели без ручной сборки отчётов.

Отдельно интересна архитектура: storage и compute масштабируются независимо. Растет объем данных — увеличивается хранилище; растёт нагрузка на расчёты — добавляются вычислительные мощности.

По оценке Yandex B2B Tech, такой подход может сократить затраты на аналитику до 30%, а подготовку отчетов и дашбордов — ускорить в 3–5 раз.

📎 Подробнее о платформе — в материале СМИ.


Regularized Recursive Self-Improvement of Agent Harnesses


📘 Paper

@datascienceiot


ττ-bench treats agent building like a real client job.


📘 Paper

@datascienceiot


Не отставайте от рынка — учитесь со скидкой 16%
Если чувствуете, что стоите на месте, и хотите освоить востребованную профессию, — сейчас хороший момент начать.
Потому что до 30 сентября на все курсы Практикума действует скидка 16%. 
Выбрать курс
Вы сможете:
— получить актуальные навыки;
— освоить ИИ-инструменты для работы;
— перенять опыт экспертов, которые двигают индустрию;
— попасть в сообщество выпускников, где можно попросить совета и, возможно, найти будущих коллег.

Просто выберите курс, начните учиться бесплатно и получите скидку 16% — она автоматически появится в личном кабинете. 
Учиться!


Erid: 2SDnjezu8Km
Название: ООО "ЯНДЕКС"
ИНН: 7736207543


Thinking with Looped Flows

📘 Paper

@datascienceiot


📘 Hidden Markov Models (HMM)

Короткий материал от Stanford по одной из классических моделей машинного обучения для работы с последовательностями.

Внутри разбираются:

- состояния и наблюдения
- transition и emission probabilities
- вычисление вероятности последовательности
- декодирование скрытых состояний
- обучение параметров HMM
- применение к последовательным данным

Хороший компактный материал, если нужно быстро разобраться, как работают скрытые марковские модели без чтения огромного учебника.

https://web.stanford.edu/~jurafsky/slp3/A.pdf


Banger report from Microsoft.

They introduce a 4B coding agent trained on roughly 1,500 software engineering environments.

📘 Paper

@datascienceiot

Показано 20 последних публикаций.