Про X-split
В прошлое воскресенье на датафесте рассказывал про нашу архитектуру X-split Argus — делюсь презой!
Напомню, что в рекламном стеке семейство аргусов решает задачу ранжирования, но в цирке не выступает выступает как фича / эмбед в финальном ранкере. Его основная ценность в кодировании истории и долгосрочных интересов пользователя. Вообще способность модели учитывать длинный контекст при низком латенси и высоких нагрузках — это большой челлендж в индустрии, и для него, как обычно, нет единого подхода.
Если неймдропать, то бывают:
• Q-former-like подходы — жмём историю в фиксированное число токенов с обучаемыми query-векторами;
• GSU / ESU — делаем для каждого пользователя индекс из исторических событий и по эмбеду запроса достаём похожие. Запросом при этом могут быть разные сущности, не только текст;
• KV-cache — храним KV-вектора по истории и релаксируем сложность инференса числом свежих событий. В этом подходе инфровых задач больше, чем ML-ных;
• Сегментное сжатие — делим историю на сегменты длины K и вводим отдельные токены, которые суммаризируют свои сегменты. На инференсе смотрим только на токены сегментов + на все свежие события
X-split — нечто среднее между первым и вторым подходом: оффлайн-модель достаёт константное число эмбедов на пользователя, а рантайм одновременно процессит недавние события и оффлайн-вектора. При этом исторические эмбеды не зависят от запроса, как в GSU, и мы не обучаем отдельные query-эмбеддинги для оффлайн-части, как в Q-former'е.
Ещё у X-split'а есть важное свойство — это модель с ранним связыванием, то есть кандидат видит всю историю пользователя через аттеншн, а не через dot product с одним вектором. Собственно, отсюда и название: X — cross-attention. Такие модели выразительно более мощные, но требуют эффективной реализации кастомной аттеншн-маски на инференсе — слава Tri Dao, у нас в 2026-м есть работающий flex attention!
——————
Как всегда, всё это уже было в Симпсонах, и ещё в 2021 году в поиск выкатывалась модель с архитектурой, которую назвали semi-split. У неё тоже было раннее связывание и сжатие длинной истории через настоящий GSU. Чего у неё не было, так это скейлинга. Благодаря переходу от itemwise-обучения к авторегрессивному, мы научились масштабировать качество модели, заливая её контекстом и компьютом
В итоге щас имеем многообещающие приросты по оффлайну и wannabe-внедрение в ближайший месяц-два. Ждём 👍
——————
Наша команда проделала огромную работу по ресерчу, а сейчас команда рекламы титаническими усилиями затаскивает это всё в прод — мощь 😎
В прошлое воскресенье на датафесте рассказывал про нашу архитектуру X-split Argus — делюсь презой!
Напомню, что в рекламном стеке семейство аргусов решает задачу ранжирования, но в цирке не выступает выступает как фича / эмбед в финальном ранкере. Его основная ценность в кодировании истории и долгосрочных интересов пользователя. Вообще способность модели учитывать длинный контекст при низком латенси и высоких нагрузках — это большой челлендж в индустрии, и для него, как обычно, нет единого подхода.
Если неймдропать, то бывают:
• Q-former-like подходы — жмём историю в фиксированное число токенов с обучаемыми query-векторами;
• GSU / ESU — делаем для каждого пользователя индекс из исторических событий и по эмбеду запроса достаём похожие. Запросом при этом могут быть разные сущности, не только текст;
• KV-cache — храним KV-вектора по истории и релаксируем сложность инференса числом свежих событий. В этом подходе инфровых задач больше, чем ML-ных;
• Сегментное сжатие — делим историю на сегменты длины K и вводим отдельные токены, которые суммаризируют свои сегменты. На инференсе смотрим только на токены сегментов + на все свежие события
Байт на комменты — пишите, чё забыл
X-split — нечто среднее между первым и вторым подходом: оффлайн-модель достаёт константное число эмбедов на пользователя, а рантайм одновременно процессит недавние события и оффлайн-вектора. При этом исторические эмбеды не зависят от запроса, как в GSU, и мы не обучаем отдельные query-эмбеддинги для оффлайн-части, как в Q-former'е.
Ещё у X-split'а есть важное свойство — это модель с ранним связыванием, то есть кандидат видит всю историю пользователя через аттеншн, а не через dot product с одним вектором. Собственно, отсюда и название: X — cross-attention. Такие модели выразительно более мощные, но требуют эффективной реализации кастомной аттеншн-маски на инференсе — слава Tri Dao, у нас в 2026-м есть работающий flex attention!
——————
Как всегда, всё это уже было в Симпсонах, и ещё в 2021 году в поиск выкатывалась модель с архитектурой, которую назвали semi-split. У неё тоже было раннее связывание и сжатие длинной истории через настоящий GSU. Чего у неё не было, так это скейлинга. Благодаря переходу от itemwise-обучения к авторегрессивному, мы научились масштабировать качество модели, заливая её контекстом и компьютом
В итоге щас имеем многообещающие приросты по оффлайну и wannabe-внедрение в ближайший месяц-два. Ждём 👍
——————
Наша команда проделала огромную работу по ресерчу, а сейчас команда рекламы титаническими усилиями затаскивает это всё в прод — мощь 😎