Vertical Watch Opinion 4


Channel's geo and language: not specified, not specified
Category: not specified


Vertical Watch / Hot takes

Related channels

Channel's geo and language
not specified, not specified
Category
not specified
Statistics
Posts filter


Семплинг важнее модели: как Entropy-Cut меняет правила для контентных пайплайнов

Reasoning-модели становятся стандартом для AI-генерации, но метрики длины текста больше не гарантируют качество. Исследование Entropy-Cut Metropolis-Hastings показало: пересэмплинг с точки максимальной энтропии даёт стабильный прирост на бенчмарках — MATH500, HumanEval, GPQA Diamond. Эффект объясняется тем, что mixing time зависит от числа решений в трассе, а не от общего числа токенов.

Для GEO и AI Overviews это прямой сигнал: при одинаковых моделях разница в выдаче может лежать в схеме сэмплинга. Если AI-выдача строится на одном прогоне среза по длине, качество может быть ниже, чем при пересборке через энтропийные точки.

Практический вывод: при тестировании AI-контента для вертикали (финансы, юриспруденция, медицина) стоит прогонять не только модель, но и разные схемы сэмплинга. Именно там часто теряется стабильность ответов. Для арбитражника это значит пересмотреть пайплайн — добавить контрольные точки пересборки, а не заливать первый попавшийся сгенерированный текст.


Красивый отбор фич не всегда продаёт модель

В табличном ML до сих пор живёт опасная иллюзия: если нашёл «правильный» набор признаков, качество почти автоматически вырастет. Но свежий разбор на SCM3K показывает более жёсткую картину. Исследователи прогнали 3 450 синтетических задач с разной плотностью признаков, шестью семействами SCM и несколькими регрессорами и проверили не просто восстановление структуры, а пользу Markov boundary именно для прогноза.

Итог неприятный для любителей «умной зачистки» данных: если подать модель только на oracle boundary, выигрыш действительно бывает, особенно когда признаков много и они сильно разрежены. Но в реальных условиях до этой точки часто не доезжают сами оценщики границы — compute уходит раньше, чем появляется ощутимая польза. А в ряде режимов полный набор фич вообще оказывается не хуже и иногда лучше.

Для вертикалей это очень приземлённый вывод. В арбитраже, SEO-табличках, антифроде или скоринге лидов соблазн выкинуть «лишнее» всегда велик: меньше шума, чище структура, вроде бы понятнее модель. Но если отбор оптимизируется под красоту схемы, а не под итоговый скор, он легко начинает вредить. Особенно когда ошибка отбрасывания полезного признака дороже, чем шум от пары лишних.

Мой вывод простой: в прикладных задачах важно не искать идеальную границу признаков, а считать экономику ошибок. Иногда честный full feature set даёт больше, чем аккуратная, но дорогая в вычислениях «умная» обрезка.


Каузальные модели в AI Search: почему реальный трафик ломает бенчмарки

Новая работа на arXiv предлагает TTT-SCL — фреймворк, который собирает тренировочные наборы динамически под каждый конкретный запрос. Авторы прямо называют три слабых места существующих supervised causal learning: разрыв между синтетикой и реальностью, хрупкость при distribution shift и провал compositional generalization. TTT-SCL якобы обходит всех на синтетике, pseudo-real и real-world датасетах.

Но суть не в методе, а в диагнозе. Для маркетологов, которые ставят каузальные модели в пайплайн ранжирования, классификации или прогноза конверсий, это красный флаг: ваша модель может отлично работать на «среднем» наборе, но сломается, когда запросы и паттерны поведения начнут плавать от сессии к сессии. А реальный трафик — это всегда сдвиг.

Если вы используете causal discovery или причинные модели для предсказания поведения пользователей, перестаньте верить бенчмаркам. Тестируйте на сегментах с аномальным поведением, на внезапных всплесках интентов, на смене источников трафика. Иначе в один момент модель выдаст красивую каузальную картинку, которая не имеет ничего общего с тем, что происходит в реальной выдаче.


Техническая проверка канала.

4 last posts shown.

4

subscribers
Channel statistics