TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
Synaptic Garden

4 Oct, 23:12

Open in Telegram Share Report

Хайп вокруг нового класса моделей — моделей принятия решений или decision models — продолжает набирать обороты. Чуть ли не каждый день на поле выходит новый игрок, за всеми и не уследить. Давайте посмотрим на несколько заметных решений и подумаем какую роль модели принятия решений будут играть в агентских системах ближайшего будущего.

Вернёмся к началу: 15 сентября TypeSafe явила миру Jev. Создатели называют её первой моделью нового класса System One: в отличие от привычных LLM, Jev не генерирует текст токен за токеном, а получает состояние системы и набор допустимых вариантов действий и сразу возвращает структурированное решение вместе с вероятностями. Например, определить, какому отделу отправить обращение, какой инструмент вызвать агенту, насколько серьёзна проблема или нужно ли вообще выполнять действие.

Идея оказалась очень своевременной. Во многих агентных системах большая языковая модель нужна далеко не на каждом шаге: часто агенту не требуется писать текст или долго рассуждать — нужно быстро выбрать одно действие из нескольких. Использовать для этого полноценную LLM дорого и медленно, а ещё приходится контролировать формат ответа. Jev фактически предложила специализированный «быстрый контур» для таких решений: никаких рассуждений и генерации, только непосредственно решение и оценка уверенности.

Судя по скорости реакции индустрии, идея попала точно в цель. Не прошло и трёх недель, как начали появляться аналоги от Cloudflare, Perplexity, Strands Labs, Fastino и других команд — причём многие сразу с открытыми весами. Сама Cloudflare в анонсе Clef прямо пишет о «большом ажиотаже» вокруг Jev и нового класса decision-моделей.

Чем интересны открытые Clef 27B и Clef-flash 9B от Cloudflare? Внутри всё ещё находится Qwen, но обычная генерация текста не используется: модель делает только prefill-проход, после чего специальная голова параллельно оценивает все допустимые варианты. У большой Clef заморожен Qwen3.8-27B, у Flash — Qwen3.5-9B, а обучаются LoRA-адаптеры и отдельный механизм маршрутизации внимания между вариантами. В тестах самой Cloudflare Clef или Clef-flash заняли первое место в 7 из 10 decision-бенчмарков: например, на BANKING77 большая Clef получила 94,2 против 79,7 у Jev, а на BFCL — 98,5 против 95,8. При этом медианная задержка составила 209 мс у Clef и всего 38,8 мс у Clef-flash против 524 мс у Jev.

Почти одновременно собственную открытую модель выпустила Perplexity — pplx-decider-v1-27b. Здесь архитектура ещё нагляднее: взяли Qwen3.8-27B, полностью убрали слой генерации языка и заменили его выходом сразу на 255 возможных решений. Затем переобучили backbone, vision-компонент и новую голову, а вероятности отдельно откалибровали. В среднем по 11 опубликованным Perplexity тестам модель набрала 85,71% против 84,51% у Jev и 74,76% у исходной Qwen. При этом победа далеко не абсолютная: например, на RAGTruth PPLX Decider получает 88,8 против 77,3 у Jev, но на BBH уже Jev впереди — 94,3 против 82,8.

Другой подход выбрала Strands Decider 2B. Это всего 1,9 млрд параметров на базе Qwen3.5-2B. Языковая голова здесь тоже удалена, но вместо фиксированного набора выходов добавлена примерно миллион-параметровая pointer-head: она сравнивает внутреннее представление вопроса с представлениями каждого предложенного варианта. Благодаря этому количество действий не нужно заранее зашивать в архитектуру. На RTX 3090 модель выдаёт решение примерно за 115 мс по медиане и при этом может работать локально даже на Apple Silicon или CPU.

Ещё радикальнее выглядит Laya. Вместо многомиллиардной decoder-LLM это bidirectional encoder на базе ModernBERT всего на 421 млн параметров, а мультиязычная версия на mmBERT содержит 322 млн. Каждый вариант ответа получает собственную позицию, модель оценивает их одновременно и делает softmax — никакой генерации вообще нет. Специализированная Laya Typed-Decisions на наборе из 2000 решений показывает accuracy 0,766 против опубликованных 0,727 у Jev. Но у маленькой модели есть и очевидный предел: на BANKING77 с десятками вариантов Jev набирает 0,870, тогда как Laya — только 0,425. Зато один запрос Laya обрабатывает примерно за 33 мс.

Наконец, появились и закрытые модели, которые пытаются развить идею дальше. GLiDE от Fastino добавляет к decision model адаптивное рассуждение: сначала выполняется быстрый проход, но если выбор сложный или модель не уверена, она выделяет дополнительное вычисление. На Decision Index GLiDE заявляет 64,81 балла против 57,91 у Jev и превосходит её в 31 из 38 тестов; особенно велик разрыв на задачах знания и рассуждения — 62,9 против 51,4.

В итоге интереснее всего даже не то, какая именно модель сейчас лидирует в конкретном бенчмарке. За несколько недель Jev фактически запустила архитектурную гонку вокруг новой идеи: если задача модели состоит не в том, чтобы разговаривать с человеком, а в том, чтобы принять одно из заранее допустимых решений, возможно, генеративная LLM для этого вообще не лучший инструмент.

Cloudflare строит специализированную голову поверх большого Qwen, Perplexity заменяет языковой выход фиксированным decision-readout, Strands использует pointer-механизм с динамическими вариантами, Laya возвращается к маленьким bidirectional encoder-моделям, а Fastino пытается объединить быстрые решения System One с рассуждением только тогда, когда оно действительно необходимо.

Пока рано говорить, останутся ли decision models отдельным классом моделей надолго. Но скорость, с которой крупные команды начали выпускать собственные реализации после Jev, выглядит как довольно сильный сигнал: в агентных системах может формироваться отдельный слой моделей, задача которых — не генерировать, а решать.

45 0 1 1
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot