TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
KotReview | Svetlana Meleshkina

17 Jul, 10:03

Open in Telegram Share Report

Подвезли новые бенчмарки для моделей. И это наконец-то больше похоже на бенчмарк здорового человека, чем SWE-bench Pro.

Scale обновила Remote Labor Index: моделям дают реальные проекты с Upwork вместе с вводными данными, исходниками и референсным результатом. Задача засчитывается только тогда, когда клиент принял бы работу (и заплатил 😜).

SWE-bench классный бенчмарк, он показывает, что модели могут работать с реальными репозиториями и закрывать реальные инженерные задачи. Но он отвечает на вопрос: может ли модель сделать коммит, который проходит проверку?

В реальной работе этого мало. Нужно не просто написать код и пройти проверки, нужно получить результат, который кто-то готов принять.

Потому что агенты, делая реально сложную работу, регулярно умудряются её не доделать. И даже при этом пройти автоматические проверки.

Ну никто не удивлён, да?

⏺Они теряют часть требований.
⏺Не собирают финальный файл.
⏺Ломают формат.
⏺Оставляют визуально кривой результат.

И это хорошо показывает разницу между возможностями модели и надёжностью системы вокруг неё.

В проде недостаточно проверить, умеет ли агент написать код, собрать презентацию или проанализировать данные.

Нужен цикл обратной связи:

⏺требования переведены в проверяемые условия;
⏺артефакт действительно создан;
⏺формат и структура валидны;
⏺тесты и автоматические проверки пройдены;
⏺человеку удобно посмотреть именно результат, а не заниматься археологией в трейсе агента.

Красивое демо отвечает на вопрос: модель вообще так может?

Рабочая система отвечает на другой: Наш техлид готов это пустить в прод?
Remote Labor Index (RLI)
Remote Labor Index (RLI): Evaluating the capability of AI agents to perform real-world, economically valuable remote work

178 0 0 2 7
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot