TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
KotReview | Svetlana Meleshkina

20 Jul, 09:59

Open in Telegram Share Report

Секте свидетелей Done в agentic workflow посвящается

Продолжим про бенчарки агентской разработки. Попался на глаза разбор по SWE-bench Verified.

Исследователи сравнили submit rate и resolve rate. Оказалось, что агент почти всегда способен сформировать и отправить изменение. Но заметно реже это изменение действительно закрывает проблему.

И это, если честно, совсем не удивительно. Метрика «я сделаль» никогда не была равна метрике «пользователь получил рабочий фикс».

Более того, одна из самых неприятных категорий ошибок получила название silent semantic failure. Это когда агент несколько раз подряд воспроизводит одно и то же неправильное решение и каждый раз уверен что задача выполнена. То есть проблема не только в том, что агент ошибся. Проблема в том, что он убежден, что он прав.

Еще из интересного. Агент часто предпочитает внести изменения, даже когда правильным решением было не менять код вообще.
Получается ловушка. Высокий submit rate не является метрикой приносимой пользы. Это всего лишь показатель того, что агент склонен что-то сделать. Опытный разраб на живой системе предпочел бы трогать минимум кода, а лучше не трогать вообще, если можно выкрутиться по другому.

Но ведь мы раньше не верили на слово джунам. Сообщение 'Починил, проверил' было поводом пойти открыть diff, убедиться, что CI зеленый, а не просто нажать на мерж. Так и агент это участник процесса, а не система контроля. Его Done всего лишь гипотеза, которую нужно проверить. Self-report агента не является доказательством.

А вот из того, как мы выстроим доказательства, критерии приемки и строится настоящая инженерия агентных систем. И эта инженерия не про то, как грозить модели пальчиком в промпте. И не про бесконечную гонку за новыми моделями. А про то, что нужно думать не только о том, что подать модели на вход, но и о том, как проверить то, что она выдала на выходе. Когда она сказала Done.
Submit rate isn't resolve rate — Stephanie Jarmak
Today's arXiv drop clusters on one question: can you trust agent-written code? Coding agents submit far more often than they resolve, leave behind code that's measurably harder for the next agent to build on, and get approved by reviewers whose scrutiny is fading. The counterweight is agents that kn...

180 0 0 4
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot