Подвезли новые бенчмарки для моделей. И это наконец-то больше похоже на бенчмарк здорового человека, чем SWE-bench Pro.
Scale обновила Remote Labor Index: моделям дают реальные проекты с Upwork вместе с вводными данными, исходниками и референсным результатом. Задача засчитывается только тогда, когда клиент принял бы работу (и заплатил 😜).
SWE-bench классный бенчмарк, он показывает, что модели могут работать с реальными репозиториями и закрывать реальные инженерные задачи. Но он отвечает на вопрос: может ли модель сделать коммит, который проходит проверку?
В реальной работе этого мало. Нужно не просто написать код и пройти проверки, нужно получить результат, который кто-то готов принять.
Потому что агенты, делая реально сложную работу, регулярно умудряются её не доделать. И даже при этом пройти автоматические проверки.
Ну никто не удивлён, да?
⏺Они теряют часть требований.
⏺Не собирают финальный файл.
⏺Ломают формат.
⏺Оставляют визуально кривой результат.
И это хорошо показывает разницу между возможностями модели и надёжностью системы вокруг неё.
В проде недостаточно проверить, умеет ли агент написать код, собрать презентацию или проанализировать данные.
Нужен цикл обратной связи:
⏺требования переведены в проверяемые условия;
⏺артефакт действительно создан;
⏺формат и структура валидны;
⏺тесты и автоматические проверки пройдены;
⏺человеку удобно посмотреть именно результат, а не заниматься археологией в трейсе агента.
Красивое демо отвечает на вопрос: модель вообще так может?
Рабочая система отвечает на другой: Наш техлид готов это пустить в прод?
Scale обновила Remote Labor Index: моделям дают реальные проекты с Upwork вместе с вводными данными, исходниками и референсным результатом. Задача засчитывается только тогда, когда клиент принял бы работу (и заплатил 😜).
SWE-bench классный бенчмарк, он показывает, что модели могут работать с реальными репозиториями и закрывать реальные инженерные задачи. Но он отвечает на вопрос: может ли модель сделать коммит, который проходит проверку?
В реальной работе этого мало. Нужно не просто написать код и пройти проверки, нужно получить результат, который кто-то готов принять.
Потому что агенты, делая реально сложную работу, регулярно умудряются её не доделать. И даже при этом пройти автоматические проверки.
Ну никто не удивлён, да?
⏺Они теряют часть требований.
⏺Не собирают финальный файл.
⏺Ломают формат.
⏺Оставляют визуально кривой результат.
И это хорошо показывает разницу между возможностями модели и надёжностью системы вокруг неё.
В проде недостаточно проверить, умеет ли агент написать код, собрать презентацию или проанализировать данные.
Нужен цикл обратной связи:
⏺требования переведены в проверяемые условия;
⏺артефакт действительно создан;
⏺формат и структура валидны;
⏺тесты и автоматические проверки пройдены;
⏺человеку удобно посмотреть именно результат, а не заниматься археологией в трейсе агента.
Красивое демо отвечает на вопрос: модель вообще так может?
Рабочая система отвечает на другой: Наш техлид готов это пустить в прод?