Мы собрали первый большой открытый бенчмарк работы LLM на 1C. В нем более 150 задач на написание кода в 1С. Бенчмарк имеет 2 режима — одношаговая генерация и многошаговый агентный режим для проверки работы AI агентов.
Подробности в статье на Хабре: https://habr.com/ru/companies/sberbank/articles/1040114
Сайт бенчмарка с результатами замаров на современных LLM: https://1cbench.github.io/
Репозиторий с кодом и задачами: https://github.com/1cbench/bench
Подробности в статье на Хабре: https://habr.com/ru/companies/sberbank/articles/1040114
Сайт бенчмарка с результатами замаров на современных LLM: https://1cbench.github.io/
Репозиторий с кодом и задачами: https://github.com/1cbench/bench