Вышла sonet-4.5, пишут что новая маленькая (и дешевая) модель бьет прошлый опус по метрикам кодинга (SWE bench-у относительно можно доверять)
Я потыкал в своих задачах кодинга, кажется что правда лучше, но возможно, она просто быстрее и успевает сделать больше попыток пока не выбесит меня
P.S. на графике режим test-time compute - это когда модель генерирует несколько решений из которых выбирается лучшее.
Я потыкал в своих задачах кодинга, кажется что правда лучше, но возможно, она просто быстрее и успевает сделать больше попыток пока не выбесит меня
P.S. на графике режим test-time compute - это когда модель генерирует несколько решений из которых выбирается лучшее.