Самое ожидаемое событие последнего месяца – вышла Qwen3.8-27B.
Открытые веса, Apache 2.0, размер тот же, что у прошлой 3.6 — но внутри другая модель.
Что изменилось за поколение:
SWE-bench Pro — берут реальные баги из живых репозиториев на гитхабе и просят модель их починить. Не абстрактные задачки, а «вот проект, вот тикет, разберись». Было 53, стало 62.
Terminal Bench — модель сажают в голый терминал и дают задачу: собери, разверни, найди почему упало. Проверяет, умеет ли она работать руками, а не только советы давать. Было 63, стало 73.
OSWorld — то же самое, но с мышкой и экраном. Модель видит рабочий стол и должна что-то в нём сделать: открыть, настроить, перенести. Было 64, стало 84. Самый заметный скачок.
DeepSWE — тяжёлый набор задач на программирование, где нужно много шагов подряд. Тут вообще с 13 до 42. То есть раньше она такое просто не вывозила.
Теперь про закрытые модели. На SWE-bench Pro Qwen обгоняет Opus 4.6 Max — 61.7 против 53.4. На длинных офисных задачах тоже впереди. На LiveCodeBench (олимпиадные задачки со свежих контестов, чтобы модель не могла их знать наизусть) примерно вровень.
Где закрытые всё ещё сильнее — там, где надо думать, а не делать. HLE — это «Humanity’s Last Exam», набор вопросов от учёных, специально составленный так, чтобы модели на нём ломались. Там 31 против 40. Плюс генерация кода на уровне целого репозитория с нуля.
То есть догнали в конкретной нише — агентская работа с кодом и интерфейсами, — а не по всему фронту.
Важная деталь: все замеры делал сам Qwen. Пара бенчмарков вообще внутренние, их никто со стороны не проверит. Так что верить стоит направлению, а не точным цифрам.
Кванты на HF уже есть, поднимается через vLLM, SGLang, Ollama. Будет чем заняться на выходных.
https://huggingface.co/Qwen/Qwen3.8-27B
Открытые веса, Apache 2.0, размер тот же, что у прошлой 3.6 — но внутри другая модель.
Что изменилось за поколение:
SWE-bench Pro — берут реальные баги из живых репозиториев на гитхабе и просят модель их починить. Не абстрактные задачки, а «вот проект, вот тикет, разберись». Было 53, стало 62.
Terminal Bench — модель сажают в голый терминал и дают задачу: собери, разверни, найди почему упало. Проверяет, умеет ли она работать руками, а не только советы давать. Было 63, стало 73.
OSWorld — то же самое, но с мышкой и экраном. Модель видит рабочий стол и должна что-то в нём сделать: открыть, настроить, перенести. Было 64, стало 84. Самый заметный скачок.
DeepSWE — тяжёлый набор задач на программирование, где нужно много шагов подряд. Тут вообще с 13 до 42. То есть раньше она такое просто не вывозила.
Теперь про закрытые модели. На SWE-bench Pro Qwen обгоняет Opus 4.6 Max — 61.7 против 53.4. На длинных офисных задачах тоже впереди. На LiveCodeBench (олимпиадные задачки со свежих контестов, чтобы модель не могла их знать наизусть) примерно вровень.
Где закрытые всё ещё сильнее — там, где надо думать, а не делать. HLE — это «Humanity’s Last Exam», набор вопросов от учёных, специально составленный так, чтобы модели на нём ломались. Там 31 против 40. Плюс генерация кода на уровне целого репозитория с нуля.
То есть догнали в конкретной нише — агентская работа с кодом и интерфейсами, — а не по всему фронту.
Важная деталь: все замеры делал сам Qwen. Пара бенчмарков вообще внутренние, их никто со стороны не проверит. Так что верить стоит направлению, а не точным цифрам.
Кванты на HF уже есть, поднимается через vLLM, SGLang, Ollama. Будет чем заняться на выходных.
https://huggingface.co/Qwen/Qwen3.8-27B