TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
Нетоксичный тимлид 🐬

14 Aug, 19:03

Telegram'da ochish Ulashish Shikoyat qilish

Самое ожидаемое событие последнего месяца – вышла Qwen3.8-27B.

Открытые веса, Apache 2.0, размер тот же, что у прошлой 3.6 — но внутри другая модель.

Что изменилось за поколение:

SWE-bench Pro — берут реальные баги из живых репозиториев на гитхабе и просят модель их починить. Не абстрактные задачки, а «вот проект, вот тикет, разберись». Было 53, стало 62.

Terminal Bench — модель сажают в голый терминал и дают задачу: собери, разверни, найди почему упало. Проверяет, умеет ли она работать руками, а не только советы давать. Было 63, стало 73.

OSWorld — то же самое, но с мышкой и экраном. Модель видит рабочий стол и должна что-то в нём сделать: открыть, настроить, перенести. Было 64, стало 84. Самый заметный скачок.

DeepSWE — тяжёлый набор задач на программирование, где нужно много шагов подряд. Тут вообще с 13 до 42. То есть раньше она такое просто не вывозила.
Теперь про закрытые модели. На SWE-bench Pro Qwen обгоняет Opus 4.6 Max — 61.7 против 53.4. На длинных офисных задачах тоже впереди. На LiveCodeBench (олимпиадные задачки со свежих контестов, чтобы модель не могла их знать наизусть) примерно вровень.

Где закрытые всё ещё сильнее — там, где надо думать, а не делать. HLE — это «Humanity’s Last Exam», набор вопросов от учёных, специально составленный так, чтобы модели на нём ломались. Там 31 против 40. Плюс генерация кода на уровне целого репозитория с нуля.

То есть догнали в конкретной нише — агентская работа с кодом и интерфейсами, — а не по всему фронту.

Важная деталь: все замеры делал сам Qwen. Пара бенчмарков вообще внутренние, их никто со стороны не проверит. Так что верить стоит направлению, а не точным цифрам.

Кванты на HF уже есть, поднимается через vLLM, SGLang, Ollama. Будет чем заняться на выходных.

https://huggingface.co/Qwen/Qwen3.8-27B

258 1 4 2 7
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot