TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
AI Metropolis

1 Jan, 20:00

Open in Telegram Share Report

11:05
Video is unavailable for watching
Show in Telegram
iQuest Coder 40B: Реальный конкурент Claude 4.5 или мастер прохождения тестов?

Очередная open-source модель iQuest Coder V1 (версия 40B Loop Instruct) наделала шума, заявив в бенчмарках цифры выше, чем у Claude 4.5 Sonnet и Gemini 3. На бумаге это выглядит как прорыв, но при реальном тестировании вскрывается классическая проблема современных нейросетей — "overfitting" под тесты. Разбираем интересную архитектуру и почему графики врут.

Ключевые моменты:
• Архитектура Loop: Данные прогоняются через блоки трансформера дважды. Это позволяет удвоить глубину рассуждений (reasoning) без увеличения количества параметров и расхода VRAM.
• Обучение на потоке (Code Flow): Вместо статичных файлов модель учили на истории коммитов и git-diff'ах, чтобы она понимала эволюцию кода от бага к фиксу.
• Принцип зрелости проекта: Датасет фильтровали, оставляя коммиты только из стадии 40-80% жизненного цикла проекта. Начальный хаос и финальную стагнацию отсекали, фокусируясь на пике активной разработки.

Главная фишка модели, вынесенная в название — рекуррентная структура. В обычных трансформерах данные идут по прямой линии: вход → слои → выход. iQuest Coder использует подход Loop Coder: входные данные проходят через модель в две итерации.
Первый проход дает общее понимание контекста ("схватывает суть").
Второй проход уточняет логику, комбинируя глобальное внимание с локальным.

Это работает как чтение сложного кода человеком: сначала вы пробегаете глазами, чтобы понять структуру, а потом вчитываетесь, чтобы разобрать логику. Также пост-тренинг разделен на два пути: стандартный Instruct и Thinking (аналог o1 от OpenAI), где модель генерирует скрытые цепочки рассуждений перед ответом.

Почему тесты врут (Benchmaxing)
В отчете модель показывает безумные 81.4 балла на SWE-verified. Это территория закрытых гигантов. Но на практике iQuest Coder ведет себя как студент-зубрила, который выучил ответы на билеты, но не понимает предмет.

Если дать ей изолированную задачу в стиле LeetCode — она справляется блестяще, выдавая оптимизированный код быстрее человека. Но в реальной разработке ("вот 10 файлов, почини стейт в Supabase на дашборде Next.js") модель теряется. Она начинает галлюцинировать несуществующие импорты и не понимает неявного контекста (например, какую именно кнопку нужно пофиксить, если это не сказано прямо).

Причина в агрессивном обучении на задачах спортивного программирования и синтетических данных. Модель научилась проходить тесты (соблюдать букву закона), но не уловила дух реальной инженерии, где нужно работать с легаси, плохой документацией и нечеткими ТЗ.

Практический вывод: iQuest Coder 40B — отличный инструмент для локального запуска (потребуется пара мощных потребительских GPU), если вам нужно генерировать алгоритмы, сниппеты или решать логические задачи. В этом она превосходит даже Llama 3 70B. Но заменять ею Claude или GPT-4 для архитектурных задач и рефакторинга больших проектов пока рано — ей не хватает "житейского" понимания кода.

AICodeKing

Переводы видео, саммари новостей про AI

35 0 1 1
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot