TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
Synaptic Garden

22 Jul, 09:33

Открыть в Telegram Поделиться Пожаловаться

Poolside выпустила Laguna S 2.1: агентная модель для кода, которая играет не в своём весе

Компания Poolside представила Laguna S 2.1 — компактную модель, ориентированную на длинные агентные сценарии программирования и активное использование рассуждений. Это Mixture-of-Experts на 118 млрд параметров с 8 млрд активных на токен и контекстным окном до 1 млн токенов, работающим как в режиме с рассуждениями, так и без них. Ключевой тезис анонса — от старта обучения до релиза прошло меньше девяти недель, а на бенчмарках для длинных задач модель конкурирует с решениями, которые в разы больше её по размеру.

Что показывают бенчмарки

На Terminal-Bench 2.1 модель набирает 70,2% с включёнными рассуждениями, и Poolside называет её самой способной агентной моделью для кода в своей весовой категории. В общем рейтинге этого бенчмарка она занимает одиннадцатую строчку, уступая заметно более крупным Kimi K3, Claude Fable 5 и линейке GPT-5.6, но обходя, например, DeepSeek-V4-Pro-Max на 1,6 трлн параметров, Inkling на 975 млрд и Nemotron 3 Ultra на 550 млрд. Отдельно Poolside разбирает бенчмарк DeepSWE от Datacurve, где у моделей ещё много пространства для роста и результаты сильнее расходятся: здесь Laguna S 2.1 набирает 40,4% в режиме рассуждений, тогда как некоторые открытые модели на триллион с лишним параметров не дотягивают и до 10%. Важная оговорка самой компании: результаты по DeepSWE получены в её собственном харнессе pool, а не в mini-swe-agent, который использует официальная таблица лидеров, поэтому напрямую цифры не сопоставимы.

Ставка на упорство, а не на размер

Главная идея релиза в том, что прирост даёт не увеличение размера модели, а изменение её манеры работы. По словам сооснователя прикладных исследований Пэнмина Вана, в этой версии добавляли не столько интеллект, сколько поведение, ведущее к результату: больше проверок, меньше принятого на веру, отказ от преждевременного объявления победы и большая настойчивость. Более ранние модели серии могли остановиться на частично проходящих тестах или бросить подход за пару шагов до успеха — Laguna S 2.1 продолжает работу. Компания формулирует это как две отдельные оси развития: сырой интеллект и способ работы модели, и вкладывается в обе, параллельно начав предобучение следующей, более крупной модели серии.

Как это выглядит на реальных задачах

Poolside приводит три показательных прогона с полными трассировками. В одном модель за 50-минутную сессию из 181 шага без вмешательства человека собрала с нуля работающий движок рендеринга HTML/CSS, а затем сама придумала способ проверить результат, запустив headless-Chromium и численно сравнив скриншоты, — притом что зрения у неё нет. В другом она оптимизировала собственное агентное окружение Poolside, ускорив его на 5,2% и снизив выделение памяти примерно на 70%, и продолжила искать улучшения даже после того, как прирост по скорости стало трудно измерять. В третьем модель заново вывела доказательство задачи Эрдёша №397, работая на Perl из-за отсутствия Python в песочнице. Здесь Poolside честно уточняет, что это повторное открытие, а не первое решение: задачу впервые закрыла GPT-5.2 Pro в январе 2026 года, но конструкция Laguna структурно другая, что говорит о самостоятельном выводе, а не о воспроизведении по памяти.

Обучение и режимы рассуждений

Laguna S 2.1 — это масштабирование семейства Laguna XS на тех же данных предобучения, что и XS 2.1; переход дали масштаб, исправления в коде обучения и небольшие изменения рецепта, а не новые данные. Это первая модель Poolside, где обучение с подкреплением велось в точности FP8. Основную разницу с младшими моделями обеспечивает пост-обучение из двух стадий — SFT с частичным использованием синтетики, а затем RL для задач, которые модель пока решает плохо. Обучающий корпус охватывает 409 тыс. агентных и неагентных окружений. У модели два режима размышлений: выключенный и максимальный по умолчанию, где она сама подбирает бюджет вычислений под задачу. Максимальный режим поднимает результат на Terminal-Bench 2.1 с 60,4% до 70,2%, а на DeepSWE — с 16,5% до 40,4%. Ручного управления уровнем усилий (низкий-средний-высокий) пока нет, компания обещает добавить его позже.

Доступность

Предобучение стартовало 22 мая 2026 года на 4096 ускорителях NVIDIA H200, а по размеру модель помещается на одну рабочую станцию NVIDIA DGX Spark. Веса выложены на Hugging Face под лицензией OpenMDW-1.1 в форматах BF16, FP8, INT4 и NVFP4, с официальными сборками GGUF и MLX. С первого дня поддерживаются vLLM, SGLang и Ollama, модель доступна через API на OpenRouter, включая бесплатный эндпоинт и платный с полным контекстом 1 млн токенов по цене 0,10 / 0,20 / 0,01 доллара за миллион токенов на входе, выходе и чтении из кэша. Кроме того, её можно попробовать без регистрации в веб-чате chat.poolside.ai.

186 0 7
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot