Poolside выпустила Laguna S 2.1: агентная модель для кода, которая играет не в своём весе
Компания Poolside представила Laguna S 2.1 — компактную модель, ориентированную на длинные агентные сценарии программирования и активное использование рассуждений. Это Mixture-of-Experts на 118 млрд параметров с 8 млрд активных на токен и контекстным окном до 1 млн токенов, работающим как в режиме с рассуждениями, так и без них. Ключевой тезис анонса — от старта обучения до релиза прошло меньше девяти недель, а на бенчмарках для длинных задач модель конкурирует с решениями, которые в разы больше её по размеру.
Что показывают бенчмарки
На Terminal-Bench 2.1 модель набирает 70,2% с включёнными рассуждениями, и Poolside называет её самой способной агентной моделью для кода в своей весовой категории. В общем рейтинге этого бенчмарка она занимает одиннадцатую строчку, уступая заметно более крупным Kimi K3, Claude Fable 5 и линейке GPT-5.6, но обходя, например, DeepSeek-V4-Pro-Max на 1,6 трлн параметров, Inkling на 975 млрд и Nemotron 3 Ultra на 550 млрд. Отдельно Poolside разбирает бенчмарк DeepSWE от Datacurve, где у моделей ещё много пространства для роста и результаты сильнее расходятся: здесь Laguna S 2.1 набирает 40,4% в режиме рассуждений, тогда как некоторые открытые модели на триллион с лишним параметров не дотягивают и до 10%. Важная оговорка самой компании: результаты по DeepSWE получены в её собственном харнессе pool, а не в mini-swe-agent, который использует официальная таблица лидеров, поэтому напрямую цифры не сопоставимы.
Ставка на упорство, а не на размер
Главная идея релиза в том, что прирост даёт не увеличение размера модели, а изменение её манеры работы. По словам сооснователя прикладных исследований Пэнмина Вана, в этой версии добавляли не столько интеллект, сколько поведение, ведущее к результату: больше проверок, меньше принятого на веру, отказ от преждевременного объявления победы и большая настойчивость. Более ранние модели серии могли остановиться на частично проходящих тестах или бросить подход за пару шагов до успеха — Laguna S 2.1 продолжает работу. Компания формулирует это как две отдельные оси развития: сырой интеллект и способ работы модели, и вкладывается в обе, параллельно начав предобучение следующей, более крупной модели серии.
Как это выглядит на реальных задачах
Poolside приводит три показательных прогона с полными трассировками. В одном модель за 50-минутную сессию из 181 шага без вмешательства человека собрала с нуля работающий движок рендеринга HTML/CSS, а затем сама придумала способ проверить результат, запустив headless-Chromium и численно сравнив скриншоты, — притом что зрения у неё нет. В другом она оптимизировала собственное агентное окружение Poolside, ускорив его на 5,2% и снизив выделение памяти примерно на 70%, и продолжила искать улучшения даже после того, как прирост по скорости стало трудно измерять. В третьем модель заново вывела доказательство задачи Эрдёша №397, работая на Perl из-за отсутствия Python в песочнице. Здесь Poolside честно уточняет, что это повторное открытие, а не первое решение: задачу впервые закрыла GPT-5.2 Pro в январе 2026 года, но конструкция Laguna структурно другая, что говорит о самостоятельном выводе, а не о воспроизведении по памяти.
Обучение и режимы рассуждений
Laguna S 2.1 — это масштабирование семейства Laguna XS на тех же данных предобучения, что и XS 2.1; переход дали масштаб, исправления в коде обучения и небольшие изменения рецепта, а не новые данные. Это первая модель Poolside, где обучение с подкреплением велось в точности FP8. Основную разницу с младшими моделями обеспечивает пост-обучение из двух стадий — SFT с частичным использованием синтетики, а затем RL для задач, которые модель пока решает плохо. Обучающий корпус охватывает 409 тыс. агентных и неагентных окружений. У модели два режима размышлений: выключенный и максимальный по умолчанию, где она сама подбирает бюджет вычислений под задачу. Максимальный режим поднимает результат на Terminal-Bench 2.1 с 60,4% до 70,2%, а на DeepSWE — с 16,5% до 40,4%. Ручного управления уровнем усилий (низкий-средний-высокий) пока нет, компания обещает добавить его позже.
Доступность
Предобучение стартовало 22 мая 2026 года на 4096 ускорителях NVIDIA H200, а по размеру модель помещается на одну рабочую станцию NVIDIA DGX Spark. Веса выложены на Hugging Face под лицензией OpenMDW-1.1 в форматах BF16, FP8, INT4 и NVFP4, с официальными сборками GGUF и MLX. С первого дня поддерживаются vLLM, SGLang и Ollama, модель доступна через API на OpenRouter, включая бесплатный эндпоинт и платный с полным контекстом 1 млн токенов по цене 0,10 / 0,20 / 0,01 доллара за миллион токенов на входе, выходе и чтении из кэша. Кроме того, её можно попробовать без регистрации в веб-чате chat.poolside.ai.
Компания Poolside представила Laguna S 2.1 — компактную модель, ориентированную на длинные агентные сценарии программирования и активное использование рассуждений. Это Mixture-of-Experts на 118 млрд параметров с 8 млрд активных на токен и контекстным окном до 1 млн токенов, работающим как в режиме с рассуждениями, так и без них. Ключевой тезис анонса — от старта обучения до релиза прошло меньше девяти недель, а на бенчмарках для длинных задач модель конкурирует с решениями, которые в разы больше её по размеру.
Что показывают бенчмарки
На Terminal-Bench 2.1 модель набирает 70,2% с включёнными рассуждениями, и Poolside называет её самой способной агентной моделью для кода в своей весовой категории. В общем рейтинге этого бенчмарка она занимает одиннадцатую строчку, уступая заметно более крупным Kimi K3, Claude Fable 5 и линейке GPT-5.6, но обходя, например, DeepSeek-V4-Pro-Max на 1,6 трлн параметров, Inkling на 975 млрд и Nemotron 3 Ultra на 550 млрд. Отдельно Poolside разбирает бенчмарк DeepSWE от Datacurve, где у моделей ещё много пространства для роста и результаты сильнее расходятся: здесь Laguna S 2.1 набирает 40,4% в режиме рассуждений, тогда как некоторые открытые модели на триллион с лишним параметров не дотягивают и до 10%. Важная оговорка самой компании: результаты по DeepSWE получены в её собственном харнессе pool, а не в mini-swe-agent, который использует официальная таблица лидеров, поэтому напрямую цифры не сопоставимы.
Ставка на упорство, а не на размер
Главная идея релиза в том, что прирост даёт не увеличение размера модели, а изменение её манеры работы. По словам сооснователя прикладных исследований Пэнмина Вана, в этой версии добавляли не столько интеллект, сколько поведение, ведущее к результату: больше проверок, меньше принятого на веру, отказ от преждевременного объявления победы и большая настойчивость. Более ранние модели серии могли остановиться на частично проходящих тестах или бросить подход за пару шагов до успеха — Laguna S 2.1 продолжает работу. Компания формулирует это как две отдельные оси развития: сырой интеллект и способ работы модели, и вкладывается в обе, параллельно начав предобучение следующей, более крупной модели серии.
Как это выглядит на реальных задачах
Poolside приводит три показательных прогона с полными трассировками. В одном модель за 50-минутную сессию из 181 шага без вмешательства человека собрала с нуля работающий движок рендеринга HTML/CSS, а затем сама придумала способ проверить результат, запустив headless-Chromium и численно сравнив скриншоты, — притом что зрения у неё нет. В другом она оптимизировала собственное агентное окружение Poolside, ускорив его на 5,2% и снизив выделение памяти примерно на 70%, и продолжила искать улучшения даже после того, как прирост по скорости стало трудно измерять. В третьем модель заново вывела доказательство задачи Эрдёша №397, работая на Perl из-за отсутствия Python в песочнице. Здесь Poolside честно уточняет, что это повторное открытие, а не первое решение: задачу впервые закрыла GPT-5.2 Pro в январе 2026 года, но конструкция Laguna структурно другая, что говорит о самостоятельном выводе, а не о воспроизведении по памяти.
Обучение и режимы рассуждений
Laguna S 2.1 — это масштабирование семейства Laguna XS на тех же данных предобучения, что и XS 2.1; переход дали масштаб, исправления в коде обучения и небольшие изменения рецепта, а не новые данные. Это первая модель Poolside, где обучение с подкреплением велось в точности FP8. Основную разницу с младшими моделями обеспечивает пост-обучение из двух стадий — SFT с частичным использованием синтетики, а затем RL для задач, которые модель пока решает плохо. Обучающий корпус охватывает 409 тыс. агентных и неагентных окружений. У модели два режима размышлений: выключенный и максимальный по умолчанию, где она сама подбирает бюджет вычислений под задачу. Максимальный режим поднимает результат на Terminal-Bench 2.1 с 60,4% до 70,2%, а на DeepSWE — с 16,5% до 40,4%. Ручного управления уровнем усилий (низкий-средний-высокий) пока нет, компания обещает добавить его позже.
Доступность
Предобучение стартовало 22 мая 2026 года на 4096 ускорителях NVIDIA H200, а по размеру модель помещается на одну рабочую станцию NVIDIA DGX Spark. Веса выложены на Hugging Face под лицензией OpenMDW-1.1 в форматах BF16, FP8, INT4 и NVFP4, с официальными сборками GGUF и MLX. С первого дня поддерживаются vLLM, SGLang и Ollama, модель доступна через API на OpenRouter, включая бесплатный эндпоинт и платный с полным контекстом 1 млн токенов по цене 0,10 / 0,20 / 0,01 доллара за миллион токенов на входе, выходе и чтении из кэша. Кроме того, её можно попробовать без регистрации в веб-чате chat.poolside.ai.