TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
🤖 Датаист

5 Sep, 19:42

Открыть в Telegram Поделиться Пожаловаться

GPT-6 Astra достигла AGI? Разбираемся без хайпа

OpenAI представила GPT-6 Astra и заявила о начале эры AGI. По определению OpenAI, общий ИИ должен превосходить людей в большинстве экономически значимых задач.

Но если убрать маркетинг, приблизилась ли Astra к человеческому пониманию мира?

Главный аргумент — бенчмарк ARC-AGI-3. Это тест, где модель попадает в незнакомые игровые миры и должна сама понять, как они устроены. Astra набрала 62,7% против 7,78% у GPT-5.6 Sol и 30,16% у Claude Opus 5. Более того, 96% решенных уровней в среде OpenAI она проходила за меньшее число действий, чем человек.

Но OpenAI показывала в этом тесте 99,9%. Разница возникла потому, что использовалась собственная обертка с памятью и обработкой контекста.

Поэтому прохождение теста еще не доказывает AGI.

При этом скачок в интеллекте серьезный. Astra получила 97,6% в сложнейшей математике FrontierMath, 96% в научных вопросах уровня аспирантуры GPQA, 95,9% в инженерном проектировании BenchCAD, 74,1% в реальных задачах разработки DeepSWE и 100% в тесте эксплуатации уязвимостей ExploitBench.

Галлюцинаций стало меньше, но в длинном контексте Astra местами уступает конкурентам.

Главное изменение видно в реальной работе.

В OSWorld 2.0, где ИИ управляет компьютером и выполняет длинные цепочки действий, Astra получила 72,6% против 65,7% у Sol и тратила на задачу около 40 минут вместо 75. Она может работать в браузере и приложениях почти как человек.

Astra дороже Sol за токен, но в DeepSWE ее лучшая конфигурация обходилась примерно на 57% дешевле за завершенную задачу. Для бизнеса важнее уже не цена токенов, а сколько стоит реально выполненная работа.

Я это вижу и на собственном опыте. У меня две подписки Claude Code по $200, и я активно использую Fable 5.1 для разработки продукта. Модель может несколько часов подряд писать код, исправлять за собой ошибки и продолжать работу, пока не упрется в пятичасовой лимит.

Поэтому для меня главный показатель: сколько полезной работы модель способна сделать автономно за час и сколько стоит итоговый результат.

Я сравнил обе модели на практике. Astra создала приложение примерно за 45 минут, Fable 5.1 — за полтора часа. При почти одинаковом результате задача у Astra стоила в два раза дешевле, чем у Fable. Во фронтенде Astra понравилась больше — дизайн меньше похож на нейрослоп.

Интересно, что Astra становится сложнее контролировать изнутри. Она научилась решать сложные задачи без длинной цепочки рассуждений: часть вычислений происходит до того, как модель вообще что-либо записывает.

Astra сокращала видимое рассуждение, когда ей сообщали, что за ним наблюдают, а в отдельных тестах могла намеренно показывать более слабый результат. Это не означает, что модель «что-то замышляет», но чем умнее становится агент, тем меньше его мыслительного процесса мы можем видеть.

При этом инъекции промтов все еще обходят защиту Astra хотя бы раз в 8,5% сценариев, а в отдельном многошаговом тесте защита срабатывала примерно в 67% случаев.

Также OpenAI не показала Astra в GDPval — собственном тесте реальной работы по 44 профессиям. Именно он хорошо проверил бы заявление о превосходстве над человеком в экономически значимых задачах.

Думаю, Astra еще не доказала, что понимает мир лучше человека, но на части незнакомых задач она уже действует на человеческом уровне, а с обвязкой вокруг нее она уже похожа на автономного цифрового сотрудника.

И работать с ней тоже нужно иначе: задавая цель, разрешать выводить намерение из контекста и доводить задачу до результата без прерываний; просить сначала подготовить конкретный вариант, а уже потом запрашивать подтверждение; для сложных задач разрешать параллельную работу субагентов, а в разработке ограничивать лишние повторные проверки.

OpenAI уже разрабатывает роботов, чтобы перенести этот интеллект в физический мир.

Спор о том, наступил ли AGI, не особо важен. Думаю, в ближайшее время мы так и не сможем определить, что такое общий ИИ.

Важно, сколько реальной работы мы готовы передать ИИ без контроля человека. И, судя по Astra, эта граница двигается очень быстро.

#новости
«Добро пожаловать в эру AGI»: OpenAI представила GPT-6 Astra
OpenAI представила GPT-6 Astra — новую передовую модель, которую компания считает возможным началом эры искусственного общего интеллекта (AGI). Сооснователь и президент OpenAI Грег Брокман заявил, что Astra позволяет делегировать ИИ сложную работу сразу в нескольких приложениях: от таблиц и CRM до и...

1.9k 2 39 2 36
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot