TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
Наталья Абабий

13 Jul, 09:09

Open in Telegram Share Report

Claude стал честнее - что это значит для вас

Пару недель назад видела заголовок: «Первый ИИ без галлюцинаций». Красиво. И неправда 🙂

Разбираемся, что произошло на самом деле.

Anthropic выпустили Claude Opus 4.8 и главным улучшением назвали не скорость и не бенчмарки, а честность. Сами они формулируют скромно: «умеренное, но ощутимое улучшение». Никакого «нуля галлюцинаций» там нет - и любой, кто обещает вам ИИ без ошибок, продаёт волшебную таблетку.

А вот что есть, и это важно.
У всех моделей была одна неприятная черта: они уверенно рапортовали об успехе, даже когда сделали работу так себе. «Готово, всё работает!» - а внутри три бага и одна выдумка.

Красиво, убедительно, неправда. Новая версия по данным Anthropic в 4 раза реже пропускает ошибки в собственном коде молча. Чаще говорит «я не уверена», «этих данных в документе нет», «уточните задачу».

И вот тут главный сдвиг, который касается не только программистов.

Мы привыкли, что «я не знаю» от ИИ - это как будто провал. А на самом деле это лучшее, что нейросеть может вам сказать. Потому что альтернатива - правдоподобная ерунда, которую вы понесёте в отчёт, договор или решение.

Что это значит на практике:
если ИИ стал чаще сомневаться и задавать вопросы - это не деградация, это взросление,
проверяйте не те ответы, где модель сомневается, а те, где она подозрительно уверена,
и приучайте команду: уверенный тон нейросети - не аргумент. Аргумент - проверенный факт.
Забавно, что «честность» пришлось отдельно тренировать. Годами мы учили нейросети звучать убедительно, а теперь учим признаваться, что они чего-то не знают.

Людям, кстати, тоже иногда не помешало бы такое обновление 🙃

Первоисточник (анонс Anthropic): https://www.anthropic.com/news/claude-opus-4-8
Introducing Claude Opus 4.8
Our latest model, Claude Opus 4.8, is an upgrade to our Opus class of models, with stronger performance across coding, agentic tasks, and professional work, and the consistency to handle long-running work.

256 0 0 1 6
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot