TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
Future AI

22 Jul, 15:50

Open in Telegram Share Report

Forward from: Machine learning Interview
Одна и та же ложь может по-разному влиять на LLM в зависимости от тона, уверенности и грамматической формы.

В EoBench собрали около 66 тысяч ложных утверждений в 19 стилях и проверили 18 моделей Gemma, Llama и Qwen. Для теста оставили только те факты, которые модель изначально знала правильно.

Лучше всего модели убеждали:

* приказы;
* формальный язык;
* обращение как к ребёнку;
* ссылки на авторитет;
* уверенная подача.

Хуже всего работали слабые формулировки и контрфактические утверждения.

Крупные модели реже принимали ложный контекст, а instruction tuning обычно дополнительно повышал устойчивость.

Вывод: оценивать LLM нужно с учётом формы запроса. Небольшое изменение формулировки может заметно изменить ответ модели.

Статья: *It’s Not What You Say, It’s How You Say It: Evaluating LLM Responses to Expressions of Belief*

arxiv.org/abs/2607.18232

22 0 1 1
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot