Репост из: Machine learning Interview
Одна и та же ложь может по-разному влиять на LLM в зависимости от тона, уверенности и грамматической формы.
В EoBench собрали около 66 тысяч ложных утверждений в 19 стилях и проверили 18 моделей Gemma, Llama и Qwen. Для теста оставили только те факты, которые модель изначально знала правильно.
Лучше всего модели убеждали:
* приказы;
* формальный язык;
* обращение как к ребёнку;
* ссылки на авторитет;
* уверенная подача.
Хуже всего работали слабые формулировки и контрфактические утверждения.
Крупные модели реже принимали ложный контекст, а instruction tuning обычно дополнительно повышал устойчивость.
Вывод: оценивать LLM нужно с учётом формы запроса. Небольшое изменение формулировки может заметно изменить ответ модели.
Статья: *It’s Not What You Say, It’s How You Say It: Evaluating LLM Responses to Expressions of Belief*
arxiv.org/abs/2607.18232
В EoBench собрали около 66 тысяч ложных утверждений в 19 стилях и проверили 18 моделей Gemma, Llama и Qwen. Для теста оставили только те факты, которые модель изначально знала правильно.
Лучше всего модели убеждали:
* приказы;
* формальный язык;
* обращение как к ребёнку;
* ссылки на авторитет;
* уверенная подача.
Хуже всего работали слабые формулировки и контрфактические утверждения.
Крупные модели реже принимали ложный контекст, а instruction tuning обычно дополнительно повышал устойчивость.
Вывод: оценивать LLM нужно с учётом формы запроса. Небольшое изменение формулировки может заметно изменить ответ модели.
Статья: *It’s Not What You Say, It’s How You Say It: Evaluating LLM Responses to Expressions of Belief*
arxiv.org/abs/2607.18232