Lost in the Noise: How Reasoning Models Fail with Contextual Distractors
Авторы представили новый бенчмарк: насколько нейронки теряют информацию в шуме. Подлость в том, что это не случайный набор данных, а информация выглядящее правдоподобной, но по факту являющейся недостоверной или вредной.
По итогом все выглядит так:
Пока протестированы далеко не все модели.
Интерактивные рузультаты.
Авторы представили новый бенчмарк: насколько нейронки теряют информацию в шуме. Подлость в том, что это не случайный набор данных, а информация выглядящее правдоподобной, но по факту являющейся недостоверной или вредной.
По итогом все выглядит так:
Gemini-2.5-Pro - 77.8 %
DeepSeek-R1-0528- 72.4%
gpt-oss-120b - 72 %
Gemini-2.5-Flash - 70.6 %
все остальные 60 и меньше.
Пока протестированы далеко не все модели.
Интерактивные рузультаты.