§ Кажется что Claude обучался на китайских моделях
Недавно появился странный эксперимент: Claude спрашивают на китайском “какая ты модель?”, а он внезапно отвечает, что он Qwen или DeepSeek.
В интернете сразу пошел разгон, что под капотом у Claude находится китайский Qwen или DeepSeek, но это гипотеза кажется мне далекой от правды.
Я бы скорее сказал следующее:
Claude мог обучаться для китайской аудитории на публичных диалогах Qwen’a / DeepSeek’a, а может они даже построили систему для того чтобы Claude вытягивал ответы из китайских моделей и учился на этом.
В этом нет ничего плохо и уж явно не говорит о том что под капотом Claude находится Qwen. Он вполне может отвечать о том что он китайская модель просто потому что в контексте китайского языка он прочитал слишком много диалогов с китайской моделью. Если LLM не сказать напрямую кто она, то она будет отвечать так как это было в большинстве обучающих выборок.
Еще раз LLM предсказывает следующий токен по распределению вероятностей, зависящему от контекста, системных инструкций, обучающих данных и decoding-параметров.
Важно: самоидентификация модели — это не доказательство того, какая модель реально стоит на backend
Недавно появился странный эксперимент: Claude спрашивают на китайском “какая ты модель?”, а он внезапно отвечает, что он Qwen или DeepSeek.
В интернете сразу пошел разгон, что под капотом у Claude находится китайский Qwen или DeepSeek, но это гипотеза кажется мне далекой от правды.
Я бы скорее сказал следующее:
Claude мог обучаться для китайской аудитории на публичных диалогах Qwen’a / DeepSeek’a, а может они даже построили систему для того чтобы Claude вытягивал ответы из китайских моделей и учился на этом.
В этом нет ничего плохо и уж явно не говорит о том что под капотом Claude находится Qwen. Он вполне может отвечать о том что он китайская модель просто потому что в контексте китайского языка он прочитал слишком много диалогов с китайской моделью. Если LLM не сказать напрямую кто она, то она будет отвечать так как это было в большинстве обучающих выборок.
Еще раз LLM предсказывает следующий токен по распределению вероятностей, зависящему от контекста, системных инструкций, обучающих данных и decoding-параметров.
Важно: самоидентификация модели — это не доказательство того, какая модель реально стоит на backend