Как LLM-вендоры обращаются с вашими данными: подробный разбор безопасности и конфиденциальности
Продолжаем доставать заготовки из рукава. В декабре прошлого года на Хабре выходила у меня статья на тему: «Как LLM-вендоры обращаются с вашими данными?».
Родилась она из классической параноидальной боли: очень хочется закинуть данные поценнее в нейрону поумнее, но внутренний безопасник бьет по рукам, пока не оценит потенциальный ущерб.
Понятно, что на случайные утечки мы повлиять не можем. Но давайте хотя бы прочитаем, как нас планируют вращать в легальном поле (согласно ToS). И тут у меня сложилось впечатление, что западные и отечественные компании в общем случае хотя бы делают вид, что следуют правилам, а вот китайцам 毫不在乎.
Вспоминая инцидент с DeepSeek. Фантастический уровень разгильдяйства. В обзор попал только DeepSeek, так что если у кого есть инфа про Kimi или Qwen, с удовольствием обсужу.
Краткие итоги моего ресерча:
🟢 Западные вендоры Меня приятно удивило, что они довольно прозрачно описывают политики и дают возможность отказаться от скармливания логов в обучающую выборку. Нюансы закопаны глубоко в дебрях лицензионного соглашения, конечно [ссылка ]. GDPR и угроза конских штрафов не дают им расслабляться. Ежовые рукавицы третьей ветви власти.
🟡 Наши (Зеленый и Желтый) Неприятно удивили. В политиках почти прямым текстом: «ваши данные теперь наши, будем учиться на них как хотим». Исключения есть, но они в основном касаются B2B тарифов. Если это читают представители компаний, которым есть что сказать по поводу, то велком в личку, буду рад здесь ошибиться.
🔴 Китайцы (DeepSeek) В ToS описано информации немного, но суть оптимизма не внушает, там напрямую говорится, что вертят они наши данные как хотят, включая передачу третьим лицам. За эти фокусы, кстати, их апп выпили из немецких сторов.
Теперь мой личный вывод такой:
1️⃣ Относительно секьюрно используем «большую тройку» (OpenAI, Anthropic, Google) и примкнувший к ним Cursor.
2️⃣ Отечественные строго по праздникам и без секретов.
3️⃣ Китайцы только когда надо дешево прогнать тонну нечувствительных данных по API и роляют косты.
Продолжаем доставать заготовки из рукава. В декабре прошлого года на Хабре выходила у меня статья на тему: «Как LLM-вендоры обращаются с вашими данными?».
Родилась она из классической параноидальной боли: очень хочется закинуть данные поценнее в нейрону поумнее, но внутренний безопасник бьет по рукам, пока не оценит потенциальный ущерб.
Понятно, что на случайные утечки мы повлиять не можем. Но давайте хотя бы прочитаем, как нас планируют вращать в легальном поле (согласно ToS). И тут у меня сложилось впечатление, что западные и отечественные компании в общем случае хотя бы делают вид, что следуют правилам, а вот китайцам 毫不在乎.
Вспоминая инцидент с DeepSeek. Фантастический уровень разгильдяйства. В обзор попал только DeepSeek, так что если у кого есть инфа про Kimi или Qwen, с удовольствием обсужу.
Краткие итоги моего ресерча:
🟢 Западные вендоры Меня приятно удивило, что они довольно прозрачно описывают политики и дают возможность отказаться от скармливания логов в обучающую выборку. Нюансы закопаны глубоко в дебрях лицензионного соглашения, конечно [ссылка ]. GDPR и угроза конских штрафов не дают им расслабляться. Ежовые рукавицы третьей ветви власти.
🟡 Наши (Зеленый и Желтый) Неприятно удивили. В политиках почти прямым текстом: «ваши данные теперь наши, будем учиться на них как хотим». Исключения есть, но они в основном касаются B2B тарифов. Если это читают представители компаний, которым есть что сказать по поводу, то велком в личку, буду рад здесь ошибиться.
🔴 Китайцы (DeepSeek) В ToS описано информации немного, но суть оптимизма не внушает, там напрямую говорится, что вертят они наши данные как хотят, включая передачу третьим лицам. За эти фокусы, кстати, их апп выпили из немецких сторов.
Теперь мой личный вывод такой:
1️⃣ Относительно секьюрно используем «большую тройку» (OpenAI, Anthropic, Google) и примкнувший к ним Cursor.
2️⃣ Отечественные строго по праздникам и без секретов.
3️⃣ Китайцы только когда надо дешево прогнать тонну нечувствительных данных по API и роляют косты.