Вчера в карусели рассказывала о 5 трендах AI. Сегодня хочу подробно остановиться на том, который для нас, россиян, важнее остальных. Открытые модели.
16 июля вышла Kimi K3 - новая модель, которую уже называют одним из самых сильных конкурентов ChatGPT и Claude. Но главное даже не её мощность, а то, что модель открытая.
Вчера ее выложили в опенсорc!
Закрытую модель вроде GPT можно арендовать только через облако её создателя за границей. А как только ты прогоняешь через неё данные клиентов, ты автоматически нарушаешь 152-ФЗ — закон о персональных данных. Он требует хранить и обрабатывать данные россиян на серверах внутри страны. Открытую же модель можно поставить на сервер в России — и закон соблюдён, и модель того же класса, что зарубежные флагманы.
Правда, сам себе такую модель российский бизнес не поставит. 2,8 триллиона параметров требуют промышленных видеокарт, а не сервера в углу офиса.
Это могут обеспечить только крупные провайдеры Яндекс, Cloud.ru — они размещают модель у себя и продают доступ.
Selectel пока перепродает K3 с 40% наценкой - за 378,94 рубля за миллион входных токенов и 1894,69 за миллион выходных — против 3 и 15 долларов на OpenRouter. Но запрос всё равно уходит к Moonshot за границу. Selectel и сам пишет честно — «транзитом через наш роутер». Для 152-ФЗ это ничего не меняет, данные покидают Россию, просто чек в рублях.
А сколько K3 будет стоить, когда её реально поставят на серверы в России, можно прикинуть по аналогии. Cloud.ru уже держит у себя DeepSeek V4 Pro. На OpenRouter она стоит 0,435 и 0,87 доллара за миллион токенов, у Cloud.ru — 183 и 732 рубля.
Переплата в 4,7 раза на входе и в 9,4 на выходе.
По такой логике локальная K3 может выйти в районе 1200 рублей за миллион входных токенов и 12 000 за миллион выходных.
То есть если на страницу А4 русского текста уходит около 1000 токенов, то прогнать такую страницу через локальную K3 и получить ответ обойдётся рублей в 13. Такова цена соблюдения закона...
И чтобы не было завышенных ожиданий. K3 медленная: ответ секунд шесть, скорость 18 токенов в секунду. Для чат-бота с живым клиентом не годится. А для фоновой работы — разобрать документы, прогнать договоры, автоматизировать внутрянку, где важен не мгновенный ответ, а качество и глубина разбора, — она как раз на своём месте.
#перевод_с_птичьего
16 июля вышла Kimi K3 - новая модель, которую уже называют одним из самых сильных конкурентов ChatGPT и Claude. Но главное даже не её мощность, а то, что модель открытая.
Вчера ее выложили в опенсорc!
Закрытую модель вроде GPT можно арендовать только через облако её создателя за границей. А как только ты прогоняешь через неё данные клиентов, ты автоматически нарушаешь 152-ФЗ — закон о персональных данных. Он требует хранить и обрабатывать данные россиян на серверах внутри страны. Открытую же модель можно поставить на сервер в России — и закон соблюдён, и модель того же класса, что зарубежные флагманы.
Правда, сам себе такую модель российский бизнес не поставит. 2,8 триллиона параметров требуют промышленных видеокарт, а не сервера в углу офиса.
Это могут обеспечить только крупные провайдеры Яндекс, Cloud.ru — они размещают модель у себя и продают доступ.
Selectel пока перепродает K3 с 40% наценкой - за 378,94 рубля за миллион входных токенов и 1894,69 за миллион выходных — против 3 и 15 долларов на OpenRouter. Но запрос всё равно уходит к Moonshot за границу. Selectel и сам пишет честно — «транзитом через наш роутер». Для 152-ФЗ это ничего не меняет, данные покидают Россию, просто чек в рублях.
А сколько K3 будет стоить, когда её реально поставят на серверы в России, можно прикинуть по аналогии. Cloud.ru уже держит у себя DeepSeek V4 Pro. На OpenRouter она стоит 0,435 и 0,87 доллара за миллион токенов, у Cloud.ru — 183 и 732 рубля.
Переплата в 4,7 раза на входе и в 9,4 на выходе.
По такой логике локальная K3 может выйти в районе 1200 рублей за миллион входных токенов и 12 000 за миллион выходных.
То есть если на страницу А4 русского текста уходит около 1000 токенов, то прогнать такую страницу через локальную K3 и получить ответ обойдётся рублей в 13. Такова цена соблюдения закона...
И чтобы не было завышенных ожиданий. K3 медленная: ответ секунд шесть, скорость 18 токенов в секунду. Для чат-бота с живым клиентом не годится. А для фоновой работы — разобрать документы, прогнать договоры, автоматизировать внутрянку, где важен не мгновенный ответ, а качество и глубина разбора, — она как раз на своём месте.
#перевод_с_птичьего