Самое загадочное в больших языковых моделях – это то, что они все работают, несмотря на огромную разницу во всем.
Dense, MoE, LatentMoE, все варианты attention (в т.ч. например Kimi Linear который вообще не совсем attention), все варианты функций активации, все варианты обучения – классический pretrain, JEPA-like цели, RL, все модальности – текст, сырое (!) аудио и картинки, видео, квантизация и дистилляция – все работает, во всех доменах, и между доменами.
Можно придумать бесконечное множество причин, почему это не должно работать – но оно работает.
Pic unrelated.
– @pgregory
Dense, MoE, LatentMoE, все варианты attention (в т.ч. например Kimi Linear который вообще не совсем attention), все варианты функций активации, все варианты обучения – классический pretrain, JEPA-like цели, RL, все модальности – текст, сырое (!) аудио и картинки, видео, квантизация и дистилляция – все работает, во всех доменах, и между доменами.
Можно придумать бесконечное множество причин, почему это не должно работать – но оно работает.
Pic unrelated.
– @pgregory