Подвезли новости из мира исследований ИИ. Google представили крупнейший в мире набор данных для обучения мультимодальных моделей, содержащий 100 миллиарда пар изображение-текст. Эксперты
пишут, что это в 10 раз больше существующих наборов данных.
Кроме того, в отчете компании указано, что эксперты проводили эмпирическое исследование потенциала предварительно обученных моделей «зрение-язык» в беспрецедентном масштабе: 100 миллиардов примеров. Однако увеличения объема в 10 раз (с 10 до 100 миллиардов) практически не улучшает результаты на стандартных западных тестах. В то же время улучшается работа с контентом из разных культур, понимание низкоресурсных языков, а также выстраивается справедливость работы системы для разных групп пользователей.
Впервые обнаружен важный побочный эффект фильтрации данных: популярные методы фильтрации (как CLIP) могут непреднамеренно снижать культурное разнообразие в данных. Впервые также показано, что для создания действительно инклюзивных ИИ систем важен не только объем данных, но и сохранение их разнообразия, даже если это снижает производительность на стандартных тестах. Исходя из этого, может поменяться представление и подход к тому, как обучать крупные ИИ - модели. Возможно, фокус будет смещаться с производительности на более широкие социальные аспекты.