LAION выпустила BVD (Big Video Dataset), чтобы дать научному сообществу альтернативу закрытым наборам данных крупных технологических компаний. Корпус предназначен для исследований с видео, изображениями и звуком.
Основой стали 1,3 млрд ссылок из архивов CommonCrawl. Из них группа скачала 80 млн роликов общей продолжительностью 10 млн часов. Видео разделили на 55 млн клипов по сменам сцен и создали для них синтетические описания происходящего на экране и звука.

Затем из роликов извлекли 300 млн статичных кадров, привязанных к сменам ракурса. В LAION считают, что такой материал даёт моделям то, чего не хватает обычным наборам изображений: движение и разные точки съёмки.
Первые тесты показали неплохой результат. По данным LAION, модели ViCLIP и CLAP, обученные на BVD, держатся на уровне передовых решений в профильных бенчмарках, а качество растёт вместе с объёмом данных.
Доступны две версии: облегчённая содержит URL видео и метаданные и свободно размещена на Hugging Face, а для медиафайлов нужно заполнить анкету. В состав входят BVD-RAW с 80 млн роликов, BVD-V-55M с 55 млн клипов, BVD-A-1.7M и BVD-A-10M с 1,7 млн и 10 млн аудиодорожек и BVD-I-300M с 300 млн кадров.
Есть и ограничение: BVD разрешён только для исследований, коммерческое применение запрещено.
