LAION випустила Big Video Dataset (BVD) — один із найбільших відкритих відеодатасетів для досліджень ШІ. Він містить 1,3 мільярда URL-адрес відео, знайдених у CommonCrawl. Команда завантажила 80 мільйонів із цих відео загальною тривалістю 10 мільйонів годин і вилучила 55 мільйонів кліпів із автоматично створеними описами відео й аудіо, а також 300 мільйонів статичних зображень.
Більшість відео в датасеті походить із YouTube, і переважна їх частина — англійською мовою. | Зображення: LAION
Згідно зі статтею, моделі, навчені на BVD, перевершують зіставні моделі, навчені на InternVid, на величину до 2,1 відсоткового пункта в поширених тестах відео-текст. Під час навчання відео, аудіо й текст пов’язуються між собою: модель вчиться визначати, який візуальний контент відповідає описам або звукам.
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний шість разів на рік звіт про передові технології «AI Radar», повний доступ до архіву та доступ до розділу коментарів.