LAION пусна Big Video Dataset (BVD) — един от най-големите отворени набори от видеоданни за изследвания в областта на ИИ. Той се основава на 1,3 милиарда URL адреса към видеоклипове, открити в CommonCrawl. Екипът е изтеглил 80 милиона от тези видеоклипове с обща продължителност 10 милиона часа и е извлякъл 55 милиона клипа с автоматично генерирани описания на видеото и аудиото, както и 300 милиона статични изображения.
Повечето видеоклипове в набора от данни идват от YouTube, а мнозинството са на английски език. | Изображение: LAION
Според научната статия моделите, обучени с BVD, превъзхождат сравними модели, обучени с InternVid, с до 2,1 процентни пункта при разпространени тестове за преобразуване на видео в текст. Обучението свързва видеото, аудиото и текста, като научава кое визуално съдържание съответства на кои описания или звуци.
Абонирайте се за THE DECODER за четене без реклами, седмичен бюлетин за ИИ, нашия ексклузивен шест пъти годишно доклад за новостите „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.