Organizacja LAION, znana z tworzenia otwartych zbiorów danych dla sztucznej inteligencji, opublikowała jeden z największych w historii otwartych zestawów wideo. Big Video Dataset (BVD) to przedsięwzięcie, które może znacząco wpłynąć na rozwój modeli multimodalnych – systemów rozumiejących jednocześnie obraz, dźwięk i tekst. To krok milowy dla badaczy, którzy do tej pory musieli polegać na komercyjnych, zamkniętych zbiorach danych.
Co kryje w sobie Big Video Dataset?
Skala przedsięwzięcia robi wrażenie. Zespół LAION rozpoczął od analizy 1,3 miliarda adresów URL z popularnego indeksu CommonCrawl, który archiwizuje strony internetowe. Z tej ogromnej puli udało się pobrać 80 milionów plików wideo, co przełożyło się na łącznie 10 milionów godzin materiału.
Ale to nie wszystko. Naukowcy nie poprzestali na samych nagraniach. Z pozyskanych plików wyodrębnili 55 milionów krótszych klipów, do których automatycznie wygenerowano opisy tekstowe i audio. Dodatkowo z materiału źródłowego pochodzi 300 milionów pojedynczych klatek, które mogą służyć do trenowania modeli analizujących obrazy.
Większość nagrań w zbiorze pochodzi z YouTube, a dominującym językiem opisów jest angielski. To naturalne ograniczenie, ale biorąc pod uwagę skalę całego projektu, nie umniejsza ono jego wartości badawczej.
Jak BVD wypada na tle konkurencji?
Twórcy zbioru przeprowadzili testy porównawcze, które pokazują realną przewagę ich rozwiązania. Modele trenowane na Big Video Dataset osiągają wyniki lepsze o maksymalnie 2,1 punktu procentowego w porównaniu z systemami uczonymi na popularnym zbiorze InternVid. Testy dotyczyły standardowych zadań dopasowywania wideo do tekstu.
Co istotne, sposób trenowania w tym przypadku łączy trzy modality jednocześnie. Model uczy się, które elementy wizualne odpowiadają konkretnym dźwiękom i opisom słownym. Dzięki temu systemy budowane na BVD mogą lepiej rozumieć relacje między tym, co widzą, słyszą i czytają.
Kwestie prawne i dostępność
LAION udostępnia zbiór wyłącznie do celów badawczych. Organizacja powołuje się przy tym na orzeczenie Sądu Okręgowego w Hamburgu z 2024 roku, które zezwala na gromadzenie treści objętych prawem autorskim do niekomercyjnych badań naukowych. To istotny precedens, który może mieć znaczenie dla przyszłych projektów tego typu w Europie.
Mimo prawnego zabezpieczenia, twórcy apelują do użytkowników o poszanowanie praw oryginalnych twórców treści. Sam zbiór oraz kod niezbędny do jego obsługi są dostępne bezpłatnie, co wpisuje się w filozofię otwartej nauki promowaną przez LAION.
Publikacja BVD to ważny sygnał dla całego środowiska AI. Otwarte, ogromne zbiory danych demokratyzują dostęp do zaawansowanych badań nad modelami wideo. Zamiast polegać na drogich, komercyjnych rozwiązaniach, mniejsze zespoły badawcze mogą teraz korzystać z zasobów, które jeszcze niedawno były poza ich zasięgiem. Pytanie tylko, jak szybko społeczność wykorzysta ten potencjał i jakie nowe zastosowania multimodalnych modeli dzięki temu powstanie.

