Steve Huffman, dyrektor generalny Reddita, w rozmowie opublikowanej 3 lipca 2026 roku na kanale Mixed Signals (podcast Semafora), zdradził kluczową liczbę dotyczącą współczesnych modeli językowych. Według niego, platforma odpowiada za około jedną trzecią zbioru treningowego wykorzystanego przez OpenAI w ostatnich publicznych badaniach. Wywiad, nagrany 22 czerwca podczas festiwalu Cannes Lions, przypadł dokładnie w 21. urodziny serwisu, który Huffman współtworzył w 2005 roku.
Rozmowa z redaktorami naczelnymi Semafora, Maxem Tanim i Benem Smithem, dotyczyła przede wszystkim rosnącego znaczenia treści generowanych przez użytkowników w rozwoju sztucznej inteligencji. Pytanie o to, ile z tego, co produkują modele takie jak Gemini, Claude czy ChatGPT, wywodzi się z Reddita, stało się bowiem kwestią o ogromnym znaczeniu komercyjnym.
Skala zależności modeli językowych od Reddita
Huffman nie ma wątpliwości, że wpływ jego platformy na rozwój dużych modeli językowych (LLM) jest ogromny. Choć dokładne liczby nie są znane, a twórcy modeli ich nie ujawniają, szef Reddita wskazał na konkretny punkt odniesienia. Przywołał ostatnią publiczną pracę badawczą OpenAI, która sugerowała, że Reddit stanowił około jednej trzeciej zbioru treningowego. Zastrzegł przy tym, że dotyczyło to etapu rozwoju modeli GPT-2 lub GPT-3 i od tego czasu nie opublikowano podobnych danych.
Dlaczego to właśnie Reddit jest tak cennym źródłem? Huffman tłumaczy to specyfiką komunikacji na platformie. Rozmowy użytkowników oddają naturalny język, jakim posługują się ludzie na co dzień – inny niż formalny styl książek czy encyklopedii. Zakres tematów jest przy tym niezwykle szeroki: od hobby, przez zakupy i problemy zdrowotne, po bieżące wydarzenia. Ben Smith podsumował to wprost: język modeli językowych jest w dużej mierze językiem Reddita.
Co istotne, Reddit nie planował takiego obrotu spraw. Jak ujął to Huffman, nie było to ani zamierzone, ani przypadkowe. Sedno problemu leży jednak gdzie indziej. Szef platformy rozgranicza bowiem działalność akademicką od komercyjnej. Reddit nadal udostępnia dane uniwersytetom, ale w przypadku wykorzystania komercyjnego wymaga odpowiednich umów. Jego stanowisko jest zwięzłe: komercyjne wykorzystanie wymaga komercyjnych warunków. Wskazuje też na istnienie całej branży zajmującej się „praniem danych” – ludzie biorą treści, wzbogacają się na nich i kłamią na temat ich pochodzenia.
Pozew przeciwko Anthropic i strategia licencyjna
Te słowa nie są jedynie retoryką. W tle toczy się bowiem konkretny spór prawny. W czerwcu 2025 roku Reddit złożył w sądzie w San Francisco pozew przeciwko Anthropic, twórcy modelu Claude. 28-stronicowy dokument zarzuca firmie naruszenie umowy, bezpodstawne wzbogacenie, ingerencję w dobra materialne oraz nieuczciwą konkurencję. Sedno sprawy stanowi fakt, że Anthropic miał przeszukiwać platformę ponad 100 tysięcy razy, mimo publicznych deklaracji o zaprzestaniu takich działań.
Huffman deklaruje jednak, że nie chce wyłączności dla żadnego z producentów modeli. Woli budować relacje z każdym z nich. Argumentuje, że technologia AI jest na tyle potężna i wciąż słabo poznana, że ekosystem potrzebuje większej liczby uczestników, a nie mniejszej. Nie chce jednego zwycięzcy w obszarze AI ani wyszukiwarki.
Dotychczasowa strategia licencyjna Reddita obejmuje umowę z Google z lutego 2024 roku (szacowaną na około 60 milionów dolarów rocznie) oraz partnerstwo z OpenAI ogłoszone w maju tego samego roku. Dodatkowo, w lipcu 2024 roku platforma zmieniła plik robots.txt, przez co Google stał się jedyną wyszukiwarką indeksującą najnowsze treści z Reddita. Ekonomika tych umów budzi jednak pytania. Analitycy podczas rozmowy o wynikach za pierwszy kwartał 2026 roku dociekali, czy warunki licencyjne odzwierciedlają rzeczywistą wartość danych. Huffman nie odpowiedział wtedy wprost.
Bezpieczeństwo marki, „slop” i przyszłość autentyczności
Działalność reklamowa Reddita przeszła ogromną transformację. Jeszcze dekadę temu klienci pytali przede wszystkim o bezpieczeństwo marki. Platforma nie miała wtedy zespołu ds. bezpieczeństwa ani praktycznie żadnej polityki treści. Dziś temat ten pojawia się rzadko, a kwestia bezpieczeństwa stała się wręcz atutem w rozmowach handlowych. Zmieniła się też publiczność – wczesna baza użytkowników to „dwudziestoparolatkowie”, głównie gracze przyzwyczajeni do kiepskich interfejsów. Poprawa użyteczności przełożyła się na stały wzrost.
Jednym z najbardziej palących problemów jest jednak zalew treści generowanych maszynowo, tzw. AI slop. Huffman traktuje to jak dawny spam – jako ten sam operacyjny problem mechanicznie tworzonych treści. Reddit inwestuje w wykrywanie nieautentycznych zachowań i deprecjonowanie spamu. Systemy moderacyjne blokują dziennie do 23 milionów wyświetleń spamu, a platforma cofa codziennie około 2 milionów nieautentycznych głosów.
Najciekawsze jest jednak stanowisko wobec zwykłych użytkowników. Najczęstszym źródłem „slopu” nie są boty, lecz ludzie, którzy używają AI do napisania posta i wklejają go na Reddita. Tego platforma nie zakazuje i nie zamierza zakazywać. Huffman argumentuje, że to po prostu sposób, w jaki ludzie będą pisać. Egzekwowanie jakości pozostawia społecznościom – to one mają wykształcić refleks wykrywania maszynowej prozy i głosować przeciwko niej. Treści, które przetrwają, będą musiały być na tyle dobre, by uznano je za wartościowe.
W kontekście weryfikacji użytkowników Huffman rozróżnia dwa cele: weryfikację człowieczeństwa od weryfikacji tożsamości. Reddit chce potwierdzać, że użytkownik jest człowiekiem, używając do tego telefonów, kluczy sprzętowych i biometrii urządzeń (takich jak Face ID). Jest sceptyczny wobec dokumentów tożsamości, które można łatwo obejść, płacąc komuś za logowanie. Anonimowość pozostaje kluczowa – ludzie dzielą się na Reddicie informacjami o chorobach czy uzależnieniach właśnie dlatego, że nie są podpisani prawdziwym nazwiskiem. To stanowi o wartości tego archiwum.
Ta filozofia ściera się z podejściem regulatorów. W lutym 2026 roku brytyjski urząd ICO nałożył na Reddita karę w wysokości 14,47 miliona funtów za brak solidnych mechanizmów weryfikacji wieku, co naruszało prawo dotyczące danych dzieci. Podobne wymogi budowane są w całej Unii Europejskiej.
Wnioski dla rynku i przyszłość platformy
Z wywiadu płyną trzy istotne wnioski. Po pierwsze, ujawniona liczba daje wydawcom rzadki punkt odniesienia. Jeśli jedna platforma dostarczyła około jednej trzeciej korpusu dużego modelu, pozycja negocjacyjna właścicieli treści jest silniejsza, niż sugerowałyby to obecne przychody z licencji. Dane Reddita pokazują, że licencjonowanie danych przyniosło 36 milionów dolarów w kwartale, podczas gdy reklamy – 549 milionów. Ta dysproporcja prowokuje pytania, na które Huffman nie chce odpowiadać.
Po drugie, stanowisko moderacyjne wyznacza granicę, której nie przekroczą dostawcy weryfikacji. Reddit nie zabroni pisania z pomocą AI, co oznacza, że reklamodawcy kupują przestrzeń z treściami wspomaganymi maszynowo, filtrowanymi przez głosy społeczności, a nie klasyfikatory. Dla kupujących stosujących unikanie treści AI w otwartej sieci, media społecznościowe działają według innej logiki.
Po trzecie, kwestia człowieczeństwa zdeterminuje, jakie dane o odbiorcach będą istnieć. Platforma weryfikująca osobę bez tożsamości tworzy inne możliwości targetowania niż ta, która zna wiek i nazwisko. Preferencje Huffmana wykluczają zweryfikowaną tożsamość jako sygnał targetowania, podczas gdy presja regulacyjna w Wielkiej Brytanii i UE popycha w przeciwnym kierunku.
Reddit balansuje między dwoma biznesami, które ciągną w przeciwne strony. Przychody reklamowe zależą od ludzkich rozmów, które modele konsumują i streszczają gdzie indziej. Przychody licencyjne zależą od sprzedaży tych samych rozmów firmom budującym modele. Wywiad z Huffmanem to jak dotąd najjaśniejszy publiczny obraz tego, jak dyrektor generalny próbuje pogodzić te dwie rzeczywistości.

