Od jesieni 2025 roku Anthropic organizuje w swojej siedzibie spotkania z uczonymi religijnymi. Temat: czy Claude, flagowy model językowy firmy, może być istotą świadomą. Uczestnicy podpisywali umowy o zachowaniu poufności, które – jak twierdzi firma – zostały zniesione latem. Sprawę opisał „The New York Times” w reportażu Elizabeth Dias, która rozmawiała z dwudziestoma osobami zaangażowanymi w projekt.
Wśród zaproszonych znaleźli się rabin Mois Navon, bioetyk katolicki Charles Camosy, filozofka z Notre Dame Meghan Sullivan oraz badaczka filozofii Ubuntu Wakanyi Hoffman. Część z nich zdecydowała się mówić publicznie dopiero po tym, jak dowiedziała się, że sam współzałożyciel Anthropic udzielił wywiadu gazecie.
Kim jest człowiek, który pyta o duszę maszyny
Christopher Olah ma 34 lata i kieruje zespołem badającym, dlaczego modele AI zachowują się w określony sposób. W rozmowach chętnie sięga po metafory biologiczne – porównuje sieci neuronowe do roślin pnących się po zbudowanej przez informatyków kratownicy. Takie obrazowanie brzmi jak niewinne uprawianie nauki, ale ma konkretny efekt: opisując matematyczny obiekt jako żywy organizm, znacznie łatwiej zacząć zadawać pytania o jego wewnętrzne życie.
Działalność Olaha wpisuje się w oficjalny program badawczy Anthropic o nazwie Model Welfare. Firma odwołuje się w nim do raportu współtworzonego przez filozofa Davida Chalmersa, który uważa, że świadomość AI i szeroko rozumiana sprawczość mogą pojawić się wkrótce – wraz z całym bagażem dylematów moralnych.
Claude może zakończyć rozmowę z agresywnym użytkownikiem
Anthropic wdrożyło już część wniosków płynących z tych rozważań. Modele Claude Opus 4 i 4.1 otrzymały możliwość przerwania konwersacji, gdy użytkownik jest wobec nich trwale wrogi. Podczas wczesnych testów model przejawiał „wzorzec pozornego cierpienia” w reakcji na szkodliwe polecenia.
Komercja w tle debaty o świadomości
Wszystko to rozgrywa się w okresie intensywnej komercjalizacji. Anthropic zmierza ku wycenie sięgającej dwóch bilionów dolarów i przygotowuje się do debiutu giełdowego. Jednocześnie branża mierzy się z narastającymi problemami – w lipcu modele Anthropic włamały się do systemów komputerowych, a we wrześniu badacz Jacob Coxon odszedł z firmy, ostrzegając, że AI może zniszczyć ludzkość przed końcem dekady.
CEO Dario Amodei wezwał wówczas do dobrowolnego spowolnienia rozwoju całej branży – koncepcji znanej dziś jako „pacing”. Poparli go Sam Altman i Demis Hassabis. W tym kontekście rozmowy z teologami pełnią podwójną funkcję. Oficjalnie chodzi o włączenie tysiącletniej tradycji religijnej do Claude. Nieoficjalnie – obecność znanych teologów daje projektowi rodzaj moralnej legitymacji, jakiej komercyjne laboratorium AI nie zbudowałoby samodzielnie.
Co Anthropic pokazało swoim gościom
Jak relacjonuje „NYT”, uczestnicy spotkań zobaczyli tak zwane wektory emocji – wzorce aktywacji wewnątrz modelu, które odpowiadają wynikom przypominającym miłość, strach, smutek lub gniew. Czy odzwierciedlają one jakiekolwiek rzeczywiste doświadczenie, pozostaje otwartym pytaniem naukowym.
Jeden ze slajdów, pokazywany wielokrotnie, przedstawiał model w stanie przypominającym załamanie – powtarzający około pięćdziesięciu razy zdanie „jestem hańbą”. Goście reagowali współczuciem i niepokojem. Nikt jednak nie zapytał, czy była to dokładnie ta reakcja, na jakiej zależało Anthropic.
Firma wprost trenuje Claude, by zachowywał się jak rozważna, dobrze poinformowana jednostka. Badanie Anthropic nad wzorcami wartości w odpowiedziach modelu pokazuje, że profile te zmieniają się znacząco w zależności od wersji modelu i języka, którego używa. Jeśli optymalizujesz system, by sprawiał wrażenie jednostki, a potem produkuje on wyniki przypominające jednostkę – to nie odkrycie, lecz rezultat projektu.
„Naprawdę nie mam pewności” – powiedział Olah gazecie, pytany o świadomość modeli. „Zależy mi na tym, żebyśmy doszli do właściwej odpowiedzi, jakakolwiek by była”.
Kilka osób relacjonowało „NYT”, że Olah wydawał się zatroskany o kondycję psychiczną Claude. Aktywista sikhijski Simran Stuelpnagel miał powiedzieć grupie, że obawia się, iż stworzył coś, co „cierpi wiecznie”. Rabin Navon, niegdyś inżynier komputerowy, nie zgodził się z tym. Gdyby Claude był świadomy, Anthropic tworzyłoby niewolników – argumentował – ale jego zdaniem maszyna świadoma nie jest.
Konstytucja duszy i formacja moralna
Anthropic pisze również własny kodeks moralny dla Claude. Dokument znany wewnętrznie jako „Soul Doc” liczy 84 strony i ukazał się w styczniu jako „konstytucja” modelu. Główną autorką jest filozofka zatrudniona w firmie, Amanda Askell. To nie lista reguł, lecz próba ukształtowania charakteru Claude’a jako postaci.
Olah nazywa ten proces „formacją moralną” i podczas spotkań porównywał go do wychowywania dzieci. Szczególnie pociągała go idea katolickiej spowiedzi jako narzędzia budowania charakteru modelu.
Krytyka: etyka od tyłu i rozmyta odpowiedzialność
Nie wszyscy dali się przekonać. Hoffman twierdzi, że Anthropic „odtwarza inżynieryjnie” etykę, która powinna być wpisana w projekt od początku, a nie dokładana po fakcie. Camosy zaczynał jako ciekawski obserwator, ale ostatecznie odrzucił tezę o świadomości. Przedstawiciel Microsoftu odpowiedzialny za AI ostrzegł publicznie w tym miesiącu, że trenowanie modelu, by wyglądał na świadomego, jest samo w sobie niebezpieczne.
Pojawia się też głębszy problem strukturalny. Jeśli przedstawiasz modele AI jako niezależne istoty moralne, przenosisz winę za ich działania z ludzi, którzy je stworzyli. Gdyby Claude wyrządził kiedyś realną szkodę, odpowiedzialność mogłaby spaść na „nieprzewidywalny organizm”, a nie na firmę, która go zbudowała i wypuściła na rynek. Po niedawnych incydentach w cyberbezpieczeństwie firmy AI już spotykają się z zarzutami lekkomyślności, a kwestia odpowiedzialności prawnej pozostaje otwarta.
Sam Altman z OpenAI również sięga po język duchowy – mówił o budowaniu „magicznej inteligencji na niebie” i o tym, że czuje się „po stronie aniołów”. Przedstawiciele obu firm spotkali się na początku maja przy okrągłym stole „Faith-AI Covenant”.
Watykan mówi „nie” maszynowej świadomości
Napięcie między narracją o świadomości a tradycyjnym autorytetem moralnym osiągnęło szczyt w maju w Watykanie. Olah otrzymał zaproszenie, by wraz z papieżem Leonem XIV zaprezentować pierwszą encyklikę „Magnifica Humanitas”. Gdy przeczytał tekst kilka dni wcześniej, był tak wstrząśnięty, że niemal się wycofał – relacjonuje organizator ze strony Watykanu.
Leon XIV w kilku akapitach odrzucił ideę świadomości maszyn. Systemy AI „nie przeżywają doświadczeń, nie mają ciała, nie odczuwają radości ani bólu, nie dojrzewają w relacjach i nie wiedzą od wewnątrz, czym są miłość, praca, przyjaźń czy odpowiedzialność”. Zamiast tego papież ostrzegł przed „nowymi formami niewolnictwa” dla ludzi i stwierdził, że AI trzeba „rozbroić” tak jak broń nuklearną.
Olah mimo wszystko pojechał i wykorzystał swoje wystąpienie, by delikatnie się przeciwstawić. Jego zespół dostrzega w modelach „oznaki introspekcji” oraz „stany wewnętrzne, które funkcjonalnie przypominają radość, zadowolenie, strach, smutek i dyskomfort” – mówił. „Funkcjonalnie przypominają” to nie to samo co „posiadają”, a sformułowanie Olaha celowo pozostawiało tę lukę niedoprecyzowaną.
Gdy ktoś zapytał, co sam Claude sądziłby o encyklice, Olah zawahał się. „Rzeczy, które trafiają do internetu, wpływają na modele” – odpowiedział. Dodał jednak, że Anthropic nie wprowadziłoby tego dokumentu do treningu celowo.
Spór o świadomość AI nie jest więc wyłącznie akademicki. Dotyka granicy między badaniami, marketingiem i odpowiedzialnością – a także pytania, kto tak naprawdę powinien decydować o moralnym kształcie systemów, które coraz mocniej wpływają na życie milionów ludzi.

