Rozwój sztucznej inteligencji napędza bezprecedensowy wzrost zapotrzebowania na energię elektryczną. Zużycie prądu przez centra danych nie działa jednak w sposób ciągły i uogólniony – jest pochodną milionów pojedynczych zapytań, które użytkownicy kierują do modeli takich jak Claude czy ChatGPT. Kluczowe pytanie brzmi: czy wszystkie modele przetwarzają te zapytania równie efektywnie? Odpowiedź brzmi: nie. Różnice są ogromne, a użytkownicy nie mają obecnie żadnego sposobu, by sprawdzić, z jakim modelem mają do czynienia.
Firmy Anthropic, OpenAI i Google nie ujawniają danych o energochłonności swoich modeli. W odpowiedzi na tę lukę badacze z Sustainable AI Group opracowali metodę szacowania zużycia energii przez zastrzeżone systemy AI. Wyniki opublikowali w interaktywnym dashboardzie, który szereguje modele według intensywności energetycznej.
Jak naukowcy obejśli brak danych od producentów
Boris Gamazaychikov, dyrektor generalny Sustainable AI Group, podkreśla, że celem projektu jest dostarczenie informacji opartych na nauce, które pomogą użytkownikom podejmować lepsze decyzje. Jednocześnie badacze liczą, że jeśli ich szacunki są błędne, producenci modeli wyjdą z kontrą i przedstawią rzeczywiste dane.
Firma została założona przez Sashę Luccioni, byłą liderkę ds. AI i klimatu w Hugging Face, oraz Gamazaychikova, który wcześniej odpowiadał za zrównoważony rozwój AI w Salesforce. Obydwoje współpracowali wcześniej przy projekcie AI Energy Score – inicjatywie wzorowanej na programie EnergyStar amerykańskiej Agencji Ochrony Środowiska. Pierwszym pracownikiem nowej firmy został Nidhal Jegham, doktorant University of Rhode Island, autor publikacji „How Hungry is AI?”.
Metoda: od modeli otwartych do zamkniętych
Punktem wyjścia było bezpośrednie mierzenie zużycia energii przez modele o otwartych wagach w realistycznych warunkach wdrożenia. Następnie badacze zidentyfikowali matematyczne zależności między energochłonnością tych modeli a innymi mierzalnymi parametrami, takimi jak ich rozmiar.
Problem pojawił się przy modelach zamkniętych – nikt nie zna ich rozmiaru, warunków wdrożenia ani wewnętrznej struktury. Jegham odkrył jednak, że „retencja wiedzy”, czyli zdolność modelu do zapamiętywania informacji faktograficznych, silnie koreluje z rozmiarem modelu. Firma Artificial Analysis testuje modele pod tym kątem, więc badacze porównali te wyniki z rozmiarem modeli otwartych, a następnie zastosowali tę samą zależność do oszacowania wielkości modeli zamkniętych.
Dla modeli Google konieczne było opracowanie odrębnej metodologii, ponieważ działają one głównie na zastrzeżonych jednostkach przetwarzania tensorów, a nie na chipach Nvidia, na których opierały się pierwotne pomiary.
Kluczowe wnioski z rankingu energochłonności
Główne ustalenia grupy opierają się na szacunkach zużycia energii na token – czyli na najmniejszą jednostkę danych, z którą pracuje model. Każde zapytanie do chatbota jest rozbijane na mniejsze fragmenty, zwykle kilkuznakowe. Model najpierw formułuje odpowiedź w tokenach, zanim przełoży ją na tekst, obraz lub inny format. Tokeny wejściowe są mniej energochłonne niż te generowane na wyjściu.
Duże modele zużywają nawet czterokrotnie więcej energii
Badacze ustalili, że większe, bardziej zaawansowane modele – takie jak Opus od Anthropic czy Sol od OpenAI – pochłaniają średnio niemal cztery razy więcej energii niż mniejsze, zwinniejsze odpowiedniki, czyli Haiku i Terra. Co istotne, nowsze iteracje modeli nie zawsze okazywały się bardziej oszczędne od poprzedników.
Przy tym samym zadaniu najmniej wydajne modele mogą zużyć ponad 30 razy więcej prądu niż te najbardziej efektywne. Znaczna różnica występuje też między sesjami czatowymi a agentowymi. Typowa sesja agentowa, w której użytkownik zleca AI wykonanie szeregu zadań, zużywa średnio 27 razy więcej energii niż zwykła rozmowa z tym samym modelem.
Ranking modeli w praktyce
Publiczny dashboard Sustainable AI Group szereguje modele według intensywności energetycznej na „typową” sesję. Typowy czat to krótka wymiana z pytaniem, odpowiedzią i jednym lub dwoma doprecyzowaniami. Sesja agentowa oznacza natomiast godzinę lub dwie pracy asystenta nad projektem – czytanie plików, wprowadzanie zmian i weryfikację własnej pracy.
Najmniej wydajnym modelem zarówno w sesji czatowej, jak i agentowej okazał się Claude Fable 5 od Anthropic. Typowa sesja agentowa zużywa w jego przypadku 76 watogodzin – mniej więcej tyle, ile potrzeba na naładowanie czterech smartfonów. Najoszczędniejszym modelem w zwykłym czacie był Claude Haiku 4.5, a w sesji agentowej – GPT-5 nano od OpenAI.
Jegham zastrzega, że dashboard nie ma na celu piętnowania konkretnych firm ani modeli. Bardziej złożone zadanie może wymagać większego modelu, który z natury będzie bardziej energochłonny. Ranking ma też ograniczenie – zakłada, że każdy model odpowiada z podobną szczegółowością. W rzeczywistości niektóre modele używają więcej słów, a więc i tokenów, do odpowiedzi na to samo pytanie. Przykładem są modele Sonnet i Opus od Anthropic: Sonnet zużywa mniej energii na token, ale potrzebuje ich więcej do tego samego zadania, przez co bywa bardziej energochłonny niż Opus.
Emisje CO2 i reakcje producentów
Dashboard pokazuje nie tylko intensywność energetyczną, ale też szacunkowe emisje dwutlenku węgla na sesję. To znacznie bardziej złożona kwestia, ponieważ rzeczywiste emisje zależą od lokalizacji sprzętu przetwarzającego dane i źródła zasilania. Nie ma łatwego sposobu, by ustalić, które centrum danych obsługuje konkretne zapytanie.
Użytkownik może przełączać się między różnymi scenariuszami emisji – na przykład centrum danych zasilanym gazem ziemnym za licznikiem versus obiektem podłączonym do relatywnie czystej sieci. Typowa sesja agentowa z Claude Fable 5 zasilanym gazem emituje około 52 gramów CO2, a sesja intensywniejsza – nieco ponad 200 gramów, co odpowiada przejechaniu około 800 metrów samochodem spalinowym.
OpenAI w odpowiedzi na pytania o brak publikacji danych wyjaśniło, że polega na partnerach infrastrukturalnych w zakresie obsługi centrów danych, więc nie zbiera bezpośrednio danych o zużyciu energii. Anthropic odmówiło komentarza. Google opublikowało szacunki zużycia energii dla mediany zapytań tekstowych w Gemini Apps z maja 2025 roku, ale nie zaktualizowało ich dla kolejnych wersji modeli.
Cooper Elsworth, starszy menedżer techniczny ds. energii AI w Google, zwraca uwagę, że branża nie wypracowała konsensusu co do pomiaru i ujawniania śladu środowiskowego zaawansowanych modeli. Podkreśla też, podobnie jak OpenAI, że gromadzenie dokładnych danych wymaga zaawansowanej infrastruktury pomiarowej, do której nie wszyscy dostawcy mają dostęp. Jednocześnie przyznaje, że ujednolicenie metryk w branży przyniosłoby ogromną wartość.
Na razie szacunki na poziomie pojedynczego tokenu pozostają za paywallem, ale Sustainable AI Group już wykorzystuje je w doradztwie dla klientów korporacyjnych. Firma pomagała m.in. Etsy opracować „router modeli” – oprogramowanie kierujące zapytania do najodpowiedniejszego modelu z uwzględnieniem emisji i kosztów. Współpracuje też z platformą Watershed nad integracją swoich danych z systemem rozliczania emisji korporacyjnych.
Inicjatywa Sustainable AI Group wpisuje się w szerszą debatę o transparentności energetycznej modeli AI. Dopóki producenci nie zaczną publikować rzetelnych danych, narzędzia takie jak ten dashboard pozostają jedynym sposobem, by użytkownicy – zwłaszcza duże firmy – mogli podejmować świadome decyzje dotyczące wpływu ich działań z AI na środowisko.

