Cerebras CS-4: podwójna moc AI na tym samym chipie

Firma Cerebras zaprezentowała nowy akcelerator AI o nazwie CS-4, który według słów dyrektora generalnego Andrew Feldmana ma być najszybszym systemem w branży. Producent postawił na rozwój istniejącej architektury zamiast projektowania układu od podstaw. Efekt? Dwukrotny wzrost wydajności względem poprzednika, osiągnięty bez zmiany samego chipa.

To istotna wiadomość dla wszystkich obserwatorów rynku sztucznej inteligencji, ponieważ pokazuje, że optymalizacja sprzętu wciąż ma ogromne znaczenie. Zamiast czekać na nowe procesory, można wycisnąć więcej z obecnych rozwiązań, poprawiając ich zasilanie i system chłodzenia. W ten sposób Cerebras stara się konkurować z dominującą na rynku Nvidią, oferując alternatywę dla firm potrzebujących ogromnej mocy obliczeniowej.

Czym właściwie jest CS-4 i jak działa?

CS-4 to produkt klasy rack-scale, co oznacza, że cała szafa serwerowa stanowi jedno urządzenie. Do centrum danych trafia kompletny zestaw: jednostki obliczeniowe, zasilanie oraz chłodzenie. To podejście upraszcza wdrożenie, bo zamiast konfigurować wiele serwerów, operatorzy otrzymują gotowy, zintegrowany system.

Sercem nowego akceleratora pozostaje układ WSE-3 wykonany w procesie 5 nm. Mimo że to ten sam chip, co w modelu CS-3, inżynierowie osiągnęli dwukrotnie lepszą wydajność. Kluczem okazało się podniesienie zegara taktowania, co stało się możliwe dzięki zwiększeniu mocy i ulepszeniu chłodzenia. To pokazuje, jak istotne są pozornie drugorzędne aspekty konstrukcji sprzętu.

Więcej mocy w jednej szafie

Nowa konstrukcja pozwala zmieścić w jednym racku trzy płytki krzemowe zamiast dwóch. Przekłada się to na imponującą przepustowość – system generuje do 4400 tokenów na sekundę dla pojedynczego użytkownika. Dla porównania, jak twierdzi producent, to nawet 30 razy szybciej niż w przypadku konfiguracji opartych na GPU Nvidii.

Warto jednak zauważyć, że pojemność pamięci pozostała bez zmian i wynosi 44 GB na każdą płytkę. To celowa decyzja projektantów, którzy skupili się na zwiększeniu tempa obliczeń, a nie na rozbudowie zasobów pamięciowych. Dla wielu zastosowań związanych z inferencją modeli językowych takie proporcje mogą być optymalne.

Nowa architektura i współpraca z partnerami

Cerebras wprowadza również innowacje w sposobie montażu swoich systemów. Nowy, modułowy projekt o nazwie „Backpack” ma przyspieszyć składanie urządzeń w fabryce. To istotne z punktu widzenia skalowania produkcji i szybszego dostarczania zamówień do klientów.

Firma stawia także na architekturę rozproszoną, czyli tzw. disaggregated inference. W praktyce oznacza to, że część obliczeń może być realizowana poza głównym systemem Cerebras, we współpracy z partnerami takimi jak AMD czy AWS Trainium. Dzięki temu klienci zyskują większą elastyczność w budowaniu infrastruktury AI.

Analitycy z SemiAnalysis zwracają jednak uwagę, że zyski w zakresie sieci są dość niewielkie.

To ważna uwaga, która studzi nieco entuzjazm. Chociaż sama moc obliczeniowa robi wrażenie, to w praktyce wydajność całego systemu zależy również od szybkości komunikacji między komponentami. Jeśli transfer danych nie nadąża za obliczeniami, pełny potencjał sprzętu może pozostać niewykorzystany.

Kto korzysta z technologii Cerebras?

Mimo tych zastrzeżeń, sprzęt Cerebras znajduje już zastosowanie w poważnych projektach. Firma OpenAI wykorzystuje te akceleratory między innymi w projekcie Codex Spark, który wspiera programistów w pisaniu kodu. To istotny sygnał, że technologia sprawdza się w realnych, komercyjnych zastosowaniach.

Więcej szczegółów na temat CS-4 poznamy podczas konferencji Hot Chips, która jest jednym z najważniejszych wydarzeń branży półprzewodnikowej. To właśnie tam producenci zwykle ujawniają szczegóły techniczne swoich najnowszych rozwiązań, więc można spodziewać się dokładniejszych informacji o architekturze i możliwościach nowego systemu.

Rynek akceleratorów AI przeżywa obecnie prawdziwy renesans. Oprócz Cerebras swoje rozwiązania rozwijają takie firmy jak AMD, Intel czy Google. Każda z nich próbuje znaleźć swoją niszę i przekonać klientów, że to właśnie ich technologia najlepiej sprawdzi się w erze coraz większych modeli językowych.

Strategia Cerebras opiera się na maksymalnym wykorzystaniu istniejącego chipa i oferowaniu gotowych, zintegrowanych systemów. To podejście może się sprawdzić w przypadku firm, które potrzebują natychmiastowej mocy obliczeniowej bez angażowania się w skomplikowaną konfigurację infrastruktury. Podwójna wydajność CS-4 to z pewnością argument, który może przekonać kolejnych klientów do wyboru tej technologii.

Źródło