Grok 4.7 w Amazon Bedrock – nowy model xAI

Amazon Bedrock wzbogacił się o kolejny model frontier. xAI udostępniło Grok 4.7 – narzędzie projektowane z myślą o programowaniu, długotrwałych agentach oraz pracy z wiedzą. To nie jest model nastawiony na błyskawiczne odpowiedzi, lecz na wytrwałość: dłuższą pracę nad trudnymi zadaniami i skrupulatniejszą weryfikację własnych wyników przed przejściem dalej.

Nowy model oferuje okno kontekstowe 500 tysięcy tokenów oraz cztery poziomy intensywności rozumowania: low, medium, high i xhigh. Jest dostępny przez endpoint bedrock-runtime z wykorzystaniem profili wnioskowania między regionami. Obsługuje API Responses, Chat Completions oraz Converse.

Do czego xAI zaprojektowało Grok 4.7

Zgodnie z ogłoszeniem xAI z 21 września 2026 roku oraz dokumentacją modelu, Grok 4.7 powstawał na nowszej i większej bazie niż poprzednicy. Proces treningu obejmował dłuższy cykl uczenia ze wzmocnieniem na trudniejszym zestawie zadań – celowo obciążonym problemami wymagającymi wielu godzin pracy. Efektem są dwie kluczowe zdolności: lepsza samoweryfikacja oraz skuteczniejsze wykorzystanie dużego okna kontekstowego przy długich zadaniach.

xAI wytrenowało również model tak, aby natywnie rozumiał harness Grok Bot, co przekłada się na poprawę w zadaniach konwersacyjnych i ogólnej pracy z wiedzą.

Samoweryfikacja kluczowa dla agentów

Dla osób budujących agentów AI najistotniejsza jest zdolność modelu do sprawdzania własnych wyników. System, który weryfikuje output przed kontynuacją, rzadziej ponosi katastrofalne porażki na długich trajektoriach – gdzie pojedynczy błąd na początku kumuluje się przez wszystkie kolejne kroki.

Obsługiwane dziedziny i benchmarki

xAI wskazuje na poprawę w generowaniu dokumentów i prezentacji oraz w profesjonalnej pracy z wiedzą – takiej, jaką wykonują prawnicy, pielęgniarki czy analitycy finansowi. Model był testowany m.in. na benchmarkach CursorBench i DeepSWE (inżynieria oprogramowania), Terminal-Bench i AA Briefcase (wielogodzinna praca w terminalu i biurze), EEBench (elektrotechnika), Harvey Legal Agent Benchmark (prawo) oraz HealthBench Professional (rozumowanie kliniczne).

Niezależna ocena Artificial Analysis

Artificial Analysis prowadzi własne ewaluacje, niezależne od danych publikowanych przez twórców modeli. Według tej organizacji Grok 4.7 poprawia wyniki w całym zestawie testów, a największe zyski widać w długoterminowej agentowej pracy z wiedzą oraz w agentach kodujących uruchamianych w harness xAI.

Indeks Inteligencji, będący kompozytem wielu niezależnych ewaluacji obejmujących użycie narzędzi, rozumowanie, niezawodność wiedzy i pracę z długim kontekstem, wzrósł z 44 do 46 punktów. Coding Agent Index skoczył z 47 na 56. W benchmarku AA-Briefcase (Elo) odnotowano wzrost z 1546 do 1657, a w GDPval-AA – z 1605 do 1695. Wskaźnik halucynacji AA-Omniscience spadł z 34% do 29%.

Jest jednak istotny kompromis: liczba tokenów wyjściowych na zadanie Indeksu Inteligencji wzrosła z około 38 tysięcy do około 81 tysięcy. To oznacza, że zyskom jakościowym towarzyszy mniej więcej dwukrotny wzrost zużycia tokenów. Dlatego warto świadomie ustawiać poziom reasoning effort, zamiast polegać na domyślnych wartościach.

Bezpieczeństwo i cyberbezpieczeństwo

Jak podaje xAI, Grok 4.7 zbudowano z zupełnie nowym stosem zabezpieczeń. Firma określa go jako najsilniejszy ze swoich modeli pod względem odmów i odporności na jailbreak. W dziedzinach podwójnego zastosowania – takich jak cyberbezpieczeństwo czy biologia – celem jest jednoczesne zachowanie użyteczności dla legalnych zadań i odmawianie tych niebezpiecznych.

W obszarze cyberbezpieczeństwa xAI raportuje, że model przepuszcza jedynie niewielki odsetek ryzykownych promptów podwójnego zastosowania, rzadko blokując przy tym legalną pracę specjalistów. Wybrani partnerzy z branży cyberbezpieczeństwa otrzymali dostęp na zaproszenie do możliwości red-team Grok 4.7 na potrzeby badań obronnych.

Jak korzystać z Grok 4.7 w Amazon Bedrock

Model przyjmuje tekst i obrazy, zwracając tekst. Jest serwowany przez endpoint bedrock-runtime z użyciem profili wnioskowania między regionami – żądania wskazują profil, a nie bezpośredni identyfikator modelu. Dostępne są dwa warianty: geo cross-Region (us.xai.grok-4.7) oraz global cross-Region (global.xai.grok-4.7).

Wybór klienta i uwierzytelnianie

Ponieważ model jest zgodny z OpenAI, masz wybór narzędzi. OpenAI SDK działa ze ścieżką /openai/v1 przy użyciu tokenu bearer – może to być klucz API Amazon Bedrock lub krótkoterminowy token wygenerowany z poświadczeń IAM. AWS SDK docierają do tego samego modelu przez Converse, podpisując żądania standardowymi poświadczeniami AWS.

Jeśli przenosisz istniejącą integrację, wybierz OpenAI SDK. Jeśli chcesz jednolity format wiadomości dla wszystkich modeli w koncie, wraz z logowaniem wywołań i strumieniowaniem odpowiedzi przez standardowe typy zdarzeń Bedrock – sięgnij po Converse.

Funkcje Bedrock wspierające agentów

Niejawna pamięć podręczna promptów stosuje się automatycznie do powtarzanych prefiksów – agenci wysyłający duży prompt systemowy przy każdej turze płacą stawkę cached za ten fragment. Amazon Bedrock Guardrails przypina się przez identyfikator i wersję w żądaniu, stosując filtry treści, tematy zabronione, redakcję danych osobowych i polityki słowne zarówno do promptu, jak i odpowiedzi.

Structured outputs pozwalają ograniczyć odpowiedź do schematu JSON, co umożliwia bezpośrednie parsowanie przez kod. Logowanie wywołań rejestruje każde żądanie w Amazon CloudWatch wraz z odpowiedzią i liczbą tokenów – w tym tokenów rozumowania – dając ścieżkę audytu dla długich przebiegów agentowych.

Regiony, poziomy usług i ceny

Profil Global kieruje każde żądanie do dowolnego wspieranego regionu komercyjnego AWS, rozkładając obciążenie i oferując niższą cenę niż profil geograficzny. Kompromisem jest mniejsza kontrola nad tym, gdzie trafia dane żądanie, co może oznaczać bardziej zmienne opóźnienia. Profil US utrzymuje przetwarzanie w granicach geograficznych USA, co odpowiada wymogom rezydencji danych.

Dostępne są trzy poziomy usług: Standard (płatność za token, bez zobowiązań), Priority (szybsze, priorytetowe przetwarzanie za dopłatą) oraz Flex (tańszy dostęp dla zadań niewrażliwych na czas). Poziom usług to istotna dźwignia kosztowa pozostająca pod kontrolą użytkownika.

Pierwsze żądanie i uprawnienia

Przed pierwszym wywołaniem warto potwierdzić w konsoli Bedrock, że model jest dostępny w planowanym regionie AWS. Żądania muszą wskazywać us.xai.grok-4.7 lub global.xai.grok-4.7. Uprawnienie bedrock:InvokeModel jest oceniane względem trzech zasobów: domyślnego projektu konta, wskazanego profilu wnioskowania oraz bazowego modelu foundation. ARN modelu bazowego zawiera wildcard dla regionów, ponieważ profile między regionami kierują poza region wywołujący.

Uwierzytelnianie tokenem bearer wymaga dodatkowo bedrock:CallWithBearerToken, którego boto3 i Converse nie potrzebują. Należy wymienić każdy profil wnioskowania, który planujesz wywoływać – profile są ograniczone indywidualnie, więc polityka wskazująca us.xai.grok-4.7 nie obejmuje global.xai.grok-4.7.

Długoterminowy klucz API Amazon Bedrock należy traktować wyłącznie jako poświadczenie do eksploracji. W środowisku produkcyjnym lepiej używać krótkoterminowych tokenów bearer generowanych z poświadczeń IAM za pomocą pakietu aws-bedrock-token-generator – wygasają automatycznie i utrzymują dostęp powiązany z tożsamością IAM.

Praca z reasoning effort

Rozumowanie jest w Grok 4.7 zawsze aktywne, a poziom effort to podstawowa dźwignia kontroli kosztów i opóźnień. Ustawia się go przez parametr reasoning w API Responses (low, medium, high lub xhigh) oraz przez additionalModelRequestFields w Converse. Wartością domyślną jest high – warto ustawiać ją jawnie, ponieważ pozostawienie domyślnej przy wywołaniach wrażliwych na opóźnienia lub o dużym wolumenie zużyje więcej tokenów rozumowania niż potrzeba.

Ponieważ model jest trenowany do dłuższej pracy i weryfikacji własnych wyników, wyższy effort przekłada się nie tylko na dodatkowe rozważania nad pojedynczą odpowiedzią, ale na więcej samosprawdzania w trakcie długiego zadania. Krótkie wywołania ekstrakcji i klasyfikacji należą do poziomu low. Wieloetapowe planowanie, długie trajektorie agentowe i zadania, gdzie wczesny błąd propaguje się dalej – to obszary, gdzie high i xhigh zarabiają na swoje tokeny.

Treść rozumowania jest szyfrowana. Można ją otrzymać, przekazując include: [„reasoning.encrypted_content”] w żądaniu Responses API, a następnie odesłać w kolejnych turach, aby dać modelowi jego własne wcześniejsze rozumowanie jako kontekst w rozmowie wieloturowej. API Chat Completions nie zwraca tokenów rozumowania.

Aby znaleźć punkt, w którym dodatkowe rozumowanie przestaje się opłacać, warto porównać poziomy na własnym obciążeniu.

Co dalej

Grok 4.7 w Amazon Bedrock daje okno kontekstowe 500 tysięcy tokenów, cztery poziomy reasoning effort, wejście obrazowe, wywoływanie narzędzi oraz routing geo i global między regionami. Wszystko to jest osiągalne przez API Responses, Chat Completions i Converse.

Przed rozpoczęciem budowania warto przejrzeć kartę modelu Grok 4.7 pod kątem aktualnej listy regionów, macierzy funkcji i szczegółów parametrów oraz sprawdzić stronę cen Amazon Bedrock dla stawek za tokeny. Jeśli wygenerowano długoterminowy klucz API do eksploracji, należy go usunąć z konsoli po zakończeniu pracy – niepotrzebne stałe poświadczenie tylko poszerza powierzchnię ataku konta.

Źródło