Nie musisz rezygnować z Claude Code ani Codex CLI, żeby korzystać z modeli DeepSeek. Co więcej – nie potrzebujesz do tego żadnego proxy. Każdy z popularnych klientów programistycznych oferuje własną, udokumentowaną ścieżkę podłączenia do tego samego API. Różnią się one sposobem konfiguracji, ale prowadzą do tego samego celu: pracy z modelem DeepSeek w znanym sobie środowisku.
Kluczowa obserwacja jest taka, że cała warstwa narzędziowa pozostaje nietknięta. Te same wtyczki, ten sam projekt, ten sam sposób pracy. Zmienia się wyłącznie dostawca, do którego trafiają żądania – a wraz z nim źródło rozliczenia. Zamiast obciążać subskrypcję Anthropic, operacje pomniejszają saldo DeepSeek.
Jak podłączyć DeepSeek do Claude Code i Codex CLI
W przypadku Claude Code wystarczy ustawić trzy zmienne środowiskowe wskazujące na endpoint zgodny z API Anthropic. Adres bazowy prowadzi do serwera DeepSeek, token autoryzacyjny zawiera klucz API, a nazwa modelu określa, który wariant ma być używany. Po tych zmianach uruchomienie klienta odbywa się dokładnie tak jak wcześniej.
Codex CLI idzie inną drogą. DeepSeek udostępnia oficjalny skrypt konfiguracyjny, który samodzielnie wpisuje sekcję dostawcy do pliku konfiguracyjnego i wykonuje kopię zapasową zastanej zawartości. Skrypt komunikuje się z DeepSeek przez Responses API. Warto jednak zachować ostrożność – każdy skrypt modyfikujący konfigurację narzędzi powinien zostać przejrzany przed uruchomieniem, tak jak każdy inny fragment kodu ingerujący w środowisko pracy.
OpenCode i Aider – alternatywne ścieżki
OpenCode ma DeepSeek na własnej liście dostawców. Wystarczy użyć komendy /connect, a następnie /models, żeby wybrać odpowiedni wariant. Aider z kolei korzysta z bazowego adresu zgodnego z OpenAI. Ustawienie dwóch zmiennych środowiskowych – adresu API i klucza – pozwala uruchomić narzędzie z modelem DeepSeek bez dodatkowej konfiguracji.
LiteLLM i Ollama – dwa bieguny elastyczności
LiteLLM przydaje się wtedy, gdy jeden dostawca to za mało. Tworzy lokalny endpoint, który potrafi kierować ruch do DeepSeek, Claude, GPT i Gemini jednocześnie – z mechanizmem fallbacku, widocznym wydatkiem i budżetem do kontroli. To rozwiązanie dla zespołów, które chcą zarządzać kosztami i niezawodnością w jednym miejscu.
Ollama reprezentuje przeciwny koniec spektrum. Model działa na własnej karcie graficznej, a żadne zapytanie nie opuszcza komputera. Karta z 11 GB pamięci bez problemu udźwignie DeepSeek Coder 6.7B oraz dystylaty R1 w rozmiarach 7B i 8B. Wersja 14B w kwantyzacji 4-bitowej również jest osiągalna, choć wymaga wsparcia pamięci RAM i wiąże się z niższą prędkością działania.
Dlaczego DeepSeek Flash wypada korzystniej niż modele frontier
DeepSeek publikuje dwie stawki za milion tokenów – jedną dla godzin szczytu, drugą poza nimi. Wersja poza szczytem jest o połowę tańsza. Model Flash w trybie off-peak kosztuje 0,15 dolara za wejście przy braku trafienia w cache i 0,60 dolara za wyjście. W godzinach szczytu stawki rosną odpowiednio do 0,30 i 1,20 dolara. Wariant Pro kształtuje się na poziomie od 0,66 do 1,98 dolara poza szczytem i od 1,32 do 3,96 dolara w szczycie.
Dla porównania standardowe modele, po które domyślnie sięgają klienci kodowania: Claude Sonnet 5 wyceniono na 2 dolary za wejście i 10 dolarów za wyjście, a GPT-5.6 Terra na 2 dolary za wejście i 12 dolarów za wyjście. W zestawieniu z tymi stawkami Flash okazuje się od około siedmiu do siedemnastu razy tańszy od modelu Anthropic i od siedmiu do dwudziestu razy tańszy od propozycji OpenAI.
Dolna granica każdego przedziału odpowiada szczytowej stawce wejściowej, górna – pozaszczytowej stawce wyjściowej. Ostateczny koszt zależy więc od godziny uruchomienia i proporcji tokenów wyjściowych w całym zapytaniu. Trzeba przy tym pamiętać, że porównanie dotyczy stawek API, a stała miesięczna subskrypcja nie poddaje się bezpośredniemu zestawieniu.
Kiedy Flash wystarcza, a kiedy warto sięgnąć po model frontier
Model Flash sprawdza się jako rozsądny domyślny wybór w wielu typowych scenariuszach:
- eksploracja repozytorium i przeszukiwanie kodu
- pisanie testów
- tworzenie dokumentacji
- generowanie szablonowego kodu
- rutynowe refaktoryzacje
- poprawki w pipeline’ach CI
- pętle z podagentami
Do zadań wymagających większej finezji nadal lepiej nadają się modele frontier od Anthropic lub OpenAI. Mowa tu o projektowaniu niejednoznacznej architektury, trudnym debugowaniu, przeglądzie bezpieczeństwa oraz ryzykownych migracjach. Żadna ze stron nie jest uniwersalnie słabsza – podział wynika z tego, gdzie każdy model jest wart swojej ceny.
Bezpieczeństwo i pułapki konfiguracji
Klucze API, pliki .env, produkcyjne poświadczenia i duże zrzuty baz danych nie powinny trafiać do modeli chmurowych bez zastanowienia. W przypadku kodu objętego poufnością lepszym rozwiązaniem jest wnioskowanie lokalne albo dostawca, którego polityka retencji odpowiada wymaganiom organizacji.
Osobnym problemem jest rozjazd między tym, co deklaruje interfejs, a tym, gdzie faktycznie trafia ruch. Zdarza się, że menu wskazuje model DeepSeek-Flash, a żądania wciąż kierowane są do endpointu OpenAI – mimo braku klucza OpenAI w konfiguracji. Przyczyną jest zmiana katalogu modeli przy jednoczesnym braku aktualizacji sekcji dostawcy. Rozwiązaniem jest ręczna weryfikacja bloku model_providers w pliku konfiguracyjnym.
Nazwa modelu w menu to jedynie etykieta. Adres dostawcy to rzeczywisty kierunek ruchu. Po zmianie konfiguracji trzeba całkowicie zamknąć Codex, ChatGPT Desktop i VS Code, a następnie otworzyć je ponownie – wybór modelu w działającym oknie nie przeładuje sekcji dostawcy.
Co to oznacza w praktyce
Podłączenie DeepSeek do popularnych klientów kodowania nie wymaga poświęcania wypracowanego workflow ani sięgania po dodatkowe warstwy pośrednie. Konfiguracja sprowadza się do kilku zmiennych środowiskowych albo jednego skryptu. Różnica w kosztach jest na tyle wyraźna, że dla wielu zadań rutynowych wybór tańszego modelu staje się naturalnym domyślnym ustawieniem.
Nie oznacza to jednak, że modele frontier tracą rację bytu. Trudne problemy architektoniczne, krytyczne przeglądy bezpieczeństwa czy ryzykowne migracje nadal wymagają możliwości, których tańsze warianty nie oferują. Rozsądne podejście polega na świadomym rozdzieleniu zadań – tam, gdzie wystarczy szybkość i niska cena, sięgamy po Flash; tam, gdzie liczy się precyzja i głębsze rozumienie kontekstu, warto zapłacić więcej. Kluczowe jest to, żeby ten podział wynikał z rzeczywistych potrzeb, a nie z przyzwyczajenia do jednego dostawcy.

