Poradnik

Limity w Claude Code: 6 sposobów, żeby zużywać mniej tokenów

Każda sesja Claude Code ma koszt startowy, a każda wiadomość wysyła na serwer całą rozmowę. Poznaj 6 nawyków, dzięki którym ten sam plan starczy Ci na dużo dłużej. Bez pluginów.

Zegar zużycia limitu w Claude Code narysowany tuszem, obok okno terminala i karteczka z komendą /context

Limity w Claude Code zużywasz szybciej, niż musisz, bo każda sesja ma koszt startowy, a każda wiadomość wysyła na serwer całą dotychczasową rozmowę. Kiedy zrozumiesz, jak działają sesje, tokeny i prompt caching, ten sam plan starczy Ci na dużo dłużej. W tym wpisie znajdziesz 6 nawyków, które stosuję na co dzień. Bez pluginów i bez magii, sama mechanika narzędzia.

W sieci znajdziesz wiele pluginów do Claude Code, które obiecują oszczędność tokenów. Powiem Ci szczerze: większość z nich nie dowozi obiecanych rezultatów, a często wręcz psuje jakość albo wydajność Claude Code. Wystarczy poświęcić chwilę na zrozumienie podstaw, na których opiera się to narzędzie, i samemu złapać, jak pracować optymalnie. Dokładnie tego uczymy w kursie Claude Code, a tutaj masz esencję w wersji do wdrożenia od razu.

01. Skąd się biorą limity w Claude Code?

Za każdym razem, gdy piszesz wiadomość w Claude Code, na serwer leci dużo więcej niż sama wiadomość: system prompt, definicje narzędzi i Twój plik CLAUDE.md. Do tego dochodzi wszystko, co Claude przeczytał wcześniej w tej rozmowie.

Jak piszesz "Hej, popraw mi widget na stronie do zbierania e-maili" w projekcie, w którym są już pliki Twojej strony, Claude w trakcie odpowiadania zaczyna je przeszukiwać i czytać, żeby zrozumieć, jak zbudowany jest ten widget. I uwaga: każdy przeczytany plik zostaje w rozmowie do końca sesji.

Co to oznacza? Że każda sesja ma wbudowany koszt startowy, zanim Claude zrobi cokolwiek pożytecznego. I ten koszt obciąża Twój limit.

Do tego model nie ma żadnej pamięci między wiadomościami. Za każdym razem, jak wyślesz nową wiadomość, Claude Code wysyła na serwer wszystko od początku:

  1. system prompt, definicje narzędzi, CLAUDE.md + pierwsza wiadomość,
  2. to samo + wynik pierwszej tury + druga wiadomość,
  3. to samo + wynik drugiej tury + trzecia wiadomość.

I tak w kółko, aż do końca sesji.

02. Jakie limity ma Claude Code w planach Pro i Max?

Limity użycia (usage limits) zależą od Twojej subskrypcji: plan Pro daje najmniejszy pakiet, plany Max 5x i Max 20x odpowiednio większy. Limit odnawia się w 5-godzinnych oknach, a od 2025 roku Anthropic dolicza też limit tygodniowy. Aktualne szczegóły znajdziesz w Anthropic Help Center, bo wartości potrafią się zmieniać. Sam dostęp do Claude Code masz w każdym z tych planów: limity Pro są po prostu najniższe, a plan Max odpowiednio je podnosi.

Ważne dla portfela: wybrany model ma inne tempo zużywania limitu. Opus zjada go kilka razy szybciej niż Sonnet, dlatego dobór modelu do zadania to osobna rada niżej. Jeżeli pracujesz przez API zamiast subskrypcji (z własnym API key), płacisz bezpośrednio za tokeny i zamiast okien masz rate limits, ale cała mechanika sesji i cache'a z tego wpisu działa tak samo.

Dwie rzeczy, które często się mylą. Po pierwsze, subskrypcja jest wspólna: rozmowy w aplikacji Claude i praca w Claude Code (w terminalu czy w VS Code) zużywają ten sam limit. Po drugie, limit użycia to co innego niż limit kontekstu (ang. context limits): okno kontekstowe ogranicza, ile jedna rozmowa pomieści, a usage limit ogranicza, ile łącznie przerobisz w oknie czasowym. Plany Team i Enterprise oraz konto w Claude Console (API) mają osobne zasady rozliczania.

Reset limitu nie wymaga od Ciebie niczego: po prostu czekasz do końca okna i możesz dalej kodować. Sęk w tym, żeby do tego resetu w ogóle nie dobijać. I tu wchodzi 6 rad.

03. Jak działa prompt caching?

Prompt caching sprawia, że nie płacisz w kółko pełnej ceny za powtarzaną część rozmowy. Po pierwszej wiadomości całość trafia do cache'a, a od drugiej wcześniejsza rozmowa liczy się za ok. 10% ceny. Pełną stawką idzie tylko to, co nowe.

Za sam zapis do cache'a płacisz trochę więcej niż normalnie (do 2x ceny inputu), ale płacisz raz. Szczegóły znajdziesz w dokumentacji Anthropic o prompt caching.

Pamiętaj tylko, że 10% to nie zero. Przy długiej rozmowie te "tanie" powtórki i tak robią realny koszt. Cache ma też termin ważności: na subskrypcji godzinę. Jak wrócisz do sesji po dłuższej przerwie, pierwsza wiadomość przetwarza cały kontekst od nowa, pełną stawką. Dlatego niżej znajdziesz rady, które trzymają rozmowy krótkie i cache w całości.

04. Rada 1: Zacznij sesję od /context i zobacz, co zjada Ci miejsce

Na początku sesji wpisz komendę /context. Zobaczysz, ile miejsca w oknie kontekstowym zajmuje system prompt, narzędzia i Twój CLAUDE.md, zanim jeszcze cokolwiek napiszesz.

Jeżeli CLAUDE.md jest za duży, to płacisz za niego w każdej wiadomości, w każdej sesji. Anthropic w dokumentacji o kosztach zaleca trzymać go poniżej ok. 200 linii. Przenieś z niego rzadko używane instrukcje do osobnych plików, które Claude doczyta na żądanie, a w CLAUDE.md zostaw tylko to, czego potrzebuje zawsze. Jak taki odchudzony plik współpracuje ze skillami, subagentami i autopilotem, pokazuję we wpisie o vibe codingu z planem.

05. Rada 2: Nie zmieniaj modelu w środku rozmowy, bo skasujesz cache

Prompt caching działa na zasadzie prefiksu. Początek tego, co wysyłasz, musi być identyczny 1 do 1 z poprzednim razem. Nowa wiadomość dokleja się na końcu, więc cache'a nie psuje.

Ale jeżeli zmienisz coś, co siedzi na początku rozmowy: model (komendą /model), poziom myślenia (komendą /effort) albo włączysz fast mode w środku sesji, to cała rozmowa liczy się od nowa, pełną kwotą.

06. Rada 3: Wskazuj pliki przez @, nie zwykłą ścieżką

Podajesz Claude'owi ścieżkę do pliku zwykłym tekstem? Ten nawyk Cię kosztuje.

Jak napiszesz "popraw mi plik widget.js", to dla Claude'a to tylko tekst. Żeby zobaczyć, co tam jest, musi sam wywołać narzędzie do czytania plików. A to oznacza dodatkową pełną rundę: Claude odpowiada "ok, czytam plik", wszystko leci na serwer, wraca wynik i dopiero wtedy zaczyna się właściwa robota.

A jak ścieżka jest niedokładna, robi się jeszcze gorzej. Claude zaczyna szukać pliku po omacku: przeszukuje foldery, czyta pliki na próbę, a każda z tych prób zostaje w rozmowie do końca sesji.

Jak napiszesz @widget.js, Claude Code dokleja zawartość pliku prosto do Twojej wiadomości, zanim cokolwiek poleci na serwer. Claude dostaje ją od razu, bez użycia narzędzi. Mniej rund, mniej tokenów.

07. Rada 4: Czyść kontekst komendą /clear między zadaniami

Rozpocząłeś rozmowę, wykonałeś szybko jedno zadanie. Nie przechodź w tej samej sesji do kolejnego, tylko wpisz /clear i startuj z czystym kontekstem.

Jedna długa sesja kosztuje więcej niż te same zadania zrobione w kilku krótszych. Wszystko przez powtórki, o których pisałem wyżej: im dłuższa historia, tym więcej "taniego" kontekstu jedzie z każdą kolejną wiadomością.

Jeżeli myślisz, że będziesz chciał wrócić do tej rozmowy, to zanim wyczyścisz, wpisz /rename i nadaj jej nazwę. Później łatwo ją znajdziesz przez /resume.

08. Rada 5: Długą rozmowę streszczaj przez /compact, a błędy cofaj przez /rewind

/clear jest na nowy temat. A co, jeżeli kontynuujesz to samo zadanie, tylko rozmowa zrobiła się już długa? Wtedy masz komendę /compact. Claude streszcza dotychczasową rozmowę i dalej pracuje na samym streszczeniu zamiast na pełnej historii.

Uwaga tylko: /compact podmienia całą rozmowę, więc kasuje cache i za nowy start płacisz pełną cenę. To inwestycja, która zwraca się dopiero w dłuższej pracy.

I najlepszy trik z całego wpisu. Jak ostatnie tury poszły w złą stronę (Claude zabrnął w ślepy zaułek, poprawiał coś w kółko bez efektu), nie odpalaj /compact. Użyj /rewind i cofnij rozmowę do momentu, zanim się zepsuło. Rewind tylko ucina końcówkę, a wszystko przed nią dalej siedzi w cache'u, więc kosztuje Cię to okrągłe zero.

09. Rada 6: Dobieraj model i poziom myślenia do zadania

Wybrany model to mnożnik na wszystkie tokeny w sesji, i te wchodzące, i te wychodzące. Bierz większy model, jak problem jest naprawdę trudny albo niejasny, a mniejszy do rutynowej roboty. Opus zostaw na najtrudniejsze problemy, Sonnet wystarczy do większości codziennej pracy. To samo z /effort: wyższy poziom myślenia to więcej tokenów przy każdej odpowiedzi.

I pamiętaj z rady 2: zmiana modelu w środku rozmowy kasuje cache. Dlatego decyzję o modelu i efforcie podejmuj na starcie sesji albo zaraz po /clear. Wtedy nie masz jeszcze czego stracić.

10. Ile to daje w praktyce?

Nagrywając ostatnio kurs o budowaniu stron, zbudowałem z Claude kompletną stronę firmy remontowej w 40 minut. Jedna sesja, około 700 tysięcy tokenów kontekstu. Bez nawyków z tego wpisu taka sesja wyglądałaby zupełnie inaczej: kilka zmian modelu po drodze, pełna historia ciągnięta od początku i limit skończyłby się w połowie roboty.

Nie potrzebowałem do tego żadnego pluginu "oszczędzającego tokeny". Wystarczyła mechanika, którą właśnie poznałeś. Podobnie działają zresztą agenci AI: tam też o koszcie decyduje to, ile kontekstu ciągniesz ze sobą, a nie sama liczba zapytań. A jeśli budujesz apkę z widokami, najwięcej rund poprawek oszczędza ustalenie wyglądu przed kodem: pokazuję to we wpisie o Figma MCP w Claude Code.

Najczęstsze pytania o limity i tokeny w Claude Code

Czy /compact oszczędza tokeny?
W długiej pracy tak, ale w momencie użycia kosztuje: podmienia całą rozmowę, więc kasuje cache i za nowy start płacisz pełną cenę inputu. Odpalaj go, gdy planujesz jeszcze długo pracować w tej samej sesji, nie pod koniec zadania.
Co kasuje cache w Claude Code?
Wszystko, co zmienia początek rozmowy: zmiana modelu (/model), poziomu myślenia (/effort), włączenie fast mode w środku sesji oraz /compact. Nowa wiadomość doklejona na końcu cache'a nie psuje.
Czy plik CLAUDE.md zużywa mój limit?
Tak. CLAUDE.md leci na serwer z każdą wiadomością, w każdej sesji. Im większy plik, tym większy koszt startowy. Sprawdź jego rozmiar komendą /context i trzymaj w nim tylko instrukcje potrzebne zawsze.
Czym różni się /clear od /rewind?
/clear czyści całą rozmowę i zaczynasz od zera, na nowy temat. /rewind cofa rozmowę do wybranego momentu i ucina tylko końcówkę, a wszystko wcześniej zostaje w cache'u. Do nowego zadania /clear, do naprawy złego kierunku /rewind.
Czy limity Claude.ai i Claude Code są wspólne?
Tak. Plan Pro albo Max obejmuje jedno wspólne usage na konto: czat na claude.ai, aplikację desktopową i Claude Code. Intensywna sesja kodowania zje limit także dla zwykłych rozmów. Osobno rozlicza się tylko Claude API (płatność za tokeny, api rate limits zamiast okien).
Co się dzieje po osiągnięciu limitu?
Claude Code zatrzyma pracę i pokaże, kiedy limit się odnowi. Czekasz do resetu 5-godzinnego okna (albo tygodniowego, jeśli wyczerpałeś ten dłuższy). Możesz też dokupić usage credits i pracować dalej, rozliczając nadwyżkę po stawkach API. Nowsze wersje Claude Code potrafią same poczekać na reset i dokończyć zadanie.
Czy pluginy oszczędzające tokeny działają?
Większość, którą testowałem, nie dowozi: dokładają własne instrukcje do kontekstu (czyli podnoszą koszt startowy), a bywa, że psują jakość odpowiedzi. Zanim zainstalujesz plugin, wykorzystaj wbudowaną mechanikę: /context, @pliki, /clear, /compact i /rewind.

11. Podsumowanie

Limity w Claude Code to w praktyce trzy rzeczy: koszt startowy sesji, powtarzana historia rozmowy i mnożnik modelu. Sześć rad z tego wpisu trzyma wszystkie trzy pod kontrolą.

Na koniec dwie dodatkowe wskazówki, których nie było na liście:

  • Trzymaj CLAUDE.md chudy. Rzadko używane instrukcje przenieś do skilli albo osobnych plików doczytywanych na żądanie. Efekt zobaczysz w /context od razu.
  • Masową robotę zlecaj subagentom. Gdy Claude ma przeczytać kilkadziesiąt plików, niech zrobi to subagent w osobnym kontekście, a do Twojej rozmowy wróci samo podsumowanie. Główna sesja zostaje chuda.

A jeżeli dopiero zaczynasz z Claude Code: 17 września robimy bezpłatny live na YouTube, na którym przechodzimy podstawy od zera. Zapiszesz się tutaj.