OpenAI poprawia pamięć podręczną w API GPT-6. Powtarzany początek rozmowy może być tańszy nawet o 90 proc.
OpenAI zmienił 22 września sposób, w jaki API modeli GPT-6 zapamiętuje powtarzane fragmenty rozmów. Firmy, które płacą za każde użycie, mają dostać zniżkę częściej i narzędzia, które pokażą, dlaczego jej nie dostały.

OpenAI zmienił 22 września działanie pamięci podręcznej w API modeli GPT-6, czyli mechanizmu, który zapamiętuje powtarzane fragmenty zapytań. Zmiana dotyczy firm, które płacą za każde użycie modelu, na przykład przez własny program, czat na stronie albo agenta do dokumentów. Jeśli korzystasz z ChatGPT w abonamencie, nic się dla ciebie nie zmienia. Szczegóły OpenAI podał w komunikacie na swoim blogu.
Po co ta pamięć
Program, który rozmawia z modelem dłużej, za każdym razem wysyła mu to samo: instrukcje, opis dostępnych narzędzi i wcześniejszą część rozmowy. OpenAI zapamiętuje taki wspólny początek i przy następnym zapytaniu nie liczy go od nowa. Za wejście obsłużone z pamięci firma płaci do 90 proc. mniej niż za zwykłe.
Przyjmijmy biuro rachunkowe, którego asystent przy każdym pytaniu klienta dostaje ten sam regulamin i cennik. Jeśli te dokumenty trafią w pamięć podręczną, firma płaci pełną stawkę głównie za nowe pytanie. Jeśli nie trafią, płaci za wszystko od początku.
Co się zmieniło
OpenAI twierdzi, że nowy system w modelach GPT-6 częściej trafia w pamięć bez żadnych zmian po stronie firmy. Zniżka obejmuje wspólne początki zapytań użyte ponownie w ciągu 30 minut.
Do tego doszły narzędzia dla osób, które pilnują rachunków. Nowy panel w koncie API pokazuje, jaka część wejścia pochodzi z pamięci i jak to się zmienia w czasie. Narzędzie diagnostyczne porównuje dwa zapytania i wskazuje, co zepsuło trafienie: zmiana modelu, narzędzi, ustawień albo treści.
Programiści dostali też większą kontrolę. Mogą sami wskazać, które fragmenty zapamiętać, zmieniać w trakcie rozmowy, jak długo model się zastanawia, bez utraty zapamiętanego kontekstu, i przygotować pamięć zawczasu, zanim użytkownik zada pierwsze pytanie. Szczegóły są w dokumentacji OpenAI.
Wyniki podane przez klientów
| Firma | Co podaje |
|---|---|
| GitHub (Copilot) | udział tokenów przetwarzanych od nowa spadł o ponad 50 proc. |
| Manus | trafienia w pamięć wzrosły z ok. 85 do ponad 90 proc. w niecały tydzień |
To dane samych firm, cytowane przez OpenAI. Komunikat nie podaje, jak często pamięć trafiała w modelach GPT-6 przed zmianą, ani czy te same poprawki obejmą starsze modele.
Co zrobić
Jeśli twoja firma płaci za API OpenAI, sprawdź w panelu, ile wejścia pochodzi z pamięci. Stawki modeli w złotych znajdziesz w cenniku modeli, a ceny GPT-6 Sol i Luna opisaliśmy w tekście o premierze GPT-6 Sol i Luna w API. Zniżka działa tylko wtedy, gdy zapytanie wróci w ciągu 30 minut.
- Ile można zaoszczędzić na pamięci podręcznej w API OpenAI?OpenAI podaje, że za wejście obsłużone z pamięci podręcznej daje zniżkę do 90 proc. Ile zaoszczędzi konkretna firma, zależy od tego, jak duża część jej zapytań się powtarza.
- Jak długo OpenAI trzyma powtarzany kontekst w pamięci podręcznej GPT-6?Zniżka obejmuje wspólne początki zapytań użyte ponownie w ciągu 30 minut, o ile spełniają warunki opisane w dokumentacji.
- Czy zmiana dotyczy abonamentu ChatGPT?Nie. Komunikat dotyczy API, czyli płatności za każde użycie modelu przez firmy i programy, a nie abonamentów w aplikacji ChatGPT.
- OpenAI, komunikat „Better prompt caching for GPT-6”, dostęp 2026-09-26
Widzisz błąd? Napisz, poprawiamy i dopisujemy notę o zmianie.

Wdraża systemy oparte na AI w firmach produkcyjnych i usługowych. Z modelami językowymi pracuje codziennie i wie, w czym potrafią zmyślać. Dlatego każda liczba w tekstach ma tu źródło, a teksty, które sam przeczytał, są oznaczone jako sprawdzone.
wszystkie teksty autora