gik|iewicz

szukaj
OpenAI ucina okno kontekstu Codex z 372k do 272k tokenów

OpenAI ucina okno kontekstu Codex z 372k do 272k tokenów

OpenAI po cichu zmniejszyła okno kontekstu modelu GPT-5.6 (Sol) w narzędziu Codex z 372 tysięcy do 272 tysięcy tokenów. Zmiana dotyczy użytkowników subskrypcji Codex oraz ChatGPT Work. Powodem był nieoczekiwanie szybki wzór limitów przez klientów, który firma uznała za błędny.

TL;DR: OpenAI zdiagnozowało, że podniesienie okna kontekstu modelu GPT-5.6 Sol do 372 tysięcy tokenów powodowało nieoczekiwanie duże zużycie limitów w Codexie. Wdrożono szereg poprawek: okno zostało z powrotem zmniejszone do 272 tysięcy tokenów, a sama firma zoptymalizowała inferencję, co daje około 10% więcej dostępnego czasu dla każdego abonamenta.

Dlaczego OpenAI zmniejszyła okno kontekstu w Codex z 372k do 272k tokenów?

Zmiana limitu z 372 tysięcy do 272 tysięcy tokenów wynika bezpośrednio z błędu w wycenie zapytań API. Zgodnie z informacjami deweloperów, model GPT-5.6 Sol po przekroczeniu progu 272 tysięcy tokenów dwukrotnie podrażał koszty inferencji. Ponadto wiele zewnętrznych bibliotek i nakładek błędnie konfigurowało limit okna na 372 tysiące. W rezultacie długie wątki konwersacji automatycznie generowały ogromne, ukryte opłaty. To drastycznie zużywało miesięczne limity użytkowników.

Theo, znany deweloper w sieci jako t3.gg, zwrócił uwagę na nakładające się problemy narzędzia Codex. Wskazał wprost, że podniesienie limitu do 372 tysięcy tokenów zbiegło się w czasie z podwójną stawką za inferencję powyżej 272 tysięcy. To sprawiło, że długie sesje programistyczne niszczyły limity w zastraszającym tempie.

Co dokładnie ogłosił Tibo z OpenAI w sprawie GPT-5.6 Sol?

Tibo (Thibault Sottiaux) z OpenAI potwierdził, że firma nie celowo ogranicza możliwości modelu, lecz naprawia błędy w systemie rozliczeń. OpenAI wdrożyło niedawno optymalizacje inferencji dla GPT-5.6 Sol, co obniża koszty operacyjne. Z tego powodu abonamenti otrzymują około 10% więcej faktycznego użycia w ramach swoich planów. Dodatkowo firma zauważyła, że błędne ustawienie okna powodowało sztucznie wyższe opłaty. Dlatego cofnięto limit.

Oficjalne oświadczenie na koncie X jasno wskazuje na chęć naprawy relacji z programistami. Zmniejszenie okna kontekstu do 272 tysięcy tokenów to bezpośrednia reakcja na zgłaszane anomalie. Przy okazji wdrożono optymalizację dającą 10% bonusu do limitów. To łagodzi skutki uboczne dla najbardziej aktywnych twórców.

Jak błędne ustawienie nakładek wpływało na zużycie limitów?

Wiele zewnętrznych interfejsów i skryptów odczytywało maksymalny limit okna jako 372 tysiące tokenów, co generowało ciche przeładowania. Gdy użytkownik zbliżał się do tej wartości, system podwajał stawkę za każdy kolejny token. To powodowało drastyczne przyspieszenie wypalania puli dostępnych zapytań w subskrypcjach. Użytkownicy nie byli świadomi tego progu cenowego. W konsekwencji ich konta traciły dostęp do narzędzia bardzo szybko.

Kun Chen opublikował istotne ostrzeżenie dla osób korzystających z GPT-5.6 poza natywnym środowiskiem. Zauważył on na platformie X, że zapytania powyżej 272 tysięcy tokenów są nadmiernie obciążane opłatami. Problemy dotyczyły wielu popularnych narzędzi programistycznych typu harness, które ustawiały limit na 372 tysiące. To powodowało błyskawiczną utratę przypisanej puli.

Jakie konkretne problemy użytkowników rozwiązuje ten rollback?

Cofnięcie limitu do 272 tysięcy tokenów rozwiązuje głównie problem błyskawicznego zużycia pakietów w ChatGPT Work. Użytkownicy narzekali na zjawisko określane jako nuking, czyli całkowite zablokowanie funkcjonalności po kilku zaledwie długich zapytaniach. Przywrócenie niższego progu eliminuje ukryte kary finansowe narzucane przez algorytm. Skrypty trzecie dostosują się do nowych, bezpieczniejszych ram. Abonament zyska stabilność działania.

Konto Elaina podsumowało sytuację dla użytkowników wersji komercyjnych. W swoim wpisie potwierdziło, że limit 372 tysięcy tokenów był główną przyczyną nieoczekiwanego spalania zasobów. Rollback do 272 tysięcy tokenów znacząco zredukuje problem. OpenAI zapowiada jednak powrót do wyższych wartości w przyszłości, gdy systemy rozliczeń zostaną w pełni naprawione.

Które subskrypcje i funkcje objęte są zmianą kontekstu?

Zmiana dotyczy wyłącznie klientów korzystających z usług ChatGPT Work oraz narzędzia OpenAI Codex dostaje wtyczki. Model GPT-5.6 Sol działa w tych planach jako główne narzędzie do generowania kodu i analizy dużych plików źródłowych. Ograniczenie okna automatycznie wpływa na maksymalną długość wątków konwersacyjnych. Zmiana nie tyczy się bezpośrednich zapytań przez standardowe API, chyba że skrypty wymuszają wyższy limit. Mimo to programiści muszą zaktualizować konfigurację.

Warto przeanalizować, jak ta aktualizacja wpływa na codzienną pracę zespołów:

  • Mniejsza ilość danych w pojedynczym zapytaniu dla modelu Sol.
  • Konieczność dzielenia dużych plików na mniejsze, niezależne chunki.
  • Eliminacja podwójnych stawek za przetwarzanie danych powyżej 272 tysięcy.
  • Stabilniejsze zużycie przydzielonych limitów w długich, wielogodzinnych sesjach.
  • Obecność dziesięcioprocentowego bonusu efektywnościowego dla abonamentów.
  • Brak nagłych przerw w działaniu narzędzia pośrednio poprawia produktywność.
  • Konieczność aktualizacji wielu bibliotek open-source do nowych limitów.
  • Szybsze i bardziej przewidywalne zużycie miesięcznych zasobów.

Powyższa tabela przedstawia najważniejsze różnice między starą a nową konfiguracją narzędzia:

CechaWersja 372kWersja 272k
Koszt powyżej limitu2x wyższa stawka bazowaBrak ukrytych kar
Zużycie limituBardzo szybkie, nieprzewidywalneStabilne, wolniejsze
Optymalizacja inferencjiBrakWdrożona (10% zysku)
Stabilność w ChatGPT WorkCzęste blokadyZnaczna poprawa

Czego mogą spodziewać się programiści po aktualizacji limitów?

Każdy skrypt wysyłający zapytania do API powinien mieć twardo ustawiony limit na 272 tysiące tokenów. Pozwoli to uniknąć podwójnych opłat, które nadal mogą występować przy bezpośrednim korzystaniu z interfejsu programistycznego. Zmiana wymusza również lepszą higienę pracy z danymi. Należy optymalizować wielkość przesyłanych logów. To zmusza do lepszego zarządzania zasobami.

Najważniejsze jest teraz śledzenie komunikatów społeczności. Błędy w nakładkach mogą nadal powodować straty. Należy ręcznie sprawdzić ustawienia w każdym z używanych narzędzi programistycznych. Na przykład proste skrypty bash do testowania limitów API mogą uchronić przed niespodziankami. Warto również obserwować reakcje zespołu Premiera GPT-5.6 od OpenAI.

Jak zoptymalizować zapytania API po ograniczeniu okna do 272 tysięcy tokenów?

Optymalizacja zapytań wymaga przede wszystkim twardego ustawienia limitu kontekstu na 272 tysiące tokenów w kodzie każdej zewnętrznej nakładki. Theo (t3.gg) wyjaśnił, że model GPT-5.6 kosztuje dwukrotnie więcej po przekroczeniu tego właśnie progu (źródło). Dlatego pozostawienie domyślnego, wyższego limitu w skryptach powoduje błyskawiczne zużycie przydziału. Należy bezwzględnie aktualizować konfigurację bibliotek. To chroni budżet przed ukrytymi karami.

Kun Chen ostrzega wprost przed błędnymi ustawieniami w narzędziach typu harness. Wskazał, że wiele z nich nadal wymusza okno 372 tysięcy tokenów, co generuje nieoczekiwanie wysokie opłaty za inferencję. Zatem programiści muszą ręcznie weryfikować maksymalne wartości w plikach konfiguracyjnych swoich środowisk programistycznych.

Oto lista kluczowych działań zapobiegawczych dla programistów:

  • Weryfikacja limitów w plikach konfiguracyjnych narzędzi zewnętrznych.
  • Dzielenie obszernych logów na mniejsze, niezależne pakiety danych.
  • Monitorowanie bieżącego zużycia tokenów podczas długich sesji.
  • Aktualizacja zewnętrznych bibliotek do ich najnowszych wersji.
  • Wykorzystanie dziesięcioprocentowego bonusu z optymalizacji inferencji.
  • Wdrażanie mechanizmów wygaszania niepotrzebnych wątków historycznych.
  • Tworzenie lokalnych testów weryfikujących próg kontekstu zapytań.
  • Ograniczenie objętości przesyłanych metadanych do modelu.

Czy OpenAI planuje przywrócić okno 372 tysięcy tokenów w przyszłości?

OpenAI oficjalnie deklaruje chęć przywrócenia okna 372 tysięcy tokenów dla modelu GPT-5.6 Sol po naprawieniu błędów rozliczeniowych. Konto Elaina potwierdziło, że firma pracuje nad przywróceniem tej funkcji, jednakże obecny rollback do 272 tysięcy tokenów ma trwale uspokoić sytuację (źródło). Tibo zapewnia, że nie jest to celowe osłabienie modelu. To wyłącznie naprawa systemu.

Zatem ograniczenie ma charakter tymczasowy, lecz konieczne do wdrożenia poprawek. Co więcej, optymalizacja inferencji daje użytkownikom 10% więcej dostępnego czasu, co łagodzi skutki braku rozszerzonego okna. Mimo to programiści wciąż muszą radzić sobie z obecnymi, surowszymi ramami. Szczegóły dotyczące przyszłych aktualizacji opisano we wpisie Premiera GPT-5.6 od OpenAI.

Często zadawane pytania

Ile tokenów wynosi nowy limit okna kontekstu dla GPT-5.6 Sol w narzędziu Codex?

Nowy limit wynosi 272 tysiące tokenów, ponieważ próg powyżej tej wartości podwajał koszty inferencji i powodował błyskawiczne zużycie pakietów (źródło). Należy pilnie zaktualizować konfigurację swoich narzędzi programistycznych.

Dlaczego zewnętrzne nakładki powodowały nagłe utraty limitów w Codexie?

Wiele zewnętrznych interfejsów błędnie ustawiało limit okna na 372 tysiące tokenów, co uruchamiało ukrytą stawkę podwójną za przetwarzanie (źródło). Wobec tego każde zapytanie wysyłane przez te skrypty drastycznie przyspieszało wypalanie przydziału.

Jakie korzyści daje wdrożona przez OpenAI optymalizacja inferencji dla modelu Sol?

Optymalizacja inferencji obniża koszty operacyjne, co daje użytkownikom około 10% więcej faktycznego użycia w ramach subskrypcji (źródło). Warto zacząć monitorować dzienne zużycie zasobów, aby zmaksymalizować zyski z tego bonusu.

Które subskrypcje i plany objęte są rollbackiem okna kontekstu?

Zmiana limitu dotyczy wyłącznie klientów korzystających z usług ChatGPT Work oraz narzędzia Codex, gdzie model GPT-5.6 Sol działa jako główne narzędzie (źródło). Zewnętrzni programiści API muszą dostosować swoje skrypty do nowych reguł.

Podsumowanie i wnioski

Ograniczenie okna kontekstu modelu GPT-5.6 Sol z 372 tysięcy do 272 tysięcy tokenów to bezpośrednia reakcja OpenAI na anomalie w rozliczeniach. Podwójne stawki za inferencję po przekroczeniu bezpiecznego progu drastycznie zużywały miesięczne limity najbardziej aktywnych użytkowników. Co więcej, błędna konfiguracja zewnętrznych narzędzi programistycznych tylko potęgowała problem, powodując zjawisko całkowitego blokowania dostępu do usług. Wdrożone optymalizacje inferencji rekompensują straty dziesięcioprocentowym bonusem wydajnościowym. Zmiana ta uświadamia potrzebę ciągłej weryfikacji ustawień API.

Zapoznaj się również z analizami rozwiązań konkurencji na rynku narzędzi programistycznych, takimi jak OpenAI Codex dostaje wtyczki lub sprawdź historyczne podejście do skalowania w tekście GPT-5.4: 1M tokenów kontekstu. Więcej szczegółów o infrastrukturze znajdziesz w artykule Modele frontier OpenAI oraz Codex są teraz dostępne na AWS.