czwartek, 30 lipca 2026

Nowości

OpenAI użyło GPT-5.6 Sol do przepisania własnych kerneli, koszty serwowania spadły o 20 procent

ModelePatryk Raba
OpenAI użyło GPT-5.6 Sol do przepisania własnych kerneli, koszty serwowania spadły o 20 procent
Fot. TechCrunch, Flickr / TechCrunch (CC BY 2.0)
Spis treści
  1. Model poprawia sam siebie
  2. Co jeszcze poprawiono
  3. Trzy warianty jednego modelu
  4. Dlaczego to ważne

OpenAI ujawniło, że jego najnowszy model GPT-5.6 Sol został użyty do optymalizacji infrastruktury, na której sam działa. Model za pomocą Codeksa samodzielnie przepisał i poprawił produkcyjne kernele odpowiadające za operacje matematyczne wykonywane podczas wnioskowania, co przełożyło się na wymierne obniżenie kosztów utrzymania usługi.

Model poprawia sam siebie

Kernele to najniższy poziom kodu wykonującego obliczenia na kartach graficznych podczas generowania odpowiedzi przez model językowy. Zwykle ich optymalizacją zajmują się wyspecjalizowani inżynierowie, bo drobne zmiany w tym kodzie mogą znacząco wpłynąć na wydajność i koszt każdego zapytania. OpenAI przyznało, że GPT-5.6 Sol, działając w środowisku Codex, samodzielnie przepisywał te fragmenty kodu, bo model został wyszkolony tak, aby dobrze radzić sobie z Triton i Gluon, dwoma otwartoźródłowymi językami programowania GPU, które firma sama rozwija i utrzymuje.

Efekt tej pracy to nie jednorazowy eksperyment, a zestaw zmian wdrożonych w produkcyjnej infrastrukturze serwującej zapytania do modeli OpenAI. Firma podała, że łączne koszty obsługi zapytań spadły o 20 procent, a wydajność generowania tokenów wzrosła o 15 procent dzięki udoskonaleniom w mechanizmie speculative decoding, w którym mniejszy model szkicowy przewiduje kolejne tokeny, a większy model je tylko weryfikuje.

Co jeszcze poprawiono

Poza samymi kernelami OpenAI zoptymalizowało obsługę pamięci podręcznej KV cache oraz systemy rozdzielania zadań między procesory graficzne, co pozwala obsłużyć więcej zapytań na tym samym sprzęcie. Firma zmieniła też sposób działania agentów: serwery Model Context Protocol i dodatkowe umiejętności są teraz wywoływane tylko wtedy, gdy są rzeczywiście potrzebne, domyślny limit danych zwracanych przez narzędzia ograniczono do 10 tysięcy tokenów, a kolejność wywołań narzędzi zoptymalizowano pod kątem lepszego wykorzystania pamięci podręcznej.

Wszystkie te usprawnienia, od routingu przez planowanie zadań po implementację samego modelu, powstały z istotnym udziałem GPT-5.6 Sol działającego w Codeksie. Według relacji z tych prac to sam model wskazywał, które fragmenty kodu warto poprawić, a następnie wdrażał zmiany, które inżynierowie OpenAI weryfikowali przed uruchomieniem na produkcji.

Trzy warianty jednego modelu

GPT-5.6 trafił do ograniczonego podglądu w API i Codeksie w trzech wariantach różniących się ceną i mocą. Sol, flagowy model, kosztuje 5 dolarów za milion tokenów wejściowych i 30 dolarów za milion wyjściowych, dokładnie tyle co poprzedni GPT-5.5. Terra, wariant średni, wyceniono na 2,5 dolara za milion wejściowych i 15 za wyjściowe, czyli na poziomie starszego GPT-5.4. Luna, najtańszy i najszybszy z trójki, kosztuje 1 dolara za milion tokenów wejściowych i 6 za wyjściowe, co OpenAI opisuje jako zupełnie nowy, tańszy poziom cenowy między GPT-5.4 i jego wersją mini.

Taki układ pozwala firmom korzystającym z API kierować trudniejsze zapytania do Sol, a prostsze zadania przekazywać do Luny, co w praktyce daje elastyczność w kontrolowaniu wydatków na wnioskowanie zależnie od skali i charakteru ruchu.

Dlaczego to ważne

Do tej pory wyścig między laboratoriami AI koncentrował się głównie na tym, który model osiągnie lepsze wyniki w benchmarkach. Przykład GPT-5.6 Sol pokazuje inny front tej rywalizacji: sztuczną inteligencję używaną do obniżania kosztów działania samej infrastruktury AI, co ma znaczenie w sytuacji, gdy wydatki firm technologicznych na centra danych i moc obliczeniową rosną szybciej niż przychody z samych usług AI.

Dla firm korzystających z API OpenAI praktyczna konsekwencja to niższe realne koszty przetwarzania dużych wolumenów zapytań przy tej samej cenie nominalnej za token, a dla samego OpenAI, stojącego pod presją coraz szybciej rozwijających się chińskich laboratoriów AI, to argument, że efektywność stała się równie istotnym polem konkurencji jak surowa jakość odpowiedzi modelu.

Dla polskich firm i programistów korzystających z GPT-5.6 przez API znaczenie ma przede wszystkim to, drugie: przy dużej skali zapytań nawet kilkunastoprocentowa redukcja kosztów wnioskowania realnie wpływa na budżety projektów opartych na tym modelu, choć same ceny za token na razie się nie zmieniły.

Udostępnij: