Klonika - AI News Portal
GPT-5.6 Sol samodzielnie wytrenował mniejszy model AI – OpenAI pokazuje rekurencyjne samodoskonalenie w praktyce
Zdjęcie: Ann H · Pexels

GPT-5.6 Sol samodzielnie wytrenował mniejszy model AI – OpenAI pokazuje rekurencyjne samodoskonalenie w praktyce

11 lipca 2026 06:58 34 · WAŻNE

W skrócie

  • GPT-5.6 Sol samodzielnie przeprowadził post-trening mniejszego modelu Luna, wykonując zadanie, które wcześniej zajęłoby dwóm starszym badaczom około dwóch tygodni.
  • Sol uzyskał wynik o 16,2 punktu wyższy niż GPT-5.5 na wewnętrznym benchmarku rekurencyjnego samodoskonalenia (RSI).
  • W ciągu ostatnich sześciu miesięcy dzienna liczba tokenów generowanych przez aktywnego badacza korzystającego z GPT-5.6 Sol ponad dwukrotnie przekroczyła poprzedni rekord ustanowiony przez GPT-5.5.

OpenAI ogłosiło, że jego nowy flagowy model GPT-5.6 Sol samodzielnie przeprowadził post-trening mniejszego modelu Luna. Po wstępnym pre-treningu Luny, Sol zoptymalizował ją pod kątem konkretnych umiejętności i zachowań – bez bezpośredniego nadzoru zespołu badawczego the-decoder.com.

Jak wyglądało zadanie

Badacz przekazał Solowi „dość ogólnie sformułowany prompt" za pośrednictwem platformy Codex. Instrukcje nakazywały modelowi znalezienie odpowiednich konfiguracji treningowych, wybór właściwych procesorów graficznych, uruchomienie skryptu treningowego oraz weryfikację poprawności działania całego procesu the-decoder.com.

Pracownik OpenAI Jason Liu doprecyzował później zakres tego osiągnięcia: Sol nie opracował kompletnej procedury treningowej od zera, ponieważ większość konfiguracji istniała już z jego własnego post-treningu. Faktyczne zadanie polegało na dostosowaniu tego zestawu do mniejszego modelu Luna i uruchomieniu procesu treningowego. Według Liua zadanie to „zajęłoby dwóm starszym badaczom może dodatkowe dwa tygodnie, więc to nadal ogromna sprawa" the-decoder.com.

Badaczka OpenAI Kathy Shi skomentowała to podczas prezentacji słowami: „Wcześniej pracował nad tym zespół starszych badaczy w OpenAI, a teraz naprawdę czuć, że zautomatyzowany badacz jest już bardzo blisko" the-decoder.com.

Benchmark rekurencyjnego samodoskonalenia

Aby bezpośrednio zmierzyć te zdolności, OpenAI zbudowało wewnętrzny zestaw ewaluacyjny oparty na rzeczywistych zadaniach badań nad AI. Obejmują one debugowanie systemów badawczych, optymalizację jąder i procedur treningowych, prowadzenie eksperymentów uczenia maszynowego oraz doskonalenie innych modeli the-decoder.com.

GPT-5.6 Sol uzyskał wynik o 16,2 punktu wyższy niż GPT-5.5 na zagregowanym indeksie RSI (Recursive Self-Improvement, czyli rekurencyjne samodoskonalenie). Sol zajmuje najwyższe miejsce w hierarchii modeli tego benchmarku, za nim plasują się warianty Terra i Luna, a następnie GPT-5.5 i GPT-5.4 the-decoder.com.

Rekurencyjne samodoskonalenie w badaniach nad AI oznacza zdolność systemu do samodzielnego ulepszania się, gdzie każda runda postępów zwiększa jego możliwości dalszego doskonalenia – tworząc pętlę zwrotną. Pojęcie to od dawna jest kluczowe w badaniach nad bezpieczeństwem AI, ponieważ system zdolny do rekurencyjnego samodoskonalenia mógłby teoretycznie wywołać gwałtowny wzrost możliwości the-decoder.com.

Warto zaznaczyć, że rywal OpenAI – Anthropic – podkreślił na początku czerwca, że pełne rekurencyjne samodoskonalenie nie zostało jeszcze osiągnięte, ale „może nadejść szybciej, niż większość instytucji jest na to przygotowana". Pełne RSI oznacza system AI projektujący własnego następcę bez udziału człowieka. Według Anthropic, Claude potrafi już wykonywać przyrostowe prace między głównymi zmianami paradygmatu, a ludzie odpowiadają jedynie za jednocyfrowy odsetek decyzji kierunkowych the-decoder.com.

Wpływ na produktywność badaczy

OpenAI podaje, że jego badacze korzystają z GPT-5.6 Sol w całym cyklu rozwoju – od debugowania i optymalizacji systemów treningowych po prowadzenie eksperymentów i analizę wyników. Już podczas wewnętrznych testów średnia dzienna liczba tokenów generowanych przez aktywnego badacza ponad dwukrotnie przekroczyła poprzedni rekord ustanowiony przez GPT-5.5. Wzrosła też liczba pull requestów i eksperymentów przypadających na badacza, co pozwala zespołom szybciej przekształcać pomysły w wyniki the-decoder.com.

Dane dotyczące wewnętrznego wdrożenia z ostatnich sześciu miesięcy pokazują dynamiczny wzrost: udział mocy obliczeniowej przeznaczonej na wewnętrzne wnioskowanie w zakresie kodowania wzrósł 100-krotnie, a użycie tokenów przez agenci skoczyło około 22-krotnie. OpenAI przyznaje, że te wskaźniki nie mierzą bezpośrednio postępu badań, ale wskazują na tempo skalowania pracy wspomaganej przez AI the-decoder.com.

Co to oznacza

Osiągnięcie GPT-5.6 Sol to pierwszy publicznie udokumentowany przypadek, w którym duży model językowy samodzielnie przeprowadził post-trening innego modelu na podstawie ogólnie sformułowanego polecenia. Choć Sol nie opracował procedury od zera, a jedynie zaadaptował istniejącą konfigurację, skrócenie czasu pracy o dwa tygodnie pracy dwóch starszych badaczy jest wymiernym dowodem na to, że AI zaczyna realnie przyspieszać własny rozwój.

Dla branży technologicznej oznacza to, że laboratoria AI wchodzą w fazę, w której modele stają się narzędziami do tworzenia kolejnych, lepszych modeli – a tempo tego procesu może rosnąć wykładniczo. Rozbieżność między stanowiskami OpenAI i Anthropic w kwestii tego, jak blisko jesteśmy pełnego rekurencyjnego samodoskonalenia, pokazuje, że nawet czołowe laboratoria inaczej oceniają dojrzałość tej technologii i związane z nią ryzyka.

Dla polskich firm i instytucji korzystających z narzędzi AI istotne jest to, że tempo poprawy możliwości modeli może być znacznie szybsze, niż wynikałoby z dotychczasowych rocznych cykli wydawniczych. Organizacje planujące wdrożenia AI powinny uwzględniać scenariusz, w którym modele dostępne komercyjnie będą się zmieniać w tempie trudnym do przewidzenia – co wymaga elastycznych strategii adopcji zamiast długoterminowych zakładów na konkretne wersje narzędzi.

Szerszy kontekst

W zestawie ewaluacji mierzących postęp w kierunku rekurencyjnego samodoskonalenia obserwujemy, że GPT-5.6 Sol stanowi poprawę o 16,2 punktu względem GPT-5.5, przyspieszając wewnętrzne badania we wszystkich obszarach.

openai.com

W ramach naszego Frameworku Gotowości traktujemy modele Sol, Terra i Luna jako posiadające wysokie zdolności zarówno w obszarze cyberbezpieczenstwa, jak i ryzyka biologicznego i chemicznego. Żaden z nich nie osiąga naszego progu wysokiego ryzyka w zakresie samodoskonalenia AI.

deploymentsafety.openai.com

GPT-5.6 Sol ustanawia nowy standard zarówno pod względem inteligencji, jak i wydajnosci, osiagajac najnowocześniejsze wyniki w kodowaniu, pracy opartej na wiedzy, cyberbezpieczenstwie i nauce, jednoczesnie przewyzszajac poprzednie i konkurencyjne modele graniczne przy uzyciu mniejszej liczby tokenow i przy nizszym szacowanym koszcie.

openai.com

W przypadku procesow kodowania GPT-5.6 Sol ustanawia nowy stan wiedzy na Terminal-Bench 2.1, ktory testuje procesy wiersza polecen wymagajace planowania, iteracji i koordynacji narzedzi.

openai.com

"Wczesniej nad czyms takim mogly pracowac zespoly starszych badaczy w OpenAI, a teraz naprawde wydaje sie, ze automatyczny badacz jest calkiem bliski" — powiedziala badaczka OpenAI Kathy Shi podczas prezentacji.

the-decoder.com

Analiza

Kluczowym znaczeniem ogłoszenia OpenAI jest nie tyle sam fakt, że Sol przeprowadził post-trening Luny, ile to, że zrobił to na podstawie ogólnie sformułowanego polecenia, bez szczegółowej specyfikacji technicznej. To jakościowa zmiana w sposobie, w jaki modele uczestniczą we własnym łańcuchu produkcyjnym — dotychczas każdy etap treningu wymagał ścisłego nadzoru starszych badaczy. Warto jednak zachować proporcje: Sol nie zaprojektował procedury od zera, lecz zaadaptował istniejącą konfigurację z własnego post-treningu do mniejszego modelu. Mimo to skrócenie pracy dwóch starszych badaczy o około dwa tygodnie jest wymiernym wskaźnikiem realnej automatyzacji badań, a nie tylko demonstracją laboratoryjną.

Istotny kontekst dodaje karta systemowa GPT-5.6 opublikowana przez OpenAI (wg deploymentsafety.openai.com): firma klasyfikuje Sol, Terra i Lunę jako modele o wysokich zdolnościach w zakresie cyberbezpieczeństwa oraz ryzyk biologicznych i chemicznych, ale żaden z nich nie osiąga progu „wysokiego" w kategorii samodoskonalenia AI. To ważne zastrzeżenie — OpenAI formalnie nie traktuje obecnych możliwości jako pełnego rekurencyjnego samodoskonalenia, co koresponduje ze stanowiskiem Anthropic, że pełne RSI jeszcze nie nastąpiło, choć może nadejść szybciej, niż większość instytucji jest przygotowana. Rozbieżność między retoryką marketingową a klasyfikacją w ramach własnego systemu bezpieczeństwa zasługuje na uwagę — szczególnie że Sol osiąga 95% skuteczności na eksperckich zadaniach typu CTF w testach UK AISI, co plasuje go znacznie powyżej GPT-5.5 (85%).

Z perspektywy praktycznej najbardziej wymowne są dane o wewnętrznym wdrożeniu: użycie mocy obliczeniowej na wewnętrzne wnioskowanie w zakresie kodowania wzrosło 100-krotnie, a użycie tokenów przez agenty około 22-krotnie w ciągu ostatnich sześciu miesięcy (wg openai.com). Nawet jeśli te wskaźniki nie przekładają się bezpośrednio na postęp badań, sygnalizują, że laboratoria AI wchodzą w fazę, gdzie modele stają się integralnym elementem własnego cyklu rozwojowego. Dla organizacji planujących wieloletnie strategie wdrożeń AI oznacza to, że zakładanie stabilnych, rocznych cykli wydawniczych jest coraz mniej uzasadnione — tempo zmian możliwości modeli może być trudne do przewidzenia nawet dla samych twórców.

Opracowanie: Klonika.pl