Google cicho aktualizuje Gemma 4: szybsze GPU, poprawki narzędzi i lepsze OCR
W skrócie
- Google wydało aktualizację modelu Gemma 4, która przyspiesza przetwarzanie promptów na GPU Nvidia Hopper o 25–70% dzięki włączeniu Flash Attention 4.
- Poprawki obejmują błędy w wywoływaniu narzędzi oraz problem z ucinaniem odpowiedzi przez model.
- Społeczność krytykuje Google za wydanie aktualizacji pod tą samą nazwą „Gemma 4" zamiast oznaczenia jej jako osobnej wersji, np. „Gemma 4.1".
Google wydało aktualizację swojego otwartego modelu Gemma 4, nie zmieniając przy tym jego nazwy. Nowa wersja przynosi przyspieszenie działania na kartach graficznych Nvidia Hopper, naprawia błędy w wywoływaniu narzędzi i rozwiązuje problem z ucinaniem odpowiedzi the-decoder.com.
Co się zmieniło w Gemma 4
Kluczową zmianą techniczną jest włączenie Flash Attention 4, które według Google przyspiesza przetwarzanie przychodzących promptów o 25–70%. Czas do pierwszego tokenu (time to first token) skraca się przy tym o nawet 31% the-decoder.com.
Poprawiono również działanie funkcji wywoływania narzędzi (tool calling), która pozwala modelowi samodzielnie uruchamiać zewnętrzne aplikacje i usługi. Opublikowane wyniki benchmarków dla wariantu 31B pokazują wzrosty we wszystkich testowanych scenariuszach — największy z nich, wynoszący 10,1 punktu procentowego, odnotowano w zastosowaniach telekomunikacyjnych the-decoder.com.
Kolejna zmiana dotyczy problemu z ucinanymi odpowiedziami — Google ograniczyło liczbę przypadków, w których model zwracał niekompletne wyniki. W obszarze przetwarzania obrazów użytkownicy mogą teraz ręcznie podnieść parametr max_soft_tokens z 280 do 1 120, co przekłada się na dokładniejsze wyniki OCR i obsługę rozdzielczości do 2,51 megapiksela. Google udostępniło w tym celu interaktywny konfigurator na platformie Hugging Face the-decoder.com.
Aktualizacja objęła wszystkie rozmiary modelu
Choć opublikowane benchmarki porównują jedynie warianty 31B i E4B z ich poprzednikami, repozytorium na Hugging Face wskazuje, że aktualizacja objęła wszystkie dostępne rozmiary parametryczne tej generacji modelu — w tym najnowsze wydanie 12B the-decoder.com.
Kontrowersje wokół nazewnictwa
Społeczność skupiona wokół modelu skrytykowała Google za sposób dystrybucji aktualizacji. Zamiast oznaczyć ją jako osobną wersję — np. „Gemma 4.1" — firma wydała ją pod tą samą nazwą „Gemma 4". Takie podejście utrudnia śledzenie zmian i może prowadzić do nieporozumień przy odtwarzaniu wyników badań czy porównywaniu zachowania modelu w czasie the-decoder.com.
Co to oznacza
Aktualizacja Gemma 4 pokazuje, że Google aktywnie rozwija swoją linię otwartych modeli, reagując na konkretne problemy zgłaszane przez użytkowników — od błędów w wywoływaniu narzędzi po ograniczenia w przetwarzaniu obrazów. Dla deweloperów i firm korzystających z Gemma 4 w produkcji oznacza to realną poprawę wydajności bez konieczności migracji na nowy model.
Jednocześnie praktyka „cichych aktualizacji" pod tą samą nazwą rodzi poważne pytania o powtarzalność wyników i transparentność w ekosystemie otwartych modeli AI. Jeśli model zmienia się bez zmiany identyfikatora wersji, wyniki benchmarków i wnioski z badań opublikowanych przed aktualizacją mogą być trudne do zweryfikowania lub porównania z nowymi wynikami. To problem, który dotyka nie tylko indywidualnych użytkowników, ale też środowisko naukowe i firmy budujące systemy oparte na konkretnych wersjach modeli.
Dla polskich zespołów technicznych pracujących z otwartymi modelami językowymi warto zwrócić uwagę na możliwość ręcznego dostrojenia parametru max_soft_tokens — szczególnie w zastosowaniach wymagających dokładnego odczytu tekstu z obrazów, takich jak digitalizacja dokumentów czy automatyczne przetwarzanie faktur.
Szerszy kontekst
15 lipca 2026 roku konto @googlegemma Google opublikowało aktualizację społecznościową (~192,5 tys. wyświetleń) dla całej rodziny modeli open-weight Gemma 4 — nie był to nowy główny numer wersji, lecz jednoczesne odświeżenie wag, jąder i szablonów na Hugging Face.
Zespół Google Gemma dostarczył FA4 na architekturę Hopper (+25–70% prefill), poprawki szablonów czatu, łatki do wywoływania narzędzi oraz ostrzejsze OCR w module wizji.
Domyślny kosz: 280 tokenów — bazowe kodowanie wizji dla typowych obrazów; max_soft_tokens: 1120 — umożliwia ostrzejsze OCR i obsługę wejść o rozdzielczości ~2,51 megapiksela.
Nic się nie zmieniło poza kolorem. Wyuczone odwzorowanie adaptera (wzorzec obrazu → token LaTeX) częściowo się rozpadło. Model przeszedł od pewnego przewidywania trybu matematycznego na białym tle do wstawiania ograniczników
$, jakby nie był pewien, czy jest w trybie matematycznym, czy tekstowym, ponieważ statystyki pikseli zakotwiczające jego wyuczone odwzorowanie już nie istnieją.
Gemma 4 używa p-RoPE w warstwach globalnej uwagi, ponieważ okno kontekstowe jest tam znacznie większe niż w warstwach lokalnej uwagi. Co więcej, p-RoPE jest szczególnie przydatne w warstwach globalnej uwagi, gdyż duże okna kontekstowe mogą skutkować odległościami między tokenami, których model wcześniej nie widział.
Analiza
Najważniejszym wnioskiem z tej aktualizacji nie jest sama poprawa wydajności, lecz ujawniony przez nią systemowy problem z zarządzaniem wersjami w ekosystemie otwartych modeli. Google wydało 15 lipca 2026 roku odświeżone wagi, jądra i szablony dla całej rodziny Gemma 4 pod niezmienioną nazwą, bez oznaczenia „4.1" ani żadnego innego identyfikatora wersji (wg explainx.ai). Oznacza to, że każdy zespół, który opublikował benchmarki lub zbudował system produkcyjny na podstawie wcześniejszych wag Gemma 4, operuje teraz na wynikach, których nie da się jednoznacznie przypisać do konkretnej iteracji modelu. Problem jest szczególnie dotkliwy w środowisku naukowym, gdzie powtarzalność eksperymentów stanowi fundament wiarygodności badań.
Pod względem technicznym zmiany są konkretne i mierzalne. Włączenie Flash Attention 4 skraca czas do pierwszego tokenu o nawet 31% na kartach Nvidia z architekturą Hopper, a prefill przyspiesza o 25–70%. W obszarze wywoływania narzędzi największy skok odnotowano w zastosowaniach telekomunikacyjnych dla wariantu 31B — o 10,1 punktu procentowego; według analizy (wg explainx.ai) poprawa wynika głównie z naprawy spójności wykonania, czyli poprawnego generowania JSON i właściwego doboru narzędzi, a nie ze wzrostu zdolności rozumowania. Warto odnotować, że architektura Gemma 4 od początku integruje obsługę wielu modalności na poziomie projektu, a nie jako dodatek — co odróżnia ją od wcześniejszych generacji (wg newsletter.maartengrootendorst.com).
Dla polskich zespołów pracujących z dokumentami największe praktyczne znaczenie ma zmiana w przetwarzaniu obrazów. Podniesienie parametru max_soft_tokens z 280 do 1 120 pozwala modelowi obsługiwać rozdzielczość do 2,51 megapiksela, co bezpośrednio przekłada się na jakość OCR przy gęstym tekście — wcześniej niska liczba tokenów wizyjnych była główną przyczyną „rozmytych" wyników na zdjęciach dokumentów i zrzutach ekranu (wg explainx.ai). Doświadczenia z dostrajania Gemma 4 do zadań LaTeX OCR pokazują jednak, że samo zwiększenie budżetu tokenów nie wystarczy — kluczowe pozostają dywersyfikacja danych treningowych i augmentacja obrazów (wg dev.to), co warto uwzględnić przy wdrożeniach w digitalizacji dokumentów czy automatycznym przetwarzaniu faktur.
