Klonika - AI News Portal
Thinking Machines Lab publikuje Inkling: otwarty model MoE z 975 mld parametrami i regulowanym wysiłkiem myślenia
Zdjęcie: Ron Lach · Pexels

Thinking Machines Lab publikuje Inkling: otwarty model MoE z 975 mld parametrami i regulowanym wysiłkiem myślenia

16 lipca 2026 13:03 44 · WAŻNE

W skrócie

  • Thinking Machines Lab wypuściło Inkling – otwarty model Mixture-of-Experts z 975 miliardami parametrów łącznie i 41 miliardami aktywnych, wytrenowany od zera na 45 bilionach tokenów tekstu, obrazów, dźwięku i wideo.
  • Model obsługuje okno kontekstowe do 1 miliona tokenów i wprowadza mechanizm kontroli wysiłku myślenia (reasoning_effort), dzięki któremu zużywa trzykrotnie mniej tokenów niż Nemotron 3 Ultra przy porównywalnych wynikach na Terminal Bench 2.1.
  • Zapowiedziano również mniejszy wariant Inkling-Small z 276 miliardami parametrów i 12 miliardami aktywnych, który na wielu testach dorównuje lub przewyższa większy model.

Thinking Machines Lab opublikowało Inkling – swój pierwszy model językowy wytrenowany od zera, udostępniony z otwartymi wagami i możliwością dostrajania przez platformę Tinker marktechpost.com.

Laboratorium pozycjonuje go przede wszystkim jako bazę do dalszej personalizacji, co sprawia, że architektura i możliwości kontroli zachowania modelu mają tu szczególne znaczenie.

Architektura: MoE z 975 miliardami parametrów

Inkling to transformer dekodujący oparty na architekturze Mixture-of-Experts (MoE) z 975 miliardami parametrów łącznie, z czego aktywnych jest 41 miliardów. Model obsługuje okno kontekstowe do 1 miliona tokenów. Pretrening obejmował 45 bilionów tokenów obejmujących tekst, obrazy, dźwięk i wideo. Na wejściu model przyjmuje tekst, obrazy i dźwięk; wyjście to wyłącznie tekst w formacie UTF-8 marktechpost.com.

Sieć składa się z 66 warstw z rzadką strukturą MoE w blokach feed-forward. Każda warstwa MoE zawiera 256 ekspertów kierowanych oraz 2 ekspertów współdzielonych. Na każdy token aktywuje się sześciu ekspertów kierowanych, a obaj eksperci współdzieleni działają przy każdym tokenie. Selekcją zajmuje się router oparty na funkcji sigmoid, korzystający z mechanizmu równoważenia obciążenia bez straty pomocniczej. Projekt warstwy MoE w dużej mierze wzoruje się na DeepSeek-V3 marktechpost.com.

Mechanizm uwagi odbiega od konwencji: warstwy z oknem przesuwnym i warstwy globalne przeplatają się w stosunku 5:1, z 8 głowicami KV. Zamiast popularnego RoPE zastosowano względne osadzanie pozycyjne, które – jak podaje laboratorium – lepiej ekstrapoluje na dłuższe sekwencje. Po projekcjach klucza i wartości oraz na wyjściach gałęzi rezydualnych stosowane są krótkie sploty marktechpost.com.

Multimodalność bez enkodera

Obsługa wielu modalności jest realizowana bez osobnego enkodera. Dźwięk trafia do modelu jako spektrogramy dMel, a obrazy są dzielone na fragmenty 40×40 pikseli przetwarzane przez czterowarstwowy moduł hMLP. Lekka warstwa osadzeń rzutuje obie modalności, po czym dekoder przetwarza je wspólnie z tokenami tekstowymi marktechpost.com.

Trening i uczenie przez wzmacnianie

Do treningu dużych macierzy wag użyto optymalizatora Muon, a do pozostałych parametrów – Adama, na systemach NVIDIA GB300 NVL72. Faza po-treningowa zaczęła się od dostrajania nadzorowanego (SFT) na danych syntetycznych, w tym wygenerowanych przez Kimi K2.5. Większość mocy obliczeniowej pochłonęło asynchroniczne uczenie przez wzmacnianie (RL), które przekroczyło 30 milionów rozwinięć i poprawiało wyniki w sposób log-liniowy przez cały czas trwania marktechpost.com.

Kontrolowalny wysiłek myślenia

Kluczową innowacją Inkling jest mechanizm regulacji wysiłku myślenia. Podczas uczenia przez wzmacnianie zespół badawczy sterował wysiłkiem, zmieniając komunikat systemowy i dostosowując koszt na token. Model nauczył się w ten sposób przeznaczać różne budżety tokenów na różne zadania. W opublikowanym materiale wysiłek jest skalowany od 0,2 do 0,99, a w bibliotece transformers kontrola ta jest dostępna jako argument reasoning_effort z nazwanymi poziomami marktechpost.com.

Efekty są wymierne: Inkling zużywa trzykrotnie mniej tokenów niż Nemotron 3 Ultra przy równoważnej wydajności na benchmarku Terminal Bench 2.1. Koszt i opóźnienie stają się tym samym parametrami konfigurowalnymi per wywołanie, a nie stałymi właściwościami modelu marktechpost.com.

Wyniki na benchmarkach

Wszystkie testy Inkling przeprowadzono przy wysiłku 0,99 i temperaturze 1,0, z limitem trajektorii 256K dla zadań programistycznych. Część wyników pochodzi z zewnętrznych pomiarów Artificial Analysis marktechpost.com.

| Benchmark | Inkling | Nemotron 3 Ultra | Kimi K2.6 | GLM 5.2 | DeepSeek V4 Pro | |---|---|---|---|---|---| | HLE (tylko tekst) | 29,7% | 26,6% | 35,9% | 40,1% | 35,9% | | AIME 2026 | 97,1% | 94,2% | 96,4% | 99,2% | 96,7% | | GPQA Diamond | 87,2% | 86,7% | 91,1% | 89,5% | 88,8% | | SWEBench Verified | 77,6% | 70,7% | 80,2% | 80,0% | 80,6% | | Terminal Bench 2.1 | 63,8% | 56,4% | 71,3% | 82,7% | 64,0% | | MCP Atlas | 74,1% | 44,7% | 68,1% | 77,8% | 73,2% | | SimpleQA Verified | 43,9% | 32,4% | 38,7% | 38,1% | 57,0% | | IFBench | 79,8% | 81,4% | 76,0% | 73,3% | 76,5% | | FORTRESS (Adversarial) | 78,0% | 77,6% | 65,6% | 71,3% | 36,0% |

Inkling wyróżnia się szczególnie w teście FORTRESS mierzącym odporność na ataki adversarialne oraz w MCP Atlas, gdzie przewyższa większość rywali. W zadaniach matematycznych (AIME 2026) i programistycznych (SWEBench) plasuje się w czołówce, choć nie zawsze na pierwszym miejscu marktechpost.com.

Inkling-Small już w drodze

Laboratorium zapowiedziało również Inkling-Small – wariant MoE z 276 miliardami parametrów i 12 miliardami aktywnych. Mniejszy model dorównuje lub przewyższa większego brata na wielu benchmarkach. Jego wagi zostaną udostępnione po zakończeniu testów marktechpost.com.

Co to oznacza

Pojawienie się Inkling jako modelu z w pełni otwartymi wagami i możliwością dostrajania to istotny sygnał dla rynku. Dotychczas modele tej skali (975 miliardów parametrów) były dostępne wyłącznie przez API zamkniętych dostawców. Otwarcie wag oznacza, że organizacje dysponujące odpowiednią infrastrukturą mogą wdrożyć model lokalnie, dostosować go do własnych danych i zachować pełną kontrolę nad przetwarzanymi informacjami – co ma szczególne znaczenie w branżach regulowanych, takich jak finanse, ochrona zdrowia czy administracja publiczna.

Mechanizm kontroli wysiłku myślenia ma bezpośrednie przełożenie na ekonomikę wdrożeń. Możliwość trzykrotnego zmniejszenia zużycia tokenów przy zachowaniu porównywalnej jakości oznacza realne oszczędności w środowiskach produkcyjnych, gdzie koszt wnioskowania jest jednym z głównych ograniczeń skalowalności. Dla polskich firm i zespołów deweloperskich budujących aplikacje oparte na dużych modelach językowych to argument za rozważeniem Inkling jako alternatywy dla płatnych API.

Warto też zwrócić uwagę na fakt, że Thinking Machines Lab wytrenowało model od zera, korzystając z danych syntetycznych generowanych m.in. przez Kimi K2.5 – co pokazuje rosnące znaczenie syntetycznych danych treningowych jako sposobu na obejście ograniczeń dostępności danych rzeczywistych. Zapowiedź Inkling-Small sugeruje, że laboratorium planuje budować ekosystem modeli o różnej skali, co może przyciągnąć deweloperów szukających rozwiązań dopasowanych do różnych budżetów obliczeniowych.

Szerszy kontekst

Regulowany wysiłek myślenia pozwala Inkling osiągnąć wynik Nemotron 3 Ultra w Terminal Bench 2.1 używając mniej więcej jednej trzeciej tokenów.

technology.org

Licencjonowany na zasadach Apache 2.0, Inkling przyjmuje tekst, obrazy i audio, a generuje tekst. Model wyróżnia się w kodowaniu, systemach agentowych i wywoływaniu narzędzi, RAG, czacie, aplikacjach wielojęzycznych i zadaniach multimodalnych. Pełne wagi BF16 wymagają co najmniej 1,9 TB miejsca na dysku — nasze dynamiczne pliki GGUF zmniejszają to do 270–285 GB przy dynamicznym 1-bicie i 317 GB przy 2-bitach.

unsloth.ai

Inkling to 66-warstwowy, rzadki transformer typu mixture-of-experts z 975 miliardami parametrów łącznie, 41 miliardami aktywnych parametrów i oknem kontekstowym do 1 miliona tokenów. [...] Inkling jest pierwszym modelem z nowej rodziny, a ponieważ Thinking Machines Lab chce uczynić dostosowywanie dostępnym dla szerszego grona zastosowań, firma udostępnia dziś pełne wagi i umożliwia dostrajanie modelu na platformie Tinker.

baseten.co

Analiza

Pojawienie się Inkling to jeden z wyraźniejszych sygnałów, że era modeli granicznych dostępnych wyłącznie przez zamknięte API dobiega końca. Thinking Machines Lab udostępniło pełne wagi modelu o skali 975 miliardów parametrów na licencji Apache 2.0 — co oznacza, że każda organizacja dysponująca odpowiednią infrastrukturą może go uruchomić lokalnie, bez uzależnienia od zewnętrznego dostawcy. Barierą pozostaje jednak sprzęt: pełne wagi w formacie BF16 wymagają co najmniej 1,9 terabajta przestrzeni dyskowej, choć — jak wskazuje (wg unsloth.ai) — skwantyzowane wersje dynamiczne obniżają ten próg do 270–317 gigabajtów przy zachowaniu około 74% dokładności. To wciąż infrastruktura dostępna raczej dla dużych firm i instytucji niż dla małych zespołów deweloperskich.

Strategicznie najciekawszym elementem Inkling nie jest sama skala, lecz mechanizm kontroli wysiłku myślenia wbudowany już na etapie treningu przez wzmacnianie. Możliwość regulowania budżetu tokenów per wywołanie — od poziomu 0,2 do 0,99 — przekształca koszt wnioskowania z właściwości modelu w konfigurowalny parametr aplikacji. Trzykrotna oszczędność tokenów względem Nemotron 3 Ultra przy porównywalnej wydajności na Terminal Bench 2.1 to argument ekonomiczny, który może przeważyć przy decyzjach o wyborze modelu w środowiskach produkcyjnych o dużym natężeniu zapytań. Warto też odnotować, że (wg baseten.co) Inkling był dostępny na platformie Baseten już w dniu premiery, co sugeruje przemyślaną strategię dystrybucji i gotowość ekosystemu narzędziowego.

Istotnym kontekstem jest też sposób, w jaki model powstał: dane syntetyczne generowane m.in. przez Kimi K2.5 stanowiły część materiału treningowego fazy po-treningowej, a sam projekt warstw MoE wzoruje się wprost na DeepSeek-V3. Thinking Machines Lab nie ukrywa tych zależności, co pokazuje, że współczesne laboratoria coraz częściej budują na dorobku innych otwartych projektów zamiast zaczynać od zera w każdym wymiarze. Zapowiedź Inkling-Small — 276 miliardów parametrów z 12 miliardami aktywnymi, który według (wg technology.org) na benchmarku IFBench osiąga 83,4% wobec 79,8% większego brata — sugeruje, że laboratorium świadomie buduje ekosystem modeli o różnej skali, celując w segmenty rynku o różnych możliwościach obliczeniowych.

Opracowanie: Klonika.pl