Cohere North Mini Code: otwarty model 30B do agentycznego programowania dostępny na Hugging Face
W skrócie
- Cohere udostępniło na licencji Apache 2.0 model North Mini Code — architekturę Mixture-of-Experts o 30 miliardach parametrów (3 miliardy aktywnych), zaprojektowaną do agentycznych zadań programistycznych.
- Model uzyskał wynik 33,4 w indeksie kodowania Artificial Analysis, przewyższając znacznie większe modele open-source, takie jak Nemotron 3 Super (120B-A12B) czy Devstral 2 (123B).
- Trening obejmował ponad 70 000 weryfikowalnych zadań z około 5 000 unikalnych repozytoriów, a cały potok uczenia łączył dwuetapowe dostrajanie nadzorowane z uczeniem przez wzmacnianie opartym na weryfikowalnych nagrodach.
Cohere opublikowało North Mini Code — pierwszy model z nowej rodziny modeli firmy, dostępny publicznie na platformie Hugging Face na licencji Apache 2.0 huggingface.co.
To model klasy Mixture-of-Experts (MoE) o łącznej liczbie 30 miliardów parametrów, z których aktywnych jest jednocześnie 3 miliardy. Został zaprojektowany i wytrenowany z myślą o agentycznych zadaniach inżynierii oprogramowania.
Architektura: rzadka sieć ekspertów z uwagą przesuwanego okna
North Mini Code to dekodujący Transformer oparty na rzadkiej architekturze Mixture-of-Experts. Mechanizm uwagi jest przeplatany między uwagą przesuwanego okna z kodowaniem pozycyjnym RoPE a uwagą globalną bez osadzania pozycji, w stosunku 3:1 huggingface.co.
Blok feed-forward to blok MoE ze 128 ekspertami, z których 8 jest aktywowanych dla każdego tokenu. Każdy blok eksperta używa aktywacji SwiGLU, a router stosuje funkcję sigmoid do logitów przed selekcją top-k. Przed warstwami rzadkimi zastosowano jedną gęstą warstwę.
Wyniki benchmarkowe: lepszy od modeli wielokrotnie większych
Na indeksie kodowania Artificial Analysis North Mini Code osiągnął wynik 33,4, przewyższając modele o zbliżonej wielkości — Qwen3.5 (35B-A3B), Gemma 4 (26B-A4B) oraz Devstral Small 2 (24B Dense) — a także modele znacznie większe: Nemotron 3 Super (120B-A12B), Mistral Small 4 (119B-A6B) i Devstral 2 (123B) huggingface.co.
Plasuje go to wśród najsilniejszych otwartych modeli do kodowania w swojej klasie rozmiarowej.
Kluczowym założeniem projektowym było unikanie optymalizacji pod kątem jednego konkretnego środowiska testowego. Model trenowano z użyciem wielu różnych szkieletów agentycznych (ang. scaffolds), co czyni go solidną podstawą dla agentów kodujących, takich jak OpenCode huggingface.co.
Potok treningu: od dostrajania nadzorowanego do uczenia przez wzmacnianie
Proces uczenia po wstępnym treningu (post-training) składał się z trzech etapów huggingface.co:
- Etap 1 — dostrajanie nadzorowane (SFT): mieszanka danych obejmuje programowanie, rozumowanie i wykonywanie instrukcji w wielu domenach. Dane dotyczące kodu stanowią 70% tokenów treningowych, z czego 43% to dane agentycznego użycia narzędzi, a 27% to dane z jednokrotnych zadań programistycznych o charakterze konkursowym lub naukowym. Kontekst: 64 000 tokenów.
- Etap 2 — SFT wysokiej jakości: mieszanka 4,5 miliarda tokenów złożona wyłącznie z próbek agentycznych i opartych na rozumowaniu. Dane dotyczące kodu stanowią 61% tokenów treningowych. Wywołania narzędzi i uzupełnienia są weryfikowane pod kątem wykonywalności i poprawności. Kontekst: 128 000 tokenów.
- Etap 3 — uczenie przez wzmacnianie z weryfikowalnymi nagrodami (RLVR): skupione na agentycznym kodowaniu.
Takie kaskadowe podejście „od długiego do dłuższego" pozwoliło najpierw zbudować solidną bazę wydajności na krótszych danych, a następnie przeprowadzić trening długiego kontekstu wyłącznie na wysokiej jakości zweryfikowanych próbkach huggingface.co.
Bez treningu wieloetapowego 20 miliardów tokenów niekodowych w pierwszym etapie dominowało nad 1,5 miliarda tokenów wysokiej jakości kodu w późniejszych etapach, co prowadziło do gorszych wyników i większych konfliktów behawioralnych.
Dane treningowe: ponad 70 000 zadań z realnych repozytoriów
Wewnętrzny potok danych Cohere opiera się na skonteneryzowanych środowiskach agentycznego kodowania huggingface.co.
Łącznie wykorzystano ponad 70 000 weryfikowalnych zadań z około 5 000 unikalnych repozytoriów. Większość środowisk pochodzi z rzeczywistych repozytoriów zadań inżynierii oprogramowania, a pozostałe to agentyczne zadania terminalowe z otwartych i wewnętrznych zbiorów danych. Środowiska zostały zdeduplikowane względem źródeł repozytoriów z benchmarków SWE-Bench i SWE-Bench-Pro, aby uniknąć wycieku danych podczas ewaluacji.
Zamiast optymalizować model pod kątem ilościowych metryk podczas SFT, Cohere przyjęło podejście traktujące dostrajanie nadzorowane wyłącznie jako „przygotowanie gruntu" pod RLVR. Mieszanka danych optymalizuje różnorodność próbkowania i wskaźnik pass@K (dla wysokich K) w kolejnych etapach huggingface.co.
Co to oznacza
Publikacja North Mini Code na licencji Apache 2.0 oznacza, że każdy deweloper, startup czy przedsiębiorstwo może swobodnie korzystać z modelu, dostrajać go i wdrażać we własnych produktach — bez opłat licencyjnych i bez ograniczeń komercyjnych. To istotne dla polskich firm technologicznych szukających otwartych alternatyw dla zamkniętych modeli kodujących oferowanych przez OpenAI czy Anthropic.
Fakt, że model o zaledwie 3 miliardach aktywnych parametrów przewyższa modele ponad 40-krotnie większe pod względem aktywnych parametrów (jak Devstral 2 z 123 miliardami parametrów), pokazuje dojrzałość architektury MoE jako podejścia do efektywnego wnioskowania. Dla organizacji wdrażających modele lokalnie lub na własnej infrastrukturze oznacza to realną możliwość uruchomienia wydajnego agenta kodującego na sprzęcie klasy konsumenckiej lub niewielkim klastrze serwerowym.
Podejście Cohere do treningu — z naciskiem na robustność względem wielu środowisk agentycznych zamiast optymalizacji pod jeden benchmark — jest sygnałem dojrzałości całej branży. Modele trenowane „pod testy" często zawodzą w produkcji; North Mini Code jest projektowany z myślą o odwrotnym scenariuszu. Dla zespołów budujących agenci kodujące w Polsce i Europie oznacza to model, który powinien zachowywać się przewidywalnie w różnych szkieletach agentycznych, a nie tylko w laboratoryjnych warunkach benchmarkowych.
Szerszy kontekst
North Mini Code to wydanie badawcze modelu o otwartych wagach z 30B-A3B parametrami, zoptymalizowanego pod kątem generowania kodu, agentowego inżynierii oprogramowania i zadań terminalowych.
Aby użyć naszego modelu w transformers, należy skorzystać z wag modelu w formacie BF16. Nasz checkpoint NVFP4_W4A16 jest przeznaczony do użytku z vLLM i MLX-VLM i nie jest kompatybilny z transformers ze względu na brak natywnej obsługi 4-bitowej.
Architektura to dekodujący rzadki projekt MoE ze 128 ekspertami, z których osiem aktywuje się na token, przeplatając uwagę przesuwnego okna i pełną samo-uwagę w stosunku 3:1. Model jest dostarczany z oknem kontekstowym 256 000 tokenów i może generować do 64 000 tokenów w jednym przebiegu — wystarczająco dużo, aby wchłonąć całą średniej wielkości bazę kodu i przepisać jej duże fragmenty za jednym razem.
Oficjalne wydanie Cohere raportuje wynik 33,4 w Artificial Analysis Coding Index oraz przepustowość do 2,8 razy większą niż Devstral Small 2.
North Mini Code to pierwszy model w nowej rodzinie modeli Cohere, zaprojektowany i wytrenowany specjalnie do agentowych zadań inżynierii oprogramowania.
Analiza
Najważniejszym wnioskiem płynącym z publikacji North Mini Code jest to, że Cohere dokonało strategicznego zwrotu w kierunku społeczności open-source — po latach koncentracji wyłącznie na klientach korporacyjnych. Jak zauważa (wg tech-insider.org), strategia ta jest celowa: otwarte wagi pod licencją Apache 2.0 mają przyciągnąć deweloperów i niezależnych twórców, którzy z czasem stają się wektorem adopcji w przedsiębiorstwach. Model jest dostępny przez Hugging Face, Cohere API oraz OpenRouter, a współzałożyciel firmy Nick Frosst publicznie zademonstrował jego działanie lokalnie na Mac Studio przy użyciu frameworka MLX firmy Apple, zużywając około 2 0 gigabajtów pamięci. Równolegle Cohere kontynuuje rozwój flagowych modeli korporacyjnych — w maju 2 0 2 6 roku firma wypuściła Command A+ łączący wizję, rozumowanie i zdolności agentyczne.
Z technicznego punktu widzenia szczególnie istotne są dwa parametry, które artykuł pomija lub wymienia skrótowo. Po pierwsze, okno kontekstowe wynosi 2 5 6 0 0 0 tokenów przy maksymalnej długości generowania 6 4 0 0 0 tokenów (wg marktechpost.com i tech-insider.org) — co oznacza możliwość przetworzenia całej średniej wielkości bazy kodu w jednym przebiegu. Po drugie, model działa na pojedynczej karcie Nvidia H1 0 0 przy precyzji FP8, a wagi są dostępne zarówno w formacie BF16, jak i skwantyzowanym W4A16 (wg huggingface.co). Przepustowość modelu jest według Cohere do 2,8 raza wyższa niż Devstral Small 2 (wg marktechpost.com), co czyni go atrakcyjnym nie tylko pod względem jakości, ale i kosztów wnioskowania.
Trójstopniowy potok treningu — od szerokiego dostrajania nadzorowanego, przez wysokiej jakości dane agentyczne, po uczenie przez wzmacnianie z weryfikowalnymi nagrodami — reprezentuje podejście, które branża zaczyna traktować jako standard dla modeli przeznaczonych do rzeczywistych zastosowań produkcyjnych. Kluczowe jest tu celowe unikanie optymalizacji pod konkretne testy: dane treningowe zostały zdeduplikowane względem repozytoriów używanych w benchmarkach SWE-Bench i SWE-Bench-Pro, a model trenowano na wielu różnych szkieletach agentycznych. Dla zespołów inżynierskich w Polsce i Europie, które rozważają wdrożenie agentów kodujących na własnej infrastrukturze, North Mini Code oferuje rzadką kombinację: otwarte wagi, licencję dopuszczającą zastosowania komercyjne, niskie wymagania sprzętowe i architekturę zaprojektowaną z myślą o przewidywalnym zachowaniu poza środowiskiem laboratoryjnym.
