Klonika - AI News Portal
MuScriptor od Kyutai: otwarty model AI do transkrypcji muzyki wieloinstrumentalnej na MIDI
Zdjęcie: Jana T. · Pexels

MuScriptor od Kyutai: otwarty model AI do transkrypcji muzyki wieloinstrumentalnej na MIDI

11 lipca 2026 07:00 22 · CIEKAWOSTKA

W skrócie

  • Francuskie laboratorium Kyutai opublikowało MuScriptor — otwarty model transformerowy do automatycznej transkrypcji muzyki wieloinstrumentalnej do formatu MIDI.
  • Model oparty jest na architekturze dekodera i udostępniony z otwartymi wagami, co umożliwia swobodne wykorzystanie przez badaczy i twórców.
  • MuScriptor wpisuje się w rosnący trend otwartych narzędzi AI dla przemysłu muzycznego, oferując alternatywę dla zamkniętych rozwiązań komercyjnych.

Francuskie laboratorium badawcze Kyutai opublikowało MuScriptor — model sztucznej inteligencji przeznaczony do automatycznej transkrypcji muzyki wieloinstrumentalnej do formatu MIDI marktechpost.com.

Narzędzie udostępniono z otwartymi wagami, co oznacza, że każdy badacz lub twórca oprogramowania może je pobrać, uruchomić i dostosować do własnych potrzeb bez konieczności uzyskiwania licencji komercyjnej.

Architektura i działanie modelu

MuScriptor zbudowany jest na architekturze transformera działającego wyłącznie jako dekoder — podejście znane przede wszystkim z dużych modeli językowych, tutaj zastosowane do zadania muzycznego marktechpost.com.

Model przyjmuje na wejściu nagranie audio zawierające wiele instrumentów i przekształca je w zapis MIDI, czyli ustrukturyzowaną reprezentację nut, rytmu i dynamiki, którą można następnie edytować w dowolnym oprogramowaniu do produkcji muzycznej.

Transkrypcja wieloinstrumentalna to jedno z trudniejszych zadań w dziedzinie rozumienia muzyki przez maszyny. Systemy muszą jednocześnie rozdzielić sygnały akustyczne poszczególnych instrumentów, przypisać im właściwe wysokości dźwięków i odwzorować timing z wystarczającą precyzją, by wynikowy plik MIDI był użyteczny w praktyce marktechpost.com.

Otwarte wagi jako strategia Kyutai

Kyutai konsekwentnie realizuje strategię otwartego publikowania swoich modeli. Udostępnienie wag MuScriptora pozwala społeczności badawczej na niezależną weryfikację wyników, dostrajanie modelu do specyficznych gatunków muzycznych czy instrumentarium, a także integrację z istniejącymi narzędziami do edycji i analizy muzyki marktechpost.com.

Co to oznacza

Automatyczna transkrypcja muzyki do MIDI to technologia o szerokim zastosowaniu praktycznym — od digitalizacji archiwalnych nagrań i tworzenia podkładów do nauki gry na instrumentach, po wspomaganie kompozytorów i producentów muzycznych w pracy z istniejącym materiałem dźwiękowym. Dotychczas narzędzia tej klasy były albo zamknięte i płatne, albo ograniczone do pojedynczych instrumentów.

Dla polskich muzyków, producentów i badaczy zajmujących się muzykologią obliczeniową pojawienie się otwartego modelu wieloinstrumentalnego oznacza realny dostęp do technologii, która wcześniej wymagała kosztownych licencji lub własnych zasobów obliczeniowych do trenowania od zera. Otwarte wagi umożliwiają też dostosowanie modelu do specyfiki muzyki tradycyjnej czy folkowej, gdzie dostępność danych treningowych jest ograniczona.

Wpisując się w szerszy trend otwartych modeli AI — widoczny m.in. w działaniach Mety czy Mistral AI — Kyutai pokazuje, że europejskie laboratoria badawcze mogą skutecznie konkurować z komercyjnymi graczami, oferując narzędzia dostępne bez barier licencyjnych. Dla ekosystemu technologii muzycznej to istotny krok w kierunku demokratyzacji zaawansowanych narzędzi AI.

Szerszy kontekst

MuScriptor to model transkrypcji muzyki o otwartych wagach, opracowany przez zespół badaczy z Kyutai i Mirelo. Zamienia pełny miks wieloinstrumentalny na MIDI, wytrenowany na 170 000 prawdziwych nagrań z różnych gatunków. W swojej istocie MuScriptor jest transformerem dekodującym.

youtube.com

Wydanie zawiera trzy warianty wagowe dostępne na Hugging Face. Ich rozmiary to: small (103M), medium (307M, domyślny) oraz large (1,4B). Kod do inferencji jest objęty licencją MIT. Wagi modelu objęte są licencją CC BY-NC 4.0, co oznacza ograniczenia w zastosowaniach komercyjnych.

marktechpost.com

Właśnie wydaliśmy model transkrypcji muzyki we współpracy z Kyutai. Wypróbowałem go: czysto wychwytuje linie harfy i skrzypiec, nawet wewnątrz pełnej orkiestry z improwizacji Jacoba Colliera.

linkedin.com

Udostępniamy MuScriptor — model (wraz z wagami i kodem do inferencji) przeznaczony do ogólnego zastosowania w transkrypcji muzyki wieloinstrumentalnej w różnorodnych stylach muzycznych. Do jego trenowania zebraliśmy zbiór danych składający się z 170 tys. nagrań (11 tys. godzin) z wyrównywanymi adnotacjami nut, obejmujący większość gatunków muzycznych, a także syntetyczny zbiór danych zawierający 1,45 mln plików MIDI.

arxiv.org

Analiza

MuScriptor to efekt współpracy Kyutai z Mirelo — nie samodzielny projekt jednego laboratorium, jak sugeruje artykuł. Model osiąga wynik Multi F1 na poziomie 48,2 wobec 21,9 dla dotychczasowego punktu odniesienia YourMT3+, co oznacza ponad dwukrotną poprawę na standardowych benchmarkach transkrypcji wieloinstrumentalnej (wg youtube.com). Dostępny jest w trzech wariantach wagowych: small (103 mln parametrów), medium (307 mln, domyślny) i large (1,4 mld), przy czym kod wnioskowania objęty jest licencją MIT, natomiast same wagi — CC BY-NC 4.0, co oznacza ograniczenia dla zastosowań komercyjnych (wg marktechpost.com). To istotne zastrzeżenie, które artykuł pomija: „otwarte wagi" nie są tu równoznaczne z pełną swobodą komercyjną.

Kluczowym wkładem badawczym jest nie architektura, lecz strategia danych i trzyetapowy proces trenowania (wg arxiv.org). Najpierw model jest wstępnie trenowany na około 1,45 mln syntetycznych plików MIDI generowanych w locie z ponad 250 zestawów brzmień, następnie dostrajany na 170 000 rzeczywistych nagrań (łącznie ponad 11 000 godzin) z wyrównaniem nut metodą dynamicznego dopasowania czasowego, a na końcu stosowane jest uczenie przez wzmacnianie w stylu GRPO na małym zbiorze wysokiej jakości transkrypcji. Syntetyczne wstępne trenowanie okazuje się szczególnie wartościowe w warunkach ograniczonych danych — podnosi offset F1 z 9,9 do 33,4 przy zaledwie 1% rzeczywistych danych treningowych (wg youtube.com). To ważna obserwacja dla zastosowań w muzyce tradycyjnej czy folkowej, gdzie zasoby treningowe są z natury skromne.

Praktyczne znaczenie tego wydania wykracza poza sam model. Mirelo udostępnia MuScriptor również przez własną platformę, co obniża próg wejścia dla muzyków nieposiadających zasobów obliczeniowych (wg linkedin.com). Dla ekosystemu muzykologii obliczeniowej i produkcji muzycznej pojawienie się otwartego modelu o takiej skuteczności — obsługującego gatunki od muzyki klasycznej po heavy metal — zmienia układ sił na rynku narzędzi do transkrypcji, gdzie dotychczas dominowały rozwiązania zamknięte lub ograniczone do jednego instrumentu.

Opracowanie: Klonika.pl