Nvidia zverejnila nový model s názvom Nemotron 3 Diarization, ktorý dokáže v reálnom čase určiť, kto z prítomných práve hovorí. Rozpoznávanie rečníkov, odborne nazývané diarizácia, patrí medzi menej viditeľné, no v praxi veľmi užitočné úlohy spracovania reči. Nvidia model uvoľnila zadarmo aj s váhami na platforme Hugging Face, takže si ho môže stiahnuť a nasadiť ktokoľvek bez licenčného poplatku.
Doterajšie nástroje na prepis rozhovorov si väčšinou poradili s jedným hovoriacim v tichom prostredí, no zlyhávali pri bežnej situácii, keď sa pri stole alebo v hovore strieda viacero ľudí a niekedy si aj skáču do reči. Práve na tento problém sa Nemotron 3 Diarization zameriava a Nvidia ho zverejnila ako súčasť rodiny malých, špecializovaných modelov Nemotron, ktoré firma stavia popri svojich veľkých jazykových modeloch.
Čo model dokáže
Nemotron 3 Diarization má približne 100 miliónov parametrov, čo je na dnešné pomery malý model. Napriek tomu dokáže rozlíšiť až osem rečníkov v jednej nahrávke a rozpoznať aj chvíle, keď hovoria viacerí naraz. Funguje pri nahrávkach aj pri živom zvuku, takže sa dá použiť napríklad počas prebiehajúceho hovoru alebo videokonferencie. V kombinácii so systémom na rozpoznávanie reči, akým je Nvidia Parakeet, dokáže vytvoriť prepis rozhovoru, v ktorom je pri každej vete označené, ktorý rečník ju povedal, hoci len anonymne, napríklad ako speaker_2.
Presnejší než predchodca
Na benchmarku Diarization-Bench od VoiceArena dosiahol model chybovosť DER 14,7 percenta, čím sa dostal na prvé miesto pred ďalší najlepší systém, ktorý má chybovosť 19,3 percenta. DER, teda diarization error rate, počíta všetky chyby vrátane prekrývajúcej sa reči a nepresného určenia hranice medzi rečníkmi, takže ide o prísne meranú metriku. Voči predchádzajúcemu modelu Streaming Sortformer je nový Nemotron presnejší v priemere o 41 percent naprieč ôsmimi testovacími scenármi. Model si vie nastaviť dĺžku zvukového buffera na jednu zo štyroch úrovní, od 30,4 sekundy až po 0,32 sekundy. Kratší buffer znamená nižšie oneskorenie, ale spravidla aj o niečo nižšiu presnosť.
Trénovanie na skutočných aj simulovaných rozhovoroch
Nvidia model trénovala na kombinácii reálnych nahrávok, napríklad z korpusu Fisher English alebo AMI Meeting Corpus, v celkovom rozsahu okolo 10-tisíc hodín, a na simulovaných nahrávkach s jedným až ôsmimi hovoriacimi, ktoré vznikli pomocou nástroja FastMSS. Váhy modelu sú dostupné pod licenciou openmdw-1.1, ktorá dovoľuje voľné použitie vrátane komerčného nasadenia. Podobne ako pri hlasovom modeli Gemini 3.8 Live, ktorý nedávno spustil Google, ide o ďalší krok k tomu, aby sa AI dokázala vyrovnať s bežnou, neusporiadanou rečou viacerých ľudí naraz, nielen s jedným hovoriacim v tichom prostredí.
Kde má model hranice
Nvidia zároveň priznáva, že presnosť modelu klesá pri vyššom počte hovoriacich, pri silnom hluku na pozadí alebo pri ozvene v miestnosti. Ide teda o nástroj, ktorý funguje najlepšie v bežných kancelárskych alebo domácich podmienkach, nie v hlučnej prevádzke či na vzdialenom mikrofóne v rozľahlej miestnosti. Nemotron 3 Diarization navyše sám o sebe nerozpoznáva slová, len určuje, kto a kedy hovoril, preto ho firmy nasadzujú vždy spolu s ďalším modelom na rozpoznávanie reči.
Čo to znamená pre firmy
Rozpoznávanie rečníkov využívajú najmä nástroje na prepis porád, call centrá, ktoré potrebujú oddeliť hlas operátora od hlasu klienta, alebo aplikácie na automatické zápisnice. Keďže je model malý a voľne dostupný, firmy si ho môžu nasadiť na vlastnej infraštruktúre bez toho, aby museli zvukové záznamy posielať do cloudu tretej strany, čo môže byť výhoda pri práci s citlivými nahrávkami, napríklad v zdravotníctve alebo v bankovníctve. Pre menšie firmy na Slovensku, ktoré uvažujú nad automatizáciou prepisov porád či hovorov so zákazníkmi, je práve otvorená licencia dôvodom, prečo tento typ modelu sledovať, aj keď nasadenie do produkčného prostredia si stále vyžaduje vlastný technický tím alebo dodávateľa. Podobný technický posun smerom k lacnejším a rýchlejším modelom vidno aj pri vývoji odolných kvantových počítačov, kde Nvidia tiež hľadá spôsoby, ako spracovať väčší objem dát pri nižších nákladoch.



