Článek
Přepis dlouhé porady obvykle nekončí ve chvíli, kdy řečníci domluví. Záznam je často nutné znovu poslouchat, oddělit jednotlivé hlasy a opravit místa, kde se lidé překřikovali. Meta nyní představila systém, který má většinu této práce zvládnout už během samotného rozhovoru.
Model Muse Voice Transcribe vznikl v laboratořích Meta Superintelligence Labs. Jde o první technologii společnosti Meta určenou přímo pro živý přepis zvuku. Kromě převodu řeči do textu rozpoznává také změny mluvčích a vytváří přepis, ve kterém lze jednotlivé účastníky odlišit.
Podle společnosti může systém pracovat s rozhovorem, do kterého se zapojí více než 20 lidí. Nemusí přitom jít o dokonale čistou studiovou nahrávku. Model byl připravován také na běžný zvuk s hlukem, přerušováním a delšími debatami.
Přepis se přizpůsobuje složitosti slov
Meta se u nového modelu nesoustředila pouze na rychlost. Muse Voice Transcribe průběžně rozhoduje, kdy už slyšel dostatečnou část slova a může ji bezpečně zapsat.
Zvuk zpracovává po úsecích dlouhých 80 milisekund. U běžných a snadno rozpoznatelných výrazů vytvoří přepis téměř okamžitě. U složitějších slov nebo méně zřetelné výslovnosti si počká na další část věty. Tento postup má snížit počet chybných odhadů, aniž by text za mluvčím výrazně zaostával.
Výraznou funkcí je také schopnost zachytit střídání jazyků. Model dokáže pokračovat v přepisu i ve chvíli, kdy řečník přejde do jiného jazyka nebo použije cizí výraz uprostřed věty. Meta uvádí, že při vývoji pracovala s více než 70 jazyky. Při uvedení modelu ověřila jeho schopnosti u 25 z nich.
Ve zveřejněné ukázce systém přepisoval rozhovor několika lidí, kteří střídali angličtinu a čínštinu. Přepis přitom automaticky odděloval jejich jednotlivé promluvy.
Novinka míří do aplikací i k vývojářům
Muse Voice Transcribe mohou jako první využít majitelé počítačů Mac prostřednictvím aplikace Meta AI. Hlasové diktování lze použít také při práci v dalších programech. Přepsaný text se vloží přímo do otevřené aplikace.
Vývojáři získali přístup přes prostředí Muse Code a rozhraní Meta Model API. Cena byla stanovena na tři dolary za tisíc minut zpracovaného zvuku. Meta současně zveřejnila demonstrační verzi, na které si lze schopnosti modelu vyzkoušet.
Představení přichází krátce po uvedení konkurenčního modelu Gemini 3.5 Transcribe od Googlu. Zatímco Google plánuje širší propojení s Androidem a prohlížečem Chrome, Meta neoznámila, zda nový přepis nasadí také do Messengeru, WhatsAppu nebo Facebooku.
Právě komunikační služby by však pro podobnou technologii dávaly smysl. Automatické zápisy z videohovorů, rozhovorů nebo pracovních porad by mohly být jedním z prvních praktických využití, které uživatelé pocítí přímo při běžné práci.
Zdroj: Engadget.com

