Xiaomi uruchomiła OmniVoice – otwarty model AI, który potrafi odczytywać teksty praktycznie w każdym języku i kopiować głosy.

Xiaomi uruchomiła OmniVoice – otwarty model AI, który potrafi odczytywać teksty praktycznie w każdym języku i kopiować głosy.

21 software

Xiaomi przedstawiła otwarty moduł AI OmniVoice

Firma ogłosiła uruchomienie modelu sztucznej inteligencji OmniVoice, który przekształca tekst w mowę. Poza syntezą głosu w setkach języków, model potrafi klonować głos i generować wymowę z indywidualnymi ustawieniami.

Co nowego w OmniVoice?
WskaźnikOpisJęzykiWsparcie ponad 200 języków, w tym rzadkich i trudnych do nauczania. Nawet przy mniej niż 10 godzinach danych model wydaje mowę „prawie na każdym języku”.JakośćTesty na 102 językach rozpoznawalność mowy była porównywalna z ludzką, a w niektórych przypadkach ją przewyższała. Na 24 językach model przewyższył kilka komercyjnych systemów pod względem podobieństwa i rozróżnialności.JednostkaArchitekturaUproszczona dwukierunkowa sieć transformera bez pośrednich modułów prognozowania tokenów. Skraca to czas szkolenia do jednego dnia przy 100 000 godzin danych i zwiększa prędkość inferencji (do 40× czasu rzeczywistego w PyTorch).Technologie• „Losowe ukrywanie akustycznych kodów” – przyspiesza uczenie.• Połączenie dużego modelu językowego podczas wstępnego szkolenia poprawia wymowę i rozróżnialność.

Praktyczne możliwości
1. Klonowanie głosu

- Generowanie mowy na podstawie opisanych cech (wiek, płeć, ton, akcent, dialekt).

- Możliwość tworzenia szeptu i innych wariantów stylistycznych bez referencyjnego audio.

2. Przetwarzanie nagrań źródłowych

- Usuwanie szumów i wydobywanie czystych cech głosu nawet z nieidealnych plików.

3. Sterowanie intonacją

- Dodawanie westchnień, śmiechu i innych niuansów dla bardziej naturalnego brzmienia.

4. Dokładna korekta wymowy

- Ręczne dostosowanie skomplikowanych dźwięków, np. wieloznacznych chińskich znaków lub anglojęzycznych nazw własnych.

Wnioski
OmniVoice stanowi konkurencyjną alternatywę dla istniejących komercyjnych systemów syntezy mowy. Dzięki prostemu projektowi, wysokiej prędkości szkolenia i inferencji oraz szerokim możliwościom personalizacji, model jest gotowy do integracji w aplikacjach konsumenckich i usługach.

Komentarze (0)

Podziel się swoją opinią — prosimy o uprzejmość i trzymanie się tematu.

Nie ma jeszcze komentarzy. Zostaw komentarz i podziel się swoją opinią!

Aby dodać komentarz, zaloguj się.

Zaloguj się, aby komentować