Xiaomi wprowadziła nową wersję modeli AI MiMo V2.5, umożliwiających konwersję tekstu na mowę i odwrotnie

Xiaomi wprowadziła nową wersję modeli AI MiMo V2.5, umożliwiających konwersję tekstu na mowę i odwrotnie

38 software

Xiaomi wprowadza nowe modele głosowe sztucznej inteligencji

Firma Xiaomi przedstawiła dwie wersje swoich modeli AI głosowych, które działają z tekstem i dźwiękiem:

Model | Funkcja | Kluczowe cechy
MiMo‑V2.5‑TTS | Tekst → mowa | 3 warianty podtekstu, darmowe przez ograniczony czas w MiMo Studio; regulacja szybkości, tonu i emocji; możliwość tworzenia nowych głosów na podstawie krótkiego zdania (VoiceDesign) oraz klonowanie głosu z niewielkiej próbki (VoiceClone).
MiMo‑V2.5‑ASR | Mowa → tekst | Rozpoznawanie mowy w trudnych warunkach, obsługa chińskich dialektów + angielskiego; dwujęzyczne dialogi i teksty piosenek (wokal na tle muzyki); działanie przy silnym szumie; automatyczne wstawianie interpunkcji według intonacji.

Jak korzystać z MiMo‑V2.5‑TTS
1. Wersja podstawowa – wybiera jeden z gotowych głosów i pozwala zmienić szybkość, ton oraz emocjonalny odcień.

2. VoiceDesign – wprowadza krótkie zdanie, po czym system generuje nowy barwę głosu.

3. VoiceClone – ładuje kilka próbek wybranego głosu; model odtwarza go z zachowaniem stylu i instrukcji.

Aby uzyskać pożądane brzmienie użytkownik może:

- Dodawać specjalne tagi do tekstu;
- Opisywać głos prostym naturalnym językiem (po chińsku lub angielsku);
- Tworzyć scenariusze dla wirtualnych przedstawień, gdzie kilka głosów współdziała jednocześnie.

Cechy MiMo‑V2.5‑ASR
- Wielojęzyczność – obsługa wielu dialektów chińskiego i angielskiego.
- Rozkodowywanie piosenek – model wyróżnia wokal nawet przy obecności tła muzycznego.
- Odporność na szumy – dokładne rozpoznawanie w warunkach silnego dźwięku zewnętrznego.
- Interpunkcja według intonacji – automatycznie wstawia znaki interpunkcyjne, co zmniejsza potrzebę ręcznej korekty.

W ten sposób Xiaomi poszerza swoje możliwości w dziedzinie technologii głosowych, oferując elastyczne narzędzia zarówno do tworzenia syntezowanej mowy, jak i precyzyjnego rozpoznawania informacji ustnych.

Komentarze (0)

Podziel się swoją opinią — prosimy o uprzejmość i trzymanie się tematu.

Nie ma jeszcze komentarzy. Zostaw komentarz i podziel się swoją opinią!

Aby dodać komentarz, zaloguj się.

Zaloguj się, aby komentować