OpenAI przedstawiła GPT‑Realtime‑2 oraz dwa nowe wersje głosowe dostępne wyłącznie przez API
OpenAI rozszerza możliwości API głosowego
Firma ogłosiła uruchomienie nowych funkcji dla swojego API, które pozwolą deweloperom tworzyć bardziej „żywe” aplikacje głosowe: będą mogli rozmawiać z użytkownikami, transkrybować mowę na tekst i tłumaczyć rozmowy w locie.
Nowe modele Realtime
Przez interfejs Realtime dostępne są teraz trzy modele:
| Model | Zastosowanie | Kluczowe cechy |
|---|---|---|
| GPT‑Realtime‑2 | Interakcja głosowa w czasie rzeczywistym | Analiza zapytań, wywoływanie narzędzi, przetwarzanie poprawek i płynne kontynuowanie dialogu. Opiera się na logice GPT‑5, co pozwala obsługiwać bardziej złożone zadania niż GPT‑Realtime‑1.5. |
| GPT‑Realtime‑Translate | Tłumaczenie w czasie rzeczywistym | Obsługuje 70+ języków wejściowych i 13 języków wyjściowych. Zachowuje sens nawet przy zmianie kontekstu, regionalnych akcentów lub specjalistycznej terminologii. |
| GPT‑Realtime‑Whisper | Transkrypcja mowy | Model strumieniowy o niskiej latencji, zamieniający audio w tekst niemal natychmiastowo. |
> „Nasze nowe modele tłumaczą audio w czasie rzeczywistym z prostego dialogu na interfejsy głosowe, które naprawdę mogą działać: słuchać, rozważać, tłumaczyć, transkrybować i podejmować działania w miarę rozwijania rozmowy”, – powiedziała firma.
Koszt
Model | Cena
---|---
GPT‑Realtime‑2 | 32 USD za 1 mln wejściowych tokenów audio, 0.40 USD za 1 mln zbuforowanych tokenów i 64 USD za 1 mln wyjściowych tokenów audio
GPT‑Realtime‑Translate | 0.034 USD na minutę
GPT‑Realtime‑Whisper | 0.017 USD na minutę
Jak spróbować
Deweloperzy mogą przetestować nowe modele na platformie online OpenAI Playground i od razu zobaczyć, jak działają w czasie rzeczywistym.
Komentarze (0)
Podziel się swoją opinią — prosimy o uprzejmość i trzymanie się tematu.
Zaloguj się, aby komentować