Voice agenti v API: vlastný hlas je iba začiatok

Xai 30. apríla 2026 predstavilo Custom Voices and Voice Library. Vlastný hlas sa dá vytvoriť z krátkej nahrávky a použiť v TTS aj Voice Agent API.
OpenAI na to 7. mája 2026 nadviazalo širšou vrstvou hlasových modelov v API: GPT-Realtime-2, GPT-Realtime-Translate a GPT-Realtime-Whisper. Voice agenti sa posúvajú z vrstvy „vie hovoriť“ do vrstvy „vie viesť živú úlohu, volať nástroje, prekladať a priebežne prepisovať.“
Čo sa mení
Xai umožňuje vytvoriť vlastný hlas z referenčného audia. Dokumentácia uvádza až 120 sekúnd ukážky a až 30 custom voices na tím. OpenAI pridáva živé hlasové modely pre produkčné interakcie: reasoning v konverzácii, živý preklad a nízkolatenčný prepis.
Čo to znamená v praxi
Dáva to zmysel pre zákaznícku podporu, onboarding, produktové návody, viacjazyčné workflow, sumarizáciu hovorov v reálnom čase a agentov, ktorí volajú interné nástroje namiesto toho, aby iba odpovedali.
Kde si počkať
Klonovanie hlasu a živá hlasová automatizácia potrebujú governance: výslovný súhlas, auditné logy, pravidlá uchovávania nahrávok, incident proces, jasné označenie AI tam, kde je to vhodné, a guardrails nad tým, čo agent smie sľúbiť alebo spustiť.
Záver
Vlastné hlasy od Xai a nové realtime modely od OpenAI ukazujú rovnaký smer: voice agenti sa posúvajú z demo fázy do produktovej vrstvy. Ak riešite support, onboarding, call centrum, prepis schôdzok alebo interných asistentov, hlasové workflow bude čoskoro normálna súčasť AI stacku.