OpenAI zavádí nové funkce pro ChatGPT, které umožní spouštění výzev pomocí obrázků a hlasových příkazů kromě textu.
Značka AI oznámil v pondělí že tyto nové funkce zpřístupní během příštích dvou týdnů uživatelům ChatGPT Plus a Enterprise. Hlasová funkce je k dispozici v systémech iOS a Android s možností přihlášení, zatímco funkce obrázků je k dispozici na všech platformách ChatGPT. OpenAI poznamenává, že po postupném zavádění plánuje rozšířit dostupnost obrazových a hlasových funkcí mimo placené uživatele.
Hlasový chat funguje jako sluchová konverzace mezi uživatelem a ChatGPT. Stisknete tlačítko a řeknete svou otázku. Po zpracování informací vám chatbot místo textu poskytne odpověď ve sluchové řeči. Proces je podobný používání virtuálních asistentů, jako je Alexa nebo Google Assistant, a mohl by být preambulí úplného přepracování virtuálních asistentů jako celku. Oznámení OpenAI přichází jen pár dní poté, co Amazon odhalil podobnou funkci pro Alexu.
K implementaci hlasové a zvukové komunikace s ChatGPT používá OpenAI nový model převodu textu na řeč, který je schopen generovat „zvuk podobný lidskému zvuku pouze z textu a několika sekund ukázkové řeči“. Jeho model Whisper navíc dokáže „přepsat vaše mluvená slova do textu“.
OpenAI říká, že si je vědoma problémů, které by mohly nastat kvůli síle této funkce, včetně „potenciálu, že by se zákeřní herci vydávali za veřejné osobnosti nebo se dopouštěli podvodu“.
To je jeden z hlavních důvodů, proč společnost plánuje omezit používání svých nových funkcí na „specifické případy použití a partnerství“. I když budou funkce dostupnější, budou přístupné především privilegovanějším uživatelům, jako jsou vývojáři.
ChatGPT nyní může vidět, slyšet a mluvit. V průběhu příštích dvou týdnů budou uživatelé Plus moci vést hlasové konverzace pomocí ChatGPT (iOS a Android) a zahrnout do konverzací obrázky (všechny platformy). https://t.co/uNZjgbR5Bm pic.twitter.com/paG0hMshXb
– OpenAI (@OpenAI) 25. září 2023
Funkce obrázku vám umožňuje zachytit obrázek a vložit jej do ChatGPT s vaší otázkou nebo výzvou. Pomocí kreslicího nástroje s aplikací můžete pomoci objasnit svou odpověď a vést s chatbotem konverzaci tam a zpět, dokud nebude váš problém vyřešen. To je podobné nové funkci Copilot společnosti Microsoft ve Windows, která je postavena na modelu OpenAI.
OpenAI také uznala výzvy ChatGPT, jako je jeho přetrvávající problém s halucinacemi. Když se značka spojila s funkcí obrázku, rozhodla se omezit určité funkce, jako je například „schopnost chatbota analyzovat a přímo vyjadřovat lidi“.
ChatGPT byl poprvé představen jako nástroj pro převod textu na řeč koncem minulého roku; OpenAI však rychle rozšířila své schopnosti. Původní chatbot založený na jazykovém modelu GPT-3 byl od té doby aktualizován na GPT-3.5 a nyní GPT-4, což je model, který dostává novou funkci.
Když byl GPT-4 v březnu poprvé uveden na trh, OpenAI oznámila různé podnikové spolupráce, jako je Duolingo, která používala model AI ke zlepšení přesnosti poslechu a lekcí založených na řeči v aplikaci pro výuku jazyků. OpenAI spolupracuje se Spotify na překladu podcastů do jiných jazyků při zachování zvuku hlasu podcastera. Společnost také hovořila o své práci s mobilní aplikací Be My Eyes, která pomáhá nevidomým a slabozrakým lidem. Mnoho z těchto aplikací a služeb bylo k dispozici před aktualizací obrázků a hlasu.
Podpořte naši práci ❤️
Pokud se vám tento článek líbil, zvažte zaslání spropitného, abychom mohli i nadále vydávat kvalitní obsah.




















