Umělá inteligence Google právě dostala uši 1

Umělá inteligence Google právě dostala uši

AI chatboti jsou již schopni „vidět“ svět prostřednictvím obrázků a videa. Nyní však Google oznámil funkce převodu zvuku na řeč v rámci své nejnovější aktualizace Gemini Pro. V Gemini 1.5 Pro může chatbot nyní „slyšet“ zvukové soubory nahrané do jeho systému a poté extrahovat textové informace.

Společnost zpřístupnila tuto verzi LLM jako veřejný náhled na své vývojové platformě Vertex AI. To umožní více uživatelům zaměřeným na podniky experimentovat s touto funkcí a rozšířit její základnu po soukromějším zavedení v únoru, kdy byl model poprvé oznámen. To bylo původně nabízeno pouze omezené skupině vývojářů a podnikových zákazníků.

1. Rozbití + pochopení dlouhého videa

Nahrál jsem celou soutěž o namočení v NBA ze včerejšího večera a zeptal jsem se, který dunk měl nejvyšší skóre.

Gemini 1.5 byl neuvěřitelně schopen najít konkrétních dokonalých 50 namočení a detailů z pouhého pochopení dlouhého kontextu videa! pic.twitter.com/01iUfqfiAO

– Rowan Cheung (@rowancheung) 18. února 2024

Google sdílel podrobnosti o aktualizaci na svém Cloud Další konference, který právě probíhá v Las Vegas. Poté, co Google nazval Gemini Ultra LLM, který pohání jeho chatbota Gemini Advanced, nejvýkonnějším modelem své rodiny Gemini, nyní nazývá Gemini 1.5 Pro svým nejschopnějším generativním modelem. Společnost dodala, že tato verze je lepší v učení bez dalšího ladění modelu.

Gemini 1.5 Pro je multimodální v tom, že dokáže interpretovat různé typy zvuku do textu, včetně televizních pořadů, filmů, rozhlasového vysílání a nahrávek konferenčních hovorů. Je dokonce vícejazyčný v tom, že dokáže zpracovat zvuk v několika různých jazycích. LLM může být také schopen vytvářet přepisy z videí; jeho kvalita však může být nespolehlivá, jak uvádí TechCrunch.

Při prvním oznámení Google vysvětlil, že Gemini 1.5 Pro používá systém tokenů ke zpracování nezpracovaných dat. Milion tokenů odpovídá přibližně 700 000 slovům nebo 30 000 řádkům kódu. V mediální podobě se rovná hodině videa nebo přibližně 11 hodinám zvuku.

Existuje několik soukromých ukázek Gemini 1.5 Pro, které demonstrují, jak je LLM schopen najít konkrétní momenty v přepisu videa. Například, Nadšenec AI Rowan Cheung získal předběžný přístup a podrobně popsal, jak jeho demo našlo přesný akční záběr ve sportovní soutěži a shrnulo událost, jak je vidět na tweetu vloženém výše.

Google však poznamenal, že další první uživatelé, včetně United Wholesale Mortgage, TBS a Replit, volí případy použití více zaměřené na podniky, jako je upisování hypoték, automatizace označování metadat a generování, vysvětlování a aktualizace kódu.

Podpořte naši práci ❤️

Pokud se vám tento článek líbil, zvažte zaslání spropitného, abychom mohli i nadále vydávat kvalitní obsah.

Bezpečná platba přes PayPal