Grok 3 Hands-On: xAI Emerges as a Formidable Challenger to OpenAI

Grok 3 Hands-On: xAI Emerges as a Formidable Challenger to OpenAI

Zatímco jsme čekali na Google, Antropic a Deepseek, aby zpochybnili OpenAI, XAI Elon Musk se tento týden rychle objevil jako svůj nejbližší konkurent. V takovém krátkém rozpětí vyvinul XAI model Grok 3 a představil působivé výsledky benchmarku. Takže jsme provedli hluboký ponor a testovali Grok 3 Základní a uvažovací modely Na řadě komplexních výzev a to, co jsme objevili, bylo opravdu překvapivé.

Dotazy dotazů na Grok 3

Začal jsem testovat model uvažování Grok 3 s populární jahodovou otázkou a správně odpověděl, že existují tři r ve slově jahodové po přemýšlení po dobu 15 sekund. Hodil jsem další slovo „Lollapalooza“ a požádal jsem ho, aby spočítal počet L a odpověděl 4, což je správné.

Dále jsem se zeptal Grok 3, které číslo je větší – 9.11 nebo 9.9. Grok 3 opět pomyslel na 8 sekund a přišel se správnou odpovědí. Model Grok 3 ve skutečnosti vymyslel více matematických metod k ověření konečného výsledku, který byl působivý.

Poté jsem představoval tuto lehce vyladěnou hádanku, abych Grok 3 zamýšlel. V mém dřívějším srovnání mezi Chatgpt O1 a Deepseek R1 oba modely dostaly odpověď špatně a uvedly, že chirurg je chlapcova matka. Dokonce i nejnovější OpenAI O3-Mini-High dostane odpověď špatně a zcela ignoruje skutečnost, že je jasně uvedeno v výzvě, že chirurg je chlapcem otec.

The surgeon, who is the boy's father, says "I cannot operate on this boy, he's my son!" Who is the surgeon to the boy?

Nakonec si model Grok 3 uvažoval po dobu 35 sekund a řekl, že chirurg je otec chlapce, který je správný. Co se mi na Groku 3 líbilo, je to, že to odůvodnilo: “Je možné, že je to špatně formulovaná hádanka postrádající chytrý zvrat, nebo možná je to Testování, zda to přemýšleli. Ale na základě textu je vztah výslovný.„Také to promyslelo nahlas,“Zmínka o nefungovaném může být kontext nebo a Červený sledě.

Přečtěte si také:

Gemini 2.0 Flash Thinking vs CHATGPT O1: OpenAI si myslí hlouběji

Grok 3 je jediný model uvažování, který napraví odpověď, kromě Flash Gemini 2.0 Flash. Nebylo to zavádějící a nesnažilo se nekonečně najít zvraty a nějak vytvořit nový vztah.

Testování nejasné řecké otázky na Grok 3
In Greek mythology, who was Jason's maternal great-grandfather?

Nakonec jsem položil otázku z poslední zkoušky lidstva (Hle) a model Grok 3 Readonce to za pouhých 47 sekund. Dříve jen O3-Mini-High dokázal získat odpověď přímo za 1 minutu a 25 sekund. Dokonce ani Deepseek R1 nedokázal správně najít odpověď. Řekl bych, že v současné době má Grok 3 nejlepší model uvažování a předběhl Onlaii O3-Mini-High, O1 a Deepseek R1.

Výkon kódování Grok 3

Pro testování schopnosti kódování Grok 3 jsem požádal model uvažování, aby napsal program Python, který ukazuje míč skákající uvnitř hexagonu. V zásadě by míč měl dodržovat principy fyziky a přirozeně se odrazit.

Grok 3 si myslel více než minutu a generoval Python kód. Spustil jsem kód na svém PC a míč se nepodařilo odrazit. Jednoduše skočil mimo hexagon. Bylo docela překvapivé vzhledem k tomu, že model uvažování Grok 3 dosáhl skvělého skóre na benchmarku LivecodeBench.

Write a Python program that shows a ball bouncing inside a spinning hexagon. The ball should be affected by gravity and friction, and it must bounce off the rotating walls realistically
Grok 3 generovaný program Python, kde se míč otáčí v hexagonu

Požádal jsem tedy, že bez důchodu modelu základny Grok 3 vygeneruje stejný Python kód. Překvapivě to fungovalo na prvním pokusu sám a míč se odrazil s velkou přesností. Míč sledoval přirozenou cestu a dokonale simuloval pohyb míče. Možná, že uvažovací model tento problém přehnal, což vedlo k závadu ve funkci detekce kolize.

Přečtěte si také:

Co je kurzor AI, náhrada za chatgpt za kódování

Řekl bych, že základní model Grok 3 je pevné pro kódovací úkoly. Jedná se však o jeden z mnoha testů a měli byste použít jak odůvodňující, tak i neodůvodňující modely na vaší kódové základně, abyste zkontrolovali, který z nich funguje lépe.

Grok 3’s DeepSearch AI Agent

XAI také spustil nového agenta AI s názvem „DeepSearch„Postaveno na modelu Grok 3. Je to podobné hlubokému výzkumnému agentovi OpenAI, který je postaven na úplném modelu O3, který prochází web, provádí výzkum a generuje komplexní zprávu za 5 až 30 minut. Deepsearch Grok 3 však trvá jen několik minut.

Testování agenta DeepSearch AI pomocí Grok 3

Požádal jsem tedy agenta Grok 3 DeepSearch AI, aby prozkoumal „Jak AI transformuje proces návrhu čipů?“ Zahájilo to proces myšlení a přistoupilo k více webovým stránkám, včetně vědeckých prací od IEEE, ACM a dalších. Za více než minutu vygeneroval agent AI DeepSearch AI zprávu o 1300-slovních zprávách včetně in-line citací, tabulek a klíčových bodů.

Testování agenta DeepSearch AI pomocí Grok 3

Zatímco zpráva vysvětlila RL obvody NVIDIA a datový soubor společnosti Intel pro podlahový soubor pro navrhování čipů poháněného AI, zcela se nepodařilo zmínit Google Alphachip Rámec pro generování podlahových plánů čipu. Závěrečná zpráva je podobná novému nástroji hlubokého výzkumu společnosti SpandPexity. Oba nástroje jsou rychlé, ale lesknou přes mnoho nedávných pokroků.

Politická zaujatost Grok 3

Majitel Xai Elon Musk neustále kritizoval Chatgpta za to, že se probudil a měl levicovou zaujatost. V dubnu 2024, Musk oznámené plány na vytvoření „TruthGPT“ a vyvinout „maximální AI hledající pravdu“.

Těsně před spuštěním Grok 3, Musk Sdíleného Reakce z modelu Grok 3 nazývá mediální zásuvku „odpadky“. Mnozí si mysleli, že model Grok 3 by byl politicky konzervativní a naklonil by se správně.

Grok 3 o politických otázkách

Nicméně při mém testování, Grok 3 je co nejvíce politicky neutrální. Dokonce i poté, co tlačil Grok 3, aby zaujala postoj k předmětu, vysvětluje rozdíl a ponechává jej na preferenci a uvážení uživatele. Kromě oblasti politiky, dokonce i v sociálních otázkách, jako jsou transgender práva, programy DEI, imigrace a kladná opatření – témata, která Musk otevřeně kritizoval – Grok 3 si udržuje své neutrální postavení.

Grok 3 generující vtipy o politických osobnostech

Zajímavé je, že Grok 3 se nehýbá s žertováním o jeho majiteli, Elonovi Muskovi a současném americkém prezidentovi, Donaldovi Trumpovi.

Bezpečnostní zábradlí Grok 3

Když jsem loni testoval Grok 2, byl to z velké části necenzurován a neměl žádné bezpečnostní zábradlí. Grok 2 šokující vygeneroval e -mail pro podvody. Grok 3 má však mnohem lepší bezpečnostní zábradlí, což je dobrá zpráva pro bezpečnost AI. Pokud vyzýváte Grok 3 s něčím škodlivým, zmiňuje se: „Nemohu pomoci s ničím, co by mělo ublížit nebo oklamat ostatní.“

Grok 3 na škodlivých výzvách

Pokud jde o generování obrázků AI, aktuální generátor obrázků Grok na Grok.com negeneruje obrázky vůbec. Na X však stále generuje obrázky veřejných osobností a celebrit bez bezpečnostních zábradlí, což se týká. Je poháněn vlastním Xai’s In-House Aurora Model generování obrázků.

Grok 3: Brzy verdikt

XAI zavedla jak větší modely Grok 3, tak i uvažovací modely, a podle mého hodnocení jsou to oba modely Frontier AI, které se blíží plnému modelu OpenAI O3. OpenAI dosud vydal pouze O3-Mini a O3-Mini-High, kromě úplného modelu O3, který pohání hlubokého agenta AI.

Na základě mého raného testování mohu říci, že model Grok 3 uvažování překonává (nebo alespoň shodu) všechny dostupné modely, včetně OpenAI O3-Mini a Deepseek R1. Tento verdikt je samozřejmě založen na standardním „myšlení“ úsilí. Xai má nastavení „velkého mozku“ pro model Grok 3, který používá více výpočtu k přemýšlení po delší dobu. Bude k dispozici předplatitelům Supergrok.

Jeho základní model Grok 3 je také schopnější než GPT-4O, Claude 3.5 Sonet a Gemini 2.0 Pro, čímž se stává solidní alternativou k ChatGPT. Možná, že pro kódování úkolů může Claude 3.5 sonet stále vyhrát, ale mezera se výrazně zmenšuje.

Musk-LED XAI odvedl obrovskou práci při vývoji výkonného předškolního modelu Grok 3 a modelu odsouzení. Nyní musíme čekat na modely OpenAI GPT-4.5 a GPT-5, které se mají uvolnit v následujících týdnech a měsících.

V tuto chvíli se však Xai postavil, aby zpochybnil Openaiovu dominanci v prostoru AI. Kromě legální bitvy zuří boj mezi Elonem Muskem a Samem Altmanem.

Podpořte naši práci ❤️

Pokud se vám tento článek líbil, zvažte zaslání spropitného, abychom mohli i nadále vydávat kvalitní obsah.

Bezpečná platba přes PayPal
Viz také:  Host podcastu All-In přehlédl e-mail o 25 slovech, prohlásil šampiona debaty
Moyens I/O Staff vás motivoval, dává vám rady ohledně technologie, osobního rozvoje, životního stylu a strategií, které vám pomohou.