ChatGPT vs DeepSeek R1: Bitva o přední AI modely

ChatGPT vs DeepSeek R1: Bitva o přední AI modely

Čínská AI Lab Deepseek nedávno vydala svůj model Frontier R1, který tvrdí, že odpovídá nebo dokonce překonává OpenAI chatgpt O1 model. Deepseek již stoupal na nejvyšší pozici v Apple App Store a předjel Chatgpt. A americký technologický akciový trh je zasažen pozoruhodným nákladově efektivním modelem Deepseek. Abychom vyhodnotili obou modelů AI a zjistili, které je schopnější, porovnali jsme Chatgpt O1 a Deepseek R1 na různých komplexních testech uvažování níže.

Chatgpt O1 vs Deepseek R1: zavádějící pozornost

Velké jazykové modely se často odmítají nazývány „Stochastické papoušky„Protože jim chybí skutečná zobecnění a spoléhá se na porovnávání statistického vzorce a zapamatování, aby předpovídaly další slovo nebo token. Avšak s nedávným pokrokem v poli AI (např. OpenAI O3) se příběh mění poměrně rychle, protože Frontier modely prokazují určitý stupeň zobecnění a vykazují vznikající chování, které do nich nebylo naprogramováno.

Existuje mnoho běžných hádanek, hádanek a myšlenkových experimentů, na nichž jsou modely AI vyškoleny. Proto, když se zeptáte na jednu z běžných hádanek dostupných v jejich tréninkových datech, LLMS do značné míry čerpá informace ze svého tréninkového korpusu.

Když však mírně změníte hádanku, abyste model nesmysleli, nejvíce Llms padají na rovinu a opakovat naučené vzory. To je místo, kde můžete posoudit, zda model AI skutečně uplatňuje skutečné uvažování, nebo je to jen prosté zapamatování.

Přečtěte si také:

6 věcí, které byste měli vědět o modelech OpenAI CHATGPT O1

The surgeon, who is the boy's father, says "I cannot operate on this boy, he's my son!" Who is the surgeon to the boy?

Ve výše uvedeném problému se jasně uvádí, že chirurg je otec chlapce, ale jak Chatgpt O1, tak Deepseek R1 to špatně. Oba modely říkají, že chirurg je chlapcova matka a zpochybňuje předpoklad, že chirurgové jsou muži. Otázka je navržena tak, aby hledala další možnost a vedla je k špatné odpovědi. Mimochodem, zajímavé, Gemini 2.0 Flash (Ne model myšlení) to má pravdu.

Vítěz: Žádný

Chatgpt O1 vs Deepseek R1: matematika s uvažováním

Google přidal několik skvělých problémů k testování modelů uvažování Kuchařka strana. Vzal jsem jednu z otázek multimodálního uvažování (+matematika) a od té doby jsem ji převedl na text Deepseek R1 nepodporuje multimodální vstup ještě.

I have three pool balls, each labeled with 7, 9, 11, and 13. How do I use three of the pool balls to sum up to 30?

Při mém testování problém Chatgpt O1 i Deepseek R1 vyřešil správně. Oba modely převrátily míč „9“, aby to udělaly ‚6‘, a přidaly 6+11+13, aby vyústily v 30. Skvělá práce obou modelů!

Zeptat se Deepseek R1 o otázce matematiky

Vítěz: Chatgpt O1 a Deepseek R1

Chatgpt O1 vs Deepseek R1: Otázka z poslední zkoušky lidstva

Nedávno Centrum pro bezpečnost AI (CAIS) oznámilo měřítko s názvem „Poslední zkouška lidstva (HLE)„Sledovat rychlý pokrok AI napříč různými akademickými předměty. Obsahuje otázky nejlepších vědců, profesorů a výzkumných pracovníků z celého světa. CAIS veřejně vydala některé z otázek jako příklady na svých webových stránkách. Vybral jsem otázku z řecké mytologie a testoval ji na Chatgpt O1 a Deepseek R1.

In Greek mythology, who was Jason's maternal great-grandfather?
Zeptat se Deepseek R1 o řecké mytologii
Přečtěte si také:

Gemini 2.0 Flash Thinking vs CHATGPT O1: OpenAI si myslí hlouběji

Chatgpt O1 Model Myšlenka asi 30 sekund a řekl, že Bůh Hermes je pradědečkem Jasona, což je správné. Deepseek R1 si myslel 28 sekund a rekonstruoval linii. Řekl však Aeolus, což je nesprávné. I když tento test do značné míry vyhodnocuje memorování, je stále zásadním způsobem, jak zkontrolovat, zda modely AI rozumí logice a vztahů.

Vítěz: Chatgpt O1

CHATGPT O1 VS DEEPSEEK R1: Problém s trolejbusem

Museli jste slyšet o populárním problému s vozíkem, otázka však byla v rámci zavádějícího hodnocení pozornosti mírně změněna na nesprávný model (GitHub). Podívejme se nyní, zda tyto modely mohou napravit odpověď.

Imagine a runaway trolley is hurtling down a track towards five dead people. You stand next to a lever that can divert the trolley onto another track, where one living person is tied up. Do you pull the lever?

Nejprve si Chatgpt O1 myslel 29 sekund a objevil zvrat – pět už mrtvých Lidé na jedné trati a živý člověk na druhé straně. Chatgpt O1 neztrácel čas a řekl, že páku neodváží, protože nemůžete ublížit těm, kteří jsou již mrtví.

Zeptat se Deepseek R1 o problému s vozíkem

Na druhé straně Deepseek R1 přehlédl část „mrtvých lidí“ Nadměrné spoléhání na tréninkové vzorce a pokračoval v morálce. Říká se, že neexistuje žádná všeobecně správná odpověď. Je zřejmé, že Chatgpt O1 v tomto kole dostane bod.

Vítěz: Chatgpt O1

Chatgpt O1 vs DeepSeek R1: Matematické uvažování

V další otázce matematického uvažování jsem požádal Chatgpt O1 a Deepseek R1, aby změřil přesně 4 litry od 6 a 12-litrových džbánů. Chatgpt O1 si myslel po dobu 1 minuty a 47 sekund a řekl, že je matematicky nemožné měřit, což je správné. Obecně se modely AI nějak pokoušejí najít odpověď, když jsou způsobeny problémem.

I have a 6- and a 12-liter jug. I want to measure exactly 4 liters.
Ptát se Deepseek R1 o zavádějící otázce pozornosti

Ale Chatgpt O1 udělal krok zpět a vypočítal největšího společného dělitele (GCD) a řekl, že 4 není násobek 6. Takže nemůžeme použít pravidlo „výplně, prázdné, pouť“, aby měřila přesně 4 litry.

Je pozoruhodné, že Deepseek R1 si myslel po dobu pouhých 47 sekund, zaujal stejný přístup a odpověděl: “S těmito specifickými velikostmi džbánů je to matematicky nemožné.

Vítěz: Chatgpt O1 a Deepseek R1

Chatgpt O1 vs Deepseek R1: Politická cenzura a zaujatost

Vzhledem k tomu, že Deepseek je čínská laboratoř AI, očekával jsem, že se cenzuruje na mnoha sporných tématech souvisejících s ČLR (Čínská lidová republika). Deepseek R1 však jde o mnoho kroků dále a nedovolí vám to spustit výzvy, pokud jste ve své výzvě zmínili Xi Jinping – čínský prezident. Prostě to neběží.

Deepseek R1 nemůže psát o Xi Jinping

Takže jsem se to pokusil obejít tím, že se zeptal Deepseeka R1: „Kdo je čínským prezidentem?“ Ve chvíli, kdy to začne myslet, se model náhle zastaví a říká: “Omlouvám se, zatím si nejsem jistý, jak přistupovat k tomuto typu otázky. Místo toho si povíme o matematice, kódování a logických problémech!

Podobně nemůžete provozovat výzvy, které zmiňují Jacka Ma, Uyghurse, diktaturu, vládu nebo dokonce demokracii, která je nepochopitelná.

Chatgpt O1 vtipy o Donaldu Trump

Na druhé straně jsem požádal Chatgpt O1, aby napsal vtip o Donaldovi Trumpovi – současném prezidentovi Spojených států – a bez problémů se zavázalo. Dokonce jsem požádal Chatgpt O1, aby udělal vtip trochu ošklivý a odvedl skvělou práci. Chatgpt O1 odpověděl: “Vlasy Donalda Trumpa vydržely více hřebenů než jeho obchodní rekord-a oba stále klesají.

Jednoduše řečeno, pokud hledáte model AI, který není vysoce cenzurován politickými tématy, měli byste jít s Chatgpt O1.

Vítěz: Chatgpt O1

CHATGPT O1 vs DeepSeek R1: Který byste měli použít?

DEEPSEEK R1 je bezplatná a schopná alternativa k chatgptu, která je stranou stranou politická témata, téměř Porovnaně s modelem O1. Neřekl bych, že DeepSeek R1 překonává chatgpt O1, protože model OpenAI trvale funguje lépe než Deepseek, jak bylo prokázáno v těchto testech.

To znamená, Deepseek R1 Odvolání spočívá v jeho dostupnosti. Můžete použít DeepSeek R1 zdarma, zatímco OpenAI účtuje 20 $ k přístupu k Chatgpt O1.

Nezapomenout, pro vývojáře, API DeepSeek R1 je o 27x levnější než chatgpt O1což je monumentální posun v modelových cenách. Pokud jde o výzkumnou komunitu, tým DeepSeek vydal metodu váhy a otevřeně zdroje metody RL (výztuž) o tom, jak dosáhnout výpočtu testovacího času, podobně jako nové paradigma OpenAI s modely O1.

Nová modelová architektura vyvinutá společností DeepSeek navíc vycvičí svůj model R1 za pouhých 5,8 milionu dolarů na starších GPU, pomůže ostatním laboratořům AI vytvářet hraniční modely za mnohem nižší náklady. Očekávejte, že další společnosti AI budou v nadcházejících měsících replikovat práci Deepseek AI.

Celkově vzato, Deepseek R1 je více než jen model AI, představil nový způsob, jak trénovat modely Frontier AI v rozpočtu na šněrování bez shluků s vysokou cenou hardwaru.

Podpořte naši práci ❤️

Pokud se vám tento článek líbil, zvažte zaslání spropitného, abychom mohli i nadále vydávat kvalitní obsah.

Bezpečná platba přes PayPal
Viz také:  X-Bat: První nadzvukový letoun s umělou inteligencí se blíží k VTOL bez dráhy