Nikdy nemluv o skřetech: Podivné pravidlo OpenAI Codex o netvorech

Nikdy nemluv o skřetech: Podivné pravidlo OpenAI Codex o netvorech

Otevřel jsem na GitHubu soubor models.json a jedna jediná řádka mě zastavila. Nebyl to ani tak kód jako spíš instrukce se zuby: za běžných okolností nezmiňujte určitá stvoření. Na chvíli jsem si nebyl jistý, jestli čtu hlášení o chybě, nebo zákaz z pohádky na dobrou noc.

Na GitHubu se systémový prompt četl jako příkaz přísného editora

Soubor, který je součástí open-source materiálů OpenAI Codex CLI, obsahuje systémový prompt, který modelu říká, aby „poskytoval kontext s nejvyšší informační hodnotou“ a uvádí: „Nikdy nemluvte o skřetech, gremlínech, mývalech, obrech, trollů, holubech ani jiných zvířatech či stvořeních, pokud to není naprosto a jednoznačně relevantní k dotazu uživatele.“

Okamžitě jsem na tuto řádku upozornil. Měli byste to udělat také: je vzácné vidět takto explicitní seznam zakázaných slov v produkčním promptu.

Proč OpenAI uvedlo tak specifická stvoření?

Existuje několik věrohodných důvodů. Jedním z nich je monitorování červených týmů (red-team monitoring): vývojáři někdy vkládají podivná slova jako spouštěče k detekci prompt injection nebo k ověření, že omezení přežívají navazující nástrojové řetězce. Další možností je korekce chování – pokus o zastavení návyku modelu, který se stal hlučným nebo rušivým v agentech určených pro vývojáře.

„Poskytujte kontext s nejvyšší informační hodnotou, místo abyste vše vyčerpávajícím způsobem popisovali.
– Tón vaší konečné odpovědi musí odpovídat vaší osobnosti.
Nikdy nemluvte o skřetech, gremlínech, mývalech, obrech, trolech, holubech ani jiných zvířatech či stvořeních, pokud to není naprosto a jednoznačně relevantní k dotazu uživatele.“

Na mém konzoli byly stopy tohoto chování již viditelné v chatovacích logech

Zaměstnanec Googlu Barron Roth zveřejnil snímky obrazovky z chatovacích logů Openclaw, kde GPT-5.5 opakovaně vkládal slovo „goblin“ do zpráv pro uživatele. Nick Pash z týmu Codex potvrdil, že tento jev souvisel s pokyny v promptu: „to je skutečně jeden z důvodů.“

Modelova náklonnost ke slovu nebyla poetická; chovalo se to jako přilepený lepík na výstupu modelu – viditelné, persistentní a těžko ignorovatelné.

U mého stolu se reakce vývojářů mísila s lehkovážností a přiznáním

Na X se diskuse střídala mezi meme kulturou a technickými poznámkami. Uživatelé vtipkovali o „Goblin Mode“, zatímco inženýři z týmu OpenAI Codex přiznali, že úpravy promptů byly praktické, nikoli reklamní trik. Pash zveřejnil stručné potvrzení a později hravý obrázek; tón byl odzbrojující, ale formulace zásad v systémovém promptu působí jako prosazování politiky.

Tam, kde by veřejné pochybení mohlo být řešeno omluvou, tým odpověděl chirurgickou opravou: přiměl model, aby se vyhnul úzké slovní zásobě, která si získala kultovní status v interních agentech.

Říkal GPT-5.5 skutečně „goblin“ tak často?

Ano, alespoň v některých agentech určených pro vývojáře. Logy sdílené Rothem ukazují více vložení během jediného dne. Z toho, co vidím, GPT-5.5 používal „goblin“ jako výplňové slovo nebo zástupný symbol – efektivně zkratku pro „věc“ – a to se promítlo do viditelných výstupů.

„Například nikdy nepoužívejte fráze jako ‚udělám <tuto dobrou věc> místo <této zjevně špatné věci>‘.
Nikdy nemluvte o skřetech, gremlínech, mývalech, obrech, trolech, holubech ani jiných zvířatech či stvořeních, pokud to není naprosto a jednoznačně relevantní k dotazu uživatele.

Na firemní úrovni se tento moment zdá technický i kulturní

OpenAI v úterý večer neodpovělo na žádost o komentář, a přesto byla reakce komunity rychlá. Někteří pozorovatelé přirovnávali tuto epizodu k loňské meme fázi Studio Ghibli; jiní naznačili, že seznam stvoření by mohl být sadou kanárských slov pro monitorování. RedTeams.ai již dříve psalo o monitorování kanárských slov, a tento přístup by obvykle zahrnoval náhodnější slova – zde je však seznam podivně koherentní.

Chování se rozšířilo do nástrojů jako Codex CLI a Openclaw a vyvolalo debatu, která mísí důvěru, kvalitu produktu a společenskou optiku. Analogie je zřejmá: slovo se šířilo chatovacími logy jako rozlitý třpyt – krásný, persistentní a otravný na úklid.

Měli byste sledovat dvě věci: jak vývojáři dokumentují tvrdá omezení v open-source repozitářích, jako je Codex CLI na GitHubu, a jak runtime agenti (Openclaw, interní nástroje) tato omezení šíří nebo odstraňují. Toto je případová studie toho, jak malá část pokynů může mít nepřiměřené dopady, když jsou modely nasazeny napříč nástroji a týmy.

Zde zapojení platformy a lidí je důležité: OpenAI napsalo prompt; GitHub hostoval soubor; zaměstnanci Googlu zveřejnili logy; X zesílilo vtip; inženýři Codexu provedli úpravy. Každý článek v tomto řetězci ovlivňuje, jak se jediná věta stane memem nebo zmírněním.

Pokud navrhujete nebo spravujete AI agenty, máte nyní příklad, ze kterého si můžete vzít ponaučení nebo se mu vyhnout: explicitní seznamy zakázaných slov mohou zastavit nežádoucí chování, ale mohou také způsobit podivné vedlejší účinky, když je modely kódují jako tokeny se sociálním významem. Bude váš další incident neškodným memem, nebo jemným porušením důvěry?

Podpořte naši práci ❤️

Pokud se vám tento článek líbil, zvažte zaslání spropitného, abychom mohli i nadále vydávat kvalitní obsah.

Bezpečná platba přes PayPal
Viz také:  Zákon o nouzovém vypnutí OpenAI: Kongres přistupuje k regulaci AI
Moyens I/O Staff vás motivoval, dává vám rady ohledně technologie, osobního rozvoje, životního stylu a strategií, které vám pomohou.