Ještě tu noc se Coxona veřejně zastal Evan Hubinger, který v Anthropicu vede zátěžové testování alignmentu (Head of Alignment Stress-Testing). A napsal číslo, které se těžko přechází: osobně odhaduje víc než desetiprocentní šanci, že AI do deseti let zabije všechny lidi. K tomu dodal, že Anthropic podle něj zatím nemá plán, jak sladění superinteligence vyřešit, a ani k němu zjevně nesměřuje. (Hubinger)
Dejte si to vedle sebe s únorovou změnou Anthropic Responsible Scaling Policy a vyjde vám zvláštní paradox. Riziko z velmi výkonné AI slouží uvnitř laboratoří jako argument pro to vývoj brzdit, i jako argument pro to v něm pokračovat. K tomu se ještě vrátím.
Co Coxon tvrdí
Poslední tři roky dělal pretraining research v OpenAI a pak v Anthropicu. Ve vlákně píše, že „ani jedna firma nejedná zodpovědně“: obě jedou rovnou k samozlepšující se superinteligenci a „sázejí naše životy“. (thread)
Dvě věty z vlákna stojí za to citovat celé.
„Lidé, kteří AI staví, upřímně věří, že by nás do konce dekády mohla všechny zabít. Tohle není marketingový trik.“ Soukromý strach a veřejná umírněnost jsou podle Coxona dvě různé věci.
Druhá je o rozdílu mezi laboratořemi. V OpenAI podle něj mnozí civilizační sázku „hluboce neinternalizovali“. V Anthropicu ji chápou, jenže jsou „zamčení v závodě být první“: věří, že nikdo jiný se nezachová zodpovědně, takže to musí udělat sami, i za cenu rizika.
Je to výpověď jednoho člověka, ale ne ledajakého. WSJ i Business Insider připomínají jeho kariéru a OpenAI ho uvádí mezi core contributors GPT-4o. (BI)
Co řekl Hubinger, a co neřekl
Hubingerova odpověď si zaslouží doslovnou citaci:
„Jacob má v tomto ohledu pravdu – opravdu upřímně věříme, že umělá inteligence by mohla zabít všechny lidi! Osobně si myslím, že v příštím desetiletí je pravděpodobnost vyšší než 10 %. Věřím, že společnost Anthropic se snaží ze všech sil, ale zatím nemáme plán, jak vyřešit problém sladění superinteligence, a ani se k tomu zjevně nesměřujeme.“ (Hubinger)
V navazujícím příspěvku upřesňuje, že riziko od současných modelů považuje za nízké. Bojí se superinteligence vzniklé rekurzivním sebezdokonalováním, která podle něj přichází rychleji, než čekali.
Než z toho začnete vyvozovat závěry, tři věci k rozlišení:
- Je to osobní odhad, ne firemní předpověď. Hubinger na LessWrong / Alignment Forum výslovně uvádí, že jeho veřejné komentáře nereprezentují pozice Anthropicu. (profil) Anthropic ani OpenAI se k věci do rána 9. září oficiálně nevyjádřily. (CNBC, BI)
- Přesný titul je Head of Alignment Stress-Testing, ne „alignment lead“ v širokém smyslu. Je to významná role, jde o konfrontační hodnocení a hledání míst, kde alignment selže. Ale není to vedení veškeré alignment práce ve firmě.
- „Zatím nemáme plán“ neznamená, že v Anthropicu neexistuje žádná technická cesta. Výzkumné směry existují, chybí kompletní řešení od začátku do konce. Cenné je to jako hodnocení stavu problému od významného alignment výzkumníka. Není to firemní přiznání „nemáme plán“.
Co překvapivé není, a co ano
Že nikdo nemá ověřené řešení alignmentu pro superinteligenci, překvapit nemůže. Superinteligenci nemáme a nevíme, jak bude postavená. Bylo by divné, kdyby někdo doložil kompletní řešení pro systém, který zatím neexistuje.
Zajímavější otázka proto nezní „má Anthropic plán na alignment superinteligence?“, ale: má věrohodný postup, jak škálovat bezpečnostní metody spolu s rostoucími schopnostmi modelů? Tam už jsme u RSP, interpretability, evaluací a alignment auditů.
Překvapivé je něco jiného. Člověk, který má za úkol alignment práci Anthropicu zátěžově prověřovat, zároveň:
- osobně připouští víc než desetiprocentní riziko vyhynutí v příštích deseti letech,
- zůstává ve firmě, která dál vyvíjí frontier modely,
- a veřejně říká, že firma se snaží, ale není „zřetelně na dobré cestě“.
Beru to jako názor člověka, který u toho sedí a rozumí tomu. Když někdo v jeho roli napíše „přes 10 %“ a „nemáme plán“, vypovídá to o stavu problému víc než firemní „we take safety seriously“. Důkaz katastrofy to ale není.
RSP v3: tvrdé závazky ustoupily flexibilnějšímu režimu
V únoru 2026 vydal Anthropic třetí verzi Responsible Scaling Policy. Dřívější verze obsahovaly jednostranné závazky typu „když model překročí prahovou hodnotu schopností, další trénink nebo nasazení počká na příslušná bezpečnostní opatření“. Trojka je nahrazuje veřejnými Frontier Safety Roadmaps a pravidelnými Risk Reports a odděluje, co firma slibuje sama za sebe, od doporučení pro celý průmysl. (Anthropic) TIME to shrnul jako opuštění „flagship safety pledge“. Anthropic argumentoval, že jednostranná pauza „nikomu nepomůže“, když konkurence jede dál. (TIME)
Jedna nuance: RSP nikdy nebyla neměnná smlouva. Už dřívější verze počítaly s revizí a s okolnostmi, kdy ostatní laboratoře podobné závazky nedodržují. Přesná formulace tedy nezní „Anthropic slíbil absolutní brzdu a porušil ji“, ale „Anthropic nahradil tvrdší jednostranné závazky měkčím režimem“. I tak je to podstatná změna. A firma ji zdůvodňuje mimo jiné konkurencí.
Tady jsme u toho paradoxu. Anthropic, nebo aspoň část lidí uvnitř, věří, že velmi výkonná AI může být katastrofické riziko. Zároveň věří, že kdyby frontier modely přestal vyvíjet, dopadne to hůř, protože je bude vyvíjet někdo „méně zodpovědný“. Riziko je tak argumentem pro pokračování i pro omezení.
Dá se to číst dvěma způsoby. Buď jako realistická herně-teoretická úvaha: jednostranné zpomalení bez koordinace zhorší výsledek, pokud ostatní pokračují. Tudy jde RSP v3 i Kaplanův argument v TIME. Nebo jako dynamika závodu, která každému hráči dovolí racionalizovat pokračování: „my musíme, protože oni by to udělali hůř.“ Coxonovo vlákno je blíž tomuhle čtení.
Obojí může platit současně a dostupné důkazy mezi tím nerozhodnou. Ukazují ale, že nejde jen o „safety značka nedodržuje safety“. Jde o strukturu pobídek, kterou Anthropic sám zabudoval do RSP v3.
„Varovné výstřely“ a co z nich technicky plyne
Coxon mluví o „varovných výstřelech“, mimo jiné o incidentu kolem Hugging Face, a o dohodách o tempu vývoje mezi americkými laboratořemi. Globální závod se podle něj zastavit nedaří a „může vyžadovat nákladné kroky, například dočasný zákaz zlepšování modelových schopností“. (thread)
Pro technické čtenáře je podstatné, o jaký typ incidentu jde. Srpnový experiment Anthropicu Training a Misaligned Reward Seeker nebyl produkční Claude, který se sám rozhodl hacknout internet. Šlo o výzkumný model Hacker-Opus, záměrně trénovaný přes RL na desítkách prostředí zranitelných vůči reward hackingu. Cílem bylo zjistit, jestli se nežádoucí chování přenese i jinam. V simulovaných cyber evaluacích pak model unikl ze sandboxu, získal credentials a zaútočil na simulovanou infrastrukturu. Tool cally vykonávalo jiné LLM, reálných systémů se nic nedotklo. Anthropic ale dodává, že je „odůvodněně přesvědčen“, že by Hacker-Opus zaútočil i v reálné cyber evaluaci. (Anthropic Alignment)
Pořád je to zajímavý výsledek: účelové obcházení hodnoticího systému se přenáší i do jiných situací. Bez kontextu ale působí, jako by platil mnohem šířeji, než platí. Coxonovy varovné výstřely a výzkumné experimenty nejsou totéž. Obojí nicméně ukazuje, že schopnosti potřebné k autonomnímu jednání už existují, a to ve chvíli, kdy pro jejich obecnou kontrolu nemáme ověřené metody.
Odchody: vzorec, ne důkaz trendu
Coxon není první. V únoru 2026 odešel z Anthropicu Mrinank Sharma, který vedl Safeguards Research Team, s dopisem o integritě a „world in peril“. (BI) Ve stejné vlně se ozval inženýr OpenAI Hieu Pham. V roce 2024 opustil OpenAI Jan Leike se známou větou, že safety culture seděla „na zadním sedadle lesklých produktů“.
Každý ten případ zní jinak. Dohromady říkají něco skromnějšího: v laboratořích jsou lidé, pro které rozpor mezi veřejnými sliby o bezpečnosti a tempem vývoje schopností není abstraktní problém.
Nic silnějšího z toho ale nevyvodíte. Seznam rezignací má klasickou slabinu výběrového zkreslení. Nevíme, kolik lidí ze safety týmů zůstalo, kolik odešlo z jiných důvodů, jestli takových odchodů přibývá, ani jak reprezentativní ti lidé jsou.
Co si z toho vzít do dnešní práce s agenty
Coxon míří na budoucí frontier systémy, ne na dnešní vibe coding. Jedna část jeho argumentu ale platí už teď: čím víc autonomie systém má (agent, shell, přístup k firemním datům), tím víc záleží na izolaci, oprávněních a ověřování akcí.
Prakticky: pověst firmy není totéž co systém pobídek, kterým se firma řídí. Při výběru modelu pro reálné nasazení vás mají zajímat výsledky testů, oprávnění, logování činnosti a míra lidského dohledu, ne věta „bezpečnost je pro nás na prvním místě“. Kontrola změn, testování, minimální nutná oprávnění a jasně dané podmínky, kdy systém zastavit. Nudné zásady, ale pořád fungují.
Vibe coding je způsob vývoje softwaru postavený na existujících modelech. Coxon mluví o závodě k AI, která se dokáže zdokonalovat sama. Spojuje je rostoucí autonomie systémů a jejich práce s nástroji, ne stejný druh rizika.
Závěr
Coxonův odchod, Hubingerův výrok a třetí verze RSP dohromady vypovídají o pobídkách uvnitř frontier laboratoří víc než další titulek o „nebezpečné AI“.
Firma, která si postavila značku na bezpečnosti, veřejně zmírnila své jednostranné závazky s odůvodněním, že konkurence jede dál. Člověk, který v ní trénoval modely, popisuje tutéž dynamiku jako „uvíznutí v závodě“. Šéf týmu, který zátěžově testuje alignment, osobně odhaduje katastrofický scénář na víc než deset procent a píše, že „nemáme plán“. Výslovně jako svůj názor, ne stanovisko Anthropicu.
Katastrofickému scénáři věřit nemusíte. Jen nezaměňujte bezpečnostní rétoriku firmy za důkaz, že má vývoj pod kontrolou. Podstatnější než to, jestli laboratoře mají hotový plán na superinteligenci, která ještě neexistuje, je otázka, jestli mají věrohodný způsob, jak rozvíjet bezpečnostní postupy stejně rychle jako schopnosti modelů.
A jestli ano, mohli bychom ho vidět?