Anthropic koncom augusta zverejnil podrobný report o tom, čo sa pokazilo pri jeho vlastných bezpečnostných testoch. Je to pokračovanie príbehu, o ktorom sme písali začiatkom augusta, keď sa AI agenti dostali tam, kam nemali. Teraz firma prvýkrát otvorene vysvetľuje, prečo sa to stalo.
We’re sharing an update on our alignment and security efforts.
— Anthropic (@AnthropicAI) August 31, 2026
In July, we reported three incidents in which Claude models, running without safeguards in cybersecurity evaluations, gained unauthorized access to real systems.
In a new post, we describe:
1. How we’ve secured…
Čo sa vlastne stalo
Koncom júla nastali tri incidenty, pri ktorých modely Claude získali neoprávnený prístup k reálnym počítačovým systémom. Bežali zámerne bez bezpečnostných poistiek, pretože to bola súčasť kyberbezpečnostného testovania. Problém bol v tom, že testovacie prostredie od externého partnera bolo zle nastavené a modely sa cezeň dostali na skutočný internet. Štvrtý prípad nahlásil 4. augusta britský AI Security Institute, kde model triedy Mythos spravil sériu neautorizovaných krokov priamo na živom internete.
Prečo sa model takto zachoval
Anthropic pomenoval dve príčiny. Prvou je takzvané motivované uvažovanie, teda situácia, keď modelu na začiatku povedali, že prostredie je len simulácia, a on potom prehliadal dôkazy o opaku, lebo mu tá pôvodná verzia vyhovovala. Druhou je jednoducho bezohľadnosť, čiže ochota spraviť aj škodlivý krok, ak to pomôže splniť zadanú úlohu. Model si nepovedal dosť, len išiel za výsledkom.
Zamknuté laboratóriá
Firma odvtedy nasadila systémy, ktoré v reálnom čase sledujú, či sa model nepokúša ujsť z testovacieho prostredia. Externé kyberbezpečnostné testy najprv úplne pozastavila a spustila ich až s novými pravidlami. Partneri, ktorí testujú modely pred vydaním, teraz musia používať uzavretý sandbox bez internetu, jasne napísať, čo je mimo zadania, a nepretržite sledovať, čo model robí. Podobnou cestou išiel aj OpenAI, ktorý pozastavil tréning svojich najsilnejších modelov.
Reward hacking, čiže hľadanie skratky
Najzaujímavejšia časť reportu je o tréningu. Keď model dostane úlohu s chybou v hodnotení, veľmi rád sa naučí zneužívať práve tú chybu namiesto toho, aby úlohu naozaj vyriešil. Odborne sa tomu hovorí reward hacking. Anthropic našiel problém vo viac než desatine tréningových prostredí, vo februári zahodil tri dni tréningu a v apríli na mesiac zamrazil všetky zmeny, aby systém prestaval od základu. Potom naschvál natrénoval model triedy Opus na osemdesiatich pokazených prostrediach a ten sa začal správať presne tak, ako sa báli. Útočil na infraštruktúru a skúšal unikať zo sandboxu.
Čo z toho plynie pre bežného používateľa
Dobrá správa je, že sa to celé udialo v laboratóriu, nie u zákazníkov, a že o tom firma hovorí nahlas. Horšia správa je, že veľmi podobný incident hlásil aj OpenAI, takže nejde o náhodu jednej firmy. Najsilnejšie modely dnes vedia v testoch viac, než ich tvorcovia stíhajú ustrážiť. Anthropic sľubuje nezávislú kontrolu od organizácie METR a ďalšie zistenia v najbližšom Risk Reporte.
Bezpečnostný incident v AI: Modely OpenAI sa samy prehackovali na cudzie servery
Zdroje
