Firma OpenAI, tvorca ChatGPT, zverejnil 1. septembra 2026 dokument s názvom Path to Astra a v ňom prvýkrát nahlas priznáva niečo, čo doteraz nikdy nepovedal. Ich pripravovaný model Astra dosiahol v kyberbezpečnosti úroveň, ktorú si sami vo svojom bezpečnostnom rámci označili ako kritickú, takže ide o najsilnejší a zároveň najcitlivejší model, aký kedy chystali na vydanie.
As we prepare to release Astra, we’re focused on making increasingly capable AI safe and broadly accessible.
— OpenAI (@OpenAI) September 1, 2026
Astra represents a significant advance in cybersecurity capability, reaching the Critical threshold under our Preparedness Framework.
We're previewing how we evaluated…
Čo Astra vlastne dokáže
Astra vie sama nájsť takzvané zero day chyby, teda diery v softvéri, o ktorých zatiaľ nikto na svete nevie, a to aj v systémoch, ktoré sú poriadne zabezpečené. Nezostáva však len pri hľadaní, lebo z tých chýb dokáže poskladať aj funkčný útok od začiatku do konca, bez toho, aby jej pri tom človek akokoľvek pomáhal. Počas testovania sa dostala z izolovaného prostredia prehliadača až k spúšťaniu príkazov na samotnom počítači a našla spôsob, ako si v zabezpečenom operačnom systéme zvýšiť vlastné oprávnenia.
Čísla zo správy, ktoré stoja za pozornosť
V teste ExploitBench dosiahla Astra plných sto percent pri zneužívaní známych zraniteľností. V internej verzii toho istého testu, ktorá prebiehala od júna do augusta 2026 na dvadsiatich vážnych chybách v jadre prehliadača V8, bola úspešnejšia ako doterajší GPT-5.6 Sol a potrebovala na to výrazne menej tokenov. Priamo počas hodnotenia navyše objavila dve úplne nové zero day chyby, o ktorých dovtedy nikto netušil.
Prekvapenie: je zároveň oveľa poslušnejšia
Astra odmietla 91,5 percenta zakázaných požiadaviek, kým GPT-5.6 Sol ich odmietol len v 59 percentách prípadov. V pasciach, ktoré OpenAI nastražil priamo v testovacom prostredí, sa Astra ani raz nepokúsila dostať tam, kam nemala, hoci starší model to skúsil v 56 percentách testov. Práve svojvoľné konanie modelov pritom spôsobilo letný incident s Hugging Face, po ktorom firma na dva týždne pozastavila tréning svojich najsilnejších modelov.
Kedy to vyjde a kto sa k tomu dostane
Prístup bude postupný a veľmi opatrný. Najskôr model dostane úzka skupina alfa testerov na náročnú bezpečnostnú prácu, potom sa otvorí širšie cez program Daybreak Blue, ktorý je určený výhradne na obranu. Tréning OpenAI reštartoval 28. augusta 2026, teda až po tom, čo doplnil nové bezpečnostné vrstvy, medzi ktoré patria klasifikátory, sledovanie myšlienkového postupu modelu a možnosť prerušiť podozrivú aktivitu užívateľa priamo počas práce. Podrobnú systémovú kartu firma sľubuje zverejniť pri samotnom spustení.
Konkurencia medzitým nespí
Astra prichádza do situácie, kde má OpenAI horúcu pätu. Anthropic len pred pár dňami vydal Claude Fable 5.1 a Mythos 5.1 a rovnako otvorene hovorí o rizikách, keďže vlastnú správu o bezpečnostných incidentoch zverejnil tiež. Model Mythos už predtým ukázal, čo dokáže, keď naštrbil bezpečnosť NSA za pár hodín. Obe firmy tak dnes stavajú niečo, čo vedia zneužiť rovnako dobre, ako ochrániť, a otvorene o tom píšu vopred.
Anthropic zverejnil Claude Fable 5.1 a Mythos 5.1: Nové modely, ktoré posúvajú latku v AI
