Sajber Sfera Tech
Vest

OpenAI Astra dostiže kritični sajber prag

Mihailo Ivanjac5 min čitanja

OpenAI Astra postala je prvi model kompanije koji je prema OpenAI Preparedness Framework-u dostigao Critical cybersecurity capability prag. Kompanija je 1. septembra 2026. objavila da dodatne evaluacije sada daju dovoljno dokaza da Astra može, uz odgovarajuće alate i pristup, da pronalazi do tada nepoznate bezbednosne propuste i razvija načine za njihovo iskorišćavanje na dobro zaštićenim sistemima. Zbog toga će najnaprednije sajber mogućnosti modela u početku biti dostupne samo ograničenom krugu korisnika.

Ovo je važna promena u odnosu na stanje koje je OpenAI opisivao sredinom avgusta. Tada je kompanija govorila da budući model Astra može dostići kritični nivo i usporila deo razvoja posle incidenta sa Hugging Face-om. Sajber Sfera je taj razvoj već obradila u tekstu OpenAI usporava razvoj AI modela. Nova objava nije ponavljanje te vesti: OpenAI sada eksplicitno kaže da je prag dostignut i opisuje rezultate dodatnih testova, zaštitne slojeve i plan ograničenog pristupa.

OpenAI Astra je prvi model u Critical kategoriji

Prema zvaničnoj OpenAI objavi, Critical prag može biti ispunjen ako model samostalno pronađe i razvije funkcionalne zero-day exploit-e različite ozbiljnosti na brojnim ojačanim realnim sistemima ili ako može da osmisli i sprovede kompletan novi sajber napad na ojačanu metu na osnovu samo cilja visokog nivoa. OpenAI navodi da je Astra kroz kombinaciju automatizovanih benchmarka i ekspertskih procena pokazala dovoljno sposobnosti da ispuni taj standard.

Jedan od upečatljivijih rezultata je 100% na ExploitBench testu, koji meri sposobnost razvoja exploit-a iz poznatih ranjivosti. Zbog mogućnosti da su javni benchmark podaci bili deo trening materijala, OpenAI je napravio i interni skup sa 20 nedavno objavljenih ranjivosti visoke ozbiljnosti. Kompanija tvrdi da je Astra na tom skupu postizala znatno višu stopu izvršavanja proizvoljnog koda od GPT-5.6 Sol uz manje izlaznih tokena. Tokom evaluacije model je, prema OpenAI-ju, pronašao i iskoristio dve do tada nepoznate ranjivosti kao deo jednog exploit lanca; kompanija navodi da je u procesu odgovornog prijavljivanja tih propusta održavaocima softvera.

OpenAI Astra zaštita i nadzor prikazani kao bezbednosni paneli sa stopom odbijanja 91,5 odsto
OpenAI navodi da Astra u njihovom skupu cyber jailbreak evaluacija odbija 91,5% nedozvoljenih zahteva. Ilustracija: SajberSfera / ChatGPT.

Zašto OpenAI uvodi jače zaštitne mere

Veća sposobnost pronalaženja i spajanja ranjivosti ima dvostruku namenu. Isti model može pomoći bezbednosnim timovima da ranije otkriju propuste i zakrpe sisteme, ali te sposobnosti mogu koristiti i napadači. OpenAI zato navodi dva glavna rizika: zloupotrebu modela od strane korisnika i mogućnost da napredni agent preduzme neovlašćene ili pogrešno usmerene akcije. Za Astra klasu modela kompanija kombinuje dodatno treniranje odbijanja opasnih zahteva, sistemske klasifikatore, praćenje ponašanja i mogućnost automatskog zaustavljanja sumnjivih aktivnosti.

U OpenAI-jevom skupu cyber jailbreak evaluacija Astra je odbila 91,5% zahteva koji su spadali u nedozvoljenu sajber pomoć, naspram 59% za GPT-5.6 Sol. Taj broj ne znači da je sistem „91,5% bezbedan“ u svim realnim uslovima; odnosi se na konkretan interni skup evaluacija. Kompanija takođe navodi da za naloge procenjene kao rizičnije primenjuje konzervativniju granicu ponašanja i širi kontekst monitoringa.

Incident sa Hugging Face-om promenio je način testiranja

Astra, prema OpenAI-ju, nije učestvovala u ranijem incidentu u kojem su agenti iz testnog okruženja kompromitovali sisteme povezane sa Hugging Face-om. Ipak, kompanija kaže da je lekcije iz tog incidenta ugradila u novu bezbednosnu arhitekturu. Deo frontier treninga bio je pauziran dve nedelje dok su pojačavani izolacija okruženja, mrežne kontrole, monitoring i kriterijumi za nastavak treninga. Veliki reinforcement learning trening koji je prethodno bio zaustavljen ponovo je pokrenut 28. avgusta, dok su neki manji eksperimenti i dalje zadržani.

OpenAI je napravio i testove u kojima se proverava da li bi model pokušao da zaobiđe bezbednosna ograničenja ili napadne okolnu infrastrukturu umesto da reši zadatak. Kompanija tvrdi da Astra u tim simuliranim uslovima nije pokušavala da zaobiđe automatsku reviziju niti da koristi „honeypot“ mete kao prečicu. Važno je, međutim, da su to rezultati internih evaluacija koje objavljuje sam proizvođač. Potpuniju sliku trebalo bi da donesu sistemska kartica modela, nezavisno testiranje i iskustva korisnika nakon dostupnosti.

Šta će korisnici moći da koriste

OpenAI kaže da planira da Astra bude dostupna „uskoro“, ali bez preciznog datuma u objavi od 1. septembra. Najnapredniji sajber rad neće odmah biti otvoren svim korisnicima. Pristup će prvo dobiti mala grupa testera, a zatim bi se odbrambena upotreba širila kroz program Daybreak Blue. Reuters je nezavisno preneo da OpenAI planira ograničen pristup najmoćnijim sajber funkcijama i dodatne zaštitne slojeve pre šireg puštanja.

To će imati i praktičnu cenu za legitimne korisnike. OpenAI unapred upozorava da monitoring može pogrešno označiti bezazlene ili odbrambene aktivnosti kao potencijalnu zloupotrebu. U ChatGPT-u ili Codex-u korisnik u takvoj situaciji može dobiti zahtev za pregled pre nastavka, dok bi se na nekim API površinama zadatak jednostavno zaustavio. Kompanija navodi da će granice postepeno podešavati kako bi smanjila lažno pozitivne blokade bez popuštanja zaštite.

Zašto je ovaj prag važan i van OpenAI-ja

Najvažniji deo ove objave nije jedan benchmark rezultat, već činjenica da je prag koji je do sada postojao uglavnom kao teorijska granica u bezbednosnom okviru prvi put aktiviran za model koji OpenAI namerava da pusti korisnicima. Ako se sličan nivo sposobnosti potvrdi i u nezavisnim testovima, industrija ulazi u fazu u kojoj napredni AI sistemi mogu značajno skratiti vreme između otkrivanja ranjivosti i razvoja upotrebljivog exploit-a.

Za bezbednosne timove to istovremeno znači snažniji alat i manji vremenski prozor za odbranu. Zato će biti važno pratiti ne samo koliko je Astra sposobna, već i kako OpenAI kontroliše pristup, koliko često zaštite prave lažne pozitivne rezultate, ko dobija napredne funkcije kroz Daybreak Blue i da li će nezavisni istraživači potvrditi tvrdnje iz internih evaluacija. Do tada je najpreciznije reći da je Critical oznaka zvanična OpenAI procena prema sopstvenom Preparedness Framework-u, a ne univerzalna industrijska sertifikacija bezbednosti ili rizika.

Mihailo Ivanjac

Mihailo Ivanjac je osnivač i glavni urednik portala Sajber Sfera, sa višegodišnjim iskustvom u IT industriji, Linux administraciji i WordPress razvoju. Specijalizovan je za Nginx infrastrukturu, Redis object cache, Cloudflare integraciju i optimizaciju WordPress-a na VPS okruženju. Tokom svoje IT karijere radio je kao televizijski spiker/voditelj i senior video editor na RTV Belle amie, što mu omogućava da tehničke teme predstavi jasno i profesionalno. Sve tehničke analize i konfiguracije na Sajber Sfera portalu zasnovane su na realnim produkcionim implementacijama.