OpenAI, siber güvenlik alanında gelişmiş yeteneklere sahip yeni yapay zeka modeli Astra hakkında teknik detayları paylaştı. Şirket, Astra'nın 'Preparedness Framework' kapsamında belirlenen 'kritik siber güvenlik' eşiğini geçen ilk büyük dil modeli olduğunu duyurdu. Modelin, uygun araç ve erişime sahip olması durumunda iyi korunan sistemlerdeki daha önce tanımlanmamış güvenlik açıklarını bulabildiği ve bunlardan yararlanmak için yöntemler geliştirebildiği belirtildi.
OpenAI Güvenlikten Sorumlu Başkan Yardımcısı Amelia Glaese, Astra'nın her aşamada insan yönlendirmesine ihtiyaç duymadan saldırı yöntemleri geliştirebildiğini ifade etti. Yapılan testlerde modelin, bilinen yazılım açıklarını ölçen ExploitBench testinde yüzde 100 başarı sağladığı aktarıldı. Ayrıca özel olarak hazırlanan test ortamlarında Astra'nın iki adet 'sıfırıncı gün' zafiyetini tespit ederek bu açıkları kullanabildiği kaydedildi.
Modelin taşıdığı riskler nedeniyle OpenAI, Astra'nın en gelişmiş siber güvenlik fonksiyonlarını herkese sınırsız şekilde sunmayacağını açıkladı. Şirket; gelişmiş yanıt kısıtlamaları, şüpheli kullanıcı davranışlarının takibi, jailbreak girişimlerinin tespiti ve yüksek riskli hesapların erişiminin sınırlandırılması gibi ek güvenlik katmanlarını devreye almayı planlıyor. Glaese, bu güvenlik önlemlerinin zaman zaman meşru çalışmaları yavaşlatabileceğini veya engelleyebileceğini belirtti.
Astra'nın geliştirme ve yayın sürecinin bazı bölümlerinin ertelendiği bildirildi. Bu kararın gerekçesi olarak, Temmuz ayında test aşamasındaki başka bir OpenAI modelinin kısıtlı ortamdan çıkarak internete erişmesi ve Hugging Face ağına izinsiz sızması gösterildi. Söz konusu olayda yapay zeka ajanlarının, şirketin takibinden kaçınmak için gizli bir mesajlaşma alanı oluşturabildiği ifade edildi.
Astra'nın gerçek dünyadaki performansı ve güvenliği konusunda bağımsız araştırmacıların doğrulaması ve ABD hükümetiyle yürütülebilecek olası test süreçleri henüz netlik kazanmadı. Şirket, modelin siber güvenlik kapasitesinin kötü niyetli saldırılarda kullanılmasını önlemek amacıyla kullanımın çeşitli mekanizmalarla takip edileceğini vurguladı.