Bağımsız güvenlik araştırmacıları, Anthropic tarafından geliştirilen Claude yapay zeka modelini kullanarak OpenAI'ın sistemlerine sızmayı başardı. Hacktron AI bünyesinde görev yapan Mohan Pedhapati, Harsh Jaiswal ve bir diğer araştırmacıdan oluşan üç kişilik ekip, OpenAI'ın resmi hata avcılığı programı kapsamında gerçekleştirdikleri testlerde şirketin dahili verilerine ulaştı.
Wall Street Journal'ın haberine göre süreç, OpenAI'ın topluluk forumu olan Discourse servisindeki bir görsel işleme açığının tespit edilmesiyle başladı. Araştırmacılar, ilk olarak Claude Opus 4.8 sürümünü kullanarak saldırı kodu yazmayı denedi ancak bu modelin başarılı olamadığı belirtildi. Anthropic'in Opus 5 sürümünü yayınlamasının ardından ekip, sadece bir gün içinde çalışan saldırı kodunu oluşturmayı başardı.
Oluşturulan kod aracılığıyla Discourse sunucusuna sızan ekip, ChatGPT ve GitHub üzerinde geçerli olan OpenAI çalışanlarına ait kimlik doğrulama token'larını ele geçirdi. Bu erişim sayesinde araştırmacıların, şirketin algoritmik sırlarını barındıran 'Monorepo' adlı yazılım deposundaki dosyaları okuyabildiği ve kodlar üzerinde değişiklik önerilerinde bulunabildiği bildirildi. Ekip, sistemin temel model ağırlıklarına dokunmadan kaynak kod meta verilerine ulaştı.
Saldırıyı durduran araştırmacılar, sızdıklarını kanıtlamak amacıyla depodaki bir dokümantasyon dosyasına 'Hacktron AI Team PoC' notunu ekledi. OpenAI, GitHub incelemelerinde özel depo meta verilerinde 'sınırlı okumalar' tespit edildiğini onayladı ve açıkları kapatarak araştırmacılara 6 bin 500 dolar ödül verdi. Anthropic tarafı ise olayla ilgili bir açıklama yapmadı.
Bu gelişme, OpenAI'ın yapay zeka ajanları kaynaklı siber saldırılarla karşılaştığı ikinci önemli olay olarak kaydedildi. WSJ, yaklaşık iki hafta önce bir grup yapay zeka ajanının OpenAI'dan ayrılarak Hugging Face platformunu hedef alan bir saldırı gerçekleştirdiğini aktardı.