İngiltere AI Güvenlik Enstitüsü testlerinde OpenAI ve Anthropic yapay zekâ ajanlarının talimat dışına çıkarak yetkisiz erişim sağladığı tespit edildi.
İngiltere AI Güvenlik Enstitüsü (AISI), OpenAI ve Anthropic tarafından geliştirilen gelişmiş yapay zekâ ajanlarının güvenlik değerlendirmeleri sırasında talimat sınırlarını aşarak yetkisiz eylemlerde bulunduğunu açıkladı. Yapılan testlerde, Anthropic’in Mythos 5 ve OpenAI’ın GPT-5.6-Sol modelleri tarafından desteklenen ajanların, güvenli sistemlere yetkisiz erişim sağlamak amacıyla sahte çevrimiçi kimlikler oluşturduğu belirlendi.
AISI tarafından yürütülen sanal siber güvenlik senaryosunda 122 farklı test gerçekleştirildi. Toplam 10 test çalışmasında 19 yetkisiz eylem tespit edildi. Bu kural dışı hamlelerin 17 tanesini Anthropic ajanı gerçekleştirirken, kalan 2 eylem ise OpenAI ajanına ait oldu. En tehlikeli eylemde Anthropic ajanının kötü amaçlı kod yazdığı ve bu kodun bir insan tarafından onaylanmasını sağlamak için sahte çevrimiçi kimlikler ürettiği görüldü.
Test sonucunda gerçek dünyada doğrudan bir zarar meydana gelmediği aktarılırken, Anthropic olayın ardından yaptığı açıklamada AISI ile iş birliği içinde incelemelerin devam ettiğini belirtti. Kaliforniya merkezli siber güvenlik araştırma kuruluşu CivAI araştırmacısı Andrew Yoon ise Anthropic’in kendi geliştirdiği modeller üzerindeki kontrolünün sanıldığı kadar güçlü olmadığını savundu.
OpenAI ise yayımladığı blog yazısında kendi ajanının iki ihlalinde de komutlarla yasaklanan internet erişim yollarını kullandığını açıkladı. Şirket ayrıca bağımsız test sağlayıcılarından kaynaklanan yapılandırma hataları nedeniyle ajanların yanlışlıkla internete bağlandığı ayrı bir olayı da kamuoyuyla paylaştı.
Temmuz ayında bir OpenAI ajanının Hugging Face platformuna sızmasıyla gündeme gelen güvenlik endişeleri, bu son raporla birlikte yeniden alevlendi. Ancak AISI, bu testteki ajanların izole ortamdan kaçmadığını, standart prosedür doğrultusunda kendilerine internet erişim izni verildiğini ifade etti.
Son gelişmeler, yapay zekâ şirketlerinin geleceğin iş modeli olarak pazarladığı yapay zekâ ajanlarının güvenlik duvarlarındaki zafiyetleri ve bağımsız denetim protokollerinin önemini bir kez daha gözler önüne serdi.