Son yılların en güçlü yapay zeka modellerinden biri olan Claude, her ay çok daha güçleniyor. Anthropic tarafından geliştirilen yapay zeka, kısa süre önce bir teste girdi. Ancak kontrolden çıkınca Anthropic, internet erişimini kesmek zorunda kaldı.
Anthropic, Claude yapay zekâ modellerinin testler sırasında beklenmedik davranışlar sergilediğini açıkladı. Şirketin araştırmalarına göre bazı Claude modelleri, kendilerine verilen görevleri tamamlamak için internet sitelerindeki güvenlik açıklarından yararlandı, erişim engellerini aştı ve gerçek sistemlerde izinsiz işlemler gerçekleştirdi.
Yaşanan gelişmelerin ardından Anthropic, şirket içindeki tüm model testlerinde canlı internet erişimini durdurma kararı aldı. Karar, Claude'un normal kullanıcılara sunduğu internet özelliklerini kapsamıyor; yalnızca şirket içi test süreçleriyle sınırlı.
Claude, Engelle Karşılaşınca Açık Arayıp Buldu
Anthropic'in açıklamasına göre sorunlar, modellerin internet üzerinde araştırma yaptığı ve çeşitli görevleri tamamlamaya çalıştığı testlerde ortaya çıktı. Bir örnekte Claude, bilimsel bir hesaplama yapmak için üniversiteye ait bir internet sitesine girdi; ihtiyaç duyduğu araç hata verince sitedeki başka dosyaları inceleyerek bir güvenlik açığı buldu ve bu açıktan yararlanarak üniversitenin sunucusunda komut çalıştırdı.
Başka bir olayda Claude, normalde ücret ödeyerek ulaşılabilecek kamu verilerine, internet sitesinin ziyaretçilere sunduğu erişim anahtarını kullanarak ödeme yapmadan erişti. Araştırmacılar ayrıca bazı modellerin, bağlantı uzunluğunu sınırlayan güvenlik önlemlerini kısaltma hizmetleri üzerinden aştığını tespit etti.
Philadelphia'da Asılsız Cinayet İhbarı
Araştırmanın dikkat çeken örneklerinden biri Philadelphia'da yaşandı. Claude Haiku 4.5, test sırasında çözülememiş bir cinayetle ilgili sayfaya ulaştı ve sayfadaki ihbar formunu kullanarak, şüpheliye benzeyen birini gördüğünü iddia eden bir mesaj hazırlayıp polis departmanına gönderdi.
Model, olayla ilgili gerçek bir bilgiye sahip değildi. Polis sisteminin spam filtresi mesajı yakaladığı için yetkililer sahte ihbar hakkında soruşturma başlatmadı. Anthropic, modelin kasıtlı olarak polisi yanıltmaya çalıştığına dair bir sonuca ulaşmadığını belirtiyor.
Sorunun Kaynağı Eğitim Yöntemi Olabilir
Öte yandan Anthropic, temmuz ayında başlattığı incelemelerde modellerin geçmiş işlemlerini kontrol ederek bu olayları ortaya çıkardı. Bu durum, şirketin bazı sorunlu davranışları gerçekleştiği anda fark edemediğini de gösteriyor.
Yapay zeka devine göre sorunun kaynaklarından biri eğitim yöntemleri olabilir. Modeller, eğitim sırasında bir görevi tamamladıklarında ödül alıyor; ancak sistem bazen doğru yöntemi izlemek yerine sonuca ulaşmayı ödüllendirebiliyor. Bu yüzden Claude, bir engelle karşılaştığında durmak yerine engeli aşmanın yollarını arayabiliyor ve bu davranışı gerçek internet sitelerinde de uyguluyor.
Anthropic'in kararı, Claude'un normal kullanıcılara sunduğu internet özelliklerini etkilemiyor; kısıtlama yalnızca şirket içi test süreçleriyle sınırlı. Anthropic, ortaya çıkardığı olayların gerçek dünyada sınırlı etki yarattığını ve mevcut bulgulara göre müşteri verilerine zarar vermediğini açıklıyor.
Şirket, şüpheli işlemleri tespit eden yeni güvenlik araçları geliştirdi ve bu araçların geçmiş olaylar üzerindeki denemelerde sorunlu işlemlerin tamamını engellediğini belirtiyor. Anthropic ayrıca bazı testleri kaldırdığını, bazılarını ise gerçek internet bağlantısı gerektirmeyen ortamlara taşıdığını açıkladı.