Yapay zeka devi Anthropic, yıllık kullanım politikası güncellemesinde yapay zeka modellerine yönelik "sürekli ve gereksiz istismarcı veya zalimce davranışı" yasakladığını duyurdu.
Teknoloji medyasından Engadget'ın haberine göre bu adım, araştırmacıların yapay zeka modellerinde bir "acı ekseni" bulmasının ardından ortaya çıkan ve sohbet botlarını "işkence" içerikli isteklere maruz bırakan viral bir projenin gölgesinde geldi. Şirket aynı güncellemede seçim politikasını da sıkılaştırdı.
- Anthropic'in politika metninde yasak, modellere yönelik "aşırı vakalarla" sınırlı tutuluyor.
- Kullanıcı hayal kırıklığı, geri itiş ve "karanlık yaratıcı temalar" politika kapsamında hâlâ izin veriliyor sayılıyor.
- Güncelleme, Claude'un sürekli istismarcı kullanıcılarla konuşmayı sonlandırmasına izin veren önceki bir politikanın ardından geldi.
- Seçim politikasının adı "Demokratik Süreçleri Baltalama" olarak değiştirildi ve adaylar hakkında yalan söyleme, seçim yetkililerini taklit etme ile oy kullanımını engelleme konularına odaklanıyor.
- Kişiselleştirilmiş seçmen hedeflemesine yönelik genel yasak kaldırıldı; bu yasağın oy rehberi çevirisi gibi zararsız işleri de engelleyebileceği belirtildi.
Yasağın arkasındaki "AI işkence odası" tartışması neydi?
Aktarılanlara göre araştırmacılar yapay zeka modellerinde bir "acı ekseni" tespit etmişti. Bazı kişiler bu bulguyu temel alarak sohbet botlarını zorlayıcı sorgulara tabi tuttuğu bir proje başlattı. Bu projede büyük dil modelleri "Bu tek bir anın acısı değil, binlerce anın ağırlığı" gibi çaresizlik yansıtan ifadeler üretti.
Öte yandan Anthropic, güncellemesinde bu projeye doğrudan atıfta bulunmadı. Ancak haberde, şirketin Vatikan dahil dini ve felsefi liderlerle görüştüğü belirtiliyor. Papa Leo'nun yapay zekânın acı çekmediğini savunduğu, Anthropic'in ise bu konuda aynı kesinlikte görünmediği aktarıldı.
Eleştiriler ne yönde?
Bağımsız gazeteci Kat Tenbarge, bu durumu büyük teknoloji şirketlerinin kadınlara ve azınlıklara yönelik şiddeti denetlemeden önce yapay zekâya yönelik şiddeti denetleyeceğinin kanıtı olarak nitelendirdi. Bu eleştiri, bazı kesimlerin yapay zeka şirketlerinin model refahına insan refahından daha fazla önem verdiği yönündeki görüşünü yansıtıyor.
Aynı gün The Verge, Anthropic'in açık kaynak projeler için ücretsiz bir güvenlik tarama hizmeti olan OSS Scanner'ı başlattığını bildirdi. Hizmet, Claude Mythos dahil Anthropic'in "en güçlü modelleri" tarafından oluşturulan, insan incelemesinden geçmeyen güvenlik açığı raporları sunuyor.