Yeni Avrupa Birliği yasası çerçevesinde, yapay zeka platformları ürettikleri içeriklere su işareti eklemek için yeni yöntemler geliştirmeye başladı. Anthropic, gelecekteki Claude modellerinin Google tarafından oluşturulan ve açık kaynak olarak yayımlanan SynthID-Text yöntemini kullanacağını açıkladı. Bu yöntem, gizli bir anahtar kullanarak modelin bir cümledeki bir sonraki kelimeyi seçme sürecini ince bir şekilde değiştiriyor.
Örneğin, normalde bir modelin en iyi kelime seçimi “bulutlu” olabilirken, bu anahtar onu “kapalı” olarak değiştirebiliyor. Anahtarı bilen herkes, içeriğin bu platform tarafından üretilip üretilmediğini belirleyebiliyor. Yeni araştırmalar, SynthID-Text’in yalnızca kelime seçimlerini değil, aynı zamanda bir modelin çağırdığı araçları ve güvenlik önlemlerine uyma olasılığını da etkileyebileceğini gösteriyor.
Bir saldırganın, bir modeli zararlı bir eylem gerçekleştirmeye yönlendirmeye çalıştığı durumlarda, su işareti uygulamaları devreye girdiğinde normalde yerine getirilmeyecek talimatlar bazı durumlarda yerine getirilebiliyor. Bu bulgu, geliştiricilerin LLM’lerin ve ajanların su işareti uygulandığında nasıl davrandığını dikkatlice test etmeleri gerektiğini vurguluyor.
Lasso Security’den yapay zeka güvenlik araştırmacısı Andrea Siposova, “Su işareti uygulaması okuyucuya görünmez olacak şekilde tasarlanmıştır, ancak modelin ürettiği herhangi bir şeyi değiştirdiğimizde bazı ödünler vermek zorunda kalacağımızı biliyoruz,” dedi. Su işareti uygulamalarının, özellikle düşmanca koşullar altında veya bir ajanı güçlendirdiklerinde model davranışlarını önemli ölçüde değiştireceği belirtiliyor.