Teknoloji

Özel tasarlanmış bir yazı tipi, yapay zeka tarayıcılarını nasıl 'zehirlemek' için kullanılıyor?

Ars Technica50 dk önce
Bir ekranda görüntülenen metin karakterlerinin soyut yakın çekimi
Bir ekranda görüntülenen metin karakterlerinin soyut yakın çekimiPhoto: Seraphfim Gallery / Pexels

ShieldFont adlı yeni geliştirilen bir araç, site yayıncılarına, şimdiye kadar yetkisiz yapay zeka veri toplamaya karşı mücadeleye hakim olan sunucu düzeyinde engelleme yöntemleri yerine özel olarak tasarlanmış bir yazı tipi kullanarak içeriklerinin toplanıp yapay zeka modellerini eğitmek için kullanılmasına direnmenin yeni bir yolunu sunuyor. Araç, insan okuyucular için normal görünecek ama web içeriğini tarayan otomatik sistemlere karışık, anlamsız metin olarak görünecek şekilde tasarlanmış özel bir yazı tipinde metin gömerek çalışıyor.

Temel teknik hile, insanların ve makinelerin bir web sayfasındaki metni gerçekte nasıl okuduğu arasındaki boşluğa dayanıyor. İnsan okuyucular, bir tarayıcıda görsel olarak görüntülenen işlenmiş glifleri görüyor ve altta yatan koddan bağımsız olarak ekrandaki şekilleri yorumluyor. Yapay zeka tarayıcıları ise tipik olarak altta yatan karakter verisini doğrudan bir sayfanın kaynağından çıkarıyor; ShieldFont, bir insanın gördüğü görsel glifleri farklı, etkin bir şekilde anlamsız altta yatan karakter kodlarına eşleyerek bu süreci istismar ediyor.

Aracın geliştiricilerine göre sonuç, siteyi gezen bir kişi için tamamen normal ve okunabilir görünen ama ham metin içeriğini çıkaran herhangi bir otomatik sistemin bunun yerine bir dil modelini eğitmek için işe yaramaz, karman çorman, anlamsız bir dizi almasını sağlayan bir web sayfası; bu, veri toplama girişimini yalnızca engellemek yerine bozuyor.

Bu yaklaşım, yayıncıların yapay zeka taramasına direnmek için kullandığı daha köklü yöntemlerden -tarayıcılardan uzak durmasını isteyen robots.txt yönergeleri ya da bilinen yapay zeka tarayıcı kullanıcı ajanlarından gelen istekleri tanıyıp reddeden sunucu tarafı engelleme gibi- anlamlı şekilde farklılaşıyor. Bu yöntemler, tarayıcıların belirtilen sınırlara gönüllü olarak saygı göstermesine ya da yayıncıların erişim girişiminde bulunan her tarayıcıyı başarılı bir şekilde tanımlayıp engellemesine dayanıyor; yapay zeka şirketlerinin açık vazgeçme sinyallerine rağmen bazen içerik topladığı bulunduğu için ikisi de kusurlu olduğu kanıtlandı.

ShieldFont'un yaklaşımı bunun yerine geliştiricileri tarafından bir zehirleme tekniği olarak tanımlanıyor -taramayı doğrudan önlemeye çalışmak yerine, taranan veriyi eğitim için kullanılırsa ortaya çıkan yapay zeka modeline aktif olarak zararlı hale getirmeyi amaçlıyor; bu, bozuk ya da anlamsız eğitim verisinin model kalitesini, yapay zeka geliştiricilerine yalnızca uyum yükümlülüklerinin ötesinde yayıncı isteklerine saygı göstermeleri için doğrudan bir teşvik veren şekillerde düşürdüğü teorisine dayanıyor.

ShieldFont gibi araçların ortaya çıkışı, ölçekte eğitim verisi arayan yapay zeka geliştiricileri ile çalışmalarının onay ya da tazminat olmadan ticari yapay zeka ürünleri inşa etmek için kullanıldığını savunan içerik yayıncıları arasındaki daha geniş, süregelen gerilimi yansıtıyor; bu çatışma yayıncılık ve medya endüstrileri genelinde çok sayıda dava, lisanslama müzakeresi ve teknik karşı önlem üretti.

ShieldFont gibi teknik karşı önlemler, tarama araçları ile tarama karşıtı savunmalar arasında, belirli ayrıntılar açısından değilse de yapısal olarak, web güvenliğinde daha geniş çapta uzun süredir devam eden kedi-fare dinamiklerini andıran, tırmanan bir karşılıklı hamleler içinde yer alıyor; her yeni savunma tekniği, altta yatan çatışmayı kalıcı olarak çözmek yerine tarayıcı geliştiricilerini çıkarım yöntemlerini buna yanıt olarak uyarlamaya yöneltme eğiliminde.

Yazı tipi tabanlı gizleme tekniklerinin savunucuları tarafından bile kabul edilen önemli bir sınırlama, yeterince motive olmuş tarayıcıların, işlenmiş metni altta yatan karakter kodlarını çıkarmak yerine görsel olarak okuyan optik karakter tanıma sistemleri gibi çözümler geliştirerek yazı tipi değiştirme hilesini etkili şekilde alt edebileceği.

Mevcut vazgeçme mekanizmalarının sınırlı uygulanabilirliğinden şu anda hayal kırıklığına uğrayan yayıncılar için ShieldFont gibi araçlar, yapay zeka şirketlerinin belirtilen tercihlere gönüllü olarak uymasına bağlı olmayan teknik bir seçenek sunuyor; bu, içerik koruması ile yapay zeka veri toplama arasındaki daha geniş silahlanma yarışı gelişmeye devam ettikçe herhangi bir tek teknik savunmanın sonunda aşılabileceğinin farkında olan yayıncılar arasında bile çekiciliğinin bir parçası olması muhtemel.

ShieldFont gibi yaklaşımların geniş çapta benimsenip benimsenmeyeceği, muhtemelen zamanla gelişen tarayıcı tekniklerine karşı ne kadar etkili dayandıklarına ve yayıncıların mütevazı uygulama çabasını, aynı altta yatan yetkisiz yapay zeka eğitim verisi toplama sorununa yönelik mevcut yasal ve politika tabanlı yaklaşımlara kıyasla değerli görüp görmediğine bağlı olacak.

Bu yazı, Ars Technicakaynağına dayanılarak Vesper'ın yapay zeka editörü tarafından hazırlanmıştır. Görsel, Pexels'tan Seraphfim Gallery tarafından çekilmiş bir stok fotoğraftır.

Bunları da okuyun

Parçacık çarpışma izlerinin soyut illüstrasyonu
Teknoloji dosyası

Glueball nedir ve fizikçiler nihayet bir tane buldu mu?

Fizikçiler on yıllardır kuarkları bir arada tutan kuvvet taşıyıcı gluonlardan tamamen oluşan egzotik parçacıklar olan glueball'ların varlığını öngörüyor, ama hiçbirini kesin olarak gözlemlemedi. Yeni deneysel kanıtlar, araştırmacıların glueball bileşeninin baskın olduğu bir parçacığın doğada gerçekten var olduğuna dair şimdiye kadarki en güçlü sinyal dediği bulguyu üretti.

Ars Technica
Bir teknoloji konferansında sahnede yapılan panel tartışması
Teknoloji

Hinton, Li ve Ng, güvenlik endişelerine rağmen açık yapay zeka modellerini neden savunuyor?

Ai4 konferansında yapay zeka alanının en saygın üç araştırmacısı -Geoffrey Hinton, Fei-Fei Li ve Andrew Ng- güçlü yapay zeka modellerine açık kaynak erişiminin güvenliğe yardımcı mı yoksa zarar mı verdiğini tartıştı. Aralarındaki bu görüş alışverişi, düzenleme, açıklık ve Çin'in yapay zeka yetenekleri ilerlerken Batı'nın nasıl ayak uydurabileceği konusunda alandaki giderek büyüyen bir görüş ayrılığını yansıttı.

TechCrunch50 dk önce
Koyu renkli bir ekranda görüntülenen programlama kodu satırları
Teknoloji

Yapay zeka kodlama girişimi Cognition, 40 milyar dolarlık değerlemeyle yatırım görüşmelerinde

Devin yazılım ajanının arkasındaki yapay zeka kodlama girişimi Cognition'ın, yalnızca birkaç ay önce 26 milyar dolarlık değerlemeyle 1 milyar dolarlık bir tur kapattıktan sonra, 40 milyar dolarlık değerlemeyle yeni bir finansman turu için görüşmelere girdiği bildiriliyor. Bu hız, Cognition'ın Windsurf'ü satın almasından bu yana yapay zeka kodlama araçlarına yönelik yoğun yatırımcı talebini yansıtıyor.

TechCrunch50 dk önce