ABD'li Yayıncılar Ortak Taramanın İçeriklerini Kazımayı Durdurmasını Talep Ediyor

ABD dijital yayıncılarını temsil eden bir ticari kuruluş olan Digital Content Next, Common Crawl Foundation'a bir durdurma ve vazgeçme mektubu gönderdi.

Mektup, Common Crawl'ın yayıncı içeriğini toplamayı bırakmasını ve halihazırda veri kümelerinde bulunan materyali kaldırmasını talep ediyor.

DCN CEO'su Jason Kint, yasal bildirimi bir blog gönderisinde duyurdu ve Press Gazette bu hafta mektupla ilgili ek ayrıntılar bildirdi.

Common Crawl, ücretsiz bir halka açık arşiv oluşturmak için 2007'den bu yana her ay birkaç milyar yeni sayfayı taradı. Bu arşiv, günümüzde kullanılan yapay zeka modellerinin çoğunu eğitmek için kullanıldı. OpenAI'nin GPT-3 makalesi, filtrelenmiş Ortak Taramayı modelin eğitim karışımının %60'ı olarak listeledi.

Anlaşmazlık, AI tarayıcılarını engelleyen tüm siteler için önemlidir. Common Crawl'ın tarayıcısı CCBot'un engellenmesi gelecekteki koleksiyonu durdurur ancak halihazırda arşivde bulunan ve herkesin indirebileceği içeriğe dokunmaz.

DCN'in Talepleri

Mektup, Common Crawl'a, DCN üye şirketlerinin “telif hakkıyla korunan, ödeme duvarlı, yalnızca abonelere özel veya başka şekilde korunan içeriği veri kümelerinden kazımayı, saklamayı veya paylaşmayı” durdurması ve halihazırda toplamış olduğu üye içeriğini kaldırması çağrısında bulunuyor.

DCN, Common Crawl'ın veri kümelerini oluşturarak ve bunları AI şirketleriyle paylaşarak telif hakkıyla korunan içeriği “açıkça ihlal ettiğini” iddia ediyor.

Mektupta “telif hakkı yasasının bir vazgeçme rejimi olmadığı” öne sürülüyor. Başka bir deyişle DCN'in görüşü, yayıncıların hariç tutulmayı talep etmemesi gerektiği yönünde. Ortak Tarama'nın bunları dahil edebilmesi için izne ihtiyacı olmalıdır.

Kint, bildirimde şunları yazdı:

“Önemli yatırımlarla oluşturulan içeriğin, teknik olarak erişilebilir olması nedeniyle toplanabileceği, depolanabileceği, başka amaçlara uygun hale getirilebileceği ve paraya dönüştürülebileceği yönünde giderek artan bir varsayıma meydan okuyor.”

DCN Neden Kaldırma Sürecinden Şüphe Ediyor?

DCN mektubu, Ortak Tarama'nın devre dışı bırakma talimatlarını takip edip etmediğini ve istendiğinde içeriği kaldırıp kaldırmadığını sorguluyor. Press Gazette'e göre DCN avukatları, Common Crawl'ın yayıncılara yaptığı açıklamaların “yanlış veya yanıltıcı olup olmadığını” inceliyor.

Common Crawl, kazınmamasını isteyen web sitelerinin halka açık bir kaydını yayınlar. Associated Press ve BBC için girişleri ve yüzlerce alanı kapsayan geniş bir Haber/Medya İttifakı gönderimini içerir. Press Gazette'in haberine göre listede diğer büyük yayıncılar da yer alıyor.

Bu, kaldırma sürecinin ilk kez sorgulanışı değil. Atlantic, Kasım ayında The New York Times ve Danimarkalı yayıncıların içeriğinin, Common Crawl'ın kaldırmayı kabul etmesinden sonra hâlâ mevcut olduğunu bildirdi.

Ortak Taramanın Yanıtı

Common Crawl genel müdürü Rich Skrenta, Press Gazette ile iletişime geçtiğinde mektup hakkında yorum yapmayı reddetti.

Daha önce de benzer iddiaları geri çevirmişti. The Atlantic'e yanıt veren Kasım ayındaki bir blog yazısında Skrenta, örgütün yayıncılara yalan söylediğini veya ödeme duvarındaki materyalleri sıyırdığını yalanladı.

Arşivin dosya formatının yayınlandıktan sonra bütünlüğünü bozmadan düzenlenemeyeceğini söyledi. Bunun yerine, Common Crawl, etkilenen URL'leri sonraki taramalardan kaldırdığını veya filtrelediğini ve bunları genel araçları ve dizinleri aracılığıyla erişilemez hale getirdiğini söylüyor:

“Bir yayıncı bizden önceden taranan materyali kaldırmamızı istediğinde hemen yanıt veriyoruz ve veri kümemizin teknik tasarımını yansıtan bir kaldırma sürecini başlatıyoruz.”

Şöyle ekledi:

“Common Crawl'da hiç kimse bu çalışmanın anında veya eksiksiz olduğunu iddia etmedi; bunun yerine, karmaşıklığı ve devam eden doğası konusunda açık olduk.”

Bu hafta bir forum gönderisinde Skrenta, Common Crawl'ın web sitelerinin AI kazıma tercihlerini nasıl ifade ettiğine ilişkin açık standart çalışmalarına katkıda bulunduğunu söyledi.

Bu Neden Önemli?

DCN mektubu, yalnızca gelecekteki taramayı değil, depolanan arşivi de hedefliyor ve ilk etapta kapsam dışında kalma yükünün yayıncıların üzerine düşmemesi gerektiğini savunuyor.

BuzzStream'in örneğindeki çoğu yayıncı, engelleme kararını zaten vermiş durumda; kontrol ettiği 100 haber sitesinin %79'u en az bir eğitim botunu engelliyor. Cloudflare'in Ocak ayında ele aldığımız Yıllık İnceleme verileri, CCBot'un en iyi etki alanlarında en fazla izin vermeme yönergesine sahip botlar arasında olduğunu gösterdi. DCN'nin gündeme getirdiği soru, yıllar süren içeriğin yine de eğitime açık kalması durumunda bu blokların ne başaracağıdır.

İleriye Bakış

DCN'nin ilerleyip ilerlemeyeceği, Common Crawl'ın nasıl tepki vereceğine bağlıdır ve Common Crawl bunun nasıl olacağını söylemedi. Her iki taraf da kimin ilk önce davranacağı konusunda farklı kurallar istiyor.

Skrenta, sitelerin kendi kazıma tercihlerini belirtmelerine olanak tanıyan standart çalışmalarını destekliyor ve bu da model olarak devre dışı kalmayı sürdürüyor. Birleşik Krallık'taki CMA, Google'ın yayıncıların AI arama özelliklerini devre dışı bırakmasına izin vermesini gerektirdiğinde benzer bir yol izledi.

DCN, kazıyıcıların öncelikle izin alması gerektiğini savunuyor. Daha fazla ticari grup bu iddiayı benimserse, baskı bireysel robots.txt dosyalarından arşivlere doğru kayacaktır.


Öne Çıkan Resim: Andre Boukreev/Shutterstock


Yayımlandı

kategorisi

yazarı:

Etiketler:

Yorumlar

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir