John Mueller'in Çılgın Robotlar Destanı.txt

Google'dan John Mueller'in kişisel blogunun robots.txt dosyası, Reddit'te birisinin Mueller'in blogunun Faydalı İçerik sistemi tarafından vurulduğunu ve daha sonra indeksinin kaldırıldığını iddia etmesiyle ilgi odağı haline geldi. Gerçeğin bundan daha az dramatik olduğu ortaya çıktı ama yine de biraz tuhaftı.

Bir X (Twitter) Gönderisinden Alt Dizine

John Mueller'in robots.txt efsanesi, birisinin X'te (eski adıyla Twitter olarak biliniyordu) bu konuda tweet atmasıyla başladı:

Daha sonra John Mueller'in web sitesinin indeksinin kaldırıldığını ve Google'ın algoritmasıyla ters düştüğünü belirten tweet'in ardından birisi Reddit'te fark etti. Ancak ne kadar ironik olsa da durum asla böyle olmayacaktı çünkü tuhaf bir şeyler döndüğünü anlamak için web sitesinin robots.txt dosyasının yüklenmesi birkaç saniye sürdü.

Mueller'in robots.txt dosyasının üst kısmı burada, göz atmak isteyenler için yorumlu bir Paskalya yumurtası yer alıyor.

Her gün görülmeyen ilk kısım, robots.txt dosyasındaki izin vermeme durumudur. Google'a robots.txt dosyasını taramamasını söylemek için robots.txt dosyasını kim kullanıyor?

Artık biliyoruz.

Robots.txt dosyasının bir sonraki bölümü, tüm arama motorlarının web sitesini ve robots.txt dosyasını taramasını engeller.

Bu muhtemelen sitenin neden Google'da indekslenmediğini açıklıyor. Ancak neden hala Bing tarafından indekslendiğini açıklamıyor.

Etrafa sordum ve bir web geliştiricisi ve SEO (LinkedIn profili) olan Adam Humphreys, büyük ölçüde aktif olmayan bir web sitesi olduğundan Bingbot'un Mueller'in sitesinde bulunmamış olabileceğini öne sürdü.

Adam bana düşüncelerini iletti:

“Kullanıcı aracısı: *
İzin verme: /topsy/
İzin verme: /crets/
İzin verme: /hidden/file.html

Bu örneklerde klasörler ve o klasördeki dosya bulunamadı.

Bing'in görmezden geldiği ancak Google'ın dinlediği robots dosyasına izin verilmemesini söylüyor.

Bing, hatalı şekilde uygulanan robotları göz ardı eder çünkü çoğu kişi bunun nasıl yapılacağını bilmiyor. “

Adam ayrıca Bing'in robots.txt dosyasını tamamen göz ardı etmiş olabileceğini de öne sürdü.

Bunu bana şu şekilde açıkladı:

“Evet ya da bir talimat dosyasını okumamak için bir direktifi görmezden gelmeyi seçer.

Bing'de yanlış uygulanan robot talimatları muhtemelen göz ardı ediliyor. Bu onlar için en mantıklı cevaptır. Bu bir yol tarifi dosyası.”

Robots.txt en son Temmuz ve Kasım 2023 arasında güncellendi; dolayısıyla Bingbot en son robots.txt dosyasını görmemiş olabilir. Bu mantıklı çünkü Microsoft'un IndexNow web tarama sistemi verimli taramaya öncelik veriyor.

Mueller'in robots.txt dosyası tarafından engellenen dizinlerden biri /nofollow/'dır (bu, bir klasör için tuhaf bir addır).

Temelde bu sayfada bazı site gezintileri ve Yönlendirici sözcüğü dışında hiçbir şey yok.

Robots.txt dosyasının gerçekten o sayfayı engelleyip engellemediğini test ettim ve öyleydi.

Google'ın Zengin Sonuçlar test aracı /nofollow/ web sayfasını tarayamadı.

Ayrıca bakınız: 8 Yaygın Robots.txt Sorunu ve Nasıl Düzeltileceği

John Mueller'in Açıklaması

Mueller, robots.txt dosyasına bu kadar çok ilgi gösterilmesinden memnun görünüyordu ve LinkedIn'de olup bitenlerle ilgili bir açıklama yayınladı.

O yazdı:

“Peki, dosyada ne var? Peki sitenizin dizini neden kaldırıldı?

Birisi bunun Google+ bağlantıları nedeniyle olabileceğini öne sürdü. Mümkün. Ve robots.txt dosyasına geri dönelim… sorun değil; yani ben böyle istiyorum ve tarayıcılar bununla başa çıkabilir. Veya RFC9309'u takip ederlerse bunu yapabilmeleri gerekir.”

Daha sonra, robots.txt dosyasındaki nofollow özelliğinin yalnızca onun bir HTML dosyası olarak indekslenmesini engellemek için olduğunu söyledi.

Açıkladı:

“”disallow: /robots.txt” – bu, robotların daireler çizerek dönmesine neden olur mu? Bu, sitenizin dizinini kaldırır mı? HAYIR.

Robots.txt dosyamın içinde pek çok şey var ve içeriğiyle birlikte indekslenmezse daha temiz olur. Bu, robots.txt dosyasının indeksleme amacıyla taranmasını tamamen engeller.

Ayrıca noindex ile x-robots-tag HTTP üstbilgisini de kullanabilirim, ancak bu şekilde robots.txt dosyasında da var.”

Mueller dosya boyutuyla ilgili de şunları söyledi:

“Boyut, ekibim ve benim üzerinde çalıştığımız çeşitli robots.txt test araçlarının testlerinden geliyor. RFC, bir tarayıcının en az 500 kibibaytı ayrıştırması gerektiğini söylüyor (bunun ne tür bir atıştırmalık olduğunu açıklayan ilk kişiye bonus beğeniler). Bir yerde durmanız gerekiyor, sonsuz uzunlukta sayfalar oluşturabilirsiniz (ve ben yaptım ve birçok insan, hatta bazıları bilerek yaptı). Pratikte robots.txt dosyasını kontrol eden sistem (ayrıştırıcı) bir yerde kesinti yapacaktır.”

Ayrıca, “tamamen izin vermeme” olarak algılanması umuduyla bu bölümün üstüne bir izin vermeme işareti eklediğini söyledi, ancak hangi izin vermemeden bahsettiğinden emin değilim. Robots.txt dosyasında tam olarak 22.433 izin verilmeyen dosya var.

O yazdı:

“Bu bölümün üstüne bir “disallow: /” ekledim, umarım bu genel bir izin vermeme olarak algılanır. Ayrıştırıcının, “allow: /cheeseisbest” içeren bir satır gibi garip bir yerde kesmesi ve tam “/” noktasında durması mümkündür, bu da ayrıştırıcıyı çıkmaza sokar (ve, trivia! izin verme kuralı) hem “allow: /” hem de “disallow: /”) varsa geçersiz kılınacaktır. Ancak bu pek olası görünmüyor.”

Dizinsiz Web Sitelerinin Gizemi Çözüldü

Mueller'in sitesinin kapanmasına neden olan şeyin robots.txt olmadığı ortaya çıktı. Bunu yapmak için Search Console'u kullanmıştı.

Mueller daha sonraki bir LinkedIn gönderisinde ne yaptığını açıkladı:

“Bir şeyi denemek için Search Console aracını kullandım. Doğru düğmeye basarsam hızlı bir iyileşme sağlayabilirim :-).

Google'ın bir human.txt dosyası var. Benimkine ne koyacağımı gerçekten bilmiyorum. Sen de var mı?”

Mueller'in web sitesi hızla arama dizinine geri döndü.

Mueller'in Sitesinin Arama Dizinine Geri Döndüğünü Gösteren Ekran Görüntüsü

Ve işte burada. John Mueller'in tuhaf robots.txt'si.

Robots.txt burada görüntülenebilir:

https://johnmu.com/robots.txt


Yayımlandı

kategorisi

yazarı:

Etiketler:

Yorumlar

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir