8 Yaygın Robots.txt Sorunu ve Bunların Nasıl Düzeltileceği

Robots.txt, arama motoru tarayıcılarına web sitenizi nasıl taramalarını istediğiniz konusunda talimat veren kullanışlı ve güçlü bir araçtır. Bu dosyayı yönetmek iyi bir teknik SEO'nun önemli bir bileşenidir.

Çok güçlü değildir – Google'ın kendi deyimiyle “bir web sayfasını Google'ın dışında tutmaya yönelik bir mekanizma değildir” – ancak sitenizin veya sunucunuzun tarayıcı istekleri tarafından aşırı yüklenmesini önlemeye yardımcı olabilir.

Sitenizde bu tarama bloğu varsa, bunun doğru şekilde kullanıldığından emin olmalısınız.

Dinamik URL'ler veya teorik olarak sonsuz sayıda sayfa oluşturan diğer yöntemleri kullanıyorsanız bu özellikle önemlidir.

Bu kılavuzda, robots.txt dosyasıyla ilgili en yaygın sorunlardan bazılarına, bunların web siteniz ve arama varlığınız üzerindeki etkilerine ve bu sorunların meydana geldiğini düşünüyorsanız nasıl düzeltilebileceğine bakacağız.

Ama önce robots.txt ve alternatiflerine hızlıca bir göz atalım.

Robots.txt Nedir?

Robots.txt düz metin dosya formatını kullanır ve web sitenizin kök dizinine yerleştirilir.

Sitenizin en üst dizininde olmalıdır. Bir alt dizine yerleştirirseniz arama motorları onu görmezden gelecektir.

Büyük gücüne rağmen, robots.txt genellikle nispeten basit bir belgedir ve temel bir robots.txt dosyası, Not Defteri gibi bir düzenleyici kullanılarak saniyeler içinde oluşturulabilir. Onlarla eğlenebilir ve kullanıcıların bulması için ek mesajlar ekleyebilirsiniz.

Yazardan resim, Şubat 2024

Robots.txt dosyasının genellikle kullanıldığı aynı hedeflerin bazılarına ulaşmanın başka yolları da vardır.

Bireysel sayfalar, sayfa kodunun kendisinde bir robots meta etiketi içerebilir.

İçeriğin arama sonuçlarında nasıl (ve gösterilip gösterilmeyeceğini) etkilemek için X-Robots-Tag HTTP üstbilgisini de kullanabilirsiniz.

Robots.txt Ne Yapabilir?

Robots.txt, bir dizi farklı içerik türünde çeşitli sonuçlar elde edebilir:

Web sayfalarının taranması engellenebilir.

Arama sonuçlarında görünmeye devam edebilirler ancak metin açıklamaları olmayacaktır. Sayfadaki HTML olmayan içerik de taranmayacaktır.

Medya dosyalarının Google arama sonuçlarında görünmesi engellenebilir.

Buna resimler, video ve ses dosyaları da dahildir.

Dosya herkese açıksa çevrimiçi olarak hâlâ “var olacaktır” ve görüntülenebilecek ve bağlantı kurulabilecektir ancak bu özel içerik Google aramalarında gösterilmez.

Önemsiz harici komut dosyaları gibi kaynak dosyaları engellenebilir.

Ancak bu, Google'ın söz konusu kaynağın yüklenmesini gerektiren bir sayfayı taraması durumunda, Googlebot robotunun sayfanın bir sürümünü sanki söz konusu kaynak yokmuş gibi “göreceği” ve bu durumun dizine eklemeyi etkileyebileceği anlamına gelir.

Bir web sayfasının Google'ın arama sonuçlarında görünmesini tamamen engellemek için robots.txt dosyasını kullanamazsınız.

Bunu başarmak için sayfanın başlığına noindex meta etiketi eklemek gibi alternatif bir yöntem kullanmalısınız.

Robots.txt Hataları Ne Kadar Tehlikelidir?

Robots.txt dosyasındaki bir hata istenmeyen sonuçlara yol açabilir, ancak bu çoğu zaman dünyanın sonu değildir.

İyi haber şu ki, robots.txt dosyanızı düzelterek tüm hatalardan hızlı ve (genellikle) tam olarak kurtulabilirsiniz.

Google'ın web geliştiricilerine yönelik rehberinde robots.txt hataları konusunda şunu söylüyor:

“Web tarayıcıları genellikle çok esnektir ve genellikle robots.txt dosyasındaki küçük hatalardan etkilenmezler. Genel olarak olabilecek en kötü şey bu yanlış [or] desteklenmeyen direktifler göz ardı edilecektir.

Ancak bir robots.txt dosyasını yorumlarken Google'ın zihinleri okuyamadığını unutmayın; getirdiğimiz robots.txt dosyasını yorumlamamız gerekiyor. Bununla birlikte, robots.txt dosyanızdaki sorunların farkındaysanız bunları düzeltmek genellikle kolaydır.”

8 Yaygın Robots.txt Hatası

  1. Robots.txt Kök Dizinde Değil.
  2. Joker Karakterlerin Kötü Kullanımı.
  3. Robots.txt dosyasındaki Noindex.
  4. Engellenen Komut Dosyaları ve Stil Sayfaları.
  5. Site Haritası URL'si yok.
  6. Geliştirme Sitelerine Erişim.
  7. Mutlak URL'leri kullanma.
  8. Kullanımdan Kaldırılan ve Desteklenmeyen Öğeler.

Web siteniz arama sonuçlarında tuhaf davranıyorsa robots.txt dosyanız hataları, sözdizimi hatalarını ve aşırı erişim kurallarını aramak için iyi bir yerdir.

Yukarıdaki hataların her birine daha ayrıntılı bir şekilde göz atalım ve geçerli bir robots.txt dosyanızın olduğundan nasıl emin olacağınızı görelim.

1. Robots.txt Kök Dizinde Değil

Arama robotları dosyayı yalnızca kök klasörünüzdeyse bulabilir.

Bu nedenle, robots.txt dosyanızın URL'sinde, web sitenizin .com (veya eşdeğer alanı) ile 'robots.txt' dosya adı arasında yalnızca eğik çizgi bulunmalıdır.

Orada bir alt klasör varsa, robots.txt dosyanız muhtemelen arama robotları tarafından görülmüyor ve web siteniz muhtemelen hiç robots.txt dosyası yokmuş gibi davranıyor.

Bu sorunu düzeltmek için robots.txt dosyanızı kök dizininize taşıyın.

Bunun sunucunuza root erişimine sahip olmanızı gerektireceğini belirtmekte fayda var.

Bazı içerik yönetimi sistemleri, dosyaları varsayılan olarak bir “medya” alt dizinine (veya benzer bir şeye) yükler; bu nedenle, robots.txt dosyanızı doğru yere koymak için bunu aşmanız gerekebilir.

2. Joker Karakterlerin Kötü Kullanımı

Robots.txt iki joker karakteri destekler:

  • Yıldız işareti
  • – kart destesindeki Joker gibi geçerli bir karakterin herhangi bir örneğini temsil eder. Dolar işareti ($)

– bir URL'nin sonunu belirtir ve kuralları URL'nin dosya türü uzantısı gibi yalnızca son kısmına uygulamanıza olanak tanır.

Joker karakterlerin web sitenizin çok daha geniş bir bölümüne kısıtlama uygulama potansiyeli olduğundan, minimalist bir yaklaşım benimsemek mantıklıdır.

Kötü yerleştirilmiş bir yıldız işaretiyle robot erişiminin sitenizin tamamından engellenmesi de nispeten kolaydır.

Beklendiği gibi davrandıklarından emin olmak için joker karakter kurallarınızı bir robots.txt test aracı kullanarak test edin. Yanlışlıkla engellemeyi veya çok fazla izin vermeyi önlemek için joker karakter kullanımına dikkat edin.

3. Robots.txt dosyasındaki Noindex

Bu, birkaç yıldan eski web sitelerinde daha yaygındır.

Google, 1 Eylül 2019 itibarıyla robots.txt dosyalarındaki noindex kurallarına uymayı durdurmuştur.

Robots.txt dosyanız bu tarihten önce oluşturulduysa veya noindex talimatları içeriyorsa, büyük olasılıkla bu sayfaların Google'ın arama sonuçlarında dizine eklendiğini göreceksiniz.

Bu sorunun çözümü alternatif bir “noindex” yöntemini uygulamaktır.

Seçeneklerden biri, Google'ın dizine eklemesini engellemek istediğiniz herhangi bir web sayfasının başlığına ekleyebileceğiniz robots meta etiketidir.

4. Engellenen Komut Dosyaları ve Stil Sayfaları

Tarayıcının harici JavaScript'lere ve basamaklı stil sayfalarına (CSS) erişimini engellemek mantıklı görünebilir.

Ancak, Googlebot'un HTML ve PHP sayfalarınızı doğru bir şekilde “görmesi” için CSS ve JS dosyalarına erişmesi gerektiğini unutmayın.

Sayfalarınız Google sonuçlarında tuhaf davranıyorsa veya Google bunları doğru şekilde göremiyor gibi görünüyorsa, tarayıcının gerekli harici dosyalara erişimini engelleyip engellemediğinizi kontrol edin.

Bunun basit bir çözümü, robots.txt dosyanızda erişimi engelleyen satırı kaldırmaktır.

Veya engellemeniz gereken bazı dosyalarınız varsa gerekli CSS ve JavaScript'e erişimi geri yükleyen bir istisna ekleyin.

5. XML Site Haritası URL'si yok

Bu, her şeyden çok SEO ile ilgilidir.

XML site haritanızın URL'sini robots.txt dosyanıza ekleyebilirsiniz.

Googlebot'un web sitenizi tararken baktığı ilk yer burası olduğundan, bu, tarayıcıya sitenizin yapısını ve ana sayfalarını tanıma konusunda bir avantaj sağlar.

Bu kesinlikle bir hata olmasa da (bir site haritasının atlanması, web sitenizin asıl temel işlevselliğini ve arama sonuçlarındaki görünümünü olumsuz etkilememelidir), yine de SEO çalışmalarınıza bir katkı sağlamak istiyorsanız site haritası URL'nizi robots.txt dosyasına eklemeniz faydalı olacaktır. artırmak.

6. Geliştirme Sitelerine Erişim

Tarayıcıların canlı web sitenize girişini engellemek hayır-hayırdır, ancak onların hala geliştirilmekte olan sayfalarınızı taramasına ve dizine eklemesine izin vermek de öyle.

Yapım aşamasındaki bir web sitesinin robots.txt dosyasına bir izin vermeme talimatı eklemek en iyi uygulamadır, böylece tamamlanana kadar genel halk siteyi göremez.

Aynı şekilde, tamamlanmış bir web sitesini başlattığınızda izin vermeme talimatını kaldırmak da çok önemlidir.

Bu satırı robots.txt dosyasından kaldırmayı unutmak, web geliştiricileri arasında en yaygın hatalardan biridir; tüm web sitenizin doğru şekilde taranmasını ve dizine eklenmesini engelleyebilir.

User-Agent: *


Disallow: /

Geliştirme siteniz gerçek dünyadan trafik alıyor gibi görünüyorsa veya yakın zamanda başlatılan web siteniz aramada hiç iyi performans göstermiyorsa, robots.txt dosyanızda evrensel kullanıcı aracısı izin vermeme kuralı arayın:

Bunu yapmamanız gerektiği halde görürseniz (veya görmeniz gerektiği halde görmezseniz), robots.txt dosyanızda gerekli değişiklikleri yapın ve web sitenizin arama görünümünün buna göre güncellenip güncellenmediğini kontrol edin.

7. Mutlak URL'leri Kullanmak

Kurallı ve hreflang gibi şeylerde mutlak URL'ler kullanmak en iyi uygulama olsa da, robots.txt dosyasındaki URL'ler için bunun tersi doğrudur.

Robots.txt dosyasındaki göreli yolların kullanılması, sitenin hangi bölümlerine tarayıcılar tarafından erişilmemesi gerektiğini belirtmek için önerilen yaklaşımdır.

Bu, Google'ın aşağıdakileri belirten robots.txt belgelerinde ayrıntılı olarak açıklanmıştır:

Az önce bahsedilen kullanıcı aracısı tarafından taranabilen, kök etki alanına göre bir dizin veya sayfa.

Mutlak bir URL kullandığınızda, tarayıcıların bunu amaçlandığı gibi yorumlayacağına ve izin verme/izin verme kuralına uyulacağına dair hiçbir garanti yoktur.

8. Kullanımdan Kaldırılan ve Desteklenmeyen Öğeler

Robots.txt dosyalarına ilişkin yönergeler yıllar içinde pek değişmese de çoğu zaman dahil edilen iki öğe şunlardır:

Bing tarama gecikmesini desteklerken Google desteklemez, ancak bu genellikle web yöneticileri tarafından belirtilir. Google Search Console'da tarama ayarlarını yapabiliyordunuz ancak bu, 2023'ün sonlarına doğru kaldırıldı.

Google, Temmuz 2019'da robots.txt dosyalarındaki noindex yönergesini desteklemeyi bırakacağını duyurdu. Bu tarihten önce web yöneticileri, robots.txt dosyalarında noindex yönergesini kullanabiliyordu.

Bu, yaygın olarak desteklenen veya standartlaştırılmış bir uygulama değildi ve noindex için tercih edilen yöntem, sayfa düzeyinde robotları veya x-robot ölçümlerini kullanmaktı.

Robots.txt Hatasından Nasıl Kurtuluruz

Robots.txt dosyasındaki bir hatanın web sitenizin arama görünümü üzerinde istenmeyen etkileri varsa ilk adım, robots.txt dosyasını düzeltmek ve yeni kuralların istenen etkiye sahip olduğunu doğrulamaktır.

Bazı SEO tarama araçları, bir sonraki adımda arama motorlarının sitenizi taramasını beklemek zorunda kalmamanıza yardımcı olabilir.

Robots.txt dosyasının istediğiniz gibi davrandığından emin olduğunuzda sitenizi mümkün olan en kısa sürede yeniden taramayı deneyebilirsiniz.

Google Arama Konsolu ve Bing Web Yöneticisi Araçları gibi platformlar yardımcı olabilir.

Güncellenmiş bir site haritası gönderin ve uygunsuz bir şekilde listeden kaldırılan sayfaların yeniden taranmasını isteyin.

Maalesef Googlebot'un isteğine kalmışsınız; eksik sayfaların Google arama dizininde yeniden görünmesinin ne kadar süreceği konusunda hiçbir garanti yok.

Yapabileceğiniz tek şey, bu süreyi mümkün olduğunca en aza indirmek için doğru işlemi yapmak ve Googlebot, düzeltilen robots.txt dosyasını uygulayana kadar kontrol etmeye devam etmektir.

Son düşünceler

Robots.txt hataları söz konusu olduğunda önlemek her zaman tedavi etmekten daha iyidir.

Gelir getiren büyük bir web sitesinde, web sitenizin tamamını Google'dan kaldıran başıboş bir joker karakter, kazançlar üzerinde anında etki yaratabilir.

Robots.txt dosyasındaki düzenlemeler deneyimli geliştiriciler tarafından dikkatli bir şekilde yapılmalı, iki kez kontrol edilmeli ve uygun olduğunda ikinci bir görüşe tabi tutulmalıdır.

Mümkünse, yanlışlıkla kullanılabilirlik sorunları yaratmamak için gerçek dünya sunucunuzda canlı yayınlamadan önce bir korumalı alan düzenleyicide test edin.

Unutmayın, en kötüsü olduğunda paniğe kapılmamak önemlidir.

Sorunu teşhis edin, robots.txt dosyasında gerekli onarımları yapın ve site haritanızı yeni bir tarama için yeniden gönderin.

Arama sıralamasındaki yerinizin birkaç gün içinde geri kazanılacağını umuyoruz.


Daha fazla kaynak:

Öne Çıkan Görsel: M-SUR/Shutterstock


Yayımlandı

kategorisi

yazarı:

Etiketler:

Yorumlar

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir