Mas Ahmad SafwanSEO & AI Search Knowledge Base Cari
Menu

Tool · berjalan di browser

Robots.txt Tester

Tempel isi robots.txt, masukkan URL dan user-agent, dan lihat aturan mana yang menang. Alat ini meniru tiga aturan pencocokan Google: grup paling spesifik, path terpanjang, dan Allow saat seri.

Oleh Diterbitkan

Pengambilan langsung hanya berhasil kalau situs itu mengizinkan permintaan lintas asal. Kalau gagal, buka berkasnya di tab baru dan tempel.

Aturan yang ditiru

  1. Pemilihan grup. Crawler membaca grup dengan User-agent yang paling spesifik cocok dengan namanya. Kalau ada grup Googlebot, Googlebot hanya membaca grup itu dan mengabaikan grup *. Kalau tidak ada, ia membaca grup *. Kalau tidak ada keduanya, semua boleh. Beberapa grup untuk token yang sama digabung.
  2. Path terpanjang menang. Di antara aturan yang cocok, yang path-nya paling panjang (setelah mengabaikan * di akhir) menentukan hasil, apa pun urutannya di berkas.
  3. Seri: Allow menang. Kalau ada Allow dan Disallow dengan panjang sama, Google memakai yang paling longgar.

Wildcard yang didukung: * untuk urutan karakter apa pun dan $ untuk akhir URL. Path peka huruf besar-kecil. Disallow: kosong berarti tidak memblokir apa pun. Baris yang bukan user-agent, allow, disallow, atau sitemap diabaikan, sama seperti Google.

Contoh yang bisa dicoba dengan isi bawaan

URLUser-agentHasilKenapa
/admin/public/laporan.pdfGooglebotBolehGrup Googlebot hanya memblokir /draf/; grup * diabaikan sama sekali
/admin/public/laporan.pdfBingbotBolehBingbot memakai grup *. Tiga aturan cocok: Disallow: /admin/ (7), Allow: /admin/public/ (14), Disallow: /*.pdf$ (6). Yang terpanjang adalah Allow, jadi boleh
/admin/rahasia.htmlBingbotDiblokir/admin/ cocok, tidak ada Allow yang lebih panjang
/apa-saja/GPTBotDiblokirGrup GPTBot: Disallow: /
/apa-saja/PerplexityBotBolehTidak ada grup khusus; grup * tidak memblokir path ini

Yang tidak diperiksa alat ini

  • Apakah crawler yang diuji benar-benar mematuhi robots.txt. Alat ini mengasumsikan patuh; kepatuhan nyata hanya terlihat di log server.
  • Kode status robots.txt (5xx membuat Google menghentikan crawl; 4xx dianggap tidak ada berkas). Lihat panduan robots.txt.
  • Perbedaan tafsir antar-mesin pencari untuk kasus tepi. Bing dan yang lain umumnya mengikuti RFC 9309 yang mirip, tapi tidak identik.
  • Apakah memblokir itu keputusan yang benar. robots.txt mengatur crawl, bukan indeks.

Rujukan

  1. How Google interprets the robots.txt specification Google Search Central
  2. RFC 9309: Robots Exclusion Protocol IETF