Mas Ahmad SafwanSEO & AI Search Knowledge Base Cari
Menu

AI Search & GEO menengah

Crawler AI dan robots.txt

Tiap vendor AI memakai lebih dari satu crawler, dan membedakan crawler pelatihan dari crawler pencarian adalah keputusan yang punya konsekuensi berbeda. Tabel di bawah disusun dari dokumentasi resmi masing-masing vendor, bukan dari daftar pihak ketiga.

Oleh Diterbitkan 4 menit baca

Status per 15 September 2026 · halaman ini ditinjau ulang saat ada perubahan produk

Crawler AI adalah bot yang mengambil halaman web untuk kebutuhan sistem AI. Ada tiga jenis dengan tujuan berbeda: crawler pelatihan (mengumpulkan data untuk melatih model), crawler pencarian (membangun indeks untuk fitur pencarian AI), dan fetcher atas permintaan pengguna (mengambil satu halaman ketika pengguna memintanya). Memblokir yang pertama tidak memengaruhi visibilitas di pencarian AI; memblokir yang kedua menghilangkannya.

Referensi per vendor

VendorToken user-agentJenisPatuh robots.txtSumber
OpenAIGPTBotPelatihanYaDokumentasi OpenAI
OpenAIOAI-SearchBotPencarian (ChatGPT search)YaSama
OpenAIChatGPT-UserAtas permintaan penggunaTidak selaluSama
AnthropicClaudeBotPelatihanYaDokumentasi Anthropic
AnthropicClaude-SearchBotPencarianYaSama
AnthropicClaude-UserAtas permintaan penggunaYa (menurut dokumentasi)Sama
PerplexityPerplexityBotPencarian (bukan pelatihan)YaDokumentasi Perplexity
PerplexityPerplexity-UserAtas permintaan penggunaUmumnya tidakSama
GoogleGooglebotSearch, termasuk AI Overviews dan AI ModeYaDokumentasi Google
GoogleGoogle-ExtendedToken kontrol (bukan crawler terpisah): pelatihan Gemini, grounding di aplikasi Gemini dan Vertex AIYaSama
GoogleGoogle-CloudVertexBotCrawl atas permintaan pemilik situs untuk Vertex AIYaSama
MicrosoftBingbotBing Search dan CopilotYaDokumentasi Bing
AppleApplebot / Applebot-ExtendedSiri dan Spotlight / kontrol pelatihanYaDokumentasi Apple
MetaMeta-ExternalAgentPelatihanYaDokumentasi Meta
Common CrawlCCBotKorpus terbuka yang dipakai banyak pihak untuk pelatihanYacommoncrawl.org
ByteDanceBytespiderPelatihanDilaporkan tidak konsistenLaporan industri

Kolom "patuh robots.txt" berdasarkan pernyataan vendor. Kepatuhan nyata hanya bisa diverifikasi dari log server sendiri. Vendor besar mempublikasikan rentang IP (OpenAI, Anthropic di claude.com/crawling/bots.json, Perplexity di perplexity.com/perplexitybot.json, Google) untuk verifikasi.

Google-Extended: yang sering salah paham

Google-Extended bukan crawler; ia token mandiri di robots.txt yang dibaca Googlebot untuk memutuskan apakah konten boleh dipakai untuk melatih generasi model Gemini berikutnya (yang menggerakkan aplikasi Gemini dan Vertex AI API) serta untuk grounding di aplikasi Gemini dan Grounding with Google Search di Vertex AI. Google menyatakan secara eksplisit: "Google-Extended does not impact a site's inclusion in Google Search nor is it used as a ranking signal in Google Search." Artinya memblokir Google-Extended tidak mengeluarkan situs dari AI Overviews atau AI Mode, karena keduanya fitur Search. Untuk membatasi pemakaian di AI Overviews, alatnya adalah nosnippet atau max-snippet, dengan efek samping ke snippet organik. terdokumentasi

Empat kebijakan yang umum, dan robots.txt-nya

KebijakanCocok untukKonsekuensi
Izinkan semuaSitus yang ingin visibilitas maksimal dan tidak keberatan kontennya dipakai pelatihanTidak ada yang hilang; konten bisa masuk korpus pelatihan
Izinkan pencarian, tolak pelatihanPenerbit yang ingin dikutip tapi tidak ingin melatih model gratisTetap tampil di ChatGPT search, Perplexity, Claude search; tidak di korpus pelatihan (sejauh vendor patuh)
Tolak semua AI kecuali GooglebotSitus yang menganggap AI Search bukan saluranHilang dari ChatGPT, Perplexity, Claude; tetap di Google termasuk AI Overviews
Tolak semua termasuk membatasi snippetKonten berbayar atau sangat sensitifSnippet organik ikut hilang; hanya masuk akal kalau klik dari Google bukan tujuan
robots.txt untuk kebijakan kedua
# Kebijakan: izinkan pencarian AI, tolak pelatihan.
# Contoh, bukan rekomendasi universal. Tinjau ulang saat vendor menambah token.

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Meta-ExternalAgent
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

# Crawler pencarian dibiarkan mengikuti grup * (tidak perlu grup sendiri)
User-agent: *
Allow: /
Disallow: /cari/

Sitemap: https://www.example.com/sitemap.xml

Ingat aturan pencocokan: crawler hanya membaca grup dengan user-agent paling spesifik yang cocok. Grup GPTBot di atas membuat GPTBot mengabaikan grup * sepenuhnya, jadi kalau ada aturan di grup * yang juga harus berlaku untuk GPTBot, salin ke grupnya. Uji dengan robots.txt tester. Penjelasan aturannya di panduan robots.txt.

Kebijakan situs ini

masahmadsafwan.com mengizinkan semua crawler, termasuk crawler pelatihan. Alasannya: tujuan situs ini adalah menjadi referensi, dan referensi yang tidak bisa dibaca sistem apa pun tidak berguna. Keputusan ini ditinjau ulang bila ada perubahan kebijakan vendor atau kebutuhan lain. Yang tidak boleh di-crawl hanya halaman pencarian internal.

Cara memverifikasi crawler

  1. Log server: filter user-agent yang mengandung token di atas. Hitung permintaan per hari dan URL yang diminta.
  2. Verifikasi IP untuk yang mengaku Googlebot (reverse DNS ke googlebot.com/google.com) atau bandingkan dengan daftar IP resmi vendor lain. Bot yang memakai user-agent palsu tidak patuh robots.txt apa pun.
  3. Kalau ada crawler yang membebani server, batasi lewat firewall atau rate limiting berdasarkan IP terverifikasi, bukan hanya robots.txt.
  4. Cloudflare dan beberapa CDN menyediakan pengaturan "AI bots" di dashboard. Pahami bahwa pengaturan itu memblokir di level jaringan, dan pastikan tidak ikut memblokir crawler pencarian yang diinginkan.

Rujukan

  1. Overview of OpenAI crawlers OpenAI
  2. Does Anthropic crawl data from the web, and how can site owners block the crawler? Anthropic
  3. Perplexity crawlers Perplexity
  4. Google's common crawlers Google Search Central
  5. Verifying Googlebot and other Google crawlers Google Search Central

Tentang penulis

Ahmad Safwan menulis dan mendokumentasikan pembelajaran tentang SEO, technical SEO, search visibility, dan perkembangan AI Search di situs ini. Koreksi dan pertanyaan lewat halaman kontak.

Lanjut membaca

  • AI Overviewspemula

    Cara kerja, syarat resmi, kontrol snippet, dampak klik, dan pemantauan.

  • AI Modemenengah

    Query fan-out dijelaskan, ketersediaan bahasa Indonesia, dan implikasi yang masuk akal.

  • ChatGPT searchmenengah

    OAI-SearchBot, syarat muncul, dan pelacakan trafik.