AI Search & GEO menengah
Crawler AI dan robots.txt
Tiap vendor AI memakai lebih dari satu crawler, dan membedakan crawler pelatihan dari crawler pencarian adalah keputusan yang punya konsekuensi berbeda. Tabel di bawah disusun dari dokumentasi resmi masing-masing vendor, bukan dari daftar pihak ketiga.
Status per 15 September 2026 · halaman ini ditinjau ulang saat ada perubahan produk
Crawler AI adalah bot yang mengambil halaman web untuk kebutuhan sistem AI. Ada tiga jenis dengan tujuan berbeda: crawler pelatihan (mengumpulkan data untuk melatih model), crawler pencarian (membangun indeks untuk fitur pencarian AI), dan fetcher atas permintaan pengguna (mengambil satu halaman ketika pengguna memintanya). Memblokir yang pertama tidak memengaruhi visibilitas di pencarian AI; memblokir yang kedua menghilangkannya.
Referensi per vendor
| Vendor | Token user-agent | Jenis | Patuh robots.txt | Sumber |
|---|---|---|---|---|
| OpenAI | GPTBot | Pelatihan | Ya | Dokumentasi OpenAI |
| OpenAI | OAI-SearchBot | Pencarian (ChatGPT search) | Ya | Sama |
| OpenAI | ChatGPT-User | Atas permintaan pengguna | Tidak selalu | Sama |
| Anthropic | ClaudeBot | Pelatihan | Ya | Dokumentasi Anthropic |
| Anthropic | Claude-SearchBot | Pencarian | Ya | Sama |
| Anthropic | Claude-User | Atas permintaan pengguna | Ya (menurut dokumentasi) | Sama |
| Perplexity | PerplexityBot | Pencarian (bukan pelatihan) | Ya | Dokumentasi Perplexity |
| Perplexity | Perplexity-User | Atas permintaan pengguna | Umumnya tidak | Sama |
Googlebot | Search, termasuk AI Overviews dan AI Mode | Ya | Dokumentasi Google | |
Google-Extended | Token kontrol (bukan crawler terpisah): pelatihan Gemini, grounding di aplikasi Gemini dan Vertex AI | Ya | Sama | |
Google-CloudVertexBot | Crawl atas permintaan pemilik situs untuk Vertex AI | Ya | Sama | |
| Microsoft | Bingbot | Bing Search dan Copilot | Ya | Dokumentasi Bing |
| Apple | Applebot / Applebot-Extended | Siri dan Spotlight / kontrol pelatihan | Ya | Dokumentasi Apple |
| Meta | Meta-ExternalAgent | Pelatihan | Ya | Dokumentasi Meta |
| Common Crawl | CCBot | Korpus terbuka yang dipakai banyak pihak untuk pelatihan | Ya | commoncrawl.org |
| ByteDance | Bytespider | Pelatihan | Dilaporkan tidak konsisten | Laporan industri |
Kolom "patuh robots.txt" berdasarkan pernyataan vendor. Kepatuhan nyata hanya bisa diverifikasi dari log server sendiri. Vendor besar mempublikasikan rentang IP (OpenAI, Anthropic di claude.com/crawling/bots.json, Perplexity di perplexity.com/perplexitybot.json, Google) untuk verifikasi.
Google-Extended: yang sering salah paham
Google-Extended bukan crawler; ia token mandiri di robots.txt yang dibaca Googlebot untuk memutuskan apakah konten boleh dipakai untuk melatih generasi model Gemini berikutnya (yang menggerakkan aplikasi Gemini dan Vertex AI API) serta untuk grounding di aplikasi Gemini dan Grounding with Google Search di Vertex AI. Google menyatakan secara eksplisit: "Google-Extended does not impact a site's inclusion in Google Search nor is it used as a ranking signal in Google Search." Artinya memblokir Google-Extended tidak mengeluarkan situs dari AI Overviews atau AI Mode, karena keduanya fitur Search. Untuk membatasi pemakaian di AI Overviews, alatnya adalah nosnippet atau max-snippet, dengan efek samping ke snippet organik. terdokumentasi
Empat kebijakan yang umum, dan robots.txt-nya
| Kebijakan | Cocok untuk | Konsekuensi |
|---|---|---|
| Izinkan semua | Situs yang ingin visibilitas maksimal dan tidak keberatan kontennya dipakai pelatihan | Tidak ada yang hilang; konten bisa masuk korpus pelatihan |
| Izinkan pencarian, tolak pelatihan | Penerbit yang ingin dikutip tapi tidak ingin melatih model gratis | Tetap tampil di ChatGPT search, Perplexity, Claude search; tidak di korpus pelatihan (sejauh vendor patuh) |
| Tolak semua AI kecuali Googlebot | Situs yang menganggap AI Search bukan saluran | Hilang dari ChatGPT, Perplexity, Claude; tetap di Google termasuk AI Overviews |
| Tolak semua termasuk membatasi snippet | Konten berbayar atau sangat sensitif | Snippet organik ikut hilang; hanya masuk akal kalau klik dari Google bukan tujuan |
# Kebijakan: izinkan pencarian AI, tolak pelatihan.
# Contoh, bukan rekomendasi universal. Tinjau ulang saat vendor menambah token.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
# Crawler pencarian dibiarkan mengikuti grup * (tidak perlu grup sendiri)
User-agent: *
Allow: /
Disallow: /cari/
Sitemap: https://www.example.com/sitemap.xmlIngat aturan pencocokan: crawler hanya membaca grup dengan user-agent paling spesifik yang cocok. Grup GPTBot di atas membuat GPTBot mengabaikan grup * sepenuhnya, jadi kalau ada aturan di grup * yang juga harus berlaku untuk GPTBot, salin ke grupnya. Uji dengan robots.txt tester. Penjelasan aturannya di panduan robots.txt.
Kebijakan situs ini
masahmadsafwan.com mengizinkan semua crawler, termasuk crawler pelatihan. Alasannya: tujuan situs ini adalah menjadi referensi, dan referensi yang tidak bisa dibaca sistem apa pun tidak berguna. Keputusan ini ditinjau ulang bila ada perubahan kebijakan vendor atau kebutuhan lain. Yang tidak boleh di-crawl hanya halaman pencarian internal.
Cara memverifikasi crawler
- Log server: filter user-agent yang mengandung token di atas. Hitung permintaan per hari dan URL yang diminta.
- Verifikasi IP untuk yang mengaku Googlebot (reverse DNS ke
googlebot.com/google.com) atau bandingkan dengan daftar IP resmi vendor lain. Bot yang memakai user-agent palsu tidak patuh robots.txt apa pun. - Kalau ada crawler yang membebani server, batasi lewat firewall atau rate limiting berdasarkan IP terverifikasi, bukan hanya robots.txt.
- Cloudflare dan beberapa CDN menyediakan pengaturan "AI bots" di dashboard. Pahami bahwa pengaturan itu memblokir di level jaringan, dan pastikan tidak ikut memblokir crawler pencarian yang diinginkan.
Rujukan
- Overview of OpenAI crawlers OpenAI
- Does Anthropic crawl data from the web, and how can site owners block the crawler? Anthropic
- Perplexity crawlers Perplexity
- Google's common crawlers Google Search Central
- Verifying Googlebot and other Google crawlers Google Search Central