Playbook menengah
Playbook: Audit Indexing
Audit ini menjawab satu pertanyaan: dari semua halaman yang seharusnya ada di Google, mana yang tidak ada, dan kenapa. Caranya membandingkan tiga daftar yang biasanya tidak pernah disandingkan, lalu mengelompokkan selisihnya.
- Waktu
- 60–90 menit untuk situs sampai beberapa ribu URL
- Prasyarat
- Akses Search Console (pemilik atau full); sitemap yang sudah dikirim
- Alat
- Search Console; crawler desktop (Screaming Frog gratis sampai 500 URL, atau Sitebulb); spreadsheet
- Hasil
- Tabel URL yang tidak terindeks, dikelompokkan per penyebab, dengan tindakan per kelompok
Prinsipnya: sitemap adalah daftar "yang kita anggap penting", crawl adalah daftar "yang benar-benar tertaut", dan laporan Page indexing adalah daftar "yang Google ketahui beserta statusnya". Ketiga daftar itu seharusnya hampir sama. Setiap selisih adalah temuan.
Langkah-langkah
-
Kumpulkan daftar A: sitemap
CekUnduh semua sitemap (atau sitemap index beserta anaknya). Ekstrak semua
<loc>ke kolom pertama spreadsheet. Crawler desktop bisa melakukannya: Mode → List → Upload → From a sitemap.TafsirJumlah URL di sini adalah jumlah halaman yang kita klaim ingin diindeks. Kalau angkanya jauh lebih besar dari perkiraan jumlah halaman berguna, sitemap-nya berisi sampah (tag, attachment, parameter) dan itu temuan pertama.
TindakanBelum ada tindakan. Catat jumlahnya.
VerifikasiBuka Search Console → Sitemaps: jumlah "Discovered URLs" harus sama dengan jumlah baris. Kalau berbeda, sebagian sitemap gagal dibaca.
-
Kumpulkan daftar B: crawl dari beranda
CekCrawl situs dari beranda dengan crawler desktop, mengikuti internal link saja, menghormati robots.txt. Ekspor: URL, status code, indexability, canonical, crawl depth, inlinks.
TafsirURL di sini adalah yang bisa ditemukan Googlebot lewat link. Perhatikan kolom indexability: URL yang "Non-indexable" karena noindex, canonical ke URL lain, atau status non-200 tidak akan diindeks, dan itu mungkin benar atau mungkin salah.
TindakanBelum ada tindakan.
VerifikasiPastikan crawl selesai (bukan berhenti karena batas 500 URL versi gratis) dan tidak diblokir server (banyak 403/429 berarti crawler kena rate limit; pelankan).
-
Kumpulkan daftar C: laporan Page indexing
CekSearch Console → Indexing → Pages. Catat jumlah "Indexed" dan "Not indexed". Untuk tiap alasan di "Why pages aren't indexed", klik dan Export. Gabungkan ke spreadsheet dengan kolom URL dan alasan.
TafsirTiap alasan menunjuk gerbang yang berbeda (crawling vs indexing). Ekspor dibatasi 1.000 URL per alasan; untuk situs besar, ini sampel, dan polanya yang dicari.
TindakanBelum ada tindakan.
VerifikasiCek tanggal "Last updated" di laporan. Kalau lebih dari seminggu, data bisa tertinggal dari kondisi situs.
-
Bandingkan A, B, C
Gabungkan tiga daftar dalam satu sheet dengan kolom: URL, ada di sitemap (ya/tidak), ditemukan crawl (ya/tidak), status crawl, status Google, alasan Google. Lalu buat lima kelompok.
CekKelompok Kondisi Arti 1. Orphan Di sitemap, tidak ditemukan crawl Halaman tidak tertaut dari mana pun. Lihat orphan page 2. Tertaut tapi tidak di sitemap Ditemukan crawl, indexable, tidak di sitemap Sitemap tidak lengkap, atau halaman tidak seharusnya diindeks 3. Diklaim penting, ditolak Google Di sitemap, status Google "Not indexed" dengan alasan apa pun Inti audit. Kelompokkan lagi per alasan 4. Bertentangan Di sitemap tapi crawl bilang non-indexable (noindex, canonical ke URL lain, 3xx/4xx) Sitemap berbohong ke Google. Bersihkan 5. Google tahu, kita tidak Di laporan Google, tidak di sitemap dan tidak di crawl URL lama, parameter, atau halaman yang dibuat sistem lain TafsirKelompok 3 biasanya yang terbesar dan yang paling perlu dipilah lagi berdasarkan alasan Google. Kelompok 4 sering menjelaskan kenapa laporan Google penuh "Duplicate" atau "Excluded by noindex" untuk URL yang ada di sitemap.
TindakanBelum ada tindakan. Tabel ini adalah hasil audit; tindakan ada di langkah berikutnya.
VerifikasiJumlah baris di lima kelompok plus jumlah "indexed dan sesuai" harus sama dengan gabungan unik ketiga daftar. Kalau tidak, ada URL yang tidak terklasifikasi (biasanya karena perbedaan garis miring akhir atau huruf besar; normalkan dulu).
-
Tindakan per alasan di kelompok 3
CekAlasan Google Cek Tindakan Panduan Discovered – currently not indexed Crawl depth dan inlinks URL itu dari daftar B Tautkan dari hub; kurangi kedalaman; untuk situs besar, kurangi URL sampah Discovered Crawled – currently not indexed Pola URL; render (URL Inspection → HTML); duplikasi; ketebalan konten Canonical/noindex untuk varian; perbaiki render; perkuat atau gabungkan konten Crawled Duplicate, Google chose different canonical User-declared vs Google-selected di URL Inspection Cari sinyal yang bertentangan (redirect, internal link, sitemap); selaraskan Canonical Duplicate without user-selected canonical Tag canonical ada? Pasang canonical self-referencing atau ke versi utama Canonical Alternate page with proper canonical tag Apakah URL itu memang varian? Kalau ya: normal, keluarkan dari sitemap. Kalau tidak: canonical-nya salah — Excluded by noindex tag Apakah disengaja? Kalau tidak: cabut noindex, request indexing Noindex Blocked by robots.txt Aturan mana yang memblokir (tester) Perbaiki aturan; kalau halaman memang tidak untuk diindeks, ganti ke noindex robots.txt Not found (404) / Soft 404 Apakah halaman seharusnya ada? Kalau ya: pulihkan atau redirect ke pengganti. Kalau tidak: keluarkan dari sitemap, biarkan 404/410 Status code Page with redirect Apakah redirect-nya benar? Normal untuk URL lama. Keluarkan dari sitemap; perbarui internal link ke tujuan akhir Redirect Server error (5xx) / Redirect error Log server; rantai redirect Perbaiki server; putus chain dan loop Status code TafsirSebagian besar situs punya satu atau dua alasan yang mendominasi. Kerjakan yang terbesar dulu, tapi kerjakan "Blocked by robots.txt" dan "Excluded by noindex" untuk halaman penting terlebih dahulu karena perbaikannya cepat dan efeknya pasti.
TindakanUntuk tiap kelompok, satu tindakan yang diterapkan ke semua URL di kelompok itu (ubah template, ubah aturan, ubah sitemap), bukan perbaikan per URL.
VerifikasiCatat tanggal tindakan. Verifikasi ada di langkah terakhir.
-
Bersihkan sitemap (kelompok 2 dan 4)
CekDaftar URL di sitemap yang non-indexable menurut crawl, dan daftar URL indexable yang tidak ada di sitemap.
TafsirSitemap yang berisi URL non-canonical, noindex, atau redirect memberi sinyal yang bertentangan dan membuat laporan Google sulit dibaca.
TindakanPerbaiki generator sitemap supaya hanya memuat URL canonical berstatus 200 tanpa noindex. Tambahkan halaman indexable yang hilang. Kirim ulang di Search Console.
VerifikasiCrawl ulang dalam mode List dari sitemap baru: semua URL harus 200 dan indexable. Search Console → Sitemaps menampilkan jumlah yang sesuai.
-
Verifikasi setelah 2–4 minggu
CekUlangi langkah 3 (ekspor Page indexing) dan bandingkan dengan hasil awal, per alasan.
TafsirYang diharapkan: jumlah "Not indexed" untuk alasan yang ditangani turun; jumlah "Indexed" naik untuk kelompok 3; alasan baru yang muncul (misalnya "Page with redirect" setelah redirect dipasang) adalah efek yang diinginkan, bukan masalah baru.
TindakanKalau kelompok tertentu tidak berubah, tindakannya belum sampai ke Google (cek Last crawl di URL Inspection pada sampel) atau tindakannya salah sasaran. Kembali ke langkah 5 untuk kelompok itu.
VerifikasiAudit selesai ketika selisih antara sitemap dan "Indexed" hanya berisi URL yang memang dibiarkan tidak terindeks dengan alasan yang tercatat.
Template spreadsheet
URL | di_sitemap | ditemukan_crawl | status_crawl | indexability | canonical_crawl | crawl_depth | inlinks | status_google | alasan_google | kelompok | tindakan | tanggal_tindakan | status_setelahRujukan
- Page indexing report Search Console Help
- Sitemaps report Search Console Help
- URL Inspection API Search Console API