Sebuah laman pembaikan telefon mempunyai halaman servis awam dan banyak URL hasil carian dalaman. Pemilik mahu perangkak kurang meminta halaman hasil carian itu tanpa menyekat servis pembaikan sebenar. Adakah robots.txt alat yang sesuai?
Robots.txt mengawal akses perangkak. Ia memberitahu perangkak yang mematuhi peraturan laluan URL mana yang boleh diminta pada sesuatu laman. Ia tidak memadam halaman, melindungi maklumat peribadi, atau menjamin URL yang disekat hilang daripada hasil carian. Gunakannya untuk akses crawl, bukan untuk kerahsiaan atau membuang URL daripada indeks.
Apakah yang Sebenarnya Dikawal oleh robots.txt?
Apabila perangkak melawat laman, ia mencari fail di akar host yang dilawati, contohnya https://example.com/robots.txt. Fail itu boleh menamakan perangkak melalui User-agent dan menetapkan laluan Disallow atau Allow. Allow boleh membuat pengecualian yang lebih khusus kepada sekatan umum; kedua-dua arahan tidak menentukan sama ada halaman masuk ke indeks. Disallow yang sepadan meminta perangkak itu tidak mengambil URL berkenaan. Pelawat masih boleh membukanya dalam pelayar.
Peraturan hanya terpakai kepada protokol, host, dan port yang menyediakan fail itu. Fail pada www.example.com tidak mengawal shop.example.com secara automatik. Sebab itu URL sebenar perlu diuji, bukan sekadar membaca peraturan yang kelihatan serupa.
Bagaimana Membaca Fail robots.txt yang Ringkas?
User-agent: *
Disallow: /internal-search/
Sitemap: https://example.com/sitemap.xml
Di sini, * merujuk kepada perangkak secara umum. Baris Disallow meminta mereka tidak mengambil URL di bawah /internal-search/. Baris Sitemap menunjuk ke peta laman; ia bukan peraturan Allow. Untuk memilih URL dalam senarai itu, baca panduan peta laman XML. Ini contoh untuk difahami, bukan tetapan yang patut disalin ke semua laman.
Pastikan laluannya tepat. Bagi perangkak yang sepadan, Disallow: / menyekat crawl seluruh host itu. Disallow: /internal-search/ lebih sempit daripada Disallow: /internal-search, yang juga boleh sepadan dengan laluan lain yang bermula dengan aksara tersebut. Satu aksara boleh menyekat lebih banyak halaman daripada yang dimaksudkan. Jika Allow dan Disallow sama-sama sepadan, Google menggunakan peraturan laluan yang lebih khusus; baris terakhir tidak semestinya menang.
Apakah yang Tidak Boleh Dilakukan oleh robots.txt?
- Ia tidak boleh membuang halaman web daripada Google Search dengan pasti. Google mungkin mengetahui URL yang disekat melalui pautan dan memaparkan alamatnya tanpa mengambil kandungannya. Jika halaman awam perlu dikecualikan daripada indeks, benarkan Google merangkaknya supaya arahan
noindexdapat dibaca. - Ia tidak boleh melindungi data sulit. Fail ini terbuka kepada umum, dan tidak semua perangkak mematuhinya. Lindungi maklumat peribadi dengan log masuk atau kebenaran akses pada pelayan.
Jangan sekat URL dalam robots.txt sambil mengharapkan Google membaca tag noindex pada halaman itu; sekatan crawl boleh menghalangnya daripada melihat arahan tersebut. Untuk memilih halaman yang patut muncul dalam carian, baca panduan pengindeksan dan noindex; untuk keseluruhan proses, baca asas SEO teknikal.
Bilakah Peraturan Ini Berguna?
Gunakan peraturan apabila ada masalah akses crawl yang jelas, contohnya bukti bahawa banyak URL carian dalaman bernilai rendah membebankan proses crawl. Sebelum menyekat satu folder, senaraikan URL di dalamnya. Pastikan halaman servis dan produk yang penting, serta fail yang diperlukan untuk memaparkan kandungan utama, kekal boleh dirangkak. Banyak laman kecil tidak memerlukan sekatan khas.
Halaman pilihan patut boleh ditemui melalui pautan dalaman biasa dan, jika berguna, peta laman. Panduan operasi peta laman dan robots.txt meliputi persediaan seluruh laman; artikel ini menumpukan keputusan sama ada peraturan crawl diperlukan.
Bagaimana Menyemak Peraturan Sebelum dan Selepas Diterbitkan?
- Buka URL
/robots.txtpada host yang tepat. Baca kumpulan peraturan yang terpakai kepada perangkak sasaran. - Pilih URL contoh: satu yang memang mahu disekat dan satu halaman penting yang mesti boleh dirangkak. Bandingkan laluan penuh dengan peraturan. Elakkan menerbitkan
Disallow: /yang terlalu luas secara tidak sengaja. - Selepas fail diterbitkan, gunakan URL Inspection dalam Search Console untuk memeriksa kebenaran crawl yang dilaporkan bagi halaman penting, dan jalankan ujian langsung apabila sesuai. Keizinan crawl tidak menjamin pengindeksan atau kedudukan.
Catat sebab setiap sekatan dibuat dan semak semula apabila struktur laman berubah.
Soalan Lazim
Adakah robots.txt Masih Berguna?
Ya, apabila laman perlu mengurus akses perangkak kepada URL tertentu. Laman kecil dengan pautan yang jelas mungkin tidak memerlukan sekatan khas.
Adakah robots.txt Menghalang Pengindeksan?
Tidak dengan pasti untuk halaman web. Ia meminta perangkak yang patuh tidak mengambil URL yang sepadan, tetapi Google masih boleh menyenaraikan URL jika menemuinya di tempat lain. Gunakan noindex yang boleh dibaca melalui crawl untuk mengecualikan halaman daripada indeks.
Bagaimana Melihat Fail robots.txt Sesebuah Laman?
Buka /robots.txt pada akar protokol dan host yang mahu diperiksa, contohnya https://example.com/robots.txt. Subdomain atau host lain boleh mempunyai fail yang berbeza.
Bilakah Patut Menggunakan noindex Sebaliknya?
Gunakan noindex apabila halaman yang boleh diakses umum tidak patut muncul dalam Google Search. Benarkan Google merangkaknya supaya arahan itu dapat dibaca. Kandungan sulit memerlukan kawalan akses, bukan salah satu daripada dua arahan ini.


