Bolehkah produk AI menemui halaman anda dalam carian tanpa menggunakannya untuk melatih model? Pada sesetengah platform, boleh. Kawalan yang betul bergantung pada tujuan produk itu mengakses halaman.
Tiga Tujuan Berbeza di Sebalik Lawatan AI
Penemuan carian ialah lawatan automatik untuk mencari halaman yang mungkin dipautkan dalam jawapan. Latihan model ialah penggunaan bahan yang dikumpul untuk menambah baik model pada masa depan. Pengambilan atas permintaan pengguna berlaku apabila seseorang meminta produk membuka halaman tertentu atau menjawab berdasarkannya. Syarikat boleh menggunakan ejen atau tetapan berbeza bagi setiap tujuan.
Lawatan tidak menjamin petikan atau pautan. Menyekat satu ejen mungkin tidak menjejaskan ejen lain. Untuk gambaran lebih luas, baca pengenalan carian AI kami.
Kawalan Mana Milik Platform Mana?
| Platform | Akses carian atau jawapan | Latihan atau kawalan lain |
|---|---|---|
| OpenAI | OAI-SearchBot digunakan untuk carian ChatGPT. | GPTBot berkaitan kandungan yang mungkin digunakan untuk latihan model asas. ChatGPT-User ialah ejen berasingan yang dipicu pengguna. |
| Googlebot merangkak kandungan untuk Carian biasa. Search Console mempunyai kawalan tapak berasingan untuk AI Overviews, AI Mode dan ciri carian generatif yang diliputi. | Google-Extended ialah token robots untuk latihan Gemini pada masa depan dan sebahagian penggunaan kandungan sebagai asas jawapan Gemini; ia tidak mengubah penyertaan atau kedudukan dalam Carian biasa. | |
| Anthropic | Claude-SearchBot menyokong kualiti hasil carian; Claude-User mengambil halaman bagi soalan pengguna. | ClaudeBot ialah perangkak latihan. Anthropic menyatakan botnya mematuhi robots.txt. |
| Perplexity | PerplexityBot membantu memaparkan laman dalam hasil carian; Perplexity-User mengambil halaman apabila diminta pengguna. | Perplexity menyatakan bot cariannya tidak digunakan untuk merangkak bagi latihan model asas. Pengambil halaman atas permintaan pengguna biasanya mengabaikan robots.txt. |
Ini ialah peranan yang diterbitkan oleh penyedia setakat Oktober 2026, bukannya piawaian sejagat untuk “bot AI”. Perplexity juga tidak menyifatkan bot cariannya sebagai suis latihan. Semak dokumentasi semasa sebelum mengubah peraturan seluruh tapak.
Bolehkah Carian Dibenarkan tetapi Latihan Ditolak?
Bagi OpenAI, boleh: OAI-SearchBot dan GPTBot mempunyai tetapan berasingan. Jika tapak memilih untuk membenarkan rangkakan carian tetapi menolak rangkakan bagi latihan model pada masa depan, ini contoh dalam robots.txt di akar hos:
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
Tetapan ini tidak menjamin pautan dalam ChatGPT atau menarik balik penggunaan data terdahulu. OpenAI menyatakan tapak yang menolak OAI-SearchBot tidak ditunjukkan dalam jawapan carian ChatGPT, walaupun pautan navigasi masih mungkin muncul. Perubahan dasar mungkin mengambil kira-kira sehari untuk dipaparkan dalam sistemnya.
Google berfungsi secara berbeza. Google-Extended ialah token robots, bukan ejen permintaan HTTP yang berasingan; ia tidak mengawal penyertaan dalam Carian biasa. Tetapan Search generative AI di Search Console secara berasingan memasukkan atau mengecualikan pautan dan kandungan daripada ciri carian generatif yang diliputi. Lihat panduan AI Overviews dan AI Mode kami untuk skop tetapan itu.
Apa yang Robots.txt Boleh dan Tidak Boleh Lakukan?
Peraturan robots.txt memberitahu perangkak yang bekerjasama URL mana yang tidak patut diambil. Ia bukan kata laluan, keputusan lesen menyeluruh atau cara untuk membatalkan latihan terdahulu. URL awam masih boleh diketahui melalui halaman lain. Lindungi maklumat peribadi dengan pengesahan akses.
Letakkan fail di akar setiap hos, contohnya https://example.com/robots.txt; subdomain memerlukan dasar sendiri. Uji kumpulan user-agent yang disasarkan: Disallow: / yang dikenakan pada ejen carian yang salah boleh menghilangkan akses carian. Panduan robots.txt kami menerangkan sintaks dan ujian. Fail llms.txt pilihan tidak menggantikan kawalan akses.
Pengambilan atas permintaan pengguna juga berbeza. OpenAI menyatakan ChatGPT-User mungkin tidak mematuhi peraturan robots; Perplexity menyatakan Perplexity-User biasanya mengabaikannya; Anthropic menyatakan botnya, termasuk Claude-User, mematuhinya.
Cara Menyemak Akses AI untuk Satu Laman
- Tulis matlamat dahulu. Adakah anda mahu keterlihatan dalam Carian Google biasa, ciri carian AI tertentu, sekatan latihan model atau gabungannya? Jangan mulakan dengan senarai nama bot.
- Semak kawalan semasa. Buka
robots.txtsebenar bagi setiap domain dan subdomain. Semak tetapan AI generatif Search Console secara berasingan, bersama peraturan CDN atau firewall yang mungkin menyekat perangkak dibenarkan. - Ubah satu dasar pada satu masa. Simpan salinan fail lama, catat user-agent dan kumpulan URL yang terlibat, kemudian uji sama ada ejen carian yang mahu dibenarkan masih boleh mengakses halaman awam.
- Sahkan hasilnya. Ambil semula
robots.txt, semak log pelayan atau CDN, dan gunakan pemeriksaan rasmi penyedia jika ada. Rentetan user-agent sahaja tidak mengesahkan asal permintaan; semak julat IP rasmi apabila berkaitan. Beri masa untuk perubahan berkuat kuasa; ketiadaan petikan AI bukan bukti perangkak disekat.
Sebuah laman peralatan dapur mungkin mahu panduan pemasangannya ditemui dalam carian tetapi menolak rangkakan latihan oleh satu penyedia. Pastikan panduan itu memang awam, kemudian tetapkan kawalan latihan penyedia tersebut tanpa menyekat ejen cariannya. Ini contoh dasar, bukan hasil pelanggan.
Selepas isu akses diselesaikan, semak syarat halaman melalui panduan rangkakan dan pengindeksan kami.
Soalan Lazim
Jika Saya Sekat Bot Latihan, Adakah Laman Saya Hilang Daripada Carian AI?
Tidak semestinya. OpenAI mengawal GPTBot dan OAI-SearchBot secara berasingan. Platform lain mempunyai peraturan berbeza; semak produk yang anda maksudkan.
Adakah Sekatan Google-Extended Mengeluarkan Laman Saya Daripada Carian Google?
Tidak. Google menyatakan Google-Extended tidak menjejaskan penyertaan atau kedudukan dalam Carian biasa. Tetapan Search Console yang berasingan mengawal ciri carian generatif yang disenaraikan.
Bolehkah Satu Peraturan Robots.txt Menyekat Semua Penggunaan AI terhadap Kandungan Saya?
Tidak. Penyedia menggunakan ejen berbeza, dan sesetengah permintaan pengguna mungkin tidak mematuhi peraturan robots. robots.txt ialah arahan rangkakan, bukan perlindungan akses; gunakan pengesahan untuk kandungan peribadi.


