# SEO

Crawling dan Indexing: Panduan Praktikal Google Cari

Crawling dan Indexing: Panduan Praktikal Google Cari

Organic visibility bergantung pada beberapa sistem berasingan. Google perlu discover URL, memilih untuk crawl, menerima response yang berguna, render JavaScript jika perlu, process page, memilih Canonical dan akhirnya mempertimbangkan page relevan untuk sesuatu query. Lulus satu stage tidak menjamin stage seterusnya.

Diagnose stage pertama yang gagal

Jangan bermula dengan “request indexing.” Kenal pasti sama ada masalah berlaku pada discovery, crawler access, server response, rendering, indexability, duplication, Canonical selection, content value atau query relevance. Setiap stage memerlukan evidence dan fix berbeza.

Cari pipeline daripada URL ke result

Google menerangkan tiga stage besar—crawling, indexing dan serving—tetapi diagnosis teknikal perlu memisahkan transition di dalamnya. URL boleh diketahui tanpa difetch, difetch tanpa rendered dengan betul, diproses tanpa dipilih sebagai Canonical, atau diindeks tanpa dipaparkan untuk query yang diperiksa.

StageAktivitiEvidenceKesimpulan salah
DiscoveryGoogle mengetahui URL wujudInternal link, Sitemap, redirect, external link“Dalam Sitemap bermaksud sudah crawl”
Crawl schedulingGoogle memilih bila hendak requestLogs, Crawl Stats, last crawl“Known bermaksud crawl segera”
FetchingCrawler request URL dan resourcesHTTP response, headers, timing“Browser okay bermaksud Googlebot okay”
RenderingHTML/JavaScript menghasilkan documentSource dan rendered HTML“Google melihat semua client state”
Index processingContent, directives dan duplicate dinilaiPage Indexing, URL Inspection“200 menjamin index”
Canonical selectionSatu representative dipilihDeclared dan selected Canonical“Canonical ialah directive”
ServingIndexed page mungkin dipilih untuk queryPerformance by page/query“Indexed bermaksud rank”

Mulakan dengan technical eligibility

Keperluan minimum Google ialah Googlebot tidak disekat, page berfungsi dengan HTTP success dan mempunyai indexable content. Ini hanya menjadikan indexing mungkin; ia tidak menjamin crawl, index atau ranking.

Minimum eligibility gate
  • Exact preferred URL public dan boleh resolve.
  • Googlebot dibenarkan oleh robots.txt untuk host itu.
  • Final page memberi stable HTTP 200.
  • Primary content lengkap dan berguna pada mobile.
  • Tiada unintended noindex dalam meta atau X-Robots-Tag.
  • Essential content tidak memerlukan login, consent atau interaction.
  • Declared Canonical valid dan selari.
  • Content tidak melanggar spam atau legal policies.

Discovery memerlukan crawlable path yang kekal

Google menemui URL melalui known pages, standard links, redirects, Sitemaps dan external links. Sitemap ialah inventory, bukan pengganti navigation. Important page perlukan normal anchor link daripada relevant hub tanpa form submission atau script event.

Gunakan panduan site architecture dan panduan internal linking untuk menghubungkan services, topic hubs dan supporting articles.

Discovery sourcePerananAudit question
Normal anchor dengan destinationPrimary repeatable pathBoleh dicapai daripada indexable hub?
XML SitemapPreferred URL inventory hintFinal, Canonical dan 200?
RedirectOld path menunjuk kepadanyaRelevant dan direct?
External linkIndependent discovery/referenceResolve tanpa access error?
JS-inserted anchorBoleh selepas renderingReal href dalam rendered HTML?
Button/onclick/fragment routeUnreliableBoleh jadi standard route dan anchor?

Discovered tidak bermaksud dicrawl segera

Selepas discovery, Google memilih secara algorithmic URL yang hendak dicrawl, frequency dan volume yang host boleh tanggung. Scheduling dipengaruhi crawl demand, host capacity, change, importance, duplication dan URL inventory. Tiada fixed frequency untuk semua pages.

“Discovered – currently not indexed” bermaksud URL diketahui tetapi belum difetch. Kuatkan meaningful internal importance, server reliability dan inventory quality sebelum repeated manual submission.

ConditionPossible effectResponse
Relevant internal linksClearer importance/discoveryLink daripada appropriate hubs
Accurate Sitemap/lastmodCleaner scheduling hintUpdate selepas substantive change
Stable fast serverHigher safe capacityMonitor latency dan 5xx
Banyak duplicate/filter URLActivity tersebarControl generation dan Canonicals
Low demand/unchanged contentLess frequent recrawlJangan cipta meaningless update
Site move/launchTemporary demand changeDirect redirects dan new Sitemap

robots.txt mengawal request, bukan indexing

robots.txt memberitahu compliant crawlers URL yang boleh diminta pada protocol, host dan port tepat. Ia bukan index-removal atau security tool. Blocked URL masih boleh diketahui dan muncul dengan limited information kerana Google tidak boleh crawl untuk membaca content atau noindex.

Untuk keluarkan public page daripada Cari, benarkan crawling dan gunakan noindex, pulangkan 4xx yang betul, atau lindungi private content dengan authentication. Lihat panduan Sitemap dan robots.txt.

GoalControlSebab
Kurangkan crawling URL spacerobots.txt + generation controlsHentikan permitted crawler requests
Exclude accessible HTMLRobots meta noindexCrawler boleh membaca rule
Exclude PDF/non-HTMLX-Robots-Tag noindexRule dalam response header
Remove deleted URL404/410Content tidak wujud
Protect confidential contentAuthentication/authorizationCegah unauthorized retrieval

HTTP response menentukan processing

ResponseMaksudAudit action
200Content boleh diproses; index tidak dijaminSemak useful content dan directives
301/308Permanent move signalSatu relevant final 200
302/303/307Temporary routingSource patut kekal long-term
304Reuse previous representationValidators ikut real changes
404/410Resource tidak wujudKekalkan jika intentional
429Server overload signalControl load dan retries
5xx/network/DNSHost tidak reliableUrgent jika sustained
200 dengan empty/error contentBoleh jadi soft 404Honest status atau restore content

Browser berjaya belum mencukupi

CDN, firewall, bot protection, geolocation, cookies, device detection, redirects dan intermittent origin failures boleh memberi Googlebot Smartphone response berbeza daripada user biasa.

Fetch evidence
  • Exact requested URL, final URL dan semua redirect hops.
  • HTTP status, headers, content type dan response time.
  • robots.txt result untuk host dan crawler betul.
  • Source HTML sebelum JavaScript.
  • Rendered HTML dan essential resources.
  • Mobile content, metadata, Canonical dan schema parity.
  • Repeated samples untuk expose intermittent failure.
  • Server logs mengesahkan crawler sampai ke application.

Rendering ialah diagnostic layer berasingan

Google menggunakan recent Chromium dan boleh execute JavaScript, tetapi rendering menambah dependency kepada scripts, APIs, CORS, CSP, client routing, hydration dan resource availability. Essential content jangan menunggu click, swipe, typing, nonessential consent atau scroll event.

Source HTML yang sudah mengandungi primary content, headings, crawlable links dan stable metadata lebih resilient. SSR atau static generation membantu hanya jika delivered HTML betul dan hydration tidak menggantikannya dengan error state.

LayerBandingFailure
HTTP responseStatus, headers, raw body200 app shell tanpa content
Source HTMLTitle, H1, links, Canonical, robotsMetadata selepas failed API
Rendered DOMFinal content dan anchorsHydration buang text
Resources/APIJS, CSS, images, dataBlocked API beri empty page
Indexed viewLast processed versionLive fix belum diproses

Mobile content ialah indexing baseline

Google menggunakan mobile version untuk indexing dan ranking. Responsive design biasanya paling mudah, tetapi semua configuration perlu equivalent primary content, metadata, schema, images dan index controls pada mobile.

Mobile accordion boleh digunakan jika content wujud dalam rendered page. Primary content yang hanya muncul selepas user interaction tidak reliable.

Mobile parity
  • Primary copy, headings dan important links equivalent.
  • Title, description, robots dan Canonical selari.
  • Structured data menerangkan visible entities sama.
  • Images ada useful alt dan accessible URLs.
  • Tiada mobile-only noindex atau blocking rule.
  • Primary lazy content tidak perlu interaction.

Indexing ialah analysis dan selection

Selepas crawl dan render, Google process text, images, video, title, alt, structured data, language dan signals. Ia menilai primary content, detect duplicates dan mungkin menyimpan selected Canonical bersama cluster. Tidak semua processed page akan diindeks.

Valid 200 page boleh kekal unindexed kerana duplicate, incompatible Canonical, soft 404, nilai tidak distinct atau tidak dipilih sistem Google. Repeated request tidak menjadikan page lebih berguna.

GateHealthyFailure
Index permissionTiada unintended noindexMeta/header conflict
Primary contentUseful dan template-specificEmpty, thin, repeated
CanonicalFinal 200 preferenceRedirect/noindex target
Language/localePage dan cluster agreePartial translation
Mobile/render parityEssential content survivesAPI/interaction hides content
Site contextRelevant hubs dan linksOrphan/near duplicate

Canonical selection berlaku dalam indexing

Google cluster similar pages dan memilih representative. Redirect serta rel=canonical ialah strong signals; Sitemap lebih lemah. Internal links, HTTPS dan content similarity turut mempengaruhi. Google boleh memilih Canonical lain jika target tidak equivalent atau evidence conflict.

Rujuk panduan Canonical dan redirects sebelum menukar URL atau consolidate pages.

StateMaksudAction
Alternate with proper CanonicalExpected consolidationSahkan deliberate
Duplicate without selected CanonicalVariants dikelompok tanpa clear declarationAlign preference signals
Google chose different CanonicalURL lain lebih representativeCompare content dan signals
Page with redirectSource bukan destination indexableInspect final target
Canonical target not indexedTarget ada issue sendiriDiagnose first failed stage

Indexing dan serving ialah outcome berbeza

Indexed page layak muncul, bukan dijamin rank. Apabila user search, Google menilai relevance, quality, language, location dan device. Cari features juga berubah mengikut query.

Jika URL indexed tetapi tiada impressions, audit search intent, demand, competition, usefulness, internal context dan measurement—bukan crawling secara default. Gunakan panduan search intent dan panduan measurement.

EvidenceMembuktikanTidak membuktikan
IndexedGoogle menyimpan selected representationRank target query
ImpressionResult dipaparkanClick/conversion
ClickUser memilih resultVisit useful
Organic sessionAnalytics rekod visitExact GSC match
Lead/conversionBusiness action berlakuSEO sahaja menyebabkannya

Fahami Page Indexing tanpa mengejar 100 peratus

StateMaksudPriority
Discovered – not indexedKnown tetapi belum crawlImportant cohorts, discovery dan inventory
Crawled – not indexedFetched tetapi tidak selectedValue, duplicate, Canonical, soft 404
Excluded by noindexRule dibacaFix hanya jika patut public
Blocked by robotsContent tidak boleh fetchFix jika perlu access/noindex
Page with redirectSource ke tempat lainExpected jika intentional
Alternate/duplicateCanonical lain selectedExpected untuk variants
Server error5xxUrgent jika widespread
Soft 404Content error-like walaupun 200Restore atau honest status

Gunakan Search Console mengikut tugas sebenar

ToolBest useLimit
Page IndexingPatterns/totals known URLsExamples ialah subset
URL Inspection index dataLast processed state satu URLBerdasarkan last cycle
Live testCurrent fetch/render selepas fixTiada duplicate clustering/guarantee
SitemapsFetch/parsing dan submitted inventoryHint, bukan approval
Crawl StatsHost, requests, responses, type/purposeAdvanced; examples tidak complete
PerformanceQueries, pages, countries, devicesCanonical/privacy affect totals
RemovalsTemporary hide owned URLBukan permanent solution

Baca URL Inspection dalam urutan betul

One-URL diagnosis
  1. Inspect exact preferred URL termasuk protocol, host dan path.
  2. Semak sama ada URL diketahui dan catat last crawl.
  3. Sahkan crawl allowed, fetch dan response.
  4. Sahkan indexing allowed dan robots rules.
  5. Banding user-declared dan Google-selected Canonical.
  6. Review discovery dan Sitemap association.
  7. Run live test untuk current response/render.
  8. Jangan keliru indexed evidence dengan live result.
  9. Baiki generating template/routing rule.
  10. Request indexing sekali selepas meaningful fix dan monitor cohort.

Crawl Stats dan logs menjawab soalan berbeza

Crawl Stats merumuskan host, response, file type, purpose dan Googlebot type; example URLs tidak complete. Server/CDN logs memberi request-level evidence tetapi tidak membuktikan index atau rank.

SoalanEvidenceCaution
Googlebot sampai ke host?Crawl Stats + verified logsVerify genuine Googlebot
Response mana meningkat?Response groups + logsSpike mungkin launch
Pattern mana consume requests?Full logsSamples bukan inventory
Redirect tambah requests?Hop logs/crawlerSetiap hop dikira
URL indexed?URL Inspection index dataCrawl log bukan index
Visibility berubah?Performance by cohortGSC dan analytics berbeza

Kebanyakan site tidak perlukan advanced crawl-budget project

Google meletakkan crawl-budget management untuk site sangat besar atau frequently updated. Search Console menyatakan site bawah kira-kira seribu pages biasanya tidak perlu Crawl Stats-level optimization. Untuk service site biasa, technical clarity dan content value lebih penting.

Large ecommerce, marketplace, publisher dan faceted site mungkin perlukan deeper control. Crawl budget menggabungkan crawl capacity dan crawl demand.

ConditionPriorityAction
Small service siteLow budget concernFix links, errors, orphans, duplicates
New siteDiscovery/valueStrong hubs dan clean Sitemap
Large faceted ecommerceInventory/logsControl combinations dan empty states
PublisherFreshness/capacityAccurate updates dan stable server
MigrationTemporary demand/redirectsOne-hop map dan both hosts
Sustained 5xx/networkCapacity emergencyFix infrastructure dahulu

Kawal URL inventory pada source

Jangan cuba membersihkan infinite filters, session IDs, calendars, search pages atau duplicate paths melalui Search Console berulang. Cegah unnecessary URL daripada dijana atau linked, tetapkan Canonical, pulangkan honest status dan expose purposeful routes sahaja.

Current SEOWithJack build memisahkan 710 HTML documents daripada 459 indexable Sitemap URLs, preserve 27 original WordPress article routes dan audit semua generated internal targets. Public files, redirect responses dan indexable Canonicals ialah inventory berbeza.

InventoryIncludeExclude
Crawlable graphUseful public pages/resourcesBroken/event-only routes
Indexable CanonicalsUnique final Cari pagesRedirect/noindex/error/duplicate
XML SitemapPreferred 200 CanonicalsParameters/retired URLs
Redirect mapEvery old source/outcomeUnknown catch-all
QA crawlTemplates, locales, edge casesLaman Utamapage-only sample

Release gate untuk crawl dan index

Sebelum production
  • Setiap intended page ada stable final URL dan HTTP 200.
  • robots.txt tersedia dan membenarkan required crawling.
  • Staging noindex tidak masuk production.
  • Source/rendered HTML ada equivalent content dan metadata.
  • Mobile mempunyai content, links dan schema sama.
  • Canonical, hreflang, links dan Sitemap guna final URLs.
  • Removed routes beri relevant redirect, 404 atau 410.
  • Redirect tanpa loop atau avoidable chain.
  • 404, forms, phone dan WhatsApp berfungsi.
  • Representative pages diuji selepas launch.
  • Monitoring meliputi server, indexing cohorts dan conversions.

Workflow troubleshooting berdasarkan stage

SymptomFirst stageEvidence
URL tiada dalam reportDiscoveryLinks/Sitemap
Discovered belum crawlScheduling/inventoryImportance, server, URL growth
Crawl failedFetchingStatus, DNS, firewall, logs
Live page kosongRenderingSource vs rendered/API
Crawled not indexedIndexingValue, soft 404, noindex, duplicate
Canonical lain selectedClusteringThree-URL comparison
Indexed tiada impressionsServing/relevancePage-query intent
Drop selepas migrationRouting/transferCohorts, redirects, logs
Traffic ada, leads turunConversionForms/calls/events

Mitos crawling dan indexing

  • “Sitemap menjamin crawl dan index.”
  • “Repeated request indexing lebih cepat.”
  • “HTTP 200 bermaksud indexed.”
  • “Indexed mesti rank untuk target keyword.”
  • “robots.txt cegah URL muncul.”
  • “Google sentiasa tunggu semua JavaScript.”
  • “Live test tunjuk Canonical indexed.”
  • “Semua non-indexed URL ialah error.”
  • “Semua discovered URL mesti 100% indexed.”
  • “Small business perlukan crawl-budget manipulation.”
  • “Tukar publish date menjamin recrawl.”
  • “Server logs membuktikan index dan rank.”

Soalan lazim

Apa beza crawling dan indexing?

Crawling ialah request URL/resources. Indexing ialah memproses content, directives, duplicates dan signals untuk menentukan apa yang disimpan.

Berapa lama Google index page?

Tiada fixed time. Recrawl boleh mengambil hari hingga minggu dan request tidak menjamin index.

Adakah Sitemap menjamin index?

Tidak. Ia membantu discovery; page masih perlu lulus access, processing, Canonical dan quality.

Mengapa crawled tetapi tidak indexed?

Duplicate, selected Canonical lain, thin value, soft 404, rendering atau selection issue.

Boleh indexed jika robots.txt block?

URL kadang-kadang boleh muncul berdasarkan external information kerana robots.txt block fetch, bukan discovery.

Adakah noindex menjimatkan crawl budget?

Noindex perlu dicrawl untuk dibaca dan boleh dicrawl semula. Ia index control, bukan fix infinite URL.

Perlu request indexing selepas setiap edit?

Tidak. Gunakan untuk sedikit important URL selepas meaningful fix; publishing biasa guna links dan Sitemap.

Index data vs live test?

Index data ialah last processed view; live test ialah current fetch/render dan tidak menilai semua indexing decisions.

Perlu optimize crawl budget?

Biasanya tidak untuk small/medium service site; perlu jika large/faceted inventory benar-benar melambatkan discovery.

Apa semak dahulu bila traffic jatuh?

Pisahkan availability, index coverage, Canonical, ranking/query demand dan conversion tracking.

Rujukan rasmi

Perlukan langkah seterusnya?Cari stage pertama yang benar-benar gagal.

Kongsikan affected URL cohort, Search Console state, recent release dan server evidence. Jack boleh memisahkan discovery, fetching, rendering, indexing, Canonical dan relevance sebelum mencadangkan perubahan.

Bincang crawling dan indexing di WhatsApp

Jack Lee

Jack Lee

Building Cari Visibility with SEO, GEO & Laman Web Dibantu AI melalui projek dan eksperimen praktikal.