Öğren · rehber3 dk okuma

Öğren / Makine okunabilirliği

Makine okunabilirliği: cevap motorları sayfanızdan gerçekte ne bekler

Cevap motorları çekebildiği, ayrıştırabildiği ve alıntılayabildiği sayfaları kaynak gösterir. Sayfaların sessizce kaybettiği dört katman: erişim, indekslenebilirlik, cevaplanabilirlik, güncellik.

YayınGüncellemeDayanak
JavaScript SEOIndexability katmanı

Arama motorları sayfaları sıralar; cevap motorları sayfaları alıntılar. ChatGPT, Perplexity veya bir yapay-zekâ tarayıcı ajanı bir soruyu yanıtlarken bir avuç sayfa çeker, onları pasajlara böler ve yolculuğu atlatan pasajları kaynak gösterir. İnsan gözüne kusursuz görünen bir sayfa bu oyunu dört ayrı yerde kaybeder ve dördü de klasik analitik panellerinde görünmez.

Erişim: hiç gerçekleşmeyen çekim

Her alıntı düz bir HTTP GET ile başlar ve o GET’in hoş karşılanıp karşılanmayacağına robots.txt karar verir. Biçim 1994’ten kalmadır ve ancak Eylül 2022’de RFC 9309 ile standartlaştı. Sahada üç hata baskındır: 5xx dönen bir robots.txt (RFC 9309 bu durumda tüm siteyi yasak saymayı söyler), yıllar önce kazıyıcılara karşı yazılmış ama bugün getirme botlarını da engelleyen toptan kurallar ve tarayıcı olmayan her user-agent’a doğrulama sayfası gösteren güvenlik duvarları.

Çözüm bir öğleden sonraya sığar: robots.txt’i 200 ya da 404 ile sunun, asla 500 ile değil; kabul ettiğiniz ajan sınıflarını açıkça listeleyin; sayfayı ağınızın dışından düz bir GET ile test edin. Engellenen bir çekim, içerik ne kadar iyi olursa olsun 0 alıntı getirir.

İndekslenebilirlik: sunucu HTML’i ile JavaScript kabuğu

Getirme sistemleri sunucunun gönderdiği HTML ile çalışır; JavaScript’i sonradan çalıştıranlar azınlıktadır. Google, tarama, render ve indeksleme olmak üzere 3 ayrı aşamayı JavaScript SEO rehberinde belgeler ve render geçişini kendi kuyruğunda çalıştırır. Cevap motoru botlarının çoğu bu geçişi hiç yapmaz: render yok, hidrasyon yok, istemci yönlendiricisi yok. Boş bir <div id="root"> gönderen tek-sayfa uygulaması, bu sistemlere tam olarak hiçbir şey göndermiş olur.

Farkı doğrudan ölçün: sayfayı curl ile çekin, etiketleri ayıklayın ve geriye kalan cümleleri sayın. Lekta bu indekslenebilirlik katmanını 0 ile 1 arasında bir JS bağımlılık katsayısıyla notlandırır — görünür metnin yalnız render sonrası var olan payı. 0,01 altındaki sayfalar fiilen statiktir; 0,5 üstündekiler tüm içeriğini, çoğu botun hiç çalıştırmadığı bir render adımına yatırır.

Cevaplanabilirlik: alıntı için biçimlenmiş içerik

Çekilebilen ve ayrıştırılabilen sayfa, yarışı pasajlarının soruları yanıtlayıp yanıtlamadığıyla sürdürür. Somut veri kazanır: tarihler, sayılar, adlar ve birimler dil modeline alıntılayacak, doğrulayıcıya da kontrol edecek bir şey verir. Yapısal işaretleme aynı yönde çalışır — datePublished ve dateModified taşıyan bir Article nesnesi motora sayfanın ne kadar taze olduğunu, bir og:type beyanı ise ne tür bir belge okuduğunu söyler.

Yapısal işaretleme, bu biçimin makine tarafında karşılığıdır. Belge türünü bir kez beyan edin, gerisini sözlük taşısın: Article nesnesi sayfanın ne olduğunu, og:type beyanı nasıl önizleneceğini söyler; motor pasajı kaldırdığında ikisi de pasajla birlikte gider.

Güncellik: makinenin de okurun da gördüğü tarih

Güncellik, bugüne dek ölçülmüş en güçlü sayfa-içi alıntı sinyalidir ve en sık yarım bırakılan sinyaldir. Render edilen sayfada hiçbir tarih yokken JSON-LD’de duran bir dateModified damgası süs gibi okunur ve birden çok motor bu damganın değerini düşürür. Tarihi okurun göreceği yere yazın, işaretlemeyi eşzamanlı tutun ve içerik gerçekten değiştiğinde ikisini birden güncelleyin.

Güncellik, tarihi durmadan yenilemek demek değildir. Değişmemiş metne taze zaman damgası basmak, motorların tam da güvenmemeyi öğrendiği davranıştır; bu yüzden Lekta sayfanın yaşını raporlar ama PUANLAMAZ — güncellik katmanının notlandırdığı şey tarihin var olup olmadığı ve okurun onu görüp göremediğidir.

Gerçek bir sitede nereden başlamalı

Denetime ana sayfadan değil, temsilî bir makale sayfasından başlayın. Açılış sayfaları navigasyondur; cevap motorlarının alıntıladığı şey makalelerdir. Dört katmanı sırayla kontrol edin — robots.txt sorunu kendisinden sonraki her katmanı geçersiz kılar, bu yüzden katmanları sırasız düzeltmek emek israfıdır. Tek sayfa için tam döngü bir saatin altında sürer; erişim ve indekslenebilirlik düzeltmeleri çoğu zaman tek seferde bütün siteye taşınır.

Kaynaklar

Dört kaynağın dördü de birincildir: RFC metninin kendisi, schema.org ile ogp.me sözlük tanımları ve Google’ın kendi tarayıcı belgeleri. Bu sırayla okuyun; yukarıdaki dört katmanla eşleşirler.

Devam1 / 5 rehber
Makine okunabilirliği: cevap motorları sayfanızdan gerçekte ne bekler — Lekta