Hubungi dukungan

Kami membalas melalui e-mail, biasanya dalam dua hari.

Google reCAPTCHA memeriksa kiriman ini untuk mencegah penyalahgunaan; data dikirim ke Google. Skrip hanya dimuat saat formulir ini dibuka.

← Semua artikel

Dua belas URL untuk satu artikel

Setiap tulisan di blog ini berada di dua belas alamat. Sebelas di antaranya memakai prefiks bahasa — /en/blog/…, /de/blog/… dan sembilan lainnya — dan yang kedua belas sama sekali tanpa prefiks. Alamat itu membaca header Accept-Language dari browser dan menjawab dalam bahasa mana pun di antara kesebelas bahasa itu yang dikenalinya.

Selama 27 dan 28 Agustus, crawler mengambil 1.609 halaman blog dari situs ini. Pembaca mengambil 628.

versi bahasa yang diambil per tulisan, dari sebelas ClaudeBot 11,0 bingbot 8,7 PetalBot 6,0 Applebot 4,3 SemrushBot 1,8 Googlebot 1,5 1.609 halaman blog diambil crawler dalam dua hari, 628 oleh pembaca bersama-sama 0,5 persen dari semua yang diminta dari server ini

Apa yang sudah saling disampaikan halaman-halaman ini

Kedua belas halaman menyatakan tiga hal yang sama di bagian head-nya, dan hari ini saya memeriksa ketiganya alih-alih memercayai kodenya.

Tautan kanonis di setiap halaman menunjuk ke halaman itu sendiri. Sebelas baris hreflang menyebut versi-versi bahasa saudaranya, dan baris kedua belas menyebut alamat tanpa prefiks sebagai x-default, karena alamat itu bukan milik satu bahasa tertentu. Alamat tanpa prefiks menjawab dengan Vary: Accept-Language, Accept-Encoding, sehingga apa pun yang melakukan cache di depannya tahu bahwa isi halaman bergantung pada sebuah header permintaan.

Negosiasinya berfungsi. Meminta URL yang sama dengan Accept-Language: de menghasilkan halaman bertanda lang="de", dengan ja halaman berbahasa Jepang, dengan kode yang tidak dipakai siapa pun, bahasa Inggris. Dua belas permintaan yang bergantian di antara empat bahasa menghasilkan empat isi halaman yang benar, tiga kali berturut-turut, jadi cache halaman memakai bahasa sebagai kunci, bukan hanya jalurnya.

Inilah yang diminta spesifikasi: kelompok yang lengkap dan timbal balik, di mana setiap anggota menyebut dirinya sendiri dan semua saudaranya. Susunan inilah yang memungkinkan mesin pencari memperlakukan dua belas alamat sebagai satu artikel dalam dua belas bahasa, bukan dua belas artikel yang saling bersaing.

Ini tidak membuat siapa pun mengambil lebih sedikit

Ini juga tidak mengurangi pengambilan, dan log akses menyatakannya tanpa banyak ruang untuk tafsiran.

ClaudeBot membuat 396 permintaan blog untuk 36 tulisan — tepat 11,0 versi bahasa per tulisan, setiap bahasa, setiap kali. bingbot rata-rata 8,7 untuk 37 tulisan, PetalBot 6,0, Applebot 4,3. SemrushBot hanya mencapai 1,8. Googlebot membuat 72 permintaan untuk 42 tulisan, rata-rata 1,5 versi bahasa per tulisan, dan hanya crawler inilah di antara keenamnya yang berperilaku seolah-olah anotasi itu sampai kepadanya.

Dari semua crawler, 73 dari 76 tulisan diakses setidaknya sekali, dan 68 di antaranya dalam lebih dari satu bahasa. Rata-ratanya 7,84 versi bahasa per tulisan dari sebelas.

Semua ini bukan pelanggaran. hreflang adalah petunjuk tentang hubungan antarhalaman, yang ditujukan kepada bagian mesin pencari yang memutuskan hasil mana yang ditampilkan. Itu bukan perintah bagi bagian yang memutuskan apa yang diunduh. Crawler yang belum pernah melihat /uk/blog/… tidak punya cara untuk mengetahui bahwa itu terjemahan sampai ia mengambilnya dan membaca bagian head-nya — anotasi itu baru bisa berlaku setelah terjadinya permintaan yang mungkin bisa dihematnya.

Berapa biayanya

Lebih kecil daripada kesan paragraf di atas. Sebanyak 1.689 permintaan crawler ke halaman blog itu merupakan 0,5 persen dari 373.019 permintaan yang dijawab virtual host ini dalam dua hari, dan 19,9 MB dari 4.363 MB yang dikirimnya. Satu halaman blog kembali dalam sekitar sepersepuluh detik, jadi seluruh perayapan sebelas kali lipat itu memakan sekitar delapan puluh detik waktu prosesor per hari.

Sitemap memakan biaya sedikit lebih besar daripada yang saya perkirakan. Sitemap itu mencantumkan 3.136 alamat dengan 13.248 anotasi bahasa alternatif yang melekat padanya: 1,85 MB XML, 35 KB setelah dikompresi. Sitemap dibangun ulang paling sering setiap enam jam, itulah sebabnya tulisan yang terbit pukul satu lewat sepuluh siang baru muncul lengkap di dalamnya beberapa jam kemudian, tidak seketika.

Tidak ada angka di situ yang perlu diubah. Satu-satunya cara yang akan mengurangi pengambilan adalah tidak memiliki alamat-alamat itu, padahal alamat-alamat itulah intinya.

Pembaca dan crawler menginginkan hal yang berbeda

Dua hari yang sama, jika dipilah menurut bahasa, menunjukkan dua kebiasaan yang cukup berbeda.

Crawler tersebar hampir merata: antara 5,5 dan 10,5 persen permintaan blog mereka menuju ke masing-masing dari sebelas versi berprefiks, ditambah 16 persen ke versi tanpa prefiks. Itulah pola sesuatu yang menyusuri sebuah daftar.

Pembaca tidak tersebar merata. 38 persen permintaan mereka menuju alamat tanpa prefiks dan 18 persen lainnya ke /en/, jadi lebih dari separuh datang dalam bahasa Inggris atau melalui negosiasi. Sisanya terbagi ke sepuluh bahasa, yang terbesar bahasa Jerman dengan 7 persen, yang terkecil bahasa Prancis dengan 2 persen.

Sisa 44 persen itulah seluruh alasan keberadaan jalur bahasa. Angka itu juga cukup kecil sehingga jalur bahasa mudah dianggap tidak perlu — dan itu kesalahan yang sama dengan membaca kolom crawler lalu menyimpulkan bahwa halaman-halaman ini populer.

Yang berlaku secara umum

Petunjuk yang benar bukanlah perintah. Semua yang ada di bagian head halaman-halaman ini benar, timbal balik, dan dapat diverifikasi, dan lima dari enam crawler mengambil halaman seolah-olah semua itu tidak ada. Spesifikasi menjelaskan arti anotasi, bukan apa yang akan dilakukan program tertentu saat melihatnya.

Jadi pertanyaan yang berguna tidak pernah soal apakah markup-nya benar. Pertanyaannya adalah berapa kali setiap pengambil benar-benar datang, dan itu pertanyaan yang hanya bisa dijawab oleh log — dan setelah terjawab, kesimpulan yang jujur adalah bahwa perayapan sebelas kali lipat itu hanya memakan setengah persen dan sebaiknya dibiarkan saja.

Iklan