多语言 Hreflang 标签 建站 配置 | 3步修复GSC缺少返回标签报错

谷歌Search Console后台的旧版工具栏目里,国际定位报告出现红色警告提示。页面上方的折线图显示缺少返回标签错误数量达到了125个。鼠标移动到图表右上角的向下箭头图标,点击导出按钮,一份包含全部异常网页明细的CSV格式文件被保存到本地电脑桌面上。用Excel表格软件打开这份大小为1.2MB的排查报告。利用Excel自带的数据透视表功能按语种分类排版,查出引发报错频率最高的是西语版网页。这份包含850行数据的表格是修改代码的依据。

  • 查阅国际定位报告里的红色警告

  • 核对折线图上125个报错数量

  • 点击右上角图标导出CSV文件

  • 在Excel建立数据透视表分类排版

  • 筛选报错频率最高的西语网页

登录网站服务器,找到西语页面的HTML源代码文件。查阅第15行至第18行的<head>区域,这里缺少了指向法语页面的rel="alternate"语句。打开对应的法语页面源代码,第16行清晰写着hreflang="es-ES"。单向的宣告违背了多语言配置的双向确认规则。打开西语网页的PHP模板文件,在第17行敲入指向法语页面的代码。代码双引号内严格填入法文地区的标准化代码fr-FR。将修改后的文件上传到/www/wwwroot/目录下覆盖原文件。

  • 审查第15至18行<head>区域代码

  • 核实指向法语页面的rel="alternate"

  • 比对法语页第16行es-ES标识

  • 修改西语网页模板补齐对应代码

  • 录入法文地区标准代码fr-FR

不少网页除了向外指向其他语种,少写了一条指向自身当前语言的语句。翻阅阿拉伯语网页的源代码,在第19行补上一条包含hreflang="ar-AE"的代码。这一行代码宣告当前网页对应的正是阿拉伯联合酋长国地区。配置列表的末尾多加一行带有x-default属性的后备页面指令。遇到电脑操作系统没有匹配语言环境的海外访客,搜索引擎会依照这条指令展示网站默认的英文版通用主页。

  • 检查指向自身当前语言的语句

  • 在阿拉伯语网页第19行补写代码

  • 核实ar-AE代表阿拉伯联合酋长国

  • 加入x-default属性后备页面指令

  • 指定英文版主页接待无匹配访客

打开常见的网站服务器控制面板,寻找网页CDN缓存清理选项。点击清空全部节点缓存按钮,页面加载转圈等待约5分钟直到进度条走完100%。网页头部的新代码被推送到遍布全球的150个CDN加速节点上。回到GSC控制台界面,把刚才修改完的西语页面完整路径粘贴到顶部的搜索框内。按下回车键,界面跳出带有正在测试实际网址字样的提示框。等待大约15秒钟,点击屏幕右侧的请求编入索引灰色按钮。

  • 在服务器控制面板寻找CDN清理

  • 等待5分钟清空全部节点缓存

  • 将代码推送到150个全球节点

  • 把西语路径粘贴到GSC搜索框

  • 点击请求编入索引灰色按钮

查阅网站根目录下的sitemap.xml网站地图文件。这个包含3500个商品网址的地图文件里混入了带有追踪参数的动态路径。在浏览器地址栏输入带有?currency=USD后缀的测试网址。按下键盘上的F12键打开网页开发者工具,网络请求面板里的状态码显示为301。爬虫顺着Hreflang标签抓取到了一个重定向跳转页面,当天的抓取配额被白白浪费。把地图文件和页面头部标签里的路径全部替换成返回200状态码的静态着陆页。

  • 查阅根目录下sitemap.xml文件

  • 核对3500个网址排查追踪参数

  • 用F12开发者工具查看网络请求

  • 剔除状态码显示为301的路径

  • 替换为200状态码的静态着陆页

常见语言地区配置正确的ISO代码写法错误的写法示例
英国英语en-GBen-UK
台湾繁体中文zh-TWzh-CN
瑞士德语de-CHde-SW
拉丁美洲西班牙语es-419es-LA

正确配置ISO 639-1语言代码和ISO 3166-1 Alpha 2地区代码,能将国际化网页的抓取错误率降低85%以上。

翻阅谷歌官方指南的抓取预算说明文档页面。一个拥有10万个商品页面的中型多语言外贸商城,每天分配到的抓取额度大约是4000到6000个网页之间。错误配置的语言标签会让爬虫在无意义的循环跳转中耗尽这5000个抓取额度。排查全站所有带有rel="canonical"的规范网页标签代码段。核对Hreflang属性里的路径字符,与Canonical标签里填写的路径做到百分之百的拼写匹配。

  • 翻阅官方指南抓取预算说明文档

  • 核算10万页商城的每日抓取额度

  • 防止爬虫在循环跳转中耗尽配额

  • 排查带有rel="canonical"的标签

  • 确保两处路径字符百分之百匹配

电脑上安装网站爬行软件模拟谷歌机器人的日常抓取行为。在软件设置界面的User-Agent下拉菜单中选择Googlebot Smartphone选项。将网站主页路径粘贴到顶部的输入栏,把抓取速度限制调整为每秒钟读取5个URL。爬行任务结束后的右侧边栏数据报告里,提示有42个网页出现了Hreflang双向对应冲突。这42个网页里有8个返回了404未找到错误。技术人员对照这份包含42个错误路径的清单进行逐一的代码修改。

  • 用爬行软件模拟谷歌机器人抓取

  • 选择Googlebot Smartphone代理

  • 将抓取速度限制为每秒5个URL

  • 在报告中查验42个Hreflang冲突

  • 对照404错误清单进行代码修改

代码修改工作完成后的第14天,重新登录GSC后台查看国际定位数据报表。原本显示125个错误的红色折线图,在图表末端数值下降到了13个。排查剩下这13个报错网页,发现属于下架超过三个月的旧款商品页。在服务器端的Nginx配置文件里加入410 Gone状态码规则。用这种状态码明确告知爬虫这13个旧商品页面已经被永久删除,不需要再去寻找对应的其他翻译版本。

  • 在修复完成后的第14天查看报表

  • 核实125个错误数值下降到13个

  • 定位下架超过三个月的旧商品页

  • 在配置文件里加入410 Gone状态码

  • 告知爬虫13个页面已被永久删除