使用死链接检测工具前,至少要准备好站点范围、入口清单、抓取限制说明、目标状态码定义和结果存放方式这五类信息。缺少其中任何一项,工具跑出来的结果都可能把正常页面误判为死链,或者漏掉真正需要修复的链接。下面按检查项逐条说明要查什么、怎么查、结果说明什么。
要查的是整站、单个栏目,还是某个活动页,直接决定工具配置和后续工作量。准备时先写下完整起始地址,例如 https://example.com/,再列出需要覆盖的子目录,如 /blog/、/product/。
怎么查:打开浏览器访问站点首页,确认最终跳转到的协议和域名版本;再用 site: 指令或站点地图查看实际存在的目录结构。结果说明什么:如果 http 与 https、带 www 与不带 www 都能打开,说明存在多版本入口,检测时必须明确以哪一个为准,否则同一页面会被重复统计,甚至把跳转当成死链。
死链接检测工具通常从种子地址开始爬行,种子越完整,覆盖越接近真实。准备一份入口清单,至少包含三类来源:XML 站点地图地址、主导航与页脚链接、以及已知的外部链接页面。
怎么查:在浏览器打开 /sitemap.xml 或 robots.txt 中声明的站点地图地址,确认能否正常返回;再手动点一遍主导航。结果说明什么:站点地图能正常访问,只说明这份清单可作为爬行种子,并不保证其中每个网址都能被抓取或收录,所以它不能替代实际检测结果。如果站点地图缺失,就以首页和栏目页作为起点,但要意识到深层页面可能覆盖不到。
robots.txt 中的 Disallow 规则会阻止爬虫访问某些路径。检测工具如果遵守这些规则,被禁止的链接就不会被抓取,结果里可能显示为“未检测”而不是“正常”。
怎么查:访问 https://你的域名/robots.txt,逐条阅读 User-agent 与 Disallow 段落,标出被屏蔽的目录;再对照检测工具是否提供“忽略 robots.txt”选项。结果说明什么:如果某批链接集中显示为跳过或未访问,先怀疑 robots 限制,而不是直接判定为死链。需要提醒的是,robots.txt 的抓取限制不等于可靠的索引移除,被禁止抓取不等于页面已从搜索结果中消失,两件事要分开判断。
不同工具对死链的判定口径不同,准备阶段就要写清楚哪些状态算问题。常见判定包括:返回 404 或 410、连续多次超时、以及跳转链过长。
怎么查:先用工具默认设置跑一遍,导出结果后按状态码分组;对超时和 403 的链接手动在浏览器和无痕窗口各访问一次。结果说明什么:如果手动访问正常,说明是抓取环境或频率导致的误报;如果手动也失败,才可归为需要处理的链接。注意一项现象可能有多个解释,不要仅凭一次检测就断言唯一原因。
检测结果需要能对比、能追踪,否则修完一轮无法确认是否真的减少。准备一个表格,字段至少包括:来源页面、目标地址、状态码、首次发现时间、处理状态。
怎么查:把工具导出的 CSV 导入表格,按目标地址去重,标记出站内链接和站外链接。结果说明什么:站内死链通常可以自己修复;站外死链只能联系对方或替换来源,处理周期更长。修复完成后,用同一份入口清单和同一套判定标准再跑一次,两次结果对比才能说明修复是否生效。
下一步:按上面的清单逐项填写,先补齐缺失项,再运行死链接检测工具;如果 robots.txt 或站点地图本身无法访问,优先解决这两个入口问题,否则后续检测结果的覆盖范围会一直不完整。