死链检查工具_怎样取得可复查的状态证据

📍 WDQWDWQD987AAAAA:216.73.216.79
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /ab137e9bbb43.html
📄

死链检查工具_怎样取得可复查的状态证据

可复查的状态证据,指的是你在某个时间点对某个URL发起请求后,保存下来的请求地址、时间、HTTP状态码、跳转链路和响应头。只截图“页面打不开”不算证据,因为它无法证明当时服务器返回的是404、410还是超时。正确做法是:用死链检查工具或命令行请求,把原始响应记录下来,并与页面上的链接来源对应。

一个假设例子:从发现到留证

假设某教程站改版后,旧路径 /old-guide 被删除,但首页仍链向它。你用工具扫出该链接返回404。此时不要只记“首页有死链”,而应记录四件事:来源页URL、目标URL、请求时间、完整响应头。例如响应中若出现 HTTP/1.1 404 Not Found,说明资源确实不存在;若出现 301 后跟 404,则说明跳转链末端失效,修复时要改的是跳转目标,而不是来源链接。

需要保存哪些字段才算可复查

如果工具只给出“死链数量”而不给上述明细,它适合做初筛,不适合作为修复依据。此时可用 curl -I 或浏览器开发者工具的Network面板补一次单条请求,把响应头复制到记录表里。

常见错误:把间接信号当成状态证据

第一类错误是用 robots.txt 的抓取限制推断页面已移除。robots.txt 只约束爬虫抓取,不等于搜索引擎已删除索引,也不等于URL返回404。第二类错误是把站点地图当成收录保证:站点地图里列出的URL仍可能返回404或500。第三类错误是看到HTTPS就认为链接健康,HTTPS只说明传输层加密,与目标资源是否存在无关。第四类错误是只测一次就下结论,服务器瞬时超时和稳定404需要区分,前者应复测,后者才进入修复清单。

可执行的复查步骤

  1. 选定检查范围:只查站内链接,还是同时查外链;只查HTML页面,还是包含图片、CSS、JS。
  2. 用工具导出结果,保留状态码、来源页、目标URL、发现时间四列。
  3. 对每个非200结果单独发起一次请求,记录完整跳转链和响应头。
  4. 按状态码分类:404/410归为需替换或删除;5xx归为服务端问题,先复测;超时归为待确认。
  5. 修复后对同一批URL再跑一次,把前后两份记录放在一起,才算完成复查闭环。

判断标准可以这样定:如果同一URL在两次请求中返回相同状态码,且跳转链一致,证据可采信;如果两次结果不同,应先排除网络波动、CDN缓存和临时维护,再决定是否修复。

修复后如何确认没有引入新死链

改完链接后,除了复测原失效URL,还应重扫来源页,确认新目标返回200。若新目标本身是跳转链,要检查末端状态,而不是只看第一跳。对重要页面,可把复查记录按日期存档,便于下次改版时对比。需要进一步操作时,先固定一份包含状态码与来源页的导出表,再按状态码分批处理,不要直接批量删除链接。

图1 图2

nginx