问题
页面被禁止抓取,却又期望搜索引擎读取页面上的 noindex 指令。
产生原因
robots.txt 控制抓取访问,noindex 是页面级索引指令;抓取被阻止时,爬虫可能无法看到 noindex。
如何诊断
检查 robots.txt 响应、准确路径规则、meta robots 或 X-Robots-Tag,并确认重定向后的最终网址。
如何修复
若目标是阻止索引,应允许抓取并返回 noindex,或使用身份验证;不要把 robots.txt 当作隐私保护。
如何验证
再次抓取 robots.txt 与页面,确认爬虫能看到预期指令,再在你拥有的网站中检查索引状态。