诊断决策 / 技术可发现性
页面不收录,先分清抓取、索引与展示
页面上线却搜不到时,不要立刻重写内容。按发现、访问、渲染、索引选择和展示资格逐层排查。
先把本篇问题写成一句话,再确认它影响的是流量、Feed、页面、结账、EDM 还是数据复盘。
围绕抓取、索引、实体事实、主题关系和引用可验证性留下证据;执行前核对当前规则。
直接判断:页面“搜不到”不是一个故障,而是至少五种状态的共同表象。先确认搜索系统有没有发现 URL、能不能访问、能不能读到主要内容、是否选择它进入索引、是否愿意在具体查询中展示。跳过分层,最常见的结果就是反复改标题和正文,却没有触及真正的阻塞点。
先做判断
先把问题限定到一个 URL 样本和一个时间窗口。不要从“全站流量下降”直接推断“全站没收录”,也不要用站内搜索结果代替外部索引证据。为样本记录发布时间、最近改动、HTTP 状态、规范 URL、是否出现在站点地图、入口内链以及检查日期。
然后区分四种结论:尚未发现、已发现但访问受阻、已访问但未被选择进入索引、已索引但没有在目标查询中获得展示。最后一种通常不是抓取故障,而是相关性、竞争、意图或需求问题。
诊断框架:从入口到结果的五层漏斗
第一层是发现。检查 URL 是否由可抓取的导航、类目、主题页或正文链接指向,是否存在于有效站点地图中。只有站点地图、没有站内关系的孤岛页,发现与重要性信号都可能偏弱。
第二层是访问。读取真实响应,检查状态码、跳转链、登录墙、robots 控制、noindex、规范标签和环境配置。不要只看浏览器最终画面;浏览器能打开,不代表爬虫拿到同样的响应。
第三层是渲染。比较初始 HTML 与执行脚本后的页面,确认标题、主正文、商品事实和内链是否在可读取结果里。客户端交互本身不是问题,问题是关键内容是否必须依赖失败或延迟的脚本才能出现。
第四层是索引选择。检查搜索系统报告的规范页是否与预期一致,再看相似页面、参数 URL、变体页和重复模板。若系统选择了另一个 URL,重写单页之前应先处理重复关系与规范信号。
第五层是展示。页面进入索引后,仍要验证它是否匹配目标问题、是否具有独特信息、是否在合适地区与语言版本出现。排名和 AI 引用属于下游结果,不应倒推前四层一定健康。
用页面队列,而不是逐页救火
把 URL 按模板和状态分组,例如商品页、类目页、指南页、参数页,每组抽取新旧、深浅层级和不同语言的样本。若同一模板普遍失败,优先修模板;若只有少数页失败,再查内容与链接差异。页面之间疑似互相替代时,转入 内容重叠诊断;修复完成后,按 SEO/GEO 发布验收 做公开回读,而不是以构建成功收尾。
常见误判
- 把“已提交站点地图”当作“已索引”。提交只是发现线索,不是结果承诺。
- 把“URL 检查通过”当作“所有地区、设备和查询都能展示”。单次工具结果只证明当时的一个检查面。
- 页面未展示就立刻增加字数。若规范页错误或正文不可读取,扩写不会修复路径。
- 看到重复页就批量删除。先确认流量、外链、转化、语言与变体职责,再决定合并或重定位。
- 将索引延迟写成固定天数。处理速度会随站点、模板和生态变化,必须以当前工具回读为准。
验证清单
- URL 样本、模板、发布日期与检查时间已记录。
- 有至少一个可抓取的站内入口,不是孤岛页。
- 最终响应、跳转、robots、
noindex与规范标签符合预期。 - 初始 HTML 或可靠渲染结果包含主要内容与内链。
- 搜索系统选择的规范 URL 已回读,而非仅检查源代码声明。
- 相似页、参数页、语言页与变体页已纳入重复关系检查。
- 已将“进入索引”和“获得展示/点击/引用”分开记录。
- 使用的平台工具名称、入口和资格要求已在执行当天回查官方说明。
适用边界
本框架用于公开网页的搜索可发现性诊断,不能替代日志级爬虫分析、服务器排障或搜索平台的官方文档。大型站点应增加日志采样、抓取预算与模板监控;小站可先用十几个代表 URL 做队列。任何抓取工具、索引报告、提交方式和 AI 搜索资格都可能变化,执行前需要回查当前官方入口,不能把本文步骤理解为平台承诺。