谷歌收录是外贸站的第一道坎:页面进不了 Google 的索引库,写得再好也是零。网站不被谷歌收录,到底该从哪查起?这篇不讲通用理论,只拆我们天问团队自己经手的三个真实案例——包括你正在看的这个站本身。这个站曾经 196 篇文章只被收录 64 篇,剩下 132 篇对 Google 来说完全不存在。排查下来,卡点没有一个出在”内容质量”上。
如果你的站也有类似情况,建议先照着做第一步,再对号入座看三个案例。
先查状态:你的页面卡在哪一档
排查收录问题最忌讳上来就改内容——内容质量只影响“Crawled – currently not indexed”这一档,而多数站真正卡住的是“unknown”和“Discovered”,改内容等于修错了零件。打开 Search Console 顶部的网址检查框,贴入页面地址,几秒钟就能看到你卡在哪一档:
| 状态 | 意思 | 该做什么 |
|---|---|---|
| URL is unknown to Google | Google 根本不知道这个页面存在 | 查 sitemap 是否真实收了它、有没有内链指向它 |
| Discovered – currently not indexed | 知道了,但还没来抓 | 加内链提权重,等待或手动请求收录 |
| Crawled – currently not indexed | 抓了,看完决定先不收 | 这才轮到检查内容价值和重复度 |
| 网址已收录到 Google | 在索引库里了 | 别动它,去救别的页 |
先别急着动内容,把未收录页逐个过一遍状态再决定下一步。我们把自己站 132 个隐形页全查了一遍,问题分布和想象的完全不一样——详细做法写在用 Search Console 做 SEO 诊断的完整流程里。
案例一:URL 里的中文,是最被低估的收录杀手
同一个中文内容站里,英文 slug 页被 Google 收录 63 篇,中文编码 slug 页收录 0 篇——两组页面内容都是中文,变量只有 URL 的编码方式(196 篇样本,2026 年 8 月 GSC 逐页检查)。
这是我们自己站上的对照实验,不是刻意设计的,是日更偷懒的副产品:早期文章用英文语义 slug,后来图省事直接拿中文标题生成 URL,浏览器里看着正常,实际地址变成 %e8%b0%b7... 这样的编码串。63 比 0,零收录的全是编码串那一组。
中文 URL 不是谷歌官方都支持吗?官方文档确实说支持,但实际抓取时编码串又长又乱,排在队列末尾。知乎、百科用中文路径照样收录,那是权重扛得住;我们那批收录为零的页面全是编码串——权重趋近于零的站,根本等不到 Google 来解码。
修复要注意两个坑。一是 34 个中文 slug 全部改成英文语义 slug 后,旧地址必须 301 到新地址;二是 WordPress 原生的 _wp_old_slug 重定向对编码中文 slug 并不可靠,我们实测只能用 mu-plugin 写硬映射才 100% 生效。改完记得清缓存再验证,带缓存的 200 是假象。
案例二:零报错的静默故障,比报错的故障害人
一个机械外贸站,几个月收录零增长,内容和外链都没问题。挖到底是两个叠加的静默故障——全程没有任何报错。
Rank Math 的 sitemap 缓存文件名是 rank_math_{md5}.xml,不含 sitemap 字样,按文件名排查永远搜不到,而且默认存活 100 天(2026 年 7 月实测)。也就是说,站长以为 sitemap 天天在更新,Google 拿到的其实是三个月前的旧文件,新文章根本不在里面。
第二个故障更隐蔽:wp-config 里关了 WP_CRON,服务器端却没配系统 cron。后果是定时发布的文章会无限期停在 Scheduled 状态、零报错——这个站积压了 176 篇”已排期”却永远不会发布的文章。同服务器其他站都配了,唯独它漏了。
对付静默故障只有一个办法:不信配置,信探针。发一篇一分钟后到期的测试定时文,看它到点发不发布;用 Search Console 的 sitemap 报告核对 Google 实际下载的时间和条数,而不是看插件后台的绿勾。
案例三:页面越多,收录率反而越低
一个 2900 多个产品页的类目站,索引率只有 36%:约 1916 个产品页停在 Discovered 状态,Google 知道它们存在,就是不来抓(90 天 GSC 全量数据,2026 年 8 月)。
这个站还有一个反直觉数据:型号类长尾查询贡献了 71% 的点击,而站长一直想主攻的”维修”类大词只有展现没有点击。大词的流量是幻觉,真实生意藏在型号长尾里——但长尾页恰恰是没被收录的那批。
给这个站的建议只有一条:索引率修到 60% 之前,停掉所有内容动作——1916 个没进索引的页面,标题改得再漂亮 Google 也看不见。我们自己站的数据摆在那:一个月发 150 多篇,收录率掉到 33%;后来怎么救回来的,下一节细说。发得多不如让 Google 先把已有的收进去——之前写过一篇专门拆这个机制的:为什么发得越多流量越少。
内链:我们实测过杠杆最高的一招
给 98 个未收录页从 64 篇已收录页建了 294 条内链之后,4 天内全站已编入索引数从 64 升到 112(2026 年 8 月实测,无其他变量介入)。
为什么内链能这么快见效?未收录页大多是孤岛,Google 从已收录页顺着链接爬过来,才算真正”发现”了它们。做法上有讲究——链接要从已收录、主题相关的页面发出,锚文本用目标页的真实标题,别堆关键词。具体的组织方法看内链与主题集群的实操指南。
外链当然也有用,但对新站来说内链是你唯一能百分百控制、当天就能上线的杠杆。内链没建完之前,先别急着花钱搞外链。
手动请求收录:配额有限,先查后提
Search Console 的”请求编入索引”每个站每天大约只有 10 次配额,用一次少一次。我们踩过的浪费:给已经收录的页面提交了请求,白烧一格。正确姿势是先看网址检查的状态,只给 Discovered 和 unknown 状态的页面提交。GSC 提交成功的弹窗里写得明明白白:多次提交同一网页并不能改变队列顺序——我们误重复提交过两次,配额白烧,队列纹丝不动。
还要认清它的定位:请求收录是加速器,不是救命药。页面本身没有内链、sitemap 里也没有它,请求十次也白搭。robots、canonical 和 sitemap 的索引控制这些基础没打好,加速器加速的是零。
一张排查顺序表
| 顺序 | 查什么 | 工具 | 常见凶手 |
|---|---|---|---|
| 1 | 未收录页的状态分布 | GSC 网址检查(官方说明) | 大量 unknown = 发现层问题 |
| 2 | URL 形态 | 肉眼看地址栏 | 中文编码串、参数、超长 URL |
| 3 | sitemap 的真实状态 | GSC sitemap 报告核对下载时间 | 缓存冻结、新页不在其中 |
| 4 | 内链入度 | 爬虫工具或数据库查询 | 孤岛页、只有分页入口 |
| 5 | 定时任务是否真在跑 | 探针法实测 | WP_CRON 关闭且无系统 cron |
| 6 | 这时才轮到内容 | 对照已收录页找差距 | 重复、拼凑、无独立价值 |
顺序很重要。市面上多数教程让你直接从第 6 步开始改内容,而我们五台服务器上托管着 90 多个外贸站,今年经手的收录排查里,凶手几乎都藏在前 5 步。
新站的现实预期
别指望速效。权重接近零的站,每个动作的反馈周期都以周计——我们自己这个站从改 slug、建内链到看见收录翻倍,走了一个多月。另外,收录只是入场券:页面进了索引库不等于有排名,更不等于有询盘。我们有个客户站点击涨了 4.7 倍、询盘反而掉到原来的十二分之一,那是另一个话题,下篇细拆。
想知道自己站的收录卡在哪一档?可以找天问做一次免费的收录体检:拉一遍全站的状态分布,告诉你未收录页卡在哪一步、值不值得救。