网站上线两个多月,首页迟迟没有被搜索引擎收录,每天查看抓取日志都是一片空白,站长群里问了一圈,有人劝你放弃,有人说你网站被惩罚了,你甚至开始怀疑自己是不是真的选错了路。但先别急着下结论,两个多月不收录首页,网站大概率没有废,只是你还没找到真正的病根。
搜索引擎的爬虫不是永动机,它每天有固定的抓取配额,你的网站被访问得少,收录自然就慢。但要分清慢和完全不动的区别。正常的新站,哪怕权重再低,搜索引擎在几周内至少会来抓一次首页,试图建立索引。如果两个月连一次像样的抓取都没有,问题往往出在技术层面,而不是内容或权重层面。
最常见的拦路虎是robots.txt文件。很多建站工具或模板默认自带一个禁止所有爬虫的规则,站长自己并不知道。比如你用的是某个开源程序,安装时套用了官方的示例robots文件,里面写着Disallow: /,爬虫来了看到这个指令,掉头就走,收录当然为零。检查方法很简单,直接在浏览器访问你的域名加上robots.txt,看看里面是不是限制了百度和谷歌的抓取。
服务器响应问题同样容易忽略。如果你的网站在国内访问时快如闪电,但搜索引擎的抓取服务器大多在境外,海外访问你的主机可能超时或直接拒绝连接。有些服务器厂商默认屏蔽了海外IP段,或者开启了防火墙拦截,爬虫连不上服务器,自然也就谈不上收录。你可以在本地使用在线工具测试一下海外节点的连通性,如果超时,就要联系主机商开放端口。
还有一层隐蔽原因是DNS解析的稳定性。如果你在网站上线初期频繁更换过域名解析,或者用了某些免费DNS服务商,解析记录在全球同步需要时间,爬虫在不同地区反复查询不到正确的IP地址,就会放弃抓取。尤其是一些小众的DNS服务商,在搜索引擎的缓存里还留着旧的解析记录,导致爬虫一直访问一个不存在的地址。

另外要看看网站本身是不是用了过重的JavaScript渲染。搜索引擎的爬虫虽然能执行部分脚本,但效率远低于浏览器。如果你的首页从空白到出现内容要加载几十个JS文件,或者页面内容完全靠异步请求填充,爬虫抓到的可能只是一堆空壳标签。你可以在浏览器里禁用JavaScript后访问自己的首页,如果什么内容都看不到,那搜索引擎收录也是同样的结果。
内容质量问题也会影响收录,但通常表现为收了又删,或者只收录内页而不收录首页。如果你的首页充斥着从别处采集的大段文字,或者完全是由图片和动画组成,没有一段可供索引的正文,那搜索引擎无法判断页面的主题,自然不愿意给它索引位置。首页需要有一段清晰、原创、描述网站核心业务的文字,哪怕只有三五百字,也要让爬虫看得懂你是什么网站。
还有一个容易被忽视的因素是域名历史。如果你买的这个域名以前被人用过,干过灰产或者被搜索引擎处罚过,那么新网站在这个域名上要花更多时间重新获取信任。你可以查一查域名的历史记录,看看是否被 Wayback Machine 或者一些域名工具收录过旧页面,如果有,且内容性质不佳,那需要先在百度搜索资源平台申诉,或者走正常的验证流程来重新建立信任。
即使以上问题都不存在,也要考虑一下外部链接的引导作用。搜索引擎发现新站的一个重要途径是顺着已有链接爬过来。如果你的网站没有任何外部入口,只有你自己在搜索引擎提交过URL,那爬虫可能一直都不知道你的存在。试着在其他被正常收录的平台上发一些带链接的软文,或者去相关目录站提交,给爬虫搭一座桥。
两个多月并不算特别漫长的周期。有些网站因为服务器所在地偏远、内容持续低质、外链为零,拖到半年才收录的情况也存在。但两个多月确实是值得警惕的节点,你可以登录百度搜索资源平台,手动提交首页的URL,并制作一份sitemap放进根目录。如果提交后过了一周依然毫无动静,那基本可以确定是技术层面的拦截,而不是单纯的权重等待。
暂停抱怨,立刻去排查上述几项。先看robots,再测海外连通性,然后检查域名解析历史,最后审视首页源码是否对爬虫友好。大多数情况下,所谓“费了”的网站,只是被一个错误的开关卡住了喉咙。修好那处故障,收录可能就在下一个抓取周期内降临。