做网站的人经常琢磨怎么让百度、Google多收页面,却容易忽略另一面:有些文件夹一旦被收录,轻则稀释权重,重则泄露信息。下面这些目录,通常都该挡在搜索引擎之外。
后台管理目录。像 /admin/、/manage/、/wp-admin/、/dede/、/system/ 这类路径,里面是登录页、操作面板、数据库工具。被收录后,别人搜“site:你的域名 inurl:admin”就能找到入口。即便有密码,也等于把门牌号挂到网上。更麻烦的是,有些老程序后台路径带参数,可能被爬虫触发异常。这个目录不该让搜索引擎进。
用户中心和隐私页面。/user/、/member/、/account/、/profile/ 下面往往有个人资料、订单、地址、手机号。搜索引擎一旦抓取,可能把用户信息快照留在搜索结果里。即使页面需要登录,爬虫也可能抓到登录提示或部分缓存。涉及隐私的目录,最好用登录墙加 noindex 双重处理。
购物车和结算流程。/cart/、/checkout/、/order/、/payment/ 这些页面动态参数多,内容重复,还涉及交易信息。让搜索引擎收录,既没有搜索流量价值,又可能因为参数组合产生大量重复页面。Google 官方也建议用 robots.txt 屏蔽购物车、结算页,减少抓取预算浪费。
API 和接口目录。/api/、/json/、/xmlrpc.php、/rest/ 这些地方返回的是数据,不是给人看的页面。被收录后,搜索结果里可能出现一堆 JSON 或报错信息。更严重的是,有些接口没有权限校验,爬虫一抓,等于帮你做了一次安全扫描。接口目录应该用 robots.txt 禁止抓取,同时做好鉴权。

程序文件和配置文件。/includes/、/config/、/inc/、/library/、/vendor/ 这些目录存放 PHP、JS、配置文件。正常情况不该被直接访问,更不该被收录。如果服务器配置不当,搜索引擎可能抓到数据库账号、密钥路径。别指望 robots.txt 能保密,它只是告诉爬虫别来,不阻止人来。正确做法是服务器层面拒绝访问,再加 noindex。
备份、日志和临时目录。/backup/、/bak/、/logs/、/tmp/、/cache/、/temp/ 这些文件夹经常被遗忘。有人把网站备份压缩包放在根目录,文件名还叫 www.zip、database.sql。搜索引擎虽然不主动解压,但一旦收录链接,等于公开下载地址。日志文件可能包含 IP、路径、错误信息。这些目录必须禁止访问,而不是只写 robots.txt。
测试和旧版目录。/test/、/demo/、/dev/、/staging/、/beta/、/old/、/new/ 这些环境往往权限弱、内容旧、和正式站重复。被收录后,可能和主站竞争排名,造成重复内容。上线后应该删除或加密码,至少用 noindex 挡住。
站内搜索结果页。/search/、/query/、/find/ 这类页面会生成大量参数组合。Google 和百度都不喜欢收录站内搜索结果,因为内容重复、质量低,还容易产生无限抓取。用 robots.txt 屏蔽 /search/ 是常见做法。
打印页和会话文件。/print/、/pdf/、/session/、/sess_ 这些页面通常是同一内容的另一种版本,收录后重复内容增多。会话文件更危险,可能包含用户状态。应该禁止抓取。
还有上传目录里的临时文件、缩略图、编辑器缓存,比如 /uploads/temp/、/wp-content/cache/。这些不是给用户看的,收录了也没用。
怎么操作?在 robots.txt 里写 Disallow: /admin/、Disallow: /cart/ 等。但记住,robots.txt 是建议,不是强制。真正不想被收录的页面,可以用 meta name="robots" content="noindex",或者 HTTP 头 X-Robots-Tag: noindex。注意,如果 robots.txt 已经禁止抓取,搜索引擎看不到页面上的 noindex。所以敏感页面最好用密码保护或服务器权限控制,而不是只靠 robots.txt。
最后,定期用 site: 命令查一下有没有不该出现的目录被收录。发现后,先加 noindex 或删除,再用百度搜索资源平台、Google Search Console 的移除工具处理。网站文件夹管理,收录不是越多越好,该挡的挡干净,搜索引擎才能把精力放在真正有价值的页面上。