先给结论:不要指望用一份 robots.txt 或一次跳转就交代清楚多域名的分工。可行做法是给每个域名写一句可验证的用途声明,再让抓取行为与这句声明一致——主站承担收录,辅助域名只承担跳转、资源分发或隔离测试,并且各自用不同的可抓取状态表达。前提变化在于:过去你可能只维护一个域名,现在业务拆分、区域化或历史遗留让多个域名同时在线,判断标准也随之改变。
两种条件对应两种选择。条件一:这些域名面向同一批用户、同一语言、同一业务,只是历史原因并存。此时应选定一个主域名承担收录,其余域名用 301 永久跳转到主域名的对应页面,并停止在站内、站点地图和外部链接中继续暴露旧域名。条件二:域名对应不同区域、不同品牌线或不同合规主体,用户和内容确实需要分开。此时不应合并,而应让每个域名有独立的用途说明、独立的站点地图和独立的内链结构,避免互相复制同一批页面。
区分依据不是域名数量,而是“同一页面是否服务同一批搜索需求”。如果两个域名的页面标题、正文主体和主要关键词几乎一致,却都希望被收录,冲突就已经存在。此时先做一次抽样对照:各取二十个代表性页面,比较标题、首屏正文和主要内链指向,若重复比例明显偏高,就属于条件一。
选定主域名后,实际动作分三步。第一步,对辅助域名上仍需保留的页面设置 301 到主域名最接近的对应页面,不要统一跳到首页,否则用户和抓取程序都拿不到对应关系。第二步,更新辅助域名的站点地图,只保留仍需被抓取的跳转入口,或直接移除并提交新的站点地图;站点地图是发现线索,不保证收录,所以不能把它当成收口手段。第三步,检查内链和外部合作链接,把指向辅助域名的链接逐步改为指向主域名。
一个假设例子:假设 a.example 是主站,b.example 是早期活动站,两者有约三百个高度相似的页面。若把 b.example 全站 robots.txt 设为禁止抓取,抓取程序可能不再访问,但已收录的结果未必随之消失,因为 robots.txt 限制的是抓取,不等于可靠的索引移除。更稳的顺序是先把 b.example 的页面 301 到 a.example 的对应页面,再观察抓取与收录状态的变化。若某些页面必须彻底退出结果,应使用页面级的移除手段,而不是只靠 robots.txt。
例外:如果辅助域名上存在用户仍需访问但不希望出现在结果中的内容,例如内部工具页或临时活动页,可以对该部分单独设置禁止抓取,同时保证主站对应内容可正常抓取。关键是分区处理,而不是整站一刀切。
当域名确实承担不同用途时,说明方式要落在抓取程序能读到的信号上,而不只是写在内部文档里。可执行的做法包括:
这里有一个容易误判的点:请求量或抓取量下降,不能单独证明你的用途声明被正确理解。它也可能来自站点地图未更新、内链减少、服务器响应变慢,或抓取程序自身的调度变化。要判断声明是否生效,应交叉看三件事:日志中抓取的是哪个域名和哪些路径、这些路径返回的状态码、以及结果中最终保留的是哪个域名的 URL。三者一致,才说明分工被正确表达。
验证动作按顺序做。先看辅助域名或非主域名的抓取日志,确认抓取程序访问的是跳转页还是内容页;再看这些访问返回的状态码,301 与 200 的含义完全不同;最后抽查结果中保留的 URL 属于哪个域名。若发现结果中仍以非预期域名为主,先检查该域名是否还有可抓取的内链和站点地图入口,而不是急于再加一层屏蔽。
调整条件也明确:当原本分开的区域域名开始服务同一批用户、内容趋同,就应回到条件一,收口到主域名;当主域名下新增了需要独立合规或独立品牌的业务,就应拆出独立域名并补齐用途声明。HTTPS 在这里不构成判断依据,它不保证安全无漏洞,也不保证排名,不能用来证明某个域名应当被保留。
把用途声明、跳转或规范设置、站点地图和日志验证连成一条链,多域名相似内容的抓取关系才有可复查的依据;缺少其中任何一环,分工都只是内部说法,而不是抓取程序能读懂的信号。