没有历史流量时,最该做的不是猜一个“好词”,而是把中文分词算法当成一台可检验的假设机器:先写下你预期搜索引擎会怎样切分、归并和匹配你的业务表述,再设计一个能在小样本上被证伪的观察。若你无法说出“出现什么结果就说明我错了”,那就还不是假设,只是愿望。
新业务通常没有搜索词报告、没有站内查询日志、没有历史排名。此时团队容易分成两派。一派认为,只要把业务描述拆成更多短词,就能覆盖更多查询;另一派认为,短词竞争激烈且意图模糊,应该坚持完整业务短语。两派都能举出看似合理的理由,但都缺少可区分对错的证据。
这里的核心变量不是“词多还是词少”,而是分词边界是否与目标用户的表达习惯一致。中文没有天然空格,搜索引擎需要先做切分,再判断哪些切分单元组合起来更接近一个完整意图。新业务没有历史流量,恰恰意味着你不能用“过去哪些词带来了访问”来反推,只能主动构造可验证的切分假设。
解释一:覆盖优先。它假设用户会用各种短词组合来找你,因此页面应尽量包含多个可独立成立的切分单元,让不同查询都有机会匹配到页面。代价是容易把页面写成词表,切分单元之间缺少语义约束,搜索引擎和用户都难以判断页面到底解决什么问题。
解释二:意图优先。它假设用户会用一个相对完整的业务短语表达需求,页面应围绕一个主切分单元展开,其他切分单元只作为限定条件。代价是如果主短语本身不是用户常用表达,页面可能长期没有匹配机会,而你又没有历史流量来提前发现这一点。
两种解释都成立,但成立条件不同。覆盖优先更适合业务概念尚未稳定、用户可能用多种说法描述同一需求的阶段;意图优先更适合业务概念已经明确、用户表达相对收敛的阶段。新业务往往处在两者之间,所以不能二选一,而要先构造一个能区分它们的假设。
要区分上述两种解释,不能只看页面有没有被访问。流量为零可能有多种合理解释:页面尚未被抓取、已抓取但未索引、已索引但排名靠后、排名尚可但标题摘要不吸引点击。把其中任何一种直接归因于分词策略,都是把相关当因果。
更可操作的证据是切分边界错误。你可以做一次小样本检查:把目标用户可能使用的表达列出来,逐条写下你预期的切分结果,再与搜索引擎实际返回的标题、摘要或相关结果做对照。这里不需要工具,只需要人工判断。若你预期的切分单元频繁被合并成另一个含义,说明意图优先的假设需要修正;若你的主短语频繁被拆散且拆散后仍能匹配到无关结果,说明覆盖优先的假设需要收紧。
假设你经营一项“旧房局部翻新”业务,没有历史流量。你可以先写下假设:用户会输入“旧房翻新”“局部翻新”“旧房局部改造”等表达,搜索引擎可能把“旧房”和“翻新”切分为两个单元,也可能把“局部翻新”视为一个整体。然后你构造一个最小验证页,标题只围绕一个主切分单元,正文用自然句子覆盖其余表达。观察下一步该做什么,取决于你看到的是边界错误还是索引状态问题:若页面未被索引,先处理可抓取与内容质量;若已索引但摘要显示切分明显偏离,才调整分词假设。
具体动作可以这样安排。第一步,写下一条假设句,格式是“如果搜索引擎把 A 切分为 B 和 C,那么当用户搜索 D 时,页面应出现在与 D 相关的结果中”。第二步,为这条假设写一个证伪条件,例如“若连续多次观察中,页面摘要把 B 和 C 合并成了与业务无关的 E,则假设不成立”。第三步,只做一个页面或一个内容块,不要同时铺开多个结构。第四步,记录你实际看到的是抓取、索引还是排名环节的问题,再决定下一步是改内容、改结构还是改外链策略。
这个动作的结果会直接影响下一步。如果证伪条件被触发,说明你的切分预期与搜索引擎理解不一致,应优先调整主切分单元和上下文,而不是增加更多短词。如果证伪条件未被触发但页面仍无访问,说明问题可能不在分词,而在索引或竞争层面,继续围绕分词做文章收益有限。
当你的业务表达本身已经是一个稳定、单一且用户常用的短语时,分词假设的边际价值会下降。此时更值得投入的是页面是否清晰回答了该短语背后的需求,以及页面是否容易被抓取和索引。反过来,当业务概念新、用户说法分散、你又没有任何查询数据时,分词假设就是少数能在早期被验证的抓手之一。
需要提醒的是,请求量、抓取量或某项统计归零,不能单独证明你的分词处理正确。它们可能只是索引延迟、页面质量不足或竞争过强的表现。把分词假设放进抓取、索引、排名三个不同环节里分别观察,才能避免用一个环节的现象去解释另一个环节的问题。
对没有历史流量的新业务来说,最稳妥的起点不是找到“正确”的分词,而是建立一个能被证伪、能指导下一步动作的假设。只要你能说清什么结果会让你改变做法,中文分词算法就不再是黑箱,而是一组可以逐步排除的选项。