语义搜索总找不到正确结果:查询理解、召回融合与排序优化
从用户意图到结果排序拆解语义搜索系统,解决近义表达、冷门实体和结果相关性不稳定。
先定义“正确结果”
搜索质量不能只靠主观感受。不同查询可能是寻找具体页面、解决问题、比较产品或探索主题。应标注意图、实体、时间和范围约束,并为典型查询建立相关性等级。点击率会受位置和标题吸引力影响,不能直接等同于相关性,需结合停留、改写、退出和人工标注。
查询理解减少歧义
系统可进行拼写纠正、同义词扩展、实体识别和意图分类,但扩展必须受领域词典约束。错误改写会让精确查询偏离目标,因此保留原查询召回通道,并为型号、版本、错误码等强实体提高权重。长问题可抽取核心主题与过滤条件,不要删除否定词和时间限制。
多路召回覆盖不同信息
关键词检索擅长精确匹配,向量检索擅长语义相似,热门与新鲜度通道补充业务信号。各通道先独立召回,再通过归一化或秩融合合并。向量库应记录模型版本,升级嵌入模型时避免新旧向量混用。没有结果时应返回可解释的放宽建议,而不是展示完全无关内容。
排序模型关注真实满足度
重排序特征可包括文本相关性、实体匹配、内容质量、时效与权限。训练样本要纠正位置偏差和曝光偏差,防止模型只学会复制旧排序。对头部查询做精细优化,对长尾查询依靠稳健的语义表示和规则兜底。
持续评测与诊断
离线使用 NDCG、召回率和零结果率,线上通过小流量实验观察成功点击、查询改写和任务完成。按查询类型拆分指标,整体提升可能掩盖关键群体退化。搜索优化的关键是建立“查询—候选—排序—反馈”的可追踪链路。
文章回复
0 条公开回复