文档目录

4.4 智能检索

智能检索是基于向量语义搜索的企业知识库检索能力,支持跨格式搜索、结果溯源和相关性排序,解决“搜不到、搜不准”的问题。

  • 基于1024维pgvector语义搜索,搜意思不搜字面
  • PDF、Word、PPT、图片等跨格式统一索引
  • 搜索结果带来源文档、段落及相关知识库溯源
  • 按语义相关度排序,最相关结果排最前
  • 与文档管理、AI问答、内容生成深度配合

一句话定位:语义级搜索,"搜意思"而不是"搜字面",跨文档、跨格式一次找全。

智能检索不是 Ctrl+F——您搜"耐高温方案",它能找到写着"适用于350℃工况"的那份文档。

您现在的问题

场景一:明明有,就是搜不到。 公司网盘里明明存过一份类似的方案,但文件名记不清了、关键词想不起来、文件夹翻了三遍——最后只能重新做一份。员工每周平均浪费 3.5 小时在"找文件"上,其中 60% 的文件其实就在系统里。

场景二:搜出来的太多,有用的太少。 搜"合同模板"出来 200 个结果,从三年前的草稿到最新的定稿混在一起,您得一个个打开确认——比不搜还累。传统关键词搜索的"有效结果率"通常不到 15%。

场景三:跨格式搜不了。 PDF 里的内容搜不到、图片里的文字搜不到、聊天记录里的附件搜不到——信息被格式"锁住"了。企业 40% 的知识锁在"搜不到"的格式里。

场景四:搜到了不知道能不能信。 找到一份文档,但不知道是不是最新版本、是不是已经被废止、是不是适用于当前场景——没有溯源和状态标注的搜索结果,用了反而更危险。

功能全景

源泉的智能检索基于向量语义搜索(1024 维 pgvector),不是传统的关键词匹配:

用户输入(自然语言问题/关键词)
        ↓
语义向量化(Embedding)
        ↓
向量相似度匹配(跨格式、跨知识库)
        ↓
结果排序(相关度 + 时效性 + 权威性)
        ↓
展示:答案片段 + 来源文档 + 段落定位 + 文档状态
  • 搜意思,不搜字面。 您输入"哪些设备适合高温环境",系统能匹配到"适用于 350℃ 工况的 XX 型号"——语义相近就能找到,不需要精确关键词。
  • 跨格式一次搜全。 PDF / Word / PPT / 图片(OCR)/ 网页 / FAQ——所有格式统一索引,一次搜索覆盖全部。
  • 结果有溯源。 每条搜索结果标注来源文档、所在段落、相关知识库——您知道答案从哪来,可以追溯验证。
  • 相关性排序。 搜索结果按语义相关度排序,最相关的排前面,不用翻页找。
  • 状态标注。 结果标注文档状态(有效/过期/草稿),过期文档自动降权或标红提醒。

操作指南

  1. 进入检索 → 源泉 → 智能检索(或全局搜索框),输入自然语言问题或关键词;
  2. 查看结果 → 结果列表展示:匹配片段(高亮)+ 来源文档名 + 相关度评分;
  3. 溯源验证 → 点击任一结果,跳转到原始文档的对应段落,查看完整上下文;
  4. 筛选缩小 → 按知识库、文档类型、时间范围、状态筛选;
  5. 引用 → 一键复制带出处的引用文本,用于方案/报告/回复客户。

关键配置项:

  • 检索范围:全部知识库/指定知识库(如只搜"产品库")
  • 结果数量:默认 Top 10,可调至 Top 50
  • 过期文档处理:降权显示/完全排除/标红提醒
  • 同义词扩展:是否自动扩展近义词(如"高温"→"耐热""350℃")

最佳实践

  1. 用"说人话"的方式搜。 不用想关键词——直接用自然语言描述您要找什么,如"客户问能不能分期付款,我们的政策是什么"。
  2. 善用"知识库筛选"。 找产品参数就限定"产品库",找合同模板就限定"法务库"——范围越小,结果越准。
  3. 搜不到时换个说法。 语义搜索虽然智能,但第一次没搜到可以换个表述再试——通常第二次就能找到。
  4. 把"搜不到"反馈给知识管理员。 如果您确定公司应该有这份资料但搜不到——说明知识采集有遗漏,反馈给管理员补充。

常见误区

误区一:还在用"精确关键词"思维。 语义搜索不需要您猜文档里用了什么词——用意思搜,不用字面搜。 "耐高温"和"适用于350℃工况"在语义搜索里是一回事。

误区二:搜到了直接用,不验证。 搜索结果可能来自过期文档或草稿——养成"看状态、点溯源、确认版本"的习惯,尤其是对外引用时。

与其他能力的配合

  • 检索的索引来自 4.2 文档管理 整理后的文档——垃圾数据不进索引,搜索结果干净;
  • 4.5 AI 问答 的底层检索引擎就是智能检索——AI 回答问题的第一步,是从知识库里"找到相关内容";
  • 基因生产文章时,通过智能检索从知识库中获取真实素材——写出来的内容有细节、有数据;
  • 灯塔做竞品分析时,也通过智能检索调取历史竞品报告做对比。

关键指标

指标健康值说明
检索响应时间<2秒超过3秒体验明显下降
首条结果相关率≥80%第一条结果就是用户想要的
零结果率<10%搜了但什么都没找到的比例
跨格式覆盖率100%所有已入库格式都应可被检索到

常见问题

智能检索与传统的关键词搜索(如 Ctrl+F)有什么本质区别?

智能检索基于 向量语义搜索(1024 维 pgvector),是“搜意思”而非“搜字面”。

  • 您输入“哪些设备适合高温环境”,系统能匹配到“适用于 350℃ 工况的 XX 型号”的文档——语义相近即可找到,无需精确关键词。
  • 传统 Ctrl+F 只能匹配字面字符,容易遗漏同义或近义表达。

智能检索让“找资料”从半小时变成三秒钟。

智能检索支持哪些文件格式?能跨格式搜索吗?

是的,智能检索支持 跨格式统一索引和搜索,覆盖以下格式:

  • 文档类:PDF、Word、PPT
  • 图片类:图片中的文字(OCR 识别后索引)
  • 网页类:网页内容
  • FAQ:知识库中的问答对
  • 其他:更多格式持续支持

所有格式的内容统一索引,一次搜索即可全部覆盖,无需分格式重复查找。

智能检索如何与文档管理、AI 问答等其他功能配合?

智能检索是源泉知识库的核心能力之一,与上下游功能紧密配合:

  • 与 4.2 文档管理配合:检索的索引来自文档管理整理后的文档——垃圾数据不进索引,搜索结果干净
  • 与 4.5 AI 问答配合:AI 问答的底层检索引擎就是智能检索——AI 回答问题的第一步,是从知识库里“找到相关内容”。
  • 与基因(内容生产)配合:基因在生成文章时,通过智能检索从知识库中获取真实素材——写出来的内容有细节、有数据。

三者形成“整理→检索→应用”的闭环。

智能检索能解决哪些常见的信息查找痛点?

智能检索主要解决三大痛点:

  1. 明明有,就是搜不到:文件记不清文件名或关键词,翻文件夹也找不到,最后只能重做。
  2. 搜出来的太多,有用的太少:搜索“合同模板”返回 200 个结果,新旧混杂,需要逐个打开确认。
  3. 跨格式搜不了:PDF、图片里的文字、聊天记录里的附件等内容被格式“锁住”,无法被传统搜索命中。

智能检索通过语义理解和统一索引,一次搜索覆盖全部格式,并按相关性排序,最相关的结果排在前面。

搜索结果如何确保准确性和可追溯性?

智能检索在结果呈现上提供双重保障:

  • 相关性排序:搜索结果按语义相关度排序,最相关的排在最前面,无需翻页筛选。
  • 结果溯源:每条搜索结果都会标注 来源文档、所在段落、相关知识库——您知道答案从哪来,可以追溯验证。

这意味着您不仅快速找到信息,还能确认信息的出处和可靠性。