文档目录

4.1 知识采集

知识采集功能解决资料散落、格式多样、整理困难的问题,通过多格式统一导入、AI自动分类打标签和知识原子提取,将零散文件变成有索引的知识库。

  • 支持PDF/Word/PPT/图片/网页等多格式统一导入
  • 可批量导入数百份文档,提高整理效率
  • AI自动识别文档类型并打上分类标签
  • 提取关键知识点形成可独立检索的知识原子
  • 采集的知识为AI问答和内容生产提供素材

一句话定位:各种格式的资料统一收进来,AI 自动分类打标签。

知识采集是源泉的入口——再好的知识库,如果灌不进去,就是一座空仓库。

您现在的问题

场景一:资料散落十个地方。 产品手册在网盘、技术方案在企业微信、客户 FAQ 在客服主管的 Excel 里、行业报告在老板的邮箱里。要找一份资料,先要想它在哪儿。员工平均每天花 20 分钟"找东西",一年就是 80 个小时。

场景二:格式五花八门。 PDF、Word、PPT、图片、网页链接、聊天记录——每种格式打开方式不同,整理方式不同,入库更是无从下手。格式壁垒让 40% 的企业知识"锁"在打不开的文件里。

场景三:收了也不整理。 好不容易把资料集中到一个文件夹里,但没有分类、没有标签、没有关联——三个月后,又得重新找一遍。没有索引的知识库,和垃圾堆没有区别。

场景四:知识"只在人脑里"。 老师傅的经验、销冠的话术、客服的临场应变——这些最有价值的知识从来没有被记录过。人一走,知识归零。企业 70% 的隐性知识从未被文档化。

功能全景

知识采集解决"知识从哪来、怎么进来、进来后怎么整理"三个问题:

资料来源(本地文件/网页/聊天记录/手动录入)
        ↓
统一采集入口(拖拽上传/批量导入/URL抓取/API对接)
        ↓
AI 自动处理:格式识别 → 文本提取 → 分类打标签 → 知识点原子化
        ↓
入库 → 4.2 文档管理(审核归档)→ 4.4 智能检索(可搜索)
  • 多格式统一收。 PDF / Word / PPT / 图片(OCR)/ 网页 / 纯文本——拖进来就完成采集,系统自动识别格式并提取文本内容。
  • 批量导入。 几百份文档一次性灌入,不用一份一份手动操作。
  • AI 自动分类。 入库时 AI 自动识别文档类型(产品说明/操作手册/合同/FAQ/行业报告),打上分类标签——省掉人工分拣的繁琐。
  • 知识原子提取。 AI 从长文档中提取关键知识点(如"适用于350℃工况""质保期两年"),变成可独立检索的知识碎片。

操作指南

  1. 进入源泉 → 知识采集 → 点击"上传"或直接将文件拖入采集区;
  2. 批量导入 → 选择文件夹或 ZIP 包,一次性导入(支持断点续传);
  3. 网页采集 → 粘贴 URL,系统自动抓取网页正文并存入知识库;
  4. 查看AI分类结果 → 导入完成后,系统展示自动分类和标签建议,您确认或调整;
  5. 提交入库 → 确认后文档进入 4.2 文档管理的收件箱,等待审核归档。

关键配置项:

  • 支持格式:默认全开(PDF/Word/PPT/图片/网页/文本)
  • OCR 开关:图片类文件是否启用文字识别
  • 自动分类置信度阈值:低于阈值的需人工确认分类
  • 去重策略:按文件名/内容哈希去重,避免重复入库

最佳实践

  1. 先"大扫荡",再"细水长流"。 上线第一周把公司现有资料一次性灌入(哪怕粗糙),之后每周增量补充 5~10 份新资料。
  2. 指定"知识管理员"。 不需要全职,但需要有一个人每周花 30 分钟检查 AI 分类是否准确、是否有遗漏资料。
  3. 优先采集"客户会问的"。 产品参数、报价规则、售后政策、常见故障——这些是客户和销售最高频需要的,先灌这些。
  4. 别追求完美再入库。 一份 80 分的资料入库了,比一份 100 分的资料永远躺在邮箱里强一万倍。

常见误区

误区一:只收不用。 采了一堆文档进来,但从不用智能检索和 AI 问答去消费它们——知识的价值在于被使用,不在于被存储。

误区二:什么垃圾都往里塞。 过期的、错误的、重复的资料混入知识库,会污染 AI 问答的质量——宁可少收,不要收错。 配合 4.2 文档管理的审核环节把关。

误区三:忽略了"人脑里的知识"。 只采集现有文档,不把老师傅的经验、销冠的话术录下来——最有价值的知识往往不在文件里,在人脑里。 用"手动录入"或"语音转文字"把隐性知识显性化。

与其他能力的配合

  • 采集的知识经 4.2 文档管理 整理归档,流入 4.3 FAQ 库4.4 智能检索
  • 4.5 AI 问答 的所有答案,原料都来自知识采集——源头越丰富,回答越准确;
  • 基因(第五章)生产内容时,也从这里取素材——所以 AI 写的文章有真实细节;
  • 灯塔(第七章)的竞品报告也可存入知识库,成为历史对标参考。

关键指标

指标健康值说明
知识库文档总量持续增长每月至少净增10份有效文档
AI分类准确率≥90%低于85%需调整分类模型或增加人工审核
知识覆盖率核心业务100%客户高频问题对应的知识必须已入库
重复率<5%过高说明去重策略需优化

常见问题

知识采集如何实现自动分类?

文件入库时,AI 会自动识别文档类型,例如 产品说明、操作手册、合同、FAQ、行业报告 等,并打上对应的分类标签。这一过程完全自动化,省去了人工分拣的繁琐工作,让资料入库即完成初步整理。

知识采集支持哪些文件格式?

知识采集支持多种常见文件格式,包括 PDF、Word、PPT、图片、网页、文本 等。您只需将文件拖入系统,AI 会自动识别格式并提取文本内容。同时支持 批量导入,可一次性处理几百份文档,无需手动逐一操作。

什么是“知识原子提取”?有什么作用?

“知识原子提取”是指 AI 从长文档中自动提取关键知识点,例如“适用于350℃工况”、“质保期两年”等具体信息,将这些知识点转变为 可独立检索的知识碎片。这样,用户无需翻阅整篇文档,就能直接搜索到最精确的信息,大幅提升知识查找效率。

知识采集与其他模块(如智能问答、文档管理)如何配合?

知识采集是整个知识库的 入口。采集后的知识会经过 4.2 文档管理 整理归档,并流入 4.3 FAQ 库4.4 智能检索;同时,4.5 AI 问答 的所有答案原料都来自知识采集,基因(内容生成)模块在创作时也从中取素材。因此,源头越丰富,整个系统的回答越准确、内容越真实。