企业 AI 知识库搭建教程:先治理资料,再接入问答
从资料盘点、权限、版本、切分、引用到人工升级,搭建能回答“依据在哪里”的企业 AI 知识库。
最常见的误区:以为上传文件就等于知识库
如果同一制度有三个版本、扫描件无法读取、权限混乱、文档没有责任人,AI 只会更快地暴露这些问题。企业知识库的核心不是聊天界面,而是资料能否被信任、被定位、被更新和按权限访问。
第一步:从一个高频问题域开始
不要第一天就导入全公司的文件。选择边界清楚、问题高频、风险可控的领域,例如产品使用说明、内部 IT 流程或标准售后问答。列出真实用户最近问过的 50—100 个问题,作为后续验收集。
第二步:建立资料清单
每份资料至少记录:标题、负责人、适用部门、生效日期、版本、保密级别、原始地址和下次复查时间。删除重复文件,标记已经废止的版本。找不到责任人的文档,不应自动成为权威答案。
第三步:先设计权限,再设计问答
用户只能检索本来就有权访问的内容。权限应在检索层生效,不能等模型生成答案后再遮盖。测试普通员工、主管、外部合作方和管理员账号,确认搜索结果、引用和日志都不越权。
特别注意文档中的隐藏信息、附件、历史版本和共享链接。前台不显示,不代表检索系统读不到。
第四步:处理文档结构
按标题、章节和语义切分,不要机械地每固定字符切一刀。保留文档标题、章节路径、版本和日期等元数据,让系统能回答“这段话来自哪份文件的哪一节”。表格、扫描 PDF 和图片需要单独检查解析效果。
内容块太小会失去上下文,太大会降低检索精度。用真实问题反复测试,而不是只看向量数量或导入成功提示。
第五步:回答必须带引用和边界
要求每个重要答案显示来源标题、章节和可点击地址。材料没有答案时明确回复“当前知识库未找到”,并提供人工升级入口。不要让模型用常识补齐公司政策、价格、合同或安全流程。
可以把回答分成三层:直接答案、依据来源、仍需确认。这样用户知道哪部分可执行,哪部分需要负责人判断。
第六步:建立评测集
评测不只看文字像不像。至少记录:是否找到正确文档、引用是否支持答案、是否混用旧版本、权限是否正确、拒答是否合理、人工是否能快速接管。
测试集应包含正常问题、同义问法、错别字、跨文档问题、无答案问题、过期问题和越权请求。每次调整切分、模型或提示词后重复运行。
第七步:设计维护责任
文档更新后谁重新同步?旧版本何时失效?低质量回答由谁处理?用户如何反馈?如果这些问题没有负责人,知识库上线后会快速变旧。
建议按风险设置复查周期:价格、政策、安全和产品版本更频繁;稳定的背景资料可以更长。变更记录要能追踪何时、由谁、为什么更新。
常见失败
- 导入数量很多,但没有真实问题集;
- 引用只指向文件首页,无法定位证据;
- 把旧制度与新制度一起检索;
- 权限只在界面控制,检索层仍能读到;
- 无答案时生成听起来合理的回复;
- 没有反馈、人工升级和内容责任人。
一个可执行的最小版本
先选 30—50 份可信资料、100 个真实问题和一组明确用户权限。做到引用可定位、无答案会拒绝、越权问题拿不到内容,再扩大范围。可靠的小知识库,比覆盖全公司却不能解释依据的聊天机器人更有价值。