过去一年,我们为零售、制造、法律等多个行业交付了企业级 AI 知识库。一个反复被验证的事实是:技术不是知识库项目的瓶颈,治理和运营才是。这篇文章把我们踩过的坑和解法整理出来。
为什么大多数知识库项目会失败
我们见过太多这样的场景:企业花几十万买了"智能知识库",上线三个月后问它任何问题,答案要么过时、要么答非所问,最后无人问津。原因几乎都出在四个环节:文档没人维护、切分策略粗暴、上线前没有评测标准、上线后没有运营机制。
第一步:先治理,再上 AI
- 责任到人:每一类文档指定唯一 Owner,过期内容有明确的下架机制;
- 版本管理:制度类文档必须有版本号和生效日期,否则 AI 会把作废条款当现行制度回答;
- 入口统一:宁可先收窄范围(只接制度 + 产品手册),也不要一上来就全公司文档大杂烩。
第二步:切分与索引策略决定上限
我们采用两级语义切分:先按文档结构解析出段落,保留标题层级(heading_path),再在段内按语义块切分(256 tokens、32 重叠)。这让每一条知识都带着"我在哪个章节"的上下文,回答时可以精确引用到"《报销制度》第一章第 3 节"。
第三步:上线前先建评测集
让业务方收集 50~100 个真实问题作为评测集,标注标准答案和来源文档。每次调整切分参数、更换模型、修改提示词,都跑一遍评测集。没有这个基线,"感觉变好了"和"真的变好了"之间隔着无数次的返工。
第四步:知识库是产品,不是项目
上线只是开始。我们给每个知识库都配了三件运营工具:未命中问题自动沉淀清单(每周认领补充)、问答日志驱动的坏例回流、以及面向业务方的效果看板。知识库的准确率不是验收那天最高的,而是运营得最好的那天最高的。