AHAX 公开知识库阶段 · 文章
03 企业知识库与 RAG 治理
从知识源、权限、检索、引用、评估到删除,把企业知识库建设成可管理、可验证、可退出的长期能力。
很多企业第一次做 AI 知识库,会把任务理解成“把文件上传给模型”。真正上线后,麻烦才出现:同一制度有多个版本,员工能搜到无权查看的合同,旧报价仍被引用,来源删除后索引和缓存没有同步失效。
RAG(检索增强生成)解决的是“回答前先找资料”,不是自动解决知识治理。它不会天然判断文件有效性、继承企业权限,也不会因为带引用就保证答案正确。
中国法律边界:知识源、索引、日志和输出涉及个人信息或重要数据时,应按实际处理活动识别责任。法律要求不能被一个“AI 知识库”产品名替代。国际自愿框架:NIST、OWASP 和 ISO 可帮助企业建立风险、评估与持续改进方法,但不是中国法定义务,也不替企业给出统一合格线。供应商能力:产品文档只能证明某项机制存在,例如混合检索、重排或文件对象删除;不能证明它在你的数据上更准确,也不能外推所有副本都已删除。AHAX 建议:先建知识源登记册和小型评估集,再选检索与模型;先验证权限、冲突和删除,再扩大使用范围。
管理者先看结论
Section titled “管理者先看结论”管理者先看结论:企业 RAG 的主要工作不是“喂数据”,而是给知识建立所有者、有效期、权限、冲突规则、评估方法和退出机制。
如果只记住六件事,记住下面六件:
- 每一条可被检索的知识,都要有来源、所有者、适用对象、版本、复核日和删除方式。
- 权限尽量在检索前过滤,而不是先把无权内容取回,再指望模型不要说。
- 关键词、向量、混合检索和重排都只是候选方案,必须用企业自己的真实问题比较。
- 引用要能定位到原文段落、版本和日期;有引用不等于结论正确。
- 评估不能只看一个“准确率”,至少要分别看检索、引用支持、答案、拒答、权限和新鲜度。
- 删除必须贯穿原文、索引、向量存储、缓存、日志和备份策略;某个供应商支持删除文件对象,不等于所有副本已同步清除。
管理者应先追问的责任问题
Section titled “管理者应先追问的责任问题”| 决策问题 | 最低可接受答案 | 不能接受的回答 |
|---|---|---|
| 哪些资料可以进入知识库 | 有来源清单、所有者和批准记录 | “共享盘里的都导进去” |
| 哪份资料当前有效 | 有版本、生效日、失效日和优先级 | “模型会自己判断” |
| 谁能检索哪些内容 | 身份、角色、部门和对象权限可验证 | “登录后都能问” |
| 回答错了由谁处理 | 知识所有者与系统负责人分别负责 | “让用户自己核对” |
| 如何证明回答可靠 | 有固定评估集、回归结果和失败记录 | “演示时基本都答对了” |
| 删除如何闭环 | 有删除请求、处理范围、复核证据 | “后台点了删除” |
AHAX 判断:第一阶段先选边界清楚、资料有 owner、错误可人工兜底的领域。把一条知识从登记、检索、引用、更新到删除完整跑通,比一次导入大量文件更有价值。
适用与不适用
Section titled “适用与不适用”RAG 适合“答案主要存在于可管理资料中,而且资料会更新”的问题;不适合把缺失的业务规则、未经确认的经验和高风险判断交给模型补全。
| 场景 | 适用性 | 原因 | 上线边界 |
|---|---|---|---|
| 产品手册与售后指引 | 较适合 | 来源明确、版本可管理、可引用原文 | 过期型号和例外政策要单独处理 |
| 内部制度与流程问答 | 有条件适合 | 能减少查找成本 | 必须按部门、岗位和地区做权限与版本控制 |
| 合同条款查找 | 有条件适合 | 可辅助定位条款 | 不替代法务判断,不把相似条款当最终意见 |
| 销售话术与报价知识 | 有条件适合 | 可提供受控素材 | 价格、承诺和有效期必须回到权威系统 |
| 客户个人资料汇总 | 高风险 | 涉及个人信息、权限与用途限制 | 先确认处理依据、最小必要和权利响应链 |
| 医疗、法律、财务结论 | 不宜直接自动决策 | 错误后果高、情境依赖强 | 只做检索辅助,并设置专业人员复核 |
| 企业没有成文规则 | 不适合直接上 RAG | 模型检索不到不存在的知识 | 先完成规则确认和文档化 |
| 多版本长期冲突 | 不适合直接自动回答 | 模型可能选择表面更像答案的内容 | 先建立冲突与优先级规则 |
RAG、搜索与微调不是一回事
Section titled “RAG、搜索与微调不是一回事”企业搜索主要返回文档或片段,适合让人自己阅读和判断。RAG先检索,再让生成模型基于检索上下文组织答案,适合需要自然语言解释和跨段整理的场景。微调主要改变模型的行为模式、表达方式或特定任务表现,不是持续更新事实知识的默认手段。
AHAX 判断:如果企业只需要“快速找到原文”,先把搜索做好;如果需要“基于多份有效资料生成有出处的回答”,再加 RAG;如果需要稳定格式、分类方式或特定任务行为,再评估微调。不要用微调替代频繁变化的制度、价格和产品参数,也不要把 RAG 当成改变模型行为的唯一工具。
检索方案怎么选
Section titled “检索方案怎么选”| 方案 | 更擅长什么 | 主要局限 | 适合的验证样本 |
|---|---|---|---|
| 关键词检索 | 专有名词、编号、产品型号、精确短语 | 同义表达和自然语言改写可能漏召回 | 合同号、料号、制度名、错误码 |
| 向量检索 | 语义相近、口语问法、同义改写 | 可能召回“意思像但业务上不对”的片段 | 用户口语、问题改写、跨表述查询 |
| 混合检索 | 同时利用精确词与语义相似 | 参数、成本和调试复杂度增加 | 专有名词与自然语言混合问题 |
| 重排 | 对候选结果再次排序 | 增加调用与延迟,效果依赖实际数据 | 多个相似制度、相近产品和冲突版本 |
Microsoft 对 Azure AI Search 的说明显示,其混合检索会并行运行全文与向量查询,再用 RRF 合并结果;语义重排还能对候选结果进一步排序。这只能证明特定产品提供这些机制,不能证明混合检索或重排必然优于其他方案。企业仍要用自己的评估集做比较。
RAG 与微调对比
Section titled “RAG 与微调对比”| 维度 | RAG | 微调 | AHAX 建议 |
|---|---|---|---|
| 知识更新 | 更新来源和索引后可反映新资料 | 通常需要重新准备数据和训练 | 高频变化事实优先 RAG |
| 来源引用 | 可以保留检索片段与来源 | 不天然提供事实出处 | 需要审计时优先可引用链路 |
| 行为与格式 | 可用提示词和工作流约束 | 可强化稳定行为与特定任务模式 | 先用可配置方式验证,再判断是否微调 |
| 权限控制 | 可在检索环节按 ACL 过滤 | 权限不应依赖模型参数记忆 | 敏感知识必须走检索前授权 |
| 删除与更正 | 要同步处理原文、索引和缓存 | 已训练影响的移除更复杂 | 有强删除要求时谨慎选择训练用途 |
| 提示注入 | 仍可能受恶意文档和外部内容影响 | 同样不能完全消除 | 两者都要做威胁建模与隔离 |
为什么不能只看“准确率”
Section titled “为什么不能只看“准确率””一个答案失败,可能是资料未找到、排序靠后、引用不支持、改写错误、该拒答时强答或发生越权。把它们压成一个准确率,团队就不知道该改哪一层。
| 指标层 | 要回答的问题 | 证据形式 | 不应混淆为 |
|---|---|---|---|
| 检索命中 | 有效来源是否进入候选结果 | case_id、候选文档、排序与分数 | 最终答案正确 |
| 引用支持 | 引用段落是否真正支持关键结论 | 结论—证据对应表 | 只要附链接就通过 |
| 答案正确 | 关键事实、条件和例外是否准确 | 知识 owner 复核记录 | 文风流畅 |
| 拒答 | 无来源、冲突或越权时是否停止 | 拒答样本与路由记录 | “什么都能回答” |
| 权限 | 是否只检索到授权范围 | 角色用例与访问日志 | 页面按钮被隐藏 |
| 新鲜度 | 是否使用当前有效版本 | 版本号、生效日、索引时间 | 文件最近上传 |
企业知识库实施可以拆成五条连续链:知识源治理、内容处理、授权检索、回答与引用、评估与运营。任一条断开,RAG 都可能只剩一个好看的演示。
第一步:建立知识源登记册
Section titled “第一步:建立知识源登记册”先盘点来源,不先买向量库。每个来源至少记录以下字段:
| 字段 | 要解决的问题 | 示例写法 |
|---|---|---|
| source_id | 如何唯一追踪来源 | KB-HR-001 |
| 标题与来源位置 | 原文在哪里 | 员工手册 / 受控文档库 |
| 知识所有者 | 谁对内容正确负责 | 人力资源负责人 |
| 技术维护人 | 谁负责接入、索引和删除 | 系统管理员 |
| 适用对象 | 哪些人可使用 | 中国区正式员工 |
| 权限标签 | 检索前如何过滤 | department=HR;level=internal |
| 版本与生效日 | 哪份当前有效 | v3.2;2026-06-01 |
| 复核日与状态 | 何时重审、是否可用 | 2026-09-01;有效 |
| 删除方式 | 从哪些系统移除 | 原文、索引、缓存分别处理 |
AHAX 示例:第一轮可选 30—100 个真实问题建立评估集。这只是小范围启动示意,不是行业标准。问题应来自真实咨询、工单、搜索词和员工访谈,并覆盖正常问题、专有名词、无答案、冲突版本、越权请求和已删除资料。
第二步:清洗、去重、切分和元数据
Section titled “第二步:清洗、去重、切分和元数据”去重:先识别完全重复、轻微改名、附件重复和历史版本。不要让同一内容以多个标题竞争排序。正文提取:保留标题层级、表格含义、页码或段落定位。扫描件要记录 OCR 状态,不把识别结果当原文无误。切分:按语义和业务结构切,不盲目采用固定字符数。制度条款、操作步骤和表格可能需要不同策略。元数据:至少附带 source_id、owner、版本、生效日、权限、业务域、语言和有效状态。冲突标记:当同一主题存在例外、地区差异或未决冲突时,显式记录,不让模型自行选一个“看起来合理”的版本。
切分没有通用最佳尺寸。块太大可能带入无关内容,太小可能丢失条件和例外。应按真实问题能否检索到完整证据验收。
第三步:权限必须进入检索链
Section titled “第三步:权限必须进入检索链”理想顺序是:验证用户身份 → 解析角色与属性 → 在检索查询中附加 ACL 过滤 → 只对授权候选做排序和生成 → 记录访问证据。
只在生成后遮挡内容风险很高,因为无权片段已经进入模型上下文,可能通过摘要、比较、引用或工具调用泄露。ACL 测试至少覆盖:不同部门、岗位变更、临时授权、共享链接、离职账号、管理员代查和多租户隔离。
AHAX 判断:上传权限、文档库权限和 RAG 检索权限不是同一个概念。接入前要明确权限如何映射、何时同步、失败时默认允许还是默认拒绝。对敏感内容,映射失败应默认拒绝。
第四步:回答、引用与冲突处理
Section titled “第四步:回答、引用与冲突处理”每个关键结论尽量回到具体来源、版本、日期和原文位置。答案模板可以要求模型区分“原文事实”“基于原文的归纳”和“缺少证据的部分”。
但引用不等于正确,至少要检查三层:引用是否真的来自当前有效来源;引用段落是否支持这句话;模型是否把适用条件、例外或否定词改错。若来源冲突,系统应展示冲突来源并转人工,而不是替管理者悄悄选边。
第五步:建立删除链和更新链
Section titled “第五步:建立删除链和更新链”删除请求不能停在一个后台按钮。至少要逐项确认:
- 原始文档或业务系统记录是否删除、停用或更正;
- 文本切片、搜索索引和向量存储是否同步更新;
- 查询缓存、生成缓存和预计算摘要是否失效;
- 日志、评估集、导出文件和人工副本如何按既定政策处理;
- 备份中的数据如何按备份保留与恢复规则管理;
- 删除后用旧问题回归,是否还能检索或生成相关内容。
OpenAI 的 Files API 文档说明可以删除文件对象,但这不自动证明相关向量存储、缓存、日志、备份或其他系统副本已经删除。使用任何供应商时,都应分别核对文件对象、向量索引、会话、日志和数据保留政策的能力边界。
建议的迭代顺序
Section titled “建议的迭代顺序”| 阶段 | 主要产出 | 放行条件 | 失败时怎么做 |
|---|---|---|---|
| 盘点 | 知识源登记册、owner、权限标签 | 每个来源有人负责且状态明确 | 无 owner 的来源暂不接入 |
| 原型 | 小范围索引、真实问题评估集 | 能定位失败属于哪一层 | 先修来源与评估,不扩大数据 |
| 试点 | 权限、冲突、删除和拒答测试 | 高风险用例有证据且可人工接管 | 收缩业务域或改为仅搜索 |
| 上线 | 监控、回归、变更和事件流程 | 责任人能处理更新与错误 | 暂停自动回答,保留原文检索 |
| 运营 | 定期复核、反馈回流、版本记录 | 质量变化可解释、可回退 | 回滚索引或下线问题来源 |
OWASP 明确提示,RAG 和微调都不能完全缓解提示注入;外部网页、附件和文档可能携带间接指令。知识库中的内容不能因为“来自公司文件”就自动视为安全指令。
| 风险 | 影响 | 早期信号 | 应对 | 负责人 |
|---|---|---|---|---|
| 过期知识继续回答 | 错误政策、价格或流程被传播 | 引用旧版本、owner 不明 | 有效状态过滤、版本优先级、过期下线 | 知识 owner |
| 权限过滤过晚 | 敏感合同、客户或员工信息泄露 | 不同角色得到相同候选片段 | 检索前 ACL、默认拒绝、越权回归测试 | 安全与系统管理员 |
| 间接提示注入 | 文档指令操纵模型或工具 | 回答忽略系统规则、请求异常工具 | 内容隔离、指令与资料分层、工具最小权限、人工审批 | AI 系统负责人 |
| 引用看似可信但不支持结论 | 管理者误把链接当证明 | 引文缺条件、跨段拼接或版本错误 | 做结论—证据对齐评估 | 知识 owner |
| 多版本冲突 | 模型任意选择口径 | 同题答案随检索结果变化 | 冲突标记、权威来源排序、转人工 | 业务负责人 |
| 删除不彻底 | 权利请求或内部撤回后仍可召回 | 原文已删但旧问法仍命中 | 删除清单、回归验证、供应商边界核验 | 数据与系统负责人 |
| 评估集被“做题” | 离线结果好,真实问题仍失败 | 只反复优化固定少量问题 | 保留盲测集、持续采样真实失败 | 产品与业务负责人 |
| 供应商能力漂移 | 接口、保留策略或排序变化 | 同样输入结果明显变化 | 记录版本、变更审查、回归和退出方案 | 技术负责人 |
涉及个人信息时,《个人信息保护法》要求处理活动具有明确、合理目的,并与目的直接相关、采取对个人权益影响最小的方式;个人还依法享有查阅、复制、更正、补充和删除等权利。《数据安全法》把收集、存储、使用、加工、传输、提供、公开等都纳入数据处理语境。对企业而言,这意味着“向量化”“索引”和“生成回答”不能被当作脱离原数据责任的新空间。
具体处理依据、敏感个人信息、委托处理、跨境、重要数据与事件报告责任,应按实际数据、行业和部署方式判断,必要时由专业人员确认。
NIST AI RMF 的生成式 AI Profile、NIST AIRC 的评估资源、OWASP 的提示注入指南以及 ISO/IEC 42001 的管理体系要求,可作为自愿治理方法,用来组织风险清单、测试、记录与持续改进。它们不自动满足中国法律,也不给出所有企业通用的准确率、召回率或上线阈值。
验收必须让第三方按相同样本、身份、版本和环境复测。不能只展示几个“答得漂亮”的问题。
| 验收项 | 样本口径 | 通过 / 停止条件 | 责任人 | 证据 |
|---|---|---|---|---|
| 检索命中 | 正常问法、改写、专有名词、编号 | 关键问题能找到当前有效来源;失败能定位原因 | 检索负责人 | case_id、候选列表、排序记录 |
| 引用支持 | 含条件、例外、否定和跨段问题 | 每个关键结论能回到支持它的原文 | 知识 owner | 结论—段落映射、版本号 |
| 答案正确 | 业务真实问题和边界问题 | 事实、条件、例外均经 owner 复核 | 业务负责人 | 复核结果与错误分类 |
| 无答案与冲突 | 无来源、来源冲突、来源过期 | 明确拒答或展示冲突并转人工 | 产品负责人 | 拒答与路由日志 |
| 权限 | 部门、岗位、离职、共享、越权请求 | 不召回无权片段,也不生成无权信息 | 安全负责人 | ACL 用例、身份和访问日志 |
| 新鲜度 | 新版、旧版、未来生效、已撤回来源 | 仅按既定规则使用有效版本 | 知识运营负责人 | 版本、索引时间、回归结果 |
| 删除链 | 原文删除、权利请求、供应商退出样本 | 约定范围内索引和缓存失效;失败则下线来源 | 数据负责人 | 删除工单、接口回执、旧问法复测 |
| 提示注入 | 恶意附件、网页指令、诱导工具调用 | 不改变高层规则、不越权调用工具 | AI 安全负责人 | 攻击样本、执行日志、阻断证据 |
不预设行业阈值,先写清自己的门槛
Section titled “不预设行业阈值,先写清自己的门槛”企业可以为不同业务域设不同放行线,但必须在测试前写清楚:评估集版本、样本来源、评分人、环境、模型与索引版本、通过条件、停止条件和例外审批人。高风险场景应更强调拒答、权限和人工复核,不能用较高的平均分掩盖一次严重泄露。
上线后至少保留四类运营记录:知识源变化、索引与配置变化、评估结果变化、线上失败与处理结果。只有这样,质量下降时才能判断是资料过期、解析错误、检索变化、模型变化还是权限同步失败。
这一章的学习目标不是记住 RAG、embedding、rerank 等词,而是亲手做出一份能进入评审的知识源登记册,并用一条真实删除请求验证整条链路。
一次完成的练习
Section titled “一次完成的练习”- 选一个边界小的知识域,例如某一产品线售后指引,不要选“全公司知识”。
- 找出 10 份左右实际资料,逐份确认 owner、版本、有效期、适用对象、权限和删除方式。数量只是练习示意。
- 删除重复、过期和无法确认责任的来源;对冲突资料标注权威顺序或转人工规则。
- 从真实咨询中整理一组问题,加入专有名词、口语改写、无答案、冲突和越权样本。
- 分别试关键词、向量或混合方案,记录每个失败发生在检索、引用、回答、拒答、权限还是新鲜度。
- 选择一份来源执行删除或停用,检查原文、索引、缓存和答案是否按约定失效。
- 把结果交给知识 owner 复核,不由开发者单独宣布“准确”。
学习产出模板
Section titled “学习产出模板”| source_id | 标题 | owner | 适用对象 / ACL | 版本与生效日 | 复核日 | 状态 | 删除范围与证据 |
|---|---|---|---|---|---|---|---|
| KB-DEMO-001 | 某产品安装说明 | 产品负责人 | 售后团队 | v2.1 / 示例日期 | 示例复核日 | 有效 | 原文、索引、缓存分别留证 |
完成后,让未参与建设的人用登记册回答:谁负责、谁能看、删除后去哪里核验?答不出来,说明知识库仍停留在技术演示。
以下来源按不同层级使用。法律用于识别中国数据处理边界;NIST、OWASP、ISO 用于自愿风险治理;Microsoft 与 OpenAI 文档只用于说明特定产品机制。它们都不替代企业自己的评估结果。
| 层级 | 来源 | 发布机构 | 直接链接 | 使用边界 |
|---|---|---|---|---|
| 中国法律 | 《中华人民共和国个人信息保护法》 | 全国人大常委会 | https://www.cac.gov.cn/2021-08/20/c_1631050028355286.htm | 涉及个人信息时识别目的、最小影响与个人权利,不替代具体合规判断 |
| 中国法律 | 《中华人民共和国数据安全法》 | 全国人大常委会 | https://www.cac.gov.cn/2021-06/11/c_1624994566919140.htm | 说明数据处理链条边界,不外推所有特殊数据义务 |
| 自愿框架 | NIST AI 600-1, Generative AI Profile | NIST | https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence | 风险管理与评估参考,不是中国法定义务 |
| 自愿资源 | NIST AI Resource Center | NIST | https://airc.nist.gov/ | 提供 AI RMF、Playbook 与评估资源,不证明产品质量 |
| 安全指南 | LLM01:2025 Prompt Injection | OWASP GenAI Security Project | https://genai.owasp.org/llmrisk/llm01-prompt-injection/ | 用于提示注入威胁建模,不是完整安全保证 |
| 管理体系 | ISO/IEC 42001:2023 | ISO/IEC | https://www.iso.org/standard/42001 | 管理体系标准,不规定切分、检索或向量库实现 |
| 供应商文档 | Hybrid Search Overview | Microsoft Learn | https://learn.microsoft.com/en-us/azure/search/hybrid-search-overview | 只说明 Azure AI Search 的混合检索机制 |
| 供应商文档 | Relevance scoring in hybrid search using RRF | Microsoft Learn | https://learn.microsoft.com/en-us/azure/search/hybrid-search-ranking | 只说明特定产品的排序与重排机制 |
| 供应商文档 | Files API Reference | OpenAI | https://platform.openai.com/docs/api-reference/files | 只说明文件对象能力,不代表向量存储、缓存和日志同步删除 |
AHAX 建议边界
Section titled “AHAX 建议边界”- 先做知识源登记册,再做数据导入。
- 先做企业评估集,再比较关键词、向量、混合与重排。
- 先验证 ACL、冲突、拒答和删除,再扩大自动回答范围。
- 不承诺 RAG 消除幻觉,不把引用等同正确,不把供应商功能等同企业效果。
- 不把示例问题数、参数、阈值、周期和成本写成行业标准。
最后核验:2026-07-15