跳转到内容
wiki

AHAX 公开知识库阶段 · 文章

03 企业知识库与 RAG 治理

从知识源、权限、检索、引用、评估到删除,把企业知识库建设成可管理、可验证、可退出的长期能力。

最后更新 · 预计阅读 · 16 分钟

很多企业第一次做 AI 知识库,会把任务理解成“把文件上传给模型”。真正上线后,麻烦才出现:同一制度有多个版本,员工能搜到无权查看的合同,旧报价仍被引用,来源删除后索引和缓存没有同步失效。

RAG(检索增强生成)解决的是“回答前先找资料”,不是自动解决知识治理。它不会天然判断文件有效性、继承企业权限,也不会因为带引用就保证答案正确。

  • 中国法律边界:知识源、索引、日志和输出涉及个人信息或重要数据时,应按实际处理活动识别责任。法律要求不能被一个“AI 知识库”产品名替代。
  • 国际自愿框架:NIST、OWASP 和 ISO 可帮助企业建立风险、评估与持续改进方法,但不是中国法定义务,也不替企业给出统一合格线。
  • 供应商能力:产品文档只能证明某项机制存在,例如混合检索、重排或文件对象删除;不能证明它在你的数据上更准确,也不能外推所有副本都已删除。
  • AHAX 建议:先建知识源登记册和小型评估集,再选检索与模型;先验证权限、冲突和删除,再扩大使用范围。

管理者先看结论:企业 RAG 的主要工作不是“喂数据”,而是给知识建立所有者、有效期、权限、冲突规则、评估方法和退出机制。

如果只记住六件事,记住下面六件:

  1. 每一条可被检索的知识,都要有来源、所有者、适用对象、版本、复核日和删除方式。
  2. 权限尽量在检索前过滤,而不是先把无权内容取回,再指望模型不要说。
  3. 关键词、向量、混合检索和重排都只是候选方案,必须用企业自己的真实问题比较。
  4. 引用要能定位到原文段落、版本和日期;有引用不等于结论正确。
  5. 评估不能只看一个“准确率”,至少要分别看检索、引用支持、答案、拒答、权限和新鲜度。
  6. 删除必须贯穿原文、索引、向量存储、缓存、日志和备份策略;某个供应商支持删除文件对象,不等于所有副本已同步清除。
决策问题最低可接受答案不能接受的回答
哪些资料可以进入知识库有来源清单、所有者和批准记录“共享盘里的都导进去”
哪份资料当前有效有版本、生效日、失效日和优先级“模型会自己判断”
谁能检索哪些内容身份、角色、部门和对象权限可验证“登录后都能问”
回答错了由谁处理知识所有者与系统负责人分别负责“让用户自己核对”
如何证明回答可靠有固定评估集、回归结果和失败记录“演示时基本都答对了”
删除如何闭环有删除请求、处理范围、复核证据“后台点了删除”

AHAX 判断:第一阶段先选边界清楚、资料有 owner、错误可人工兜底的领域。把一条知识从登记、检索、引用、更新到删除完整跑通,比一次导入大量文件更有价值。

RAG 适合“答案主要存在于可管理资料中,而且资料会更新”的问题;不适合把缺失的业务规则、未经确认的经验和高风险判断交给模型补全。

场景适用性原因上线边界
产品手册与售后指引较适合来源明确、版本可管理、可引用原文过期型号和例外政策要单独处理
内部制度与流程问答有条件适合能减少查找成本必须按部门、岗位和地区做权限与版本控制
合同条款查找有条件适合可辅助定位条款不替代法务判断,不把相似条款当最终意见
销售话术与报价知识有条件适合可提供受控素材价格、承诺和有效期必须回到权威系统
客户个人资料汇总高风险涉及个人信息、权限与用途限制先确认处理依据、最小必要和权利响应链
医疗、法律、财务结论不宜直接自动决策错误后果高、情境依赖强只做检索辅助,并设置专业人员复核
企业没有成文规则不适合直接上 RAG模型检索不到不存在的知识先完成规则确认和文档化
多版本长期冲突不适合直接自动回答模型可能选择表面更像答案的内容先建立冲突与优先级规则
  • 企业搜索主要返回文档或片段,适合让人自己阅读和判断。
  • RAG先检索,再让生成模型基于检索上下文组织答案,适合需要自然语言解释和跨段整理的场景。
  • 微调主要改变模型的行为模式、表达方式或特定任务表现,不是持续更新事实知识的默认手段。

AHAX 判断:如果企业只需要“快速找到原文”,先把搜索做好;如果需要“基于多份有效资料生成有出处的回答”,再加 RAG;如果需要稳定格式、分类方式或特定任务行为,再评估微调。不要用微调替代频繁变化的制度、价格和产品参数,也不要把 RAG 当成改变模型行为的唯一工具。

方案更擅长什么主要局限适合的验证样本
关键词检索专有名词、编号、产品型号、精确短语同义表达和自然语言改写可能漏召回合同号、料号、制度名、错误码
向量检索语义相近、口语问法、同义改写可能召回“意思像但业务上不对”的片段用户口语、问题改写、跨表述查询
混合检索同时利用精确词与语义相似参数、成本和调试复杂度增加专有名词与自然语言混合问题
重排对候选结果再次排序增加调用与延迟,效果依赖实际数据多个相似制度、相近产品和冲突版本

Microsoft 对 Azure AI Search 的说明显示,其混合检索会并行运行全文与向量查询,再用 RRF 合并结果;语义重排还能对候选结果进一步排序。这只能证明特定产品提供这些机制,不能证明混合检索或重排必然优于其他方案。企业仍要用自己的评估集做比较。

维度RAG微调AHAX 建议
知识更新更新来源和索引后可反映新资料通常需要重新准备数据和训练高频变化事实优先 RAG
来源引用可以保留检索片段与来源不天然提供事实出处需要审计时优先可引用链路
行为与格式可用提示词和工作流约束可强化稳定行为与特定任务模式先用可配置方式验证,再判断是否微调
权限控制可在检索环节按 ACL 过滤权限不应依赖模型参数记忆敏感知识必须走检索前授权
删除与更正要同步处理原文、索引和缓存已训练影响的移除更复杂有强删除要求时谨慎选择训练用途
提示注入仍可能受恶意文档和外部内容影响同样不能完全消除两者都要做威胁建模与隔离

一个答案失败,可能是资料未找到、排序靠后、引用不支持、改写错误、该拒答时强答或发生越权。把它们压成一个准确率,团队就不知道该改哪一层。

指标层要回答的问题证据形式不应混淆为
检索命中有效来源是否进入候选结果case_id、候选文档、排序与分数最终答案正确
引用支持引用段落是否真正支持关键结论结论—证据对应表只要附链接就通过
答案正确关键事实、条件和例外是否准确知识 owner 复核记录文风流畅
拒答无来源、冲突或越权时是否停止拒答样本与路由记录“什么都能回答”
权限是否只检索到授权范围角色用例与访问日志页面按钮被隐藏
新鲜度是否使用当前有效版本版本号、生效日、索引时间文件最近上传

企业知识库实施可以拆成五条连续链:知识源治理、内容处理、授权检索、回答与引用、评估与运营。任一条断开,RAG 都可能只剩一个好看的演示。

先盘点来源,不先买向量库。每个来源至少记录以下字段:

字段要解决的问题示例写法
source_id如何唯一追踪来源KB-HR-001
标题与来源位置原文在哪里员工手册 / 受控文档库
知识所有者谁对内容正确负责人力资源负责人
技术维护人谁负责接入、索引和删除系统管理员
适用对象哪些人可使用中国区正式员工
权限标签检索前如何过滤department=HR;level=internal
版本与生效日哪份当前有效v3.2;2026-06-01
复核日与状态何时重审、是否可用2026-09-01;有效
删除方式从哪些系统移除原文、索引、缓存分别处理

AHAX 示例:第一轮可选 30—100 个真实问题建立评估集。这只是小范围启动示意,不是行业标准。问题应来自真实咨询、工单、搜索词和员工访谈,并覆盖正常问题、专有名词、无答案、冲突版本、越权请求和已删除资料。

第二步:清洗、去重、切分和元数据

Section titled “第二步:清洗、去重、切分和元数据”
  1. 去重:先识别完全重复、轻微改名、附件重复和历史版本。不要让同一内容以多个标题竞争排序。
  2. 正文提取:保留标题层级、表格含义、页码或段落定位。扫描件要记录 OCR 状态,不把识别结果当原文无误。
  3. 切分:按语义和业务结构切,不盲目采用固定字符数。制度条款、操作步骤和表格可能需要不同策略。
  4. 元数据:至少附带 source_id、owner、版本、生效日、权限、业务域、语言和有效状态。
  5. 冲突标记:当同一主题存在例外、地区差异或未决冲突时,显式记录,不让模型自行选一个“看起来合理”的版本。

切分没有通用最佳尺寸。块太大可能带入无关内容,太小可能丢失条件和例外。应按真实问题能否检索到完整证据验收。

理想顺序是:验证用户身份 → 解析角色与属性 → 在检索查询中附加 ACL 过滤 → 只对授权候选做排序和生成 → 记录访问证据。

只在生成后遮挡内容风险很高,因为无权片段已经进入模型上下文,可能通过摘要、比较、引用或工具调用泄露。ACL 测试至少覆盖:不同部门、岗位变更、临时授权、共享链接、离职账号、管理员代查和多租户隔离。

AHAX 判断:上传权限、文档库权限和 RAG 检索权限不是同一个概念。接入前要明确权限如何映射、何时同步、失败时默认允许还是默认拒绝。对敏感内容,映射失败应默认拒绝。

第四步:回答、引用与冲突处理

Section titled “第四步:回答、引用与冲突处理”

每个关键结论尽量回到具体来源、版本、日期和原文位置。答案模板可以要求模型区分“原文事实”“基于原文的归纳”和“缺少证据的部分”。

但引用不等于正确,至少要检查三层:引用是否真的来自当前有效来源;引用段落是否支持这句话;模型是否把适用条件、例外或否定词改错。若来源冲突,系统应展示冲突来源并转人工,而不是替管理者悄悄选边。

删除请求不能停在一个后台按钮。至少要逐项确认:

  • 原始文档或业务系统记录是否删除、停用或更正;
  • 文本切片、搜索索引和向量存储是否同步更新;
  • 查询缓存、生成缓存和预计算摘要是否失效;
  • 日志、评估集、导出文件和人工副本如何按既定政策处理;
  • 备份中的数据如何按备份保留与恢复规则管理;
  • 删除后用旧问题回归,是否还能检索或生成相关内容。

OpenAI 的 Files API 文档说明可以删除文件对象,但这不自动证明相关向量存储、缓存、日志、备份或其他系统副本已经删除。使用任何供应商时,都应分别核对文件对象、向量索引、会话、日志和数据保留政策的能力边界。

阶段主要产出放行条件失败时怎么做
盘点知识源登记册、owner、权限标签每个来源有人负责且状态明确无 owner 的来源暂不接入
原型小范围索引、真实问题评估集能定位失败属于哪一层先修来源与评估,不扩大数据
试点权限、冲突、删除和拒答测试高风险用例有证据且可人工接管收缩业务域或改为仅搜索
上线监控、回归、变更和事件流程责任人能处理更新与错误暂停自动回答,保留原文检索
运营定期复核、反馈回流、版本记录质量变化可解释、可回退回滚索引或下线问题来源

OWASP 明确提示,RAG 和微调都不能完全缓解提示注入;外部网页、附件和文档可能携带间接指令。知识库中的内容不能因为“来自公司文件”就自动视为安全指令。

风险影响早期信号应对负责人
过期知识继续回答错误政策、价格或流程被传播引用旧版本、owner 不明有效状态过滤、版本优先级、过期下线知识 owner
权限过滤过晚敏感合同、客户或员工信息泄露不同角色得到相同候选片段检索前 ACL、默认拒绝、越权回归测试安全与系统管理员
间接提示注入文档指令操纵模型或工具回答忽略系统规则、请求异常工具内容隔离、指令与资料分层、工具最小权限、人工审批AI 系统负责人
引用看似可信但不支持结论管理者误把链接当证明引文缺条件、跨段拼接或版本错误做结论—证据对齐评估知识 owner
多版本冲突模型任意选择口径同题答案随检索结果变化冲突标记、权威来源排序、转人工业务负责人
删除不彻底权利请求或内部撤回后仍可召回原文已删但旧问法仍命中删除清单、回归验证、供应商边界核验数据与系统负责人
评估集被“做题”离线结果好,真实问题仍失败只反复优化固定少量问题保留盲测集、持续采样真实失败产品与业务负责人
供应商能力漂移接口、保留策略或排序变化同样输入结果明显变化记录版本、变更审查、回归和退出方案技术负责人

涉及个人信息时,《个人信息保护法》要求处理活动具有明确、合理目的,并与目的直接相关、采取对个人权益影响最小的方式;个人还依法享有查阅、复制、更正、补充和删除等权利。《数据安全法》把收集、存储、使用、加工、传输、提供、公开等都纳入数据处理语境。对企业而言,这意味着“向量化”“索引”和“生成回答”不能被当作脱离原数据责任的新空间。

具体处理依据、敏感个人信息、委托处理、跨境、重要数据与事件报告责任,应按实际数据、行业和部署方式判断,必要时由专业人员确认。

NIST AI RMF 的生成式 AI Profile、NIST AIRC 的评估资源、OWASP 的提示注入指南以及 ISO/IEC 42001 的管理体系要求,可作为自愿治理方法,用来组织风险清单、测试、记录与持续改进。它们不自动满足中国法律,也不给出所有企业通用的准确率、召回率或上线阈值。

验收必须让第三方按相同样本、身份、版本和环境复测。不能只展示几个“答得漂亮”的问题。

验收项样本口径通过 / 停止条件责任人证据
检索命中正常问法、改写、专有名词、编号关键问题能找到当前有效来源;失败能定位原因检索负责人case_id、候选列表、排序记录
引用支持含条件、例外、否定和跨段问题每个关键结论能回到支持它的原文知识 owner结论—段落映射、版本号
答案正确业务真实问题和边界问题事实、条件、例外均经 owner 复核业务负责人复核结果与错误分类
无答案与冲突无来源、来源冲突、来源过期明确拒答或展示冲突并转人工产品负责人拒答与路由日志
权限部门、岗位、离职、共享、越权请求不召回无权片段,也不生成无权信息安全负责人ACL 用例、身份和访问日志
新鲜度新版、旧版、未来生效、已撤回来源仅按既定规则使用有效版本知识运营负责人版本、索引时间、回归结果
删除链原文删除、权利请求、供应商退出样本约定范围内索引和缓存失效;失败则下线来源数据负责人删除工单、接口回执、旧问法复测
提示注入恶意附件、网页指令、诱导工具调用不改变高层规则、不越权调用工具AI 安全负责人攻击样本、执行日志、阻断证据

不预设行业阈值,先写清自己的门槛

Section titled “不预设行业阈值,先写清自己的门槛”

企业可以为不同业务域设不同放行线,但必须在测试前写清楚:评估集版本、样本来源、评分人、环境、模型与索引版本、通过条件、停止条件和例外审批人。高风险场景应更强调拒答、权限和人工复核,不能用较高的平均分掩盖一次严重泄露。

上线后至少保留四类运营记录:知识源变化、索引与配置变化、评估结果变化、线上失败与处理结果。只有这样,质量下降时才能判断是资料过期、解析错误、检索变化、模型变化还是权限同步失败。

这一章的学习目标不是记住 RAG、embedding、rerank 等词,而是亲手做出一份能进入评审的知识源登记册,并用一条真实删除请求验证整条链路。

  1. 选一个边界小的知识域,例如某一产品线售后指引,不要选“全公司知识”。
  2. 找出 10 份左右实际资料,逐份确认 owner、版本、有效期、适用对象、权限和删除方式。数量只是练习示意。
  3. 删除重复、过期和无法确认责任的来源;对冲突资料标注权威顺序或转人工规则。
  4. 从真实咨询中整理一组问题,加入专有名词、口语改写、无答案、冲突和越权样本。
  5. 分别试关键词、向量或混合方案,记录每个失败发生在检索、引用、回答、拒答、权限还是新鲜度。
  6. 选择一份来源执行删除或停用,检查原文、索引、缓存和答案是否按约定失效。
  7. 把结果交给知识 owner 复核,不由开发者单独宣布“准确”。
source_id标题owner适用对象 / ACL版本与生效日复核日状态删除范围与证据
KB-DEMO-001某产品安装说明产品负责人售后团队v2.1 / 示例日期示例复核日有效原文、索引、缓存分别留证

完成后,让未参与建设的人用登记册回答:谁负责、谁能看、删除后去哪里核验?答不出来,说明知识库仍停留在技术演示。

以下来源按不同层级使用。法律用于识别中国数据处理边界;NIST、OWASP、ISO 用于自愿风险治理;Microsoft 与 OpenAI 文档只用于说明特定产品机制。它们都不替代企业自己的评估结果。

层级来源发布机构直接链接使用边界
中国法律《中华人民共和国个人信息保护法》全国人大常委会https://www.cac.gov.cn/2021-08/20/c_1631050028355286.htm涉及个人信息时识别目的、最小影响与个人权利,不替代具体合规判断
中国法律《中华人民共和国数据安全法》全国人大常委会https://www.cac.gov.cn/2021-06/11/c_1624994566919140.htm说明数据处理链条边界,不外推所有特殊数据义务
自愿框架NIST AI 600-1, Generative AI ProfileNISThttps://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence风险管理与评估参考,不是中国法定义务
自愿资源NIST AI Resource CenterNISThttps://airc.nist.gov/提供 AI RMF、Playbook 与评估资源,不证明产品质量
安全指南LLM01:2025 Prompt InjectionOWASP GenAI Security Projecthttps://genai.owasp.org/llmrisk/llm01-prompt-injection/用于提示注入威胁建模,不是完整安全保证
管理体系ISO/IEC 42001:2023ISO/IEChttps://www.iso.org/standard/42001管理体系标准,不规定切分、检索或向量库实现
供应商文档Hybrid Search OverviewMicrosoft Learnhttps://learn.microsoft.com/en-us/azure/search/hybrid-search-overview只说明 Azure AI Search 的混合检索机制
供应商文档Relevance scoring in hybrid search using RRFMicrosoft Learnhttps://learn.microsoft.com/en-us/azure/search/hybrid-search-ranking只说明特定产品的排序与重排机制
供应商文档Files API ReferenceOpenAIhttps://platform.openai.com/docs/api-reference/files只说明文件对象能力,不代表向量存储、缓存和日志同步删除
  • 先做知识源登记册,再做数据导入。
  • 先做企业评估集,再比较关键词、向量、混合与重排。
  • 先验证 ACL、冲突、拒答和删除,再扩大自动回答范围。
  • 不承诺 RAG 消除幻觉,不把引用等同正确,不把供应商功能等同企业效果。
  • 不把示例问题数、参数、阈值、周期和成本写成行业标准。

最后核验:2026-07-15

上一章 | 返回专题总览 | 下一章