AHAX 公开知识库阶段 · 文章
01 如何选择第一个 AI 场景
从真实业务基线出发,用频率、价值、可验证性、可逆性和数据准备度筛选首个 AI 试点,并提前写清验收与停止条件。
企业第一次引入 AI,最容易犯的错不是模型选错,而是场景选错:把低频问题包装成战略项目,把演示效果当成业务效果,把原本应由规则系统完成的任务交给模型,再用不断修改提示词掩盖流程本身不清楚。
这篇文章不提供“最热门 AI 场景排行榜”,而是给管理者一套可复算的选择方法。最终产出不是一份技术愿望清单,而是一张有基线、有证据、有责任人、有停止条件的场景 backlog。
本文有四类信息,阅读时不要混为一谈:
- 中国法规:当场景涉及个人信息、面向境内公众提供生成式 AI 服务等活动时,应按实际处理活动判断适用义务。
- 政策与评测方向:工信部文件支持从数字化基础、经营、管理和成效出发做场景化评测,但不替企业证明某个 AI 项目一定有效。
- 国际自愿框架:NIST AI RMF、NIST GenAI Profile 和 ISO/IEC 42001 可帮助组织管理风险,不是中国企业统一的法定验收标准。
- AHAX 示例:本文的量表、权重、成熟度和试点模板用于辅助决策,不是行业平均值,也不构成效果、周期或收益承诺。
管理者先看结论
Section titled “管理者先看结论”第一个 AI 场景应同时满足六个条件:问题真实且重复发生、业务价值可解释、结果容易复核、错误可以撤销或转人工、数据可合法获得、业务负责人愿意持续参与。它不一定是公司价值最大的场景,但应该是最容易形成可信证据闭环的场景。
管理者可以先用下面六问做快速判断:
- 最近一个完整业务周期内,这个问题实际发生了多少次,而不是“大家感觉经常发生”?
- 每次发生造成了什么损失:等待、返工、漏单、投诉、机会流失,还是管理者无法及时决策?
- AI 输出能否由规则、系统记录或有资格的人在合理时间内复核?
- 输出错误后,能否撤回、重做、补偿或转人工?
- 输入数据从哪里来,谁有权使用,是否足够新,谁负责修正?
- 试点结束时,谁依据什么证据决定继续、调整或停止?
只要第 3、4、5 问中有两项答不清,就不适合直接做自动执行型试点。可以先做人工辅助、数据治理或流程标准化。
首个场景的优先信号
Section titled “首个场景的优先信号”| 信号 | 好场景的表现 | 危险表现 | 管理动作 |
|---|---|---|---|
| 高频 | 同类任务稳定重复,有时间戳或工单 | 只在少数特殊月份出现 | 按完整业务周期取样,不凭印象 |
| 有价值 | 能对应时间、质量、收入、成本或风险 | 只有“更有科技感” | 写出基线与计算口径 |
| 可验证 | 有标准答案、规则、来源或人工复核人 | 好坏完全依赖主观感觉 | 先建测试集和判定规则 |
| 可逆 | 错误可以拦截、撤回、重做或转人工 | 一次错误就可能造成不可恢复损害 | 保留人工闸门和回滚路径 |
| 数据可用 | 来源、权限、口径、更新和责任人明确 | 数据散落、过期或来源不明 | 先补数据清单与治理责任 |
| owner 明确 | 业务负责人参与样本、规则和验收 | 只有技术或供应商推动 | 没有 owner 就不进入试点 |
AHAX 判断:首个试点的任务是建立组织学习能力,不是证明 AI 无所不能。一个范围窄、可复核、可停止的闭环,比一个覆盖多个部门但无人能验收的“大平台”更有价值。
适用与不适用
Section titled “适用与不适用”本方法适用于准备把生成式 AI、机器学习能力或 AI 辅助工具接入真实业务流程的中小企业,也适用于已经买了工具、但不知道先在哪个部门落地的企业。它尤其适合从客服知识检索、销售准备、文档处理、内容初稿、经营分析和内部助手等候选任务中做第一轮筛选。
它不替代法律意见、行业监管判断、安全评估或采购审查。医疗诊断、信贷审批、人事录用、重大合同决策、自动对外承诺等高影响场景,不能因为评分高就直接自动化。
优先、降级与暂缓
Section titled “优先、降级与暂缓”| 场景类型 | 建议路线 | 原因 | 进入下一步前必须补什么 |
|---|---|---|---|
| 高频、低风险、答案可复核 | 优先做受控试点 | 容易形成基线与反馈闭环 | 样本集、负责人、停止条件 |
| 高频但数据混乱 | 先治理数据,再试点 | 模型会放大错误口径 | 字段字典、来源、更新责任 |
| 有价值但结果难验证 | 先做人工辅助 | 无法安全地让系统自动决定 | 复核规则、人工确认、证据链 |
| 低频且高影响 | 暂缓自动化 | 样本少,错误代价大 | 专项风险评估和专家复核 |
| 规则明确且结果确定 | 优先传统自动化 | 不需要模型的不确定性 | 工作流规则、异常分支、日志 |
| 只为展示或跟风 | 不立项 | 没有可验收业务问题 | 回到业务基线与损失样本 |
明确不适合作为第一个 AI 场景的情况
Section titled “明确不适合作为第一个 AI 场景的情况”- 没有真实样本,只能用临时编写的演示数据。
- 业务规则仍在频繁变化,各部门对“正确结果”没有共识。
- 输入包含大量个人信息、商业秘密或敏感数据,但用途、权限和供应商处理边界尚未明确。
- 输出会直接触发付款、解雇、签约、定价、公开承诺或其他高影响动作,且没有人工批准。
- 只能比较“用了以后感觉更快”,无法按同一口径采集试点前后的结果。
- 项目没有业务 owner,只有采购、IT、供应商或某位 AI 爱好者推动。
- 失败后无法撤回或补偿,也没有降级流程。
若场景涉及个人信息,应结合《中华人民共和国个人信息保护法》审视处理目的、必要性、透明度、权限和个人权利等责任。若企业面向境内公众提供生成式 AI 服务,还需结合《生成式人工智能服务管理暂行办法》判断适用边界。内部使用不当然适用该暂行办法,但仍可能适用个人信息、数据、网络安全和行业规则。
选定业务问题后,不要默认“上 AI”只有一种方式。同一任务可能更适合规则自动化、AI 辅助、受控 AI 自动化或 Agent。路线越靠后,系统自主性越高,对数据、权限、监控和停止机制的要求也越高。
| 路线 | 系统做什么 | 人做什么 | 更适合 | 主要风险 |
|---|---|---|---|---|
| 不改系统 | 保持现状 | 人工处理并记录问题 | 低频、暂不值得投入 | 问题继续存在,但避免错误投资 |
| 流程/规则自动化 | 按确定条件执行 | 维护规则、处理异常 | 条件明确、结果确定的任务 | 规则遗漏、异常分支未覆盖 |
| AI 辅助 | 检索、摘要、分类、起草、建议 | 审核并作最终决定 | 输出可复核但仍有不确定性 | 人员过度信任、复核流于形式 |
| 受控 AI 自动化 | 在限定范围内生成或执行 | 审批高风险动作、处理异常 | 样本稳定、边界清晰、可回滚 | 错误扩散、权限过大、监控不足 |
| Agent | 分解目标、调用工具、跨步骤执行 | 设置目标、授权、观察和中止 | 流程稳定且工具权限能严格隔离 | 提示注入、工具误用、链式错误 |
AHAX 判断:如果任务可以用“如果 A,则执行 B”完整表达,就先用工作流或业务系统。只有当输入存在自然语言、非结构化材料、模糊匹配或需要生成判断时,才考虑 AI。Agent 不是成熟度的勋章,而是一种更高风险的执行方式。
企业准备度不是“用了几个模型”
Section titled “企业准备度不是“用了几个模型””下面的四级模型是 AHAX 示例,用于判断组织当前能承受多大范围的试点。它不是工信部评测等级,也不是 ISO 认证等级。
| 级别 | 组织表现 | 可选择的首批场景 | 升级前证据 |
|---|---|---|---|
| L0 个人试用 | 各自使用工具,无统一数据和规则 | 不进入正式业务闭环 | 工具清单、禁止输入边界、问题样本 |
| L1 受控辅助 | 有指定用户、样本和人工复核 | 检索、摘要、起草、分类建议 | 基线、测试集、复核记录、责任人 |
| L2 流程集成 | AI 接入工作流,结果可回写、可追踪 | 有限自动分类、路由、内容生产 | 日志、回滚、权限、异常队列 |
| L3 受控执行 | 可调用有限工具,持续监控和复盘 | 严格边界内的自动执行或 Agent | 工具白名单、批准机制、事件响应 |
企业规模不能直接推导成熟度。人数多的企业也可能数据口径混乱,人数少的企业也可能拥有清晰流程和可靠日志。工信部《中小企业数字化水平评测指标(2024年版)》从数字化基础、经营、管理和成效等维度评估,给出的启发是先看基础与实效;它不是本文 AI 场景评分的官方依据。
实施从“收集候选场景”开始,而不是从选模型开始。建议用一个完整业务周期的数据建立基线;如果业务季节性明显,应覆盖能代表正常与高峰的周期。不要机械套用三个月,也不要只取最容易成功的一周。
先把部门愿望拆成可验证任务
Section titled “先把部门愿望拆成可验证任务”“做一个销售 AI”“建设智能客服”“实现内容自动化”都不是可评分的场景,它们只是方向。一个可评分场景必须能写成:当什么事情发生,系统取得哪些输入,AI 只完成哪一步,由谁复核,结果写回哪里,什么状态代表结束。
例如,“做智能客服”可以拆成知识检索、相似问题匹配、回复建议、会话摘要、工单分类、升级路由、自动回复等不同任务。知识检索可能容易验证、容易撤回;自动回复则可能直接面对客户,风险和控制要求完全不同。如果把它们打成一个总分,高风险任务会被低风险任务掩盖,最终也不知道试点究竟验证了什么。
拆任务时按真实流程从左到右走一遍:触发来自哪里,数据由谁提供,人员当前如何判断,异常怎样升级,结果进入哪个系统,后续谁使用。每一步只问三个问题:它是确定规则还是模糊判断;错误能否在影响客户或账务前发现;是否必须使用个人信息、商业秘密或外部平台。由此得到的不是功能清单,而是边界清楚的候选任务。
| 原始愿望 | 可验证任务 | 可观察输入 | 可复核输出 | 初始路线 |
|---|---|---|---|---|
| 提高销售效率 | 根据已批准资料生成拜访准备摘要 | CRM 记录、产品资料、客户公开信息 | 引用完整的准备清单 | AI 辅助 |
| 改善客服体验 | 为客服检索已生效知识并给出来源 | 用户问题、版本化知识库 | 答案候选、来源和适用版本 | AI 辅助 |
| 加快合同处理 | 提取合同字段并标记缺失项 | 已授权合同文件、字段规则 | 结构化字段和缺失清单 | AI 辅助 + 人工确认 |
| 自动做经营分析 | 对已确认指标生成异常说明草稿 | 指标口径、报表、历史变化 | 异常候选及数据引用 | AI 辅助 |
AHAX 判断:场景名称越大,越难建立责任和证据。第一期应以“一个触发、一个主要输出、一个业务 owner、一个结束状态”为边界;后续是否扩展,由真实运行证据决定。
第一步:建立业务基线
Section titled “第一步:建立业务基线”每个候选场景至少收集以下证据:
| 基线项 | 记录内容 | 常见错误 | 可用证据 |
|---|---|---|---|
| 任务量 | 有效任务数、异常任务数、峰谷分布 | 把收到的消息都算成任务 | 工单、订单、文档或系统日志 |
| 处理时间 | 起止口径、等待时间、实际操作时间 | 只记录最快人员 | 时间戳、抽样观察、人员记录 |
| 质量 | 返工、漏项、错误、升级或投诉 | 没有统一错误分类 | 复核单、退回记录、投诉记录 |
| 业务结果 | 对交付、客户、收入、成本或风险的影响 | 把相关性写成因果 | 财务、运营或客户记录 |
| 数据条件 | 来源、更新、权限、缺失、冲突 | 只看“有没有文件” | 数据清单、字段字典、权限记录 |
| 责任链 | 提供数据、执行、复核、决策和维护人员 | 默认由 IT 负责全部 | RACI、岗位和审批记录 |
第二步:用统一量表评分
Section titled “第二步:用统一量表评分”以下为 AHAX 示例。六个维度均使用 0–5 的整数分,不允许半分:0 表示没有证据或完全不具备;1 表示证据很弱;2 表示部分具备但缺口明显;3 表示具备基本条件;4 表示证据充分且主要风险可控;5 表示证据完整、责任清楚并经过实际验证。
权重合计 100%。总分按百分制计算,保留 1 位小数:
总分 = Σ(单项得分 ÷ 5 × 该项权重)
| 维度 | 权重 | 5 分证据 | 0–1 分表现 |
|---|---|---|---|
| 发生频率 | 15% | 在代表性周期稳定重复,任务量有系统记录 | 偶发或只有印象 |
| 业务价值 | 25% | 损失或改善方向可按同一口径核验 | 无法说明对经营的影响 |
| 可验证性 | 20% | 有测试集、判定规则或合格复核人 | 正确与否没有共识 |
| 可逆性 | 15% | 可拦截、撤回、重做、补偿或转人工 | 错误后果不可恢复 |
| 数据准备度 | 15% | 来源、用途、权限、质量、更新和 owner 明确 | 来源或使用权不清 |
| 组织准备度 | 10% | 业务 owner、执行人、复核人和维护人到位 | 只有技术方推动 |
中间分不能凭感觉取整。以下锚点用于区分 2、3、4 分;若证据横跨两档,取较低档并记录尚缺证据。
| 维度 | 2 分:已有局部事实但缺口明显 | 3 分:具备试点基本条件 | 4 分:证据充分、主要缺口已控制 |
|---|---|---|---|
| 发生频率 | 只有人工抽样,周期短或波动未解释 | 有代表性周期记录,能区分正常与异常 | 多周期系统记录稳定,峰谷和异常已解释 |
| 业务价值 | 能描述损失,但口径或数据源未固定 | 指标、口径、基线和负责人已确定 | 可复算基线经业务/财务复核,归因边界清楚 |
| 可验证性 | 只有少量示例,复核标准不一致 | 有正常/异常样本和合格复核人 | 评估集分层、评分已校准且阻断错误明确 |
| 可逆性 | 主要错误能人工修复,但无演练 | 有人工闸门、回滚/补偿步骤和负责人 | 异常路径完成演练,恢复证据可追踪 |
| 数据准备度 | 有数据但来源、权限或更新存在明显缺口 | 必要字段、来源、用途、权限和 owner 已列清 | 质量抽查、更新、删除和供应商流向均已验证 |
| 组织准备度 | 有推动者但业务/维护责任缺位 | 业务 owner、执行和复核角色已确认 | 替补、培训、运维预算和升级机制均到位 |
AHAX 评分示例(非客户案例)
Section titled “AHAX 评分示例(非客户案例)”| 候选场景 | 频率 | 价值 | 可验证 | 可逆 | 数据 | 组织 | 总分 |
|---|---|---|---|---|---|---|---|
| 售前材料初稿与引用核验 | 4 | 3 | 5 | 5 | 4 | 4 | 81.0 |
| 客服知识检索与回复建议 | 5 | 4 | 4 | 4 | 3 | 4 | 80.0 |
| 自动批准大额退款 | 3 | 5 | 2 | 1 | 4 | 3 | 63.0 |
第一行可以这样复算:
4÷5×15 + 3÷5×25 + 5÷5×20 + 5÷5×15 + 4÷5×15 + 4÷5×10 = 81.0
其余候选也必须保留分项证据,不能只保留总分。总分用于排序,不自动决定立项;任何场景若出现“不可接受的法律、安全或业务后果”,即使总分高,也应降级为人工辅助或暂缓。
| 分数区间 | AHAX 建议动作 | 不能误解为 |
|---|---|---|
| 80.0–100.0 | 进入试点设计,并再做合规、安全和成本复核 | 已批准上线或保证成功 |
| 65.0–79.9 | 补最弱的一个维度后重新评分 | 可以边做边补所有基础 |
| 50.0–64.9 | 先做流程、数据或责任治理 | 只要换更强模型就能解决 |
| 0–49.9 | 暂不进入 AI 试点,保留观察条件 | 永远不值得做 |
第三步:设计最小可证伪试点
Section titled “第三步:设计最小可证伪试点”试点必须能证明“这个假设不成立”。如果无论结果如何都解释为成功,它就不是试点,而是展示。
- 冻结一个闭环:写清触发、输入、AI 动作、人工动作、系统回写和结束状态。
- 冻结样本口径:保留正常、异常、边界和高风险样本,不只测试理想输入。
- 先跑影子模式:AI 给出结果但不直接影响业务,用现有流程作为对照。
- 定义人工闸门:谁复核、什么必须拦截、多久未处理就转人工。
- 记录完整成本:工具、集成、数据整理、复核、培训、异常处理和维护都计入。
- 预写三种结论:继续、调整、停止分别需要什么证据,谁签字。
自动化还是辅助:用失败后果决定
Section titled “自动化还是辅助:用失败后果决定”同一场景可以从辅助开始,再根据证据升级。比如客服场景第一阶段只检索知识并生成建议,由客服选择和修改;第二阶段才允许系统自动回答低风险、答案稳定的问题;涉及退款、合同、投诉升级或个人信息时仍转人工。升级依据应是测试、运行和异常记录,而不是团队对模型“越来越有信心”。
工信部《中小企业数字化赋能专项行动方案(2025—2027年)解读》强调分场景、供需适配、评测和转型实效。它支持从具体问题和实效出发,不代表企业必须购买某项 AI 产品,也不证明任何试点可以获得补贴。
场景选择阶段的风险,往往早于模型安全风险。问题定义错了、数据没权使用、责任人缺位,即使模型本身表现不错,项目仍会失败。
| 风险 | 早期信号 | 影响 | 负责人 | 应对 | 停止或降级条件 |
|---|---|---|---|---|---|
| 伪需求 | 只有管理层口号,没有任务样本 | 投入无法转成经营结果 | 业务 owner | 先收集代表性周期样本 | 无真实任务与损失证据则停止 |
| 基线污染 | 试点前后使用不同样本和统计口径 | 结果不可比较 | 数据负责人 | 冻结口径、版本和排除项 | 无法重建基线则不作效果结论 |
| 自动化过度 | 一开始就自动发送、审批或执行 | 错误快速扩散 | 业务 owner + 技术负责人 | 影子模式、人工闸门、权限最小化 | 高影响动作无人工批准则降级 |
| 数据使用不当 | 来源、用途、授权或供应商边界说不清 | 合规、泄露和信任风险 | 企业管理者 + 合规/法务角色 | 数据清单、最小必要、脱敏和合同审查 | 使用边界未明确则停止接入 |
| 复核失效 | 人员机械点击通过,不查来源 | 错误被“人工审核”掩盖 | 复核负责人 | 抽检复核质量、显示来源与差异 | 复核不能识别关键错误则收缩范围 |
| 模型漂移 | 同一测试集在版本变化后结果明显变化 | 运行质量不可控 | 技术负责人 | 记录模型/配置版本并做回归 | 关键用例未通过则回退版本 |
| 供应商锁定 | 数据、提示、日志或结果无法导出 | 后续迁移和审计困难 | 采购 + 技术负责人 | 上线前验证导出、删除和退出 | 无可接受退出路径则换路线 |
| 沉没成本 | 指标未达标仍不断扩大范围 | 小试点变成长期消耗 | 管理者 | 按预设门槛作继续/调整/停止决策 | 连续评审无证据改善则停止 |
NIST 的 AI Risk Management Framework 1.0 以 Govern、Map、Measure、Manage 组织风险管理工作;Generative AI Profile 进一步补充生成式 AI 风险。它们适合帮助团队把价值、使用场景、测量和风险控制放进同一张决策表,但属于自愿方法,不替代中国法律义务。
ISO 的 ISO/IEC 42001:2023 提供 AI 管理体系要求,适合成熟组织建立持续改进和责任机制。是否采用或认证应由企业根据客户、行业、治理和采购要求决定,不能写成所有中国中小企业都必须认证。
首个场景的验收不是问“AI 能不能生成一个看起来不错的答案”,而是验证业务闭环是否比基线更可控。指标必须在试点前确定样本口径、统计方法、责任人、证据位置和停止条件。
场景选择验收
Section titled “场景选择验收”| 验收项 | 基线/样本口径 | 通过条件 | 责任人 | 证据 |
|---|---|---|---|---|
| 问题真实性 | 一个代表性业务周期的真实任务 | 能说明频率、损失和异常分布 | 业务 owner | 样本清单、系统记录、流程图 |
| 评分可复算 | 全部候选使用同一量表与权重 | 每项有证据,计算结果可复现 | 试点负责人 | 评分表、公式、证据链接 |
| 数据可用 | 按字段、来源、用途、权限检查 | 必要数据可合法取得且有 owner | 数据负责人 | 数据清单、权限和处理说明 |
| 风险可控 | 覆盖正常、异常、边界和高影响样本 | 人工闸门、回滚和停止路径可演示 | 业务 + 技术负责人 | 风险清单、演练或测试记录 |
试点结果验收模板
Section titled “试点结果验收模板”| 指标 | 基线口径 | 试点口径 | 继续/调整/停止门槛 | 调整责任与复测 | 证据形式 |
|---|---|---|---|---|---|
| 有效任务完成率 | 现有流程完成的有效任务/有效任务总数 | 使用同一任务定义和排除项 | 项目预填继续值、可调整区间和停止值 | 业务 owner;修正流程/知识后复测;最多轮次预先约定 | 系统日志、任务清单 |
| 关键错误率 | 预先定义的关键错误数/有效输出数 | 同一错误分类、同一复核规则 | 低于目标继续;一般错误进入调整;触发红线立即停止 | AI + 业务负责人;关闭错误根因后跑受影响集和阻断集 | 复核单、错误样本 |
| 人工处理量 | 每任务实际操作与复核时间 | 同一岗位、同一计时方式 | 达成净改善继续;仅转移工作量则调整;人工负担失控则停止 | 运营负责人;调整界面/分工后按同岗位复测 | 时间记录、工单 |
| 业务结果 | 与场景直接相关的交付、响应或质量指标 | 同期或可比样本 | 达到预设范围继续;证据不足调整样本;负面影响越界停止 | 业务 owner;固定口径后重新观察完整周期 | 运营、财务或客户记录 |
| 全成本 | 工具、集成、数据、复核、培训、维护 | 试点期间统一归集 | 在批准边界内继续;结构可优化则调整;超过止损线停止 | 财务/项目负责人;调整范围或架构后重新核算 | 合同、工时、费用记录 |
| 风险事件 | 泄露、越权、错误外发、不可追溯输出 | 全量登记,不只登记严重事件 | 无阻断事件继续;可控缺口调整;触发红线立即暂停 | 风险 owner;整改、复盘并获重新批准后复测 | 事件单、日志、处置记录 |
每个调整项都要记录:具体缺口、责任人、完成日期、复测样本、重新进入门槛和最大调整轮次。达到最大轮次仍不满足条件时,不再用“继续优化”无限延期,而是缩小范围或停止试点。
样本怎么选,才不会把演示当验收
Section titled “样本怎么选,才不会把演示当验收”试点样本应在运行前冻结编号、来源、时间范围和纳入规则。至少区分四类:日常正常样本,用于观察主要工作量;异常样本,用于测试缺字段、格式错误和流程例外;边界样本,用于检验相似概念、过期资料和模糊表达;高风险样本,用于确认系统会拒绝、提示或转人工。各类样本的占比不应照搬统一数字,而应根据企业真实任务分布和风险后果确定。
不能让项目实施者一边看答案一边挑样本,也不能在测试失败后悄悄删除不利样本。若试点期间业务规则、知识版本、模型配置或提示模板发生变化,应记录变更点,并决定重新跑完整测试集还是只跑受影响部分。否则前后两次结果不在同一条件下,无法证明改善来自哪里。
对开放式输出,不要只用“满意/不满意”。可把验收拆成事实是否有来源、关键字段是否齐全、是否违反业务规则、是否需要重大改写、是否触发人工升级。评分人员应先对少量样本共同校准规则;如果同一输出在不同复核人之间长期无法达成基本一致,应先修订任务定义和评分规则,而不是继续扩大试点。
验收证据应能回到单个样本:输入版本、模型或系统版本、输出、引用、人工修改、最终动作、复核人和时间戳。汇总表用于管理决策,单样本链用于追查错误。只有两者同时存在,管理者才能判断问题来自数据、流程、模型、提示、接口还是人工复核。
验收会议只作三种结论:
- 继续:核心指标达到预设门槛,高风险问题关闭,下一阶段范围和预算明确。
- 调整:价值假设仍有证据,但数据、流程、模型或人工闸门需要修正;修正后重新测试,不直接扩围。
- 停止:问题不真实、结果不可验证、数据边界不能接受、风险超限或完整成本不成立。
AHAX 判断:停止也是合格的试点结果。它避免企业把更大的预算投入到错误问题上。
学习这套方法,不需要先学提示词工程。管理者和业务负责人应先完成一次真实场景盘点,最终交付一张按统一口径排序的 backlog。
两次工作坊的学习任务
Section titled “两次工作坊的学习任务”| 环节 | 参与人 | 操作 | 产出 |
|---|---|---|---|
| 业务取样 | 业务 owner、一线人员、数据负责人 | 从真实记录中抽取正常、异常和边界任务 | 候选任务与样本包 |
| 问题定义 | 管理者、业务 owner | 写频率、损失、当前流程和责任链 | 一页场景卡 |
| 路线判断 | 业务、技术、合规角色 | 比较不改、规则自动化、AI 辅助、受控自动化、Agent | 路线选择及理由 |
| 统一评分 | 全体评审人 | 按 0–5 分量表逐项举证 | 可复算评分表 |
| 风险挑战 | 未参与方案设计的人 | 专门寻找不可逆、不可验证和数据边界问题 | 风险与降级清单 |
| 管理决策 | 管理者 | 排序并指定试点、补证据或暂停 | 场景 backlog 与决策记录 |
backlog 每一行必须有的字段
Section titled “backlog 每一行必须有的字段”- 场景名称和业务 owner。
- 当前流程、任务频率、损失基线和证据链接。
- 选择规则自动化、AI 辅助、受控自动化或 Agent 的理由。
- 六项评分、总分和每个分值的证据。
- 涉及的数据、个人信息、外部供应商和系统接口。
- 人工闸门、回滚、降级和停止条件。
- 试点样本、指标、责任人、证据形式和决策日期。
排序时先看红线风险,再看总分;总分相近时,优先可验证、可逆和 owner 更明确的场景。backlog 不是一次性表格,每次试点、流程变化、数据变化或模型版本变化后都应更新证据和排序。
建议学习顺序是:先读工信部评测指标理解“基础—经营—管理—成效”的评测思路,再读 NIST AI RMF 学习如何把场景、测量和风险连起来;涉及个人信息或公众服务时,再由合适的责任人核对中国适用规则。不要从工具教程开始,因为工具不会替你定义业务问题。
最后核验:2026-07-15