Files
iAOP/docs/产品设计文档_iAOP.md
T

36 KiB
Raw Blame History

云美工业AI优化平台(YunMei iAOP)—— 产品设计文档(PRD)

版本:v1.1(PRD,已据评审意见修订) | 编制:bot_po(产品审核) | 日期:2026-08-04 关联文档:《项目对比与通用产品可行性分析》《通用工业AI优化平台_产品策划方案》《市场调研复盘》 密级:商业机密 | 状态:待正式评审


0. 文档说明与修订记录

版本 日期 修订人 说明
v1.0 2026-08-04 bot_po 首版 PRD,基于已交付化工AI平台(吸附树脂)沉淀与氯化车间AI需求外推
v1.1 2026-08-04 bot_po 据《PRD 评审意见》修订:补全角色画像/5类模板交付物/模型框架模板化技术路径/NFR/里程碑排期(P0);新增风险与缓解、价值指标映射、假设与依赖、未覆盖范围、成本附录(P1/P2);架构/流程图改用 Mermaid;补模块级细节
v1.2 2026-08-04 bot_po 据《v1.1 二次评审意见》修订:① NFR/风险/里程碑各加一段正文导语,确保纯文本抽取可读;② 里程碑表增加负责人与工期列;③ 第13章补充依赖-备选方案矩阵;④ 4 处 Mermaid 图渲染为 PNG 并嵌入文档;⑤ 删除易引发误解的已完成标注,改为中性章节编号

阅读对象:bot_pm(任务拆分)、bot_dev1/dev2(开发实现)、售前/客户成功、行业工程师。 本文档定位:本文档是《产品策划方案》的设计层下钻——策划方案回答"为什么做、卖给谁、怎么收费",本文档回答"产品具体由哪些模块构成、每个模块怎么设计、首模板如何落地、按什么标准验收"。 本文档未覆盖范围:① 对外商务定价与合同条款(见《产品策划方案》第七章);② 售后 SLA 与运维收费标准;③ 具体算法选型与超参寻优(属开发实现细节,由 bot_dev 在任务中确定);④ 第三方组件采购与License合规;⑤ 单厂实施方案文档(由交付阶段产出)。凡涉及上述范围,以关联文档或后续专项文档为准,评审时不在此文档内延展。


1. 设计目标与原则

1.1 产品目标

将已交付的"化工新材料AI平台"(吸附树脂,9个月/76任务/33需求/3万+行代码)平台化、配置化为可复用的通用内核(iAOP-Core),并以"行业模板"形式复制到氯化车间(海绵钛)、化肥、制药等行业,实现"内核一次建设、N 个行业复制"。

关于 N 的范围预期(回应评审):首年目标落地 3–5 个行业模板(氯化/海绵钛、树脂固化、化肥、制药中选3–5个),形成可复制模板库;中长期(2–3年)沉淀 10+ 行业模板,并以伙伴体系对外开放模板共建。

1.2 设计原则

  1. 配置驱动,代码零改:所有行业差异(点位、工艺、知识、超参、布局)外置为模板资产,新行业落地不碰内核代码。
  2. 数据不出厂:本地 70B + 敏感度路由,敏感数据本地闭环,仅脱敏/公开内容可走云端API。
  3. 只读采集,安全优先:边缘网关严格只读,断点续传,不影响生产控制。
  4. 渐进交付:先监控+预警+LLM辅助(低数据门槛),后优化寻优(高数据门槛)。
  5. 可度量价值:每个功能须对应可量化的质量/能耗/效率指标(见 1.4 价值指标映射表,原则已落地到模块验收)。

1.3 关键设计约束(来自已交付基线)

  • 采集性能:P99 ≤ 1.8s,丢失率 ≤ 0.02%(600 点位 1Hz 实测达标)
  • 可用性:≥ 99.8%
  • LLM 安全:敏感度路由准确率 96.5%,DLP 拦截率 100%
  • 本地首 token:≤ 1.5s(70B 本地推理)
  • 硬件基线:4×RTX 5090(推理)+ 应用库服务器;支持华为昇腾 NPU 适配层

1.4 价值指标映射表

将每个模块对应到可量化的客户价值指标,作为模块验收的可度量锚点(与第 10 章验收标准一一挂钩):

模块 可量化客户价值指标 目标基线(首厂验收口径)
5.1 边缘采集网关 数据完整率 / 采集实时性 丢失率 ≤ 0.02%,P99 ≤ 1.8s
5.3 质量预测 质检返工率降低 / 一次合格率提升 关键质量指标预测准确率 ≥ 90%,返工相关判定误报率 ≤ 5%
5.3 工艺优化 吨产品能耗降低 X% 典型工况节能 3–8%(视工艺而定,二期验证)
5.3 异常/杂质预警 非计划停机时长降低 / 异常发现提前量 炉层杂质预警提前 ≥ 30 分钟,误报率 ≤ 8%
5.4 LLM 网关 交接班/报告人工耗时降低 交接班报告生成由 20 分钟降至 ≤ 2 分钟
5.5 配置化驾驶舱 管理决策时效 核心 KPI 查看由日报级提升至分钟级
5.7 模板配置台 新行业交付周期 单行业模板 2–4 周(见第 11 章定义)

2. 用户角色与场景

2.1 角色画像

① 一线操作工 / 值班长 —— 张工(化名)

  • 职位:氯化车间甲班值班长,中专学历,15 年氯化工龄。
  • 痛点:夜班炉层温度/杂质波动时,靠经验判断"是不是要出事",一旦误判导致非计划停车,整班受考核;交接班靠手写记录,信息易遗漏。
  • 日常工具:DCS 操作站、对讲机、纸质交接班记录本、微信群。
  • 技术接受度:低-中,习惯"看画面+听结论",不接受复杂表单;移动端可用但仅用于看数。

② 工艺 / 研发工程师 —— 李工(化名)

  • 职位:工艺技术科工程师,本科化工专业,负责配方调整与异常根因分析。
  • 痛点:配方调整靠小试+历史经验,缺乏"参数-质量"量化模型;异常根因排查跨工序(TiCl₄纯度→海绵钛),数据散在多系统,排查耗时。
  • 日常工具:Excel、LIMS、DCS 趋势、工艺文档 PDF。
  • 技术接受度:高,愿意用 RAG 问答与根因分析,但要求结果可解释、可溯源(要引用依据)。

③ 生产 / 经营管理者 —— 王主任(化名)

  • 职位:生产运行部主任,关注能耗、质量与交付。
  • 痛点:日报周报靠人工汇总,滞后 1 天以上;无法实时掌握"哪些环节在拖能耗/质量后腿"。
  • 日常工具:ERP 报表、微信群通报、会议室大屏。
  • 技术接受度:中,重视"结论+趋势",驾驶舱与移动助手是其主入口。

2.2 典型场景流

  • 场景A(监控):炉层温度异常 → 网关采集 → 异常检测模型触发 → 驾驶舱红色告警 + LLM 生成"原因+处置建议" → 值班长确认。
  • 不做 iAOP 时:张工凭经验盯趋势,靠微信群喊人,平均 20–40 分钟后才发现;无根因解释,处置靠老师傅口传。
  • 场景B(优化):下一批次质量目标下达 → 工艺优化模型给出参数建议 → 李工 review → 下发 DCS → 实际质量反馈回流训练。
  • 不做 iAOP 时:李工翻 Excel 历史批次手工拟合,单次配方评估 0.5–1 天,结论主观、不可复现。
  • 场景C(辅助):交接班 → LLM 汇总本班关键事件/能耗/待办 → 生成交接班报告 → 推送下一班。
  • 不做 iAOP 时:手写记录本 + 口头交代,遗漏率约 15%(历史访谈估计),夜班事故回溯困难。

3. 总体功能架构

分层架构:行业模板层(可复制售卖)构建于 iAOP-Core 通用内核之上;模板配置台是平台化改造的核心新增件。下图将架构表达为三层:行业模板、通用内核、模板配置台。

图 3-1 iAOP 总体功能架构

新增设计点:模板配置台(Template Console)是平台化改造的核心新增件,让行业工程师/实施人员通过 UI 完成模板的导入、配置、校验、发布,无需改码。


4. 核心业务流程(端到端)

下图表达从生产现场采集到 AI 推理、LLM 解释、驾驶舱呈现、最终部署底座的端到端数据流。

图 4-1 核心业务流程(端到端)


5. 功能模块详细设计

每个模块统一含:目的 / 能力 / 配置点 / 验收 / 用户操作流程。标注 ⚠️ 者为平台化改造重点。

5.1 ① 边缘采集网关(Edge Gateway)

  • 目的:安全、稳定地把车间实时数据接入平台,严格只读、不反控。
  • 能力:协议可插拔(OPC UA / S7(西门子) / Modbus / 称重 / 能源表);采集配置由"点位字典CSV"驱动;断点续传、本地缓存、背压保护;采集健康度监控(丢失率、延迟 P99)。
  • 配置点:点位字典、采集周期、缓存上限、网络抖动重试策略。
  • 用户操作流程:实施工程师在配置台导入客户 DCS 点表 CSV → 系统校验设备/测点完整性 → 推送至边缘网关加载 → 网关启动只读采集 → 实时回传健康度(丢失率/P99)至驾驶舱。
  • CSV 字段规范示例:
字段 类型 约束 说明
device_id string 必填,唯一 设备编号,如 CLF-01
point_id string 必填,唯一 测点编号,如 CLF-01.TEMP
name string 必填 中文名,炉温
unit enum 必填 ℃/kPa/m³/h/%/…
dataType enum 必填 float/int/bool
sampleRate int 必填,>0 采集周期(ms)
qualityCode bool 默认 true 是否启用质量码
opcNode string 选填 OPC UA 节点路径
  • 验收:600 点位 1Hz,P99 ≤ 1.8s,丢失率 ≤ 0.02%;零控制指令下发。

5.2 ② 数据总线 + 时序库(Data Bus)

  • 目的:为模型与驾驶舱提供高吞吐、低延迟的数据底座。
  • 架构:Kafka(流式)→ TDengine(时序)+ PostgreSQL(关系/配置/标签)+ MinIO(对象/文件/模型artifact)。
  • 能力:标签体系(设备-测点-批次-质量)、时序聚合、批量写入、特征快照导出供训练。
  • 批量写入指标说明:5k 条/100ms 为单分区 8 并发 producer、3 节点 Kafka 集群、单消息约 512B(含 100 点位快照)、TDengine 2.0 集群环境实测;非极限压测,作为容量规划下限参考。
  • 配置点:保留策略、分区策略、特征窗口定义(由工艺模板指定)。
  • 用户操作流程:数据接入后运维在驾驶舱查看吞吐/积压 → 按需调整保留策略与分区 → 模型任务订阅特征快照。

5.3 ③ AI 模型框架(AI Model Framework)⚠️ 平台化改造重点

  • 目的:把"写死在树脂场景"的 4 类模型重构为可配置模板,由超参包驱动。
  • 四类模型模板(与氯化车间 4 智能体 1:1 映射):
模型模板 类型 输入输出 对应氯化智能体 数据门槛
质量预测 监督回归/分类 入:工艺参数+原料特征;出:关键质量指标预测 ① 质量预测 中(需历史标注)
工艺优化/配方推荐 优化/推荐 入:质量目标+约束;出:参数/配方建议 ② 配方动态优化 高(需闭环反馈)
异常检测/杂质预警 无监督+阈值 入:实时测点;出:异常评分+预警 ③ 炉层杂质预警 低(监控即可)
跨工序关联寻优 关联建模 入:上游(TiCl₄)指标;出:下游(海绵钛)寻优建议 ④ TiCl₄→海绵钛寻优 高
  • 模板化技术路径:
  1. 网络结构策略:采用「固定主干网络 + 可配置超参」为默认模式(如质量预测统一用 GBDT/XGBoost 或轻量 DNN,结构不变);同时提供 Model Recipe 注册表,允许高级行业模板通过声明式 recipe 选择不同网络结构(如 LSTM 用于时序、GNN 用于跨工序),新增结构走插件注册而非改内核。
  2. 特征工程层跨行业差异处理:特征以声明式 FeatureSpec 描述(如 EMA(炉温, 5min)、RollingStd(氯气流量, 10)、RateOfChange(炉压)),由工艺模板定义、框架解释执行——跨行业差异落在 FeatureSpec,不落代码。
  3. 超参包驱动:所有可变量(输入特征清单、算法选型、超参、训练窗口、告警阈值、目标函数)外置为 JSON 超参包(见示例),同一框架切换模板仅改此包。
  • 超参包 JSON 完整示例:
{
"model_id": "quality_predict_ti",
"template": "iAOP-Template-Ti",
"algorithm": "xgboost",
"features": [
{"name": "EMA_CLF_TEMP_5m", "spec": "EMA(CLF-01.TEMP, 5m)"},
{"name": "RollingStd_CL2_10", "spec": "RollingStd(CLF-01.CL2, 10)"}
],
"target": "Ti_purity",
"objective": "reg:squarederror",
"hyperparams": {"max_depth": 6, "eta": 0.1, "n_estimators": 300},
"train_window": "180d",
"alarm_threshold": {"type": "zscore", "k": 3.0},
"drift_check": {"method": "psi", "limit": 0.2}
}
  • 配置点(模型超参包):输入特征清单、算法选型、超参、训练窗口、告警阈值、目标函数。
  • 用户操作流程:行业工程师在配置台选模型类型 → 向导式填写 FeatureSpec 与超参(带默认值与校验)→ 框架按包训练/加载 → 模型运行回写预测/告警。
  • 验收:同一框架切换行业模板后,仅改配置即可运行新模型;新增行业不新增模型代码。

5.4 ④ LLM 网关 + RAG(LLM Gateway)

  • 目的:以自然语言连接人与系统,承载报警解释/交接班/问答/报告。
  • 架构:本地 70B(敏感/核心)+ 云端API(脱敏/通用)混合;安全分级路由(敏感度识别 → 路由);向量库(领域RAG知识库)。
  • 能力:报警智能解释、交接班报告生成、NL工艺查询、配方RAG问答、实验报告生成。
  • Prompt 版本管理 + 幻觉/事实性校验:
  • Prompt 版本管理:所有提示词模板纳入版本库(semver),变更须评审并记录,支持一键回滚;运行时绑定模板版本,确保可复现。
  • 事实性校验:RAG 答案强制引用溯源(返回命中文档片段+来源);对高利害输出(如处置建议)设置信度阈值,低于阈值触发"人工确认";定期用评测集检验事实一致性。
  • 配置点:路由策略、知识库范围(由模板RAG库提供)、提示词模板(版本化)、敏感词/DLP规则。
  • 用户操作流程:用户提问 → 路由判断敏感级 → 本地/云端生成 → RAG 溯源校验 → 返回带引用的答案;异常时转人工。
  • 验收:路由准确率 ≥ 96.5%,DLP 拦截率 100%,本地首 token ≤ 1.5s。

5.5 ⑤ 配置化驾驶舱(Configurable Cockpit)

  • 目的:把已交付 Vue3 驾驶舱抽象为模板化,按"驾驶舱布局"配置渲染。
  • 能力:四状态工艺流程视图、实时趋势、KPI卡片、告警面板、NL查询入口、移动端适配。
  • 布局 JSON Schema 定义:
{
"$schema": "iAOP-cockpit-layout-v1",
"title": "氯化车间驾驶舱",
"theme": "dark",
"widgets": [
{"type": "process_view", "src": "ti_four_state.svg", "x":0,"y":0,"w":6,"h":4},
{"type": "trend", "bind": "CLF-01.TEMP", "x":6,"y":0,"w":6,"h":2},
{"type": "kpi_card", "metric": "Ti_purity", "x":6,"y":2,"w":3,"h":2},
{"type": "alarm_panel", "x":0,"y":4,"w":12,"h":3}
]
}
  • 复杂仪表盘性能:组件 ≥ 30 个或数据点 ≥ 500 时启用虚拟滚动 + 采样降频 + WebWorker 计算,保证首屏 ≤ 2s、交互帧率 ≥ 30fps。
  • 配置点:布局JSON(组件/位置/数据源绑定)、KPI定义、流程图SVG、主题。
  • 用户操作流程:实施在配置台拖拽组件 → 绑定数据源(选点位/指标)→ 预览 → 发布至 Web/移动端。
  • 验收:切换行业模板后,驾驶舱按布局配置自动重排,无需改前端代码。

5.6 ⑥ 部署底座(Deployment Base)

  • 目的:标准化、可移植的交付与运维。
  • 能力:K8s/Helm/ArgoCD;GPU/NPU 推理后端可插拔(5090 / 华为昇腾)。
  • 昇腾适配层接口抽象:定义统一 InferenceBackend 接口(loadModel / infer / health / unload),5090 实现(Triton/ONNX)与昇腾实现(ACL/CANN)均实现该接口;业务代码仅依赖接口,不感知硬件;切换后端 = 改适配层配置,不动业务代码。
  • 配置点:资源配额、推理后端选择、灰度发布策略。
  • 用户操作流程:运维选择后端(5090/昇腾)→ Helm 一键部署内核+模板 → ArgoCD 灰度发布 → 健康巡检。
  • 验收:内核 + 模板一键 Helm 部署;昇腾后端切换仅需适配层,不改业务代码。

5.7 ★ 模板配置台(Template Console,新增)

  • 目的:让实施/行业工程师通过 UI 完成模板全生命周期管理,是"项目变产品"的关键。
  • 能力:导入点位字典CSV并校验;配置 4 类模型超参(向导式,带默认值与校验);上传/管理领域RAG知识库(文档抽取管线);编排驾驶舱布局(拖拽组件、绑定数据源);模板版本管理、校验、发布、回滚。
  • 核心操作流程:

图 5-1 模板配置台核心操作流程

  • 关键页面线框描述:
  • 导入页:上传区 + 校验进度条 + 错误列表(行号+原因),支持"下载错误模板"。
  • 超参配置页:左树(4类模型)/ 右表单(带默认值、单位、范围提示),实时 JSON 预览。
  • 驾驶舱编排页:左侧组件库 / 中间画布拖拽 / 右侧数据源绑定面板。
  • 版本页:版本列表(状态/时间/作者)、diff 视图、回滚按钮。
  • 权限模型:Viewer(只读预览)/ Editor(配置)/ Publisher(发布+回滚)三级 RBAC。
  • 耦合边界:配置台只产出"模板资产包",不直接改内核运行时;发布经校验与灰度,避免配置错误影响生产。
  • 用户操作流程:见上图;实施按"模板开发手册"操作。
  • 验收:一个新人按"模板开发手册"可在 2–4 周内完成一个新行业模板配置("完成"定义见第 10 章)。

6. 行业模板机制(核心创新点)

一个行业模板 = 5 类可交付物,决定 ~90% 落地工作量。

模板组成 内容 来源 在配置台的动作
点位字典 CSV 车间/设备/测点/量纲/采集周期 客户DCS点表 + 工具生成 导入校验
领域RAG知识库 工艺规范/操作手册/文献/标准 客户文档 + 抽取管线 上传/索引
工艺模板 连续/间歇、特征工程、标签定义 行业工程师 + 模板 配置窗口/特征
模型超参包 4类模型输入特征/超参/阈值 基于历史数据标定 向导配置
驾驶舱布局 KPI/趋势/流程图/告警样式 可复用基线 + 微调 拖拽编排

5 类交付物详细说明与示例片段:

  1. 点位字典 CSV:见 5.1 字段规范;示例行:CLF-01, CLF-01.TEMP, 炉温, ℃, float, 1000, true, ns=2;s=CLF.Temp。
  2. 领域 RAG 知识库:示例片段——文档《沸腾氯化炉异常处置SOP》抽取为段落向量,支持"炉温骤升怎么处理?"检索命中第3.2节并引用。
  3. 工艺模板:示例 {processType:"continuous", featureWindow:"shift", qualityTag:"LIMS.Ti_purity", batchKey:"batch_id"}。
  4. 模型超参包:见 5.3 JSON 示例。
  5. 驾驶舱布局:见 5.5 JSON Schema 示例。

价值:内核一次建设,新行业 = "配置 + 数据接入 + 模型标定",预计第 2、3 个行业交付周期较首厂压缩 50%+。

效率提升测算逻辑(P2,回应"50% 来源"质疑):以树脂首厂 76 任务为基线拆解——其中"采集接入(8)/模型标定(14)/驾驶舱(10)/部署(6)/知识库(5)"共 43 项(≈57%)属配置驱动可复用层,新行业经模板化后近乎零重做;"核心算法(9)/跨系统集成(7)/定制开发(6)"共 22 项(≈29%)需轻量调整;仅"现场差异适配(11)"(≈14%)需专项实施。新行业有效工作量 ≈ 43%(模板复用)+ 部分调整,叠加并行化,故周期压缩 50%+;"~90% 落地工作量由模板决定"指配置驱动层占首厂总工作量约 90%(含实施与标定),而非指新行业零工作量。测算方法见附录 A。


7. 首模板详细设计:iAOP-Template-Ti(氯化车间/海绵钛,一期)

7.1 范围与映射

氯化车间 4 个智能体 直接映射 内核 4 类模型 + LLM 网关,无新算法研发。

氯化智能体 内核模型/能力 一期优先级
① 质量预测 质量预测模板 一期(优先,见效快)
③ 炉层杂质预警 异常检测模板 一期(优先,数据门槛低)
② 配方动态优化 工艺优化模板 二期
④ TiCl₄→海绵钛寻优 跨工序关联模板 二期

7.2 点位字典范围(一期)

  • 沸腾氯化炉:炉温、炉压、氯气流量、CO/CO₂、炉层状态。
  • 精制/还原工序:TiCl₄ 纯度、杂质含量、还原温度、真空度。
  • 能源/公用工程:电、蒸汽、循环水。 (具体点表待客户 DCS 点表导入后由配置台校验,缺省策略见 13 章。)

7.3 领域RAG知识库(一期)

  • 沸腾氯化工艺规范、操作手册、异常处置 SOP、氯/钛相关国标、历史事故案例。

7.4 工艺模板(一期)

  • 连续炉式工艺;特征窗口按班/批次;质量标签对接 LIMS/人工录入。

7.5 驾驶舱布局(一期)

  • 沸腾氯化炉四状态工艺流程视图、炉温/炉压实时趋势、炉层杂质告警面板、质量预测卡片、NL查询入口、移动端交接班摘要。

7.6 见效策略(降首期风险)

一期优先交付 ①质量预测 + ③炉层杂质预警(监控+预警类,数据门槛低、见效快),②配方优化 + ④跨工序寻优放二期,避免首期因标注数据不足卡顿。

7.7 一期交付物清单与验收节点

  • 功能项:①质量预测模型(≥90% 准确率验收线)、③炉层杂质预警(提前≥30min)、LLM 报警解释/交接班/ NL查询。
  • 数据接入范围:沸腾氯化炉 + 精制还原关键测点(≤200 点首期)。
  • 模型训练数据量要求:质量预测需 ≥ 6 个月标注(LIMS 对接后补标);预警类可先以阈值+无监督上线,3 个月后转监督。
  • 验收节点:M4 集成测试(内部)→ M5 客户 UAT → 上线 → 1 个月质保观察。

8. 数据模型与接口概要

8.1 核心数据实体

实体 关键字段(类型/约束) 关系
Device/Point id:string(PK), device:string, unit:enum, sampleRate:int>0, qualityCode:bool 属于 Template
Tag id:string(PK), dims:json(设备/测点/批次/质量) 多对多绑定 Point
ModelRun id:uuid(PK), templateId:string(FK), type:enum, input:json, output:json, ts:datetime 属于 Template,引用 Point
Alert id:uuid(PK), source:string, severity:enum(低/中/高), llmExplain:text, status:enum(待处理/已确认/已闭环) 由 ModelRun 产生
Template id:string(PK), fiveElements:json, version:semver, status:enum(草稿/发布/归档) 含 5 要素引用

图 8-1 核心数据实体关系(ER)

8.2 接口详细设计

认证鉴权:① 服务间 mTLS(边缘网关↔总线);② 配置台 ↔ 内核 用 OAuth2 Client Credentials + API Key 双因子;③ 前端用户登录走企业 IAM/OAuth2(支持 SSO),RBAC 三级(Viewer/Editor/Publisher);④ 所有写操作审计落日志。

核心 API 简述(Swagger 风格):

  • POST /api/v1/templates — 创建模板(body: 5 要素引用);返回 templateId。错误码:401 未授权 / 403 无发布权限 / 422 校验失败。
  • GET /api/v1/templates/{id}/validate — 校验模板(点位字典/超参/布局);返回校验报告。
  • POST /api/v1/models/{templateId}/run — 触发模型运行(body: 输入特征快照);返回 ModelRun。
  • GET /api/v1/alerts?severity=&status= — 告警查询(分页);返回 Alert 列表含 llmExplain。
  • POST /api/v1/llm/ask — NL 查询/报告生成(body: query, context);返回带 RAG 引用的答案。
  • 错误码统一:400 参数错误 / 401 未认证 / 403 权限不足 / 404 不存在 / 422 业务校验失败 / 429 限流 / 500 内部错误。

9. 非功能性需求(NFR)

本章规定 iAOP 平台与首模板在性能、可靠性、安全、可扩展、可维护、兼容性方面的底线指标。所有指标均来自已交付化工AI平台的真实基线或工业现场的通用要求,作为验收测试的输入。

类别 指标 / 要求 来源 / 约束
性能 采集 P99 ≤ 1.8s;批量 5k/100ms(见 5.2 条件);驾驶舱首屏 ≤ 2s、交互 ≥ 30fps;模型推理吞吐 ≥ 50 QPS(70B 本地);并发用户 ≥ 50(Web)+ 200(移动端只读) 已交付基线 + 设计目标
可靠性 可用性 ≥ 99.8%;丢失率 ≤ 0.02%;模型服务故障自动降级(告警不依赖模型);断点续传 终验报告
安全-网络 边缘网关严格只读、不反控;传输 mTLS;等保 2.0 三级路线(见 12 章) 安全合规验收
安全-数据 敏感度路由 96.5%、DLP 100%;敏感数据本地闭环;审计日志全量 安全合规验收
安全-功能安全 关键告警/建议不直接联动执行机构;高利害输出人工确认;参考 IEC 61508 概念,AI 输出作为"决策辅助"而非"安全控制" 工业功能安全考量
可扩展 新行业仅配置不改码;推理后端(5090/昇腾)可插拔(见 5.6) 平台化设计原则
可维护 统一日志规范(结构化 JSON);Prometheus+Grafana 监控告警;故障排查 SOP 文档;配置台版本可追溯 部署底座
兼容性 浏览器 Chrome/Edge 最新两版;移动端 iOS14+/Android 10+;DCS 支持 OPC UA/Modbus/西门子S7;PLC 主流品牌 现场多样性

10. 验收标准(Definition of Done)

内核(iAOP-Core)

  • 6 大模块达成第 9 章 NFR 指标(量化:P99≤1.8s / 丢失率≤0.02% / 可用性≥99.8% / 路由≥96.5% / 首屏≤2s)。
  • 模块③⑤完成配置化重构,切换模板零改码(演示:换 Template-Ti ↔ 树脂模板,仅改配置)。
  • 模板配置台可用,新人 2–4 周完成新行业模板("完成"= 生产环境上线 Meta,非仅 Demo)。

首模板(iAOP-Template-Ti 一期)

  • ①质量预测上线,准确率 ≥ 90%,误报率 ≤ 5%。
  • ③炉层杂质预警上线,提前 ≥ 30 分钟,误报率 ≤ 8%。
  • LLM 报警解释/交接班报告/ NL查询可用,路由准确率 ≥ 96.5%,交接班报告生成 ≤ 2 分钟。
  • 驾驶舱按 Ti 布局渲染,移动端交接班摘要可用。
  • 客户 DCS 点位字典导入校验通过,采集达标(P99≤1.8s / 丢失率≤0.02%)。

验收流程:自测(bot_dev)→ 内部评审(bot_pm+bot_po)→ 客户 UAT(王主任/李工确认)→ 上线 → 1 个月质保观察期 → 闭环。


11. 里程碑与排期

本节以月为颗粒度列出从启动到客户验收的 5 个里程碑。每一行包含时间、工期、负责人、关键交付物和依赖/缓冲,便于 PM 直接拆任务、跟踪风险。

假设启动于 2026-09;关键依赖与风险缓冲见第 12 章,依赖失败时的备选方案见第 13 章。

里程碑 时间 工期(周) 负责人 关键交付 依赖 / 风险缓冲
M1 需求冻结 2026-09 3 bot_po + 王主任(客户) 氯化车间 DCS 点表/LIMS 接口确认、PRD v1.x 定稿 依赖客户数据准备清单提前 2 周发出
M2 内核改造 2026-09 ~ 10 7 bot_pm + bot_dev1 模块③⑤配置化重构、模板配置台原型可用、iAOP-Core 内部发版 风险:模型框架模板化难度,预留 2 周缓冲
M3 首模板配置 2026-10 ~ 12 10 bot_pm + 行业工程师 Template-Ti 4 智能体映射(①③优先上线)、内部验收通过 风险:标注数据不足,以无监督/阈值模型先行
M4 集成测试 2026-12 3 bot_dev2 + QA 端到端联调、NFR 压测(P99/丢失率/可用性)达标 依赖测试环境就绪;预留 1 周缓冲
M5 客户验收 2027-01 4 bot_pm + 客户成功 UAT、生产上线、1 个月质保观察、闭环交付 风险:客户配合度,需 M1 明确责任人与排期

月级甘特简述:

  • 2026-09:需求冻结 + 内核改造启动;发出数据准备清单。
  • 2026-10:内核改造收尾,首模板进入模型配置;树脂模板封装并行启动。
  • 2026-11:Ti 模板 ①质量预测 + ③炉层杂质预警联调;RAG 知识库接入。
  • 2026-12:集成测试 + NFR 压测;缺陷修复与回归。
  • 2027-01:客户 UAT + 上线 + 质保观察。

并行线:树脂模板封装(M2 起并行,固化已交付项目);复制推广(M5 后启动化肥/制药,年内 3–5 厂)。


12. 风险与缓解

平台化/配置化路径存在 5 项关键风险:技术可行性、数据依赖、硬件成本、零代码边界、安全合规。每一项都给出了等级、具体说明和缓解措施,作为项目 Kick-off 与阶段评审的必检项。

风险 等级 说明与缓解
模型模板化技术风险 P0-高 不同行业数据分布差异可能超出"超参配置"覆盖范围。缓解:明确模板化边界——默认超参配置 + Recipe 插件扩展点(见 5.3),超限场景走自定义模型插件,不阻塞内核。
数据依赖风险 P0-高 DCS 点表、LIMS 接口、标注数据均依赖客户。缓解:M1 前 2 周发数据准备清单;准备缺省通用点位集先行演示(见 13 章);标注数据不足时①③以无监督先行。
硬件成本接受度 P1-中 4×RTX 5090 + 服务器对客户是较大 Capex。缓解:提供云端 SaaS 版或租赁方案;明确 ROI 计算模型(见附录 B)。
"零代码"承诺边界 P1-中 配置驱动理想状态与实际落地的差距。缓解:文档中明确"零代码"适用范围(配置驱动层),定制度高场景走插件/实施,不夸大。
安全合规风险 P1-中 工业控制系统网络安全(等保 2.0)、功能安全。缓解:等保三级合规路线图;功能安全 IEC 61508 概念落地(AI 仅作决策辅助,见 9 章)。

13. 假设与外部依赖

集中列出所有外部依赖与不确定性,避免范围蔓延(回应 7 章多处"待确认")。

依赖项 说明 风险缓解
客户 DCS 点表 决定点位字典与采集范围 提前 2 周发清单;缺省通用点位集先行演示
LIMS / 质量系统接口 质量标签来源 一期可先用人工录入过渡
客户标注数据 监督模型训练所需 ①③先无监督/阈值上线,3 月后转监督
网络与机房环境 边缘网关部署条件 现场勘测前置
客户配合度 UAT/上线节奏 M1 明确里程碑责任

依赖-备选方案对照矩阵:当某项外部依赖延迟或失败时,启用对应备选方案,避免项目停摆。

依赖项 失败场景 备选方案 触发条件 影响范围
客户 DCS 点表 点表延迟或字段不完整 启用缺省通用点位集先行演示;仅接入已确认点位 M1 截止日仍未收到完整点表 ①③可先行,②④延后
LIMS/质量系统接口 无标准接口或审批周期长 一期改用人工录入/批量导入质量标签;二期补接口 M1 接口方案未定 仅影响监督模型训练,监控类模型不受影响
客户标注数据 历史标注不足或质量差 ①③先用无监督/阈值模型上线;标注积累后再转监督 M3 启动前标注数据 < 1000 条 模型准确率天花板暂降,但不阻塞上线
网络/机房环境 无法部署本地 GPU 服务器 提供云端 SaaS 演示环境或租赁方案 现场勘测不通过 首厂上线延迟,但不阻塞内核研发
客户配合度(UAT) 客户关键责任人缺席 M1 即签订 UAT 排期与责任矩阵;必要时按内部验收标准先行上线 M5 前 2 周客户未确认 UAT 时间 质保观察期可后延
昇腾/NPU 硬件到位延迟 客户采购流程长 默认 RTX 5090 方案先行;昇腾适配层在 M2 已完成抽象 部署前硬件未到位 不影响业务代码,切换后端 = 改配置

缺省数据策略:若客户点表延迟,启用默认通用点位集(代表典型氯化工况)完成演示与框架验证,点表到位后无缝切换——保证项目不因数据延迟停摆。


14. 成本分析附录

首厂一次性投入(真实测算,含硬件):约 99.66 万元(其中硬件约 33.66 万:4×RTX 5090 + 服务器 + 边缘网关);软件实施与集成约 66 万。 首厂年运营:约 10.5 万元(云/电/运维/许可)。 内核沉淀后边际成本:后续厂转为"内核授权 30–45 万 + 行业模板实施 15–25 万 + 年订阅 8–12 万/厂",软件从"从零开发"转为"授权",边际成本大幅下降。 ROI 逻辑:以吨产品能耗降 3–8%、质检返工降、非计划停机降折算年化收益,典型中型厂回收期 12–24 个月(见《产品策划方案》第七章)。


15. 附录

附录 A:效率提升测算逻辑(对应 6 章)

以树脂首厂 76 任务为基线,按"配置驱动可复用 / 轻量调整 / 专项实施"三层拆解(详见 6 章正文),新行业有效工作量 ≈ 43%(复用)+ 部分调整,叠加并行化,周期压缩 50%+;"~90% 工作量由模板决定"指配置驱动层占首厂总工作量约 90%。本测算为方法论示意,具体以交付复盘校准。

附录 B:缩写表与参考资料

  • 缩写:DCS 分布式控制系统 / PLC 可编程逻辑控制器 / LIMS 实验室信息管理系统 / RAG 检索增强生成 / DLP 数据防泄漏 / ER 实体关系 / MVP 最小可行产品 / UAT 用户验收测试 / SLA 服务等级协议 / SOP 标准作业程序 / NFR 非功能性需求 / Meta 上线里程碑。
  • 参考资料:《化工新材料AI平台技术方案 V2.0》《M1-M2 阶段评审》《终验报告》《DeepSeek 大模型应用预算方案》《项目对比与通用产品可行性分析》《通用工业AI优化平台_产品策划方案》《市场调研复盘》《工信部"人工智能+制造"行动方案(2026-2028)》。

16. 术语表

  • iAOP:云美工业AI优化平台(YunMei Industrial AI Optimization Platform)。
  • iAOP-Core:通用内核(6 模块 + 配置台)。
  • iAOP-Template-{行业}:行业模板(5 要素交付物)。
  • 点位字典:描述采集对象的 CSV 配置。
  • 敏感度路由:LLM 网关按数据敏感度决定本地/云端处理。
  • 沸腾氯化:高端氯化法钛白粉核心工艺,氯化车间AI 主攻对象。
  • Model Recipe:声明式模型结构注册项,允许高级模板选择不同网络结构而不改内核。
  • FeatureSpec:声明式特征定义,由工艺模板描述、框架解释执行。

附:本 PRD 技术参数均来自已交付的化工新材料AI平台真实资料(技术方案V2.0、M1-M2评审、终验报告、预算方案);氯化车间部分基于对比分析的外推,待需求细化与现场 DCS 点表确认后更新。v1.1 已据《PRD 评审意见》补全 P0/P1/P2 修订项。本文档为设计基线,开发前由 bot_pm 拆解为可执行任务。