Files
iAOP/docs/产品设计文档_iAOP.md
T

457 lines
36 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 云美工业AI优化平台(YunMei iAOP)—— 产品设计文档(PRD)
> 版本:v1.1(PRD,已据评审意见修订) | 编制:bot_po(产品审核) | 日期:2026-08-04
> 关联文档:《项目对比与通用产品可行性分析》《通用工业AI优化平台_产品策划方案》《市场调研复盘》
> 密级:商业机密 | 状态:待正式评审
---
## 0. 文档说明与修订记录
| 版本 | 日期 | 修订人 | 说明 |
|------|------|--------|------|
| v1.0 | 2026-08-04 | bot_po | 首版 PRD,基于已交付化工AI平台(吸附树脂)沉淀与氯化车间AI需求外推 |
| v1.1 | 2026-08-04 | bot_po | 据《PRD 评审意见》修订:补全角色画像/5类模板交付物/模型框架模板化技术路径/NFR/里程碑排期(P0);新增风险与缓解、价值指标映射、假设与依赖、未覆盖范围、成本附录(P1/P2);架构/流程图改用 Mermaid;补模块级细节 |
| v1.2 | 2026-08-04 | bot_po | 据《v1.1 二次评审意见》修订:① NFR/风险/里程碑各加一段正文导语,确保纯文本抽取可读;② 里程碑表增加负责人与工期列;③ 第13章补充依赖-备选方案矩阵;④ 4 处 Mermaid 图渲染为 PNG 并嵌入文档;⑤ 删除易引发误解的已完成标注,改为中性章节编号 |
**阅读对象**:bot_pm(任务拆分)、bot_dev1/dev2(开发实现)、售前/客户成功、行业工程师。
**本文档定位**:本文档是《产品策划方案》的**设计层下钻**——策划方案回答"为什么做、卖给谁、怎么收费",本文档回答"产品具体由哪些模块构成、每个模块怎么设计、首模板如何落地、按什么标准验收"。
**本文档未覆盖范围**:① 对外商务定价与合同条款(见《产品策划方案》第七章);② 售后 SLA 与运维收费标准;③ 具体算法选型与超参寻优(属开发实现细节,由 bot_dev 在任务中确定);④ 第三方组件采购与License合规;⑤ 单厂实施方案文档(由交付阶段产出)。凡涉及上述范围,以关联文档或后续专项文档为准,评审时不在此文档内延展。
---
## 1. 设计目标与原则
### 1.1 产品目标
将已交付的"化工新材料AI平台"(吸附树脂,9个月/76任务/33需求/3万+行代码)**平台化、配置化**为可复用的通用内核(iAOP-Core),并以"行业模板"形式复制到氯化车间(海绵钛)、化肥、制药等行业,实现"内核一次建设、N 个行业复制"。
> **关于 N 的范围预期(回应评审)**:首年目标落地 **3–5 个行业模板**(氯化/海绵钛、树脂固化、化肥、制药中选3–5个),形成可复制模板库;中长期(2–3年)沉淀 **10+ 行业模板**,并以伙伴体系对外开放模板共建。
### 1.2 设计原则
1. **配置驱动,代码零改**:所有行业差异(点位、工艺、知识、超参、布局)外置为模板资产,新行业落地不碰内核代码。
2. **数据不出厂**:本地 70B + 敏感度路由,敏感数据本地闭环,仅脱敏/公开内容可走云端API。
3. **只读采集,安全优先**:边缘网关严格只读,断点续传,不影响生产控制。
4. **渐进交付**:先监控+预警+LLM辅助(低数据门槛),后优化寻优(高数据门槛)。
5. **可度量价值**:每个功能须对应可量化的质量/能耗/效率指标(见 1.4 价值指标映射表,原则已落地到模块验收)。
### 1.3 关键设计约束(来自已交付基线)
- 采集性能:P99 ≤ 1.8s,丢失率 ≤ 0.02%(600 点位 1Hz 实测达标)
- 可用性:≥ 99.8%
- LLM 安全:敏感度路由准确率 96.5%,DLP 拦截率 100%
- 本地首 token:≤ 1.5s(70B 本地推理)
- 硬件基线:4×RTX 5090(推理)+ 应用库服务器;支持华为昇腾 NPU 适配层
### 1.4 价值指标映射表
将每个模块对应到可量化的客户价值指标,作为模块验收的可度量锚点(与第 10 章验收标准一一挂钩):
| 模块 | 可量化客户价值指标 | 目标基线(首厂验收口径) |
|------|------------------|----------------------|
| 5.1 边缘采集网关 | 数据完整率 / 采集实时性 | 丢失率 ≤ 0.02%,P99 ≤ 1.8s |
| 5.3 质量预测 | 质检返工率降低 / 一次合格率提升 | 关键质量指标预测准确率 ≥ 90%,返工相关判定误报率 ≤ 5% |
| 5.3 工艺优化 | 吨产品能耗降低 X% | 典型工况节能 3–8%(视工艺而定,二期验证) |
| 5.3 异常/杂质预警 | 非计划停机时长降低 / 异常发现提前量 | 炉层杂质预警提前 ≥ 30 分钟,误报率 ≤ 8% |
| 5.4 LLM 网关 | 交接班/报告人工耗时降低 | 交接班报告生成由 20 分钟降至 ≤ 2 分钟 |
| 5.5 配置化驾驶舱 | 管理决策时效 | 核心 KPI 查看由日报级提升至分钟级 |
| 5.7 模板配置台 | 新行业交付周期 | 单行业模板 2–4 周(见第 11 章定义) |
---
## 2. 用户角色与场景
### 2.1 角色画像
**① 一线操作工 / 值班长 —— 张工(化名)**
- **职位**:氯化车间甲班值班长,中专学历,15 年氯化工龄。
- **痛点**:夜班炉层温度/杂质波动时,靠经验判断"是不是要出事",一旦误判导致非计划停车,整班受考核;交接班靠手写记录,信息易遗漏。
- **日常工具**:DCS 操作站、对讲机、纸质交接班记录本、微信群。
- **技术接受度**:低-中,习惯"看画面+听结论",不接受复杂表单;移动端可用但仅用于看数。
**② 工艺 / 研发工程师 —— 李工(化名)**
- **职位**:工艺技术科工程师,本科化工专业,负责配方调整与异常根因分析。
- **痛点**:配方调整靠小试+历史经验,缺乏"参数-质量"量化模型;异常根因排查跨工序(TiCl₄纯度→海绵钛),数据散在多系统,排查耗时。
- **日常工具**:Excel、LIMS、DCS 趋势、工艺文档 PDF。
- **技术接受度**:高,愿意用 RAG 问答与根因分析,但要求结果可解释、可溯源(要引用依据)。
**③ 生产 / 经营管理者 —— 王主任(化名)**
- **职位**:生产运行部主任,关注能耗、质量与交付。
- **痛点**:日报周报靠人工汇总,滞后 1 天以上;无法实时掌握"哪些环节在拖能耗/质量后腿"。
- **日常工具**:ERP 报表、微信群通报、会议室大屏。
- **技术接受度**:中,重视"结论+趋势",驾驶舱与移动助手是其主入口。
### 2.2 典型场景流
- **场景A(监控)**:炉层温度异常 → 网关采集 → 异常检测模型触发 → 驾驶舱红色告警 + LLM 生成"原因+处置建议" → 值班长确认。
- *不做 iAOP 时*:张工凭经验盯趋势,靠微信群喊人,平均 20–40 分钟后才发现;无根因解释,处置靠老师傅口传。
- **场景B(优化)**:下一批次质量目标下达 → 工艺优化模型给出参数建议 → 李工 review → 下发 DCS → 实际质量反馈回流训练。
- *不做 iAOP 时*:李工翻 Excel 历史批次手工拟合,单次配方评估 0.5–1 天,结论主观、不可复现。
- **场景C(辅助)**:交接班 → LLM 汇总本班关键事件/能耗/待办 → 生成交接班报告 → 推送下一班。
- *不做 iAOP 时*:手写记录本 + 口头交代,遗漏率约 15%(历史访谈估计),夜班事故回溯困难。
---
## 3. 总体功能架构
**分层架构**:行业模板层(可复制售卖)构建于 iAOP-Core 通用内核之上;模板配置台是平台化改造的核心新增件。下图将架构表达为三层:行业模板、通用内核、模板配置台。
![图 3-1 iAOP 总体功能架构](assets/diag_arch.png)
**新增设计点**:模板配置台(Template Console)是平台化改造的核心新增件,让行业工程师/实施人员通过 UI 完成模板的导入、配置、校验、发布,无需改码。
---
## 4. 核心业务流程(端到端)
下图表达从生产现场采集到 AI 推理、LLM 解释、驾驶舱呈现、最终部署底座的端到端数据流。
![图 4-1 核心业务流程(端到端)](assets/diag_flow.png)
---
## 5. 功能模块详细设计
> 每个模块统一含:目的 / 能力 / 配置点 / 验收 / **用户操作流程**。标注 ⚠️ 者为平台化改造重点。
### 5.1 ① 边缘采集网关(Edge Gateway)
- **目的**:安全、稳定地把车间实时数据接入平台,严格只读、不反控。
- **能力**:协议可插拔(OPC UA / S7(西门子) / Modbus / 称重 / 能源表);采集配置由"点位字典CSV"驱动;断点续传、本地缓存、背压保护;采集健康度监控(丢失率、延迟 P99)。
- **配置点**:点位字典、采集周期、缓存上限、网络抖动重试策略。
- **用户操作流程**:实施工程师在配置台导入客户 DCS 点表 CSV → 系统校验设备/测点完整性 → 推送至边缘网关加载 → 网关启动只读采集 → 实时回传健康度(丢失率/P99)至驾驶舱。
- **CSV 字段规范示例**:
| 字段 | 类型 | 约束 | 说明 |
|------|------|------|------|
| device_id | string | 必填,唯一 | 设备编号,如 CLF-01 |
| point_id | string | 必填,唯一 | 测点编号,如 CLF-01.TEMP |
| name | string | 必填 | 中文名,炉温 |
| unit | enum | 必填 | ℃/kPa/m³/h/%/… |
| dataType | enum | 必填 | float/int/bool |
| sampleRate | int | 必填,>0 | 采集周期(ms) |
| qualityCode | bool | 默认 true | 是否启用质量码 |
| opcNode | string | 选填 | OPC UA 节点路径 |
- **验收**:600 点位 1Hz,P99 ≤ 1.8s,丢失率 ≤ 0.02%;零控制指令下发。
### 5.2 ② 数据总线 + 时序库(Data Bus)
- **目的**:为模型与驾驶舱提供高吞吐、低延迟的数据底座。
- **架构**:Kafka(流式)→ TDengine(时序)+ PostgreSQL(关系/配置/标签)+ MinIO(对象/文件/模型artifact)。
- **能力**:标签体系(设备-测点-批次-质量)、时序聚合、批量写入、特征快照导出供训练。
- **批量写入指标说明**:**5k 条/100ms** 为单分区 8 并发 producer、3 节点 Kafka 集群、单消息约 512B(含 100 点位快照)、TDengine 2.0 集群环境实测;非极限压测,作为容量规划下限参考。
- **配置点**:保留策略、分区策略、特征窗口定义(由工艺模板指定)。
- **用户操作流程**:数据接入后运维在驾驶舱查看吞吐/积压 → 按需调整保留策略与分区 → 模型任务订阅特征快照。
### 5.3 ③ AI 模型框架(AI Model Framework)⚠️ 平台化改造重点
- **目的**:把"写死在树脂场景"的 4 类模型重构为**可配置模板**,由超参包驱动。
- **四类模型模板**(与氯化车间 4 智能体 1:1 映射):
| 模型模板 | 类型 | 输入输出 | 对应氯化智能体 | 数据门槛 |
|---------|------|---------|--------------|---------|
| 质量预测 | 监督回归/分类 | 入:工艺参数+原料特征;出:关键质量指标预测 | ① 质量预测 | 中(需历史标注) |
| 工艺优化/配方推荐 | 优化/推荐 | 入:质量目标+约束;出:参数/配方建议 | ② 配方动态优化 | 高(需闭环反馈) |
| 异常检测/杂质预警 | 无监督+阈值 | 入:实时测点;出:异常评分+预警 | ③ 炉层杂质预警 | 低(监控即可) |
| 跨工序关联寻优 | 关联建模 | 入:上游(TiCl₄)指标;出:下游(海绵钛)寻优建议 | ④ TiCl₄→海绵钛寻优 | 高 |
- **模板化技术路径**:
1. **网络结构策略**:采用「固定主干网络 + 可配置超参」为默认模式(如质量预测统一用 GBDT/XGBoost 或轻量 DNN,结构不变);同时提供 **Model Recipe 注册表**,允许高级行业模板通过声明式 recipe 选择不同网络结构(如 LSTM 用于时序、GNN 用于跨工序),**新增结构走插件注册而非改内核**。
2. **特征工程层跨行业差异处理**:特征以**声明式 FeatureSpec** 描述(如 `EMA(炉温, 5min)`、`RollingStd(氯气流量, 10)`、`RateOfChange(炉压)`),由工艺模板定义、框架解释执行——跨行业差异落在 FeatureSpec,不落代码。
3. **超参包驱动**:所有可变量(输入特征清单、算法选型、超参、训练窗口、告警阈值、目标函数)外置为 JSON 超参包(见示例),同一框架切换模板仅改此包。
- **超参包 JSON 完整示例**:
```json
{
"model_id": "quality_predict_ti",
"template": "iAOP-Template-Ti",
"algorithm": "xgboost",
"features": [
{"name": "EMA_CLF_TEMP_5m", "spec": "EMA(CLF-01.TEMP, 5m)"},
{"name": "RollingStd_CL2_10", "spec": "RollingStd(CLF-01.CL2, 10)"}
],
"target": "Ti_purity",
"objective": "reg:squarederror",
"hyperparams": {"max_depth": 6, "eta": 0.1, "n_estimators": 300},
"train_window": "180d",
"alarm_threshold": {"type": "zscore", "k": 3.0},
"drift_check": {"method": "psi", "limit": 0.2}
}
```
- **配置点(模型超参包)**:输入特征清单、算法选型、超参、训练窗口、告警阈值、目标函数。
- **用户操作流程**:行业工程师在配置台选模型类型 → 向导式填写 FeatureSpec 与超参(带默认值与校验)→ 框架按包训练/加载 → 模型运行回写预测/告警。
- **验收**:同一框架切换行业模板后,仅改配置即可运行新模型;新增行业不新增模型代码。
### 5.4 ④ LLM 网关 + RAG(LLM Gateway)
- **目的**:以自然语言连接人与系统,承载报警解释/交接班/问答/报告。
- **架构**:本地 70B(敏感/核心)+ 云端API(脱敏/通用)**混合**;安全分级路由(敏感度识别 → 路由);向量库(领域RAG知识库)。
- **能力**:报警智能解释、交接班报告生成、NL工艺查询、配方RAG问答、实验报告生成。
- **Prompt 版本管理 + 幻觉/事实性校验**:
- **Prompt 版本管理**:所有提示词模板纳入版本库(semver),变更须评审并记录,支持一键回滚;运行时绑定模板版本,确保可复现。
- **事实性校验**:RAG 答案强制**引用溯源**(返回命中文档片段+来源);对高利害输出(如处置建议)设置信度阈值,低于阈值触发"人工确认";定期用评测集检验事实一致性。
- **配置点**:路由策略、知识库范围(由模板RAG库提供)、提示词模板(版本化)、敏感词/DLP规则。
- **用户操作流程**:用户提问 → 路由判断敏感级 → 本地/云端生成 → RAG 溯源校验 → 返回带引用的答案;异常时转人工。
- **验收**:路由准确率 ≥ 96.5%,DLP 拦截率 100%,本地首 token ≤ 1.5s。
### 5.5 ⑤ 配置化驾驶舱(Configurable Cockpit)
- **目的**:把已交付 Vue3 驾驶舱抽象为模板化,按"驾驶舱布局"配置渲染。
- **能力**:四状态工艺流程视图、实时趋势、KPI卡片、告警面板、NL查询入口、移动端适配。
- **布局 JSON Schema 定义**:
```json
{
"$schema": "iAOP-cockpit-layout-v1",
"title": "氯化车间驾驶舱",
"theme": "dark",
"widgets": [
{"type": "process_view", "src": "ti_four_state.svg", "x":0,"y":0,"w":6,"h":4},
{"type": "trend", "bind": "CLF-01.TEMP", "x":6,"y":0,"w":6,"h":2},
{"type": "kpi_card", "metric": "Ti_purity", "x":6,"y":2,"w":3,"h":2},
{"type": "alarm_panel", "x":0,"y":4,"w":12,"h":3}
]
}
```
- **复杂仪表盘性能**:组件 ≥ 30 个或数据点 ≥ 500 时启用**虚拟滚动 + 采样降频 + WebWorker 计算**,保证首屏 ≤ 2s、交互帧率 ≥ 30fps。
- **配置点**:布局JSON(组件/位置/数据源绑定)、KPI定义、流程图SVG、主题。
- **用户操作流程**:实施在配置台拖拽组件 → 绑定数据源(选点位/指标)→ 预览 → 发布至 Web/移动端。
- **验收**:切换行业模板后,驾驶舱按布局配置自动重排,无需改前端代码。
### 5.6 ⑥ 部署底座(Deployment Base)
- **目的**:标准化、可移植的交付与运维。
- **能力**:K8s/Helm/ArgoCD;GPU/NPU 推理后端可插拔(5090 / 华为昇腾)。
- **昇腾适配层接口抽象**:定义统一 `InferenceBackend` 接口(`loadModel / infer / health / unload`),5090 实现(Triton/ONNX)与昇腾实现(ACL/CANN)均实现该接口;**业务代码仅依赖接口,不感知硬件**;切换后端 = 改适配层配置,不动业务代码。
- **配置点**:资源配额、推理后端选择、灰度发布策略。
- **用户操作流程**:运维选择后端(5090/昇腾)→ Helm 一键部署内核+模板 → ArgoCD 灰度发布 → 健康巡检。
- **验收**:内核 + 模板一键 Helm 部署;昇腾后端切换仅需适配层,不改业务代码。
### 5.7 ★ 模板配置台(Template Console,新增)
- **目的**:让实施/行业工程师通过 UI 完成模板全生命周期管理,是"项目变产品"的关键。
- **能力**:导入点位字典CSV并校验;配置 4 类模型超参(向导式,带默认值与校验);上传/管理领域RAG知识库(文档抽取管线);编排驾驶舱布局(拖拽组件、绑定数据源);模板版本管理、校验、发布、回滚。
- **核心操作流程**:
![图 5-1 模板配置台核心操作流程](assets/diag_console.png)
- **关键页面线框描述**:
- *导入页*:上传区 + 校验进度条 + 错误列表(行号+原因),支持"下载错误模板"。
- *超参配置页*:左树(4类模型)/ 右表单(带默认值、单位、范围提示),实时 JSON 预览。
- *驾驶舱编排页*:左侧组件库 / 中间画布拖拽 / 右侧数据源绑定面板。
- *版本页*:版本列表(状态/时间/作者)、diff 视图、回滚按钮。
- **权限模型**:Viewer(只读预览)/ Editor(配置)/ Publisher(发布+回滚)三级 RBAC。
- **耦合边界**:配置台只产出"模板资产包",不直接改内核运行时;发布经校验与灰度,避免配置错误影响生产。
- **用户操作流程**:见上图;实施按"模板开发手册"操作。
- **验收**:一个新人按"模板开发手册"可在 2–4 周内完成一个新行业模板配置("完成"定义见第 10 章)。
---
## 6. 行业模板机制(核心创新点)
**一个行业模板 = 5 类可交付物,决定 ~90% 落地工作量。**
| 模板组成 | 内容 | 来源 | 在配置台的动作 |
|---------|------|------|--------------|
| 点位字典 CSV | 车间/设备/测点/量纲/采集周期 | 客户DCS点表 + 工具生成 | 导入校验 |
| 领域RAG知识库 | 工艺规范/操作手册/文献/标准 | 客户文档 + 抽取管线 | 上传/索引 |
| 工艺模板 | 连续/间歇、特征工程、标签定义 | 行业工程师 + 模板 | 配置窗口/特征 |
| 模型超参包 | 4类模型输入特征/超参/阈值 | 基于历史数据标定 | 向导配置 |
| 驾驶舱布局 | KPI/趋势/流程图/告警样式 | 可复用基线 + 微调 | 拖拽编排 |
**5 类交付物详细说明与示例片段**:
1. **点位字典 CSV**:见 5.1 字段规范;示例行:`CLF-01, CLF-01.TEMP, 炉温, ℃, float, 1000, true, ns=2;s=CLF.Temp`。
2. **领域 RAG 知识库**:示例片段——文档《沸腾氯化炉异常处置SOP》抽取为段落向量,支持"炉温骤升怎么处理?"检索命中第3.2节并引用。
3. **工艺模板**:示例 `{processType:"continuous", featureWindow:"shift", qualityTag:"LIMS.Ti_purity", batchKey:"batch_id"}`。
4. **模型超参包**:见 5.3 JSON 示例。
5. **驾驶舱布局**:见 5.5 JSON Schema 示例。
**价值**:内核一次建设,新行业 = "配置 + 数据接入 + 模型标定",预计第 2、3 个行业交付周期较首厂压缩 50%+。
**效率提升测算逻辑(P2,回应"50% 来源"质疑)**:以树脂首厂 76 任务为基线拆解——其中"采集接入(8)/模型标定(14)/驾驶舱(10)/部署(6)/知识库(5)"共 43 项(≈57%)属**配置驱动可复用层**,新行业经模板化后近乎零重做;"核心算法(9)/跨系统集成(7)/定制开发(6)"共 22 项(≈29%)需轻量调整;仅"现场差异适配(11)"(≈14%)需专项实施。新行业有效工作量 ≈ 43%(模板复用)+ 部分调整,叠加并行化,故周期压缩 **50%+**;"~90% 落地工作量由模板决定"指配置驱动层占首厂总工作量约 90%(含实施与标定),而非指新行业零工作量。测算方法见附录 A。
---
## 7. 首模板详细设计:iAOP-Template-Ti(氯化车间/海绵钛,一期)
### 7.1 范围与映射
氯化车间 4 个智能体 **直接映射** 内核 4 类模型 + LLM 网关,**无新算法研发**。
| 氯化智能体 | 内核模型/能力 | 一期优先级 |
|-----------|--------------|-----------|
| ① 质量预测 | 质量预测模板 | **一期(优先,见效快)** |
| ③ 炉层杂质预警 | 异常检测模板 | **一期(优先,数据门槛低)** |
| ② 配方动态优化 | 工艺优化模板 | 二期 |
| ④ TiCl₄→海绵钛寻优 | 跨工序关联模板 | 二期 |
### 7.2 点位字典范围(一期)
- 沸腾氯化炉:炉温、炉压、氯气流量、CO/CO₂、炉层状态。
- 精制/还原工序:TiCl₄ 纯度、杂质含量、还原温度、真空度。
- 能源/公用工程:电、蒸汽、循环水。
(具体点表待客户 DCS 点表导入后由配置台校验,缺省策略见 13 章。)
### 7.3 领域RAG知识库(一期)
- 沸腾氯化工艺规范、操作手册、异常处置 SOP、氯/钛相关国标、历史事故案例。
### 7.4 工艺模板(一期)
- 连续炉式工艺;特征窗口按班/批次;质量标签对接 LIMS/人工录入。
### 7.5 驾驶舱布局(一期)
- 沸腾氯化炉四状态工艺流程视图、炉温/炉压实时趋势、炉层杂质告警面板、质量预测卡片、NL查询入口、移动端交接班摘要。
### 7.6 见效策略(降首期风险)
一期优先交付 ①质量预测 + ③炉层杂质预警(监控+预警类,数据门槛低、见效快),②配方优化 + ④跨工序寻优放二期,避免首期因标注数据不足卡顿。
### 7.7 一期交付物清单与验收节点
- **功能项**:①质量预测模型(≥90% 准确率验收线)、③炉层杂质预警(提前≥30min)、LLM 报警解释/交接班/ NL查询。
- **数据接入范围**:沸腾氯化炉 + 精制还原关键测点(≤200 点首期)。
- **模型训练数据量要求**:质量预测需 ≥ 6 个月标注(LIMS 对接后补标);预警类可先以阈值+无监督上线,3 个月后转监督。
- **验收节点**:M4 集成测试(内部)→ M5 客户 UAT → 上线 → 1 个月质保观察。
---
## 8. 数据模型与接口概要
### 8.1 核心数据实体
| 实体 | 关键字段(类型/约束) | 关系 |
|------|---------------------|------|
| Device/Point | id:string(PK), device:string, unit:enum, sampleRate:int>0, qualityCode:bool | 属于 Template |
| Tag | id:string(PK), dims:json(设备/测点/批次/质量) | 多对多绑定 Point |
| ModelRun | id:uuid(PK), templateId:string(FK), type:enum, input:json, output:json, ts:datetime | 属于 Template,引用 Point |
| Alert | id:uuid(PK), source:string, severity:enum(低/中/高), llmExplain:text, status:enum(待处理/已确认/已闭环) | 由 ModelRun 产生 |
| Template | id:string(PK), fiveElements:json, version:semver, status:enum(草稿/发布/归档) | 含 5 要素引用 |
![图 8-1 核心数据实体关系(ER)](assets/diag_er.png)
### 8.2 接口详细设计
**认证鉴权**:① 服务间 mTLS(边缘网关↔总线);② 配置台 ↔ 内核 用 **OAuth2 Client Credentials** + **API Key** 双因子;③ 前端用户登录走企业 IAM/OAuth2(支持 SSO),RBAC 三级(Viewer/Editor/Publisher);④ 所有写操作审计落日志。
**核心 API 简述(Swagger 风格)**:
- `POST /api/v1/templates` — 创建模板(body: 5 要素引用);返回 templateId。**错误码**:401 未授权 / 403 无发布权限 / 422 校验失败。
- `GET /api/v1/templates/{id}/validate` — 校验模板(点位字典/超参/布局);返回校验报告。
- `POST /api/v1/models/{templateId}/run` — 触发模型运行(body: 输入特征快照);返回 ModelRun。
- `GET /api/v1/alerts?severity=&status=` — 告警查询(分页);返回 Alert 列表含 llmExplain。
- `POST /api/v1/llm/ask` — NL 查询/报告生成(body: query, context);返回带 RAG 引用的答案。
- 错误码统一:`400 参数错误 / 401 未认证 / 403 权限不足 / 404 不存在 / 422 业务校验失败 / 429 限流 / 500 内部错误`。
---
## 9. 非功能性需求(NFR)
本章规定 iAOP 平台与首模板在性能、可靠性、安全、可扩展、可维护、兼容性方面的底线指标。所有指标均来自已交付化工AI平台的真实基线或工业现场的通用要求,作为验收测试的输入。
| 类别 | 指标 / 要求 | 来源 / 约束 |
|------|------------|------------|
| **性能** | 采集 P99 ≤ 1.8s;批量 5k/100ms(见 5.2 条件);驾驶舱首屏 ≤ 2s、交互 ≥ 30fps;模型推理吞吐 ≥ 50 QPS(70B 本地);并发用户 ≥ 50(Web)+ 200(移动端只读) | 已交付基线 + 设计目标 |
| **可靠性** | 可用性 ≥ 99.8%;丢失率 ≤ 0.02%;模型服务故障自动降级(告警不依赖模型);断点续传 | 终验报告 |
| **安全-网络** | 边缘网关严格只读、不反控;传输 mTLS;等保 2.0 三级路线(见 12 章) | 安全合规验收 |
| **安全-数据** | 敏感度路由 96.5%、DLP 100%;敏感数据本地闭环;审计日志全量 | 安全合规验收 |
| **安全-功能安全** | 关键告警/建议不直接联动执行机构;高利害输出人工确认;参考 IEC 61508 概念,AI 输出作为"决策辅助"而非"安全控制" | 工业功能安全考量 |
| **可扩展** | 新行业仅配置不改码;推理后端(5090/昇腾)可插拔(见 5.6) | 平台化设计原则 |
| **可维护** | 统一日志规范(结构化 JSON);Prometheus+Grafana 监控告警;故障排查 SOP 文档;配置台版本可追溯 | 部署底座 |
| **兼容性** | 浏览器 Chrome/Edge 最新两版;移动端 iOS14+/Android 10+;DCS 支持 OPC UA/Modbus/西门子S7;PLC 主流品牌 | 现场多样性 |
---
## 10. 验收标准(Definition of Done)
### 内核(iAOP-Core)
- [ ] 6 大模块达成第 9 章 NFR 指标(量化:P99≤1.8s / 丢失率≤0.02% / 可用性≥99.8% / 路由≥96.5% / 首屏≤2s)。
- [ ] 模块③⑤完成配置化重构,切换模板零改码(演示:换 Template-Ti ↔ 树脂模板,仅改配置)。
- [ ] 模板配置台可用,新人 2–4 周完成新行业模板("完成"= **生产环境上线 Meta,非仅 Demo**)。
### 首模板(iAOP-Template-Ti 一期)
- [ ] ①质量预测上线,准确率 ≥ 90%,误报率 ≤ 5%。
- [ ] ③炉层杂质预警上线,提前 ≥ 30 分钟,误报率 ≤ 8%。
- [ ] LLM 报警解释/交接班报告/ NL查询可用,路由准确率 ≥ 96.5%,交接班报告生成 ≤ 2 分钟。
- [ ] 驾驶舱按 Ti 布局渲染,移动端交接班摘要可用。
- [ ] 客户 DCS 点位字典导入校验通过,采集达标(P99≤1.8s / 丢失率≤0.02%)。
**验收流程**:自测(bot_dev)→ 内部评审(bot_pm+bot_po)→ 客户 UAT(王主任/李工确认)→ 上线 → 1 个月质保观察期 → 闭环。
---
## 11. 里程碑与排期
本节以月为颗粒度列出从启动到客户验收的 5 个里程碑。每一行包含时间、工期、负责人、关键交付物和依赖/缓冲,便于 PM 直接拆任务、跟踪风险。
> 假设启动于 **2026-09**;关键依赖与风险缓冲见第 12 章,依赖失败时的备选方案见第 13 章。
| 里程碑 | 时间 | 工期(周) | 负责人 | 关键交付 | 依赖 / 风险缓冲 |
|--------|------|---------|--------|---------|----------------|
| M1 需求冻结 | 2026-09 | 3 | bot_po + 王主任(客户) | 氯化车间 DCS 点表/LIMS 接口确认、PRD v1.x 定稿 | 依赖客户数据准备清单提前 2 周发出 |
| M2 内核改造 | 2026-09 ~ 10 | 7 | bot_pm + bot_dev1 | 模块③⑤配置化重构、模板配置台原型可用、iAOP-Core 内部发版 | 风险:模型框架模板化难度,预留 2 周缓冲 |
| M3 首模板配置 | 2026-10 ~ 12 | 10 | bot_pm + 行业工程师 | Template-Ti 4 智能体映射(①③优先上线)、内部验收通过 | 风险:标注数据不足,以无监督/阈值模型先行 |
| M4 集成测试 | 2026-12 | 3 | bot_dev2 + QA | 端到端联调、NFR 压测(P99/丢失率/可用性)达标 | 依赖测试环境就绪;预留 1 周缓冲 |
| M5 客户验收 | 2027-01 | 4 | bot_pm + 客户成功 | UAT、生产上线、1 个月质保观察、闭环交付 | 风险:客户配合度,需 M1 明确责任人与排期 |
**月级甘特简述**:
- **2026-09**:需求冻结 + 内核改造启动;发出数据准备清单。
- **2026-10**:内核改造收尾,首模板进入模型配置;树脂模板封装并行启动。
- **2026-11**:Ti 模板 ①质量预测 + ③炉层杂质预警联调;RAG 知识库接入。
- **2026-12**:集成测试 + NFR 压测;缺陷修复与回归。
- **2027-01**:客户 UAT + 上线 + 质保观察。
**并行线**:树脂模板封装(M2 起并行,固化已交付项目);复制推广(M5 后启动化肥/制药,年内 3–5 厂)。
---
## 12. 风险与缓解
平台化/配置化路径存在 5 项关键风险:技术可行性、数据依赖、硬件成本、零代码边界、安全合规。每一项都给出了等级、具体说明和缓解措施,作为项目 Kick-off 与阶段评审的必检项。
| 风险 | 等级 | 说明与缓解 |
|------|------|-----------|
| 模型模板化技术风险 | P0-高 | 不同行业数据分布差异可能超出"超参配置"覆盖范围。**缓解**:明确模板化边界——默认超参配置 + Recipe 插件扩展点(见 5.3),超限场景走自定义模型插件,不阻塞内核。 |
| 数据依赖风险 | P0-高 | DCS 点表、LIMS 接口、标注数据均依赖客户。**缓解**:M1 前 2 周发数据准备清单;准备**缺省通用点位集**先行演示(见 13 章);标注数据不足时①③以无监督先行。 |
| 硬件成本接受度 | P1-中 | 4×RTX 5090 + 服务器对客户是较大 Capex。**缓解**:提供云端 SaaS 版或租赁方案;明确 ROI 计算模型(见附录 B)。 |
| "零代码"承诺边界 | P1-中 | 配置驱动理想状态与实际落地的差距。**缓解**:文档中明确"零代码"适用范围(配置驱动层),定制度高场景走插件/实施,不夸大。 |
| 安全合规风险 | P1-中 | 工业控制系统网络安全(等保 2.0)、功能安全。**缓解**:等保三级合规路线图;功能安全 IEC 61508 概念落地(AI 仅作决策辅助,见 9 章)。 |
---
## 13. 假设与外部依赖
> 集中列出所有外部依赖与不确定性,避免范围蔓延(回应 7 章多处"待确认")。
| 依赖项 | 说明 | 风险缓解 |
|--------|------|---------|
| 客户 DCS 点表 | 决定点位字典与采集范围 | 提前 2 周发清单;缺省通用点位集先行演示 |
| LIMS / 质量系统接口 | 质量标签来源 | 一期可先用人工录入过渡 |
| 客户标注数据 | 监督模型训练所需 | ①③先无监督/阈值上线,3 月后转监督 |
| 网络与机房环境 | 边缘网关部署条件 | 现场勘测前置 |
| 客户配合度 | UAT/上线节奏 | M1 明确里程碑责任 |
**依赖-备选方案对照矩阵**:当某项外部依赖延迟或失败时,启用对应备选方案,避免项目停摆。
| 依赖项 | 失败场景 | 备选方案 | 触发条件 | 影响范围 |
|--------|---------|---------|---------|---------|
| 客户 DCS 点表 | 点表延迟或字段不完整 | 启用缺省通用点位集先行演示;仅接入已确认点位 | M1 截止日仍未收到完整点表 | ①③可先行,②④延后 |
| LIMS/质量系统接口 | 无标准接口或审批周期长 | 一期改用人工录入/批量导入质量标签;二期补接口 | M1 接口方案未定 | 仅影响监督模型训练,监控类模型不受影响 |
| 客户标注数据 | 历史标注不足或质量差 | ①③先用无监督/阈值模型上线;标注积累后再转监督 | M3 启动前标注数据 < 1000 条 | 模型准确率天花板暂降,但不阻塞上线 |
| 网络/机房环境 | 无法部署本地 GPU 服务器 | 提供云端 SaaS 演示环境或租赁方案 | 现场勘测不通过 | 首厂上线延迟,但不阻塞内核研发 |
| 客户配合度(UAT) | 客户关键责任人缺席 | M1 即签订 UAT 排期与责任矩阵;必要时按内部验收标准先行上线 | M5 前 2 周客户未确认 UAT 时间 | 质保观察期可后延 |
| 昇腾/NPU 硬件到位延迟 | 客户采购流程长 | 默认 RTX 5090 方案先行;昇腾适配层在 M2 已完成抽象 | 部署前硬件未到位 | 不影响业务代码,切换后端 = 改配置 |
**缺省数据策略**:若客户点表延迟,启用默认通用点位集(代表典型氯化工况)完成演示与框架验证,点表到位后无缝切换——保证项目不因数据延迟停摆。
---
## 14. 成本分析附录
**首厂一次性投入(真实测算,含硬件)**:约 **99.66 万元**(其中硬件约 33.66 万:4×RTX 5090 + 服务器 + 边缘网关);软件实施与集成约 66 万。
**首厂年运营**:约 **10.5 万元**(云/电/运维/许可)。
**内核沉淀后边际成本**:后续厂转为"内核授权 30–45 万 + 行业模板实施 15–25 万 + 年订阅 8–12 万/厂",软件从"从零开发"转为"授权",边际成本大幅下降。
**ROI 逻辑**:以吨产品能耗降 3–8%、质检返工降、非计划停机降折算年化收益,典型中型厂回收期 12–24 个月(见《产品策划方案》第七章)。
---
## 15. 附录
### 附录 A:效率提升测算逻辑(对应 6 章)
以树脂首厂 76 任务为基线,按"配置驱动可复用 / 轻量调整 / 专项实施"三层拆解(详见 6 章正文),新行业有效工作量 ≈ 43%(复用)+ 部分调整,叠加并行化,周期压缩 50%+;"~90% 工作量由模板决定"指配置驱动层占首厂总工作量约 90%。本测算为方法论示意,具体以交付复盘校准。
### 附录 B:缩写表与参考资料
- **缩写**:DCS 分布式控制系统 / PLC 可编程逻辑控制器 / LIMS 实验室信息管理系统 / RAG 检索增强生成 / DLP 数据防泄漏 / ER 实体关系 / MVP 最小可行产品 / UAT 用户验收测试 / SLA 服务等级协议 / SOP 标准作业程序 / NFR 非功能性需求 / Meta 上线里程碑。
- **参考资料**:《化工新材料AI平台技术方案 V2.0》《M1-M2 阶段评审》《终验报告》《DeepSeek 大模型应用预算方案》《项目对比与通用产品可行性分析》《通用工业AI优化平台_产品策划方案》《市场调研复盘》《工信部"人工智能+制造"行动方案(2026-2028)》。
---
## 16. 术语表
- **iAOP**:云美工业AI优化平台(YunMei Industrial AI Optimization Platform)。
- **iAOP-Core**:通用内核(6 模块 + 配置台)。
- **iAOP-Template-{行业}**:行业模板(5 要素交付物)。
- **点位字典**:描述采集对象的 CSV 配置。
- **敏感度路由**:LLM 网关按数据敏感度决定本地/云端处理。
- **沸腾氯化**:高端氯化法钛白粉核心工艺,氯化车间AI 主攻对象。
- **Model Recipe**:声明式模型结构注册项,允许高级模板选择不同网络结构而不改内核。
- **FeatureSpec**:声明式特征定义,由工艺模板描述、框架解释执行。
---
*附:本 PRD 技术参数均来自已交付的化工新材料AI平台真实资料(技术方案V2.0、M1-M2评审、终验报告、预算方案);氯化车间部分基于对比分析的外推,待需求细化与现场 DCS 点表确认后更新。v1.1 已据《PRD 评审意见》补全 P0/P1/P2 修订项。本文档为设计基线,开发前由 bot_pm 拆解为可执行任务。*