本文前半部分回答为什么必须工程化,中段定义技能本体与生产规范,后半部分解释怎样验证、上线、运营,并用热熔胶机异常研判把所有概念串成完整案例。

图 1 工业 SKILL 的岗位作业包类比
完整技能同时包含使命、数据、工具、安全和验收。
工业场景中的大模型应用,真正困难的部分不是“模型能不能回答”,而是回答是否建立在正确的设备、正确的时段、正确的工况和足够可信的数据上;它是否清楚地区分事实、计算、推断与确认;它能否在权限、联锁、作业许可和人员职责的边界内行动;发生缺数、工具失败、知识冲突或高后果事件时,是否能够安全降级;版本变更后,能否证明关键能力没有退化。把若干提示词、接口说明和经验文档放进一个目录,并不能自动得到可用于工业生产的 SKILL。
本文提出一套建议性工程方法I-SKILL/1.0(Industrial Skill Engineering Specification)。它不是现有国家标准或国际标准,而是对 Agent Skills、OpenAI Codex Skills、NousResearch Hermes Agent 技能机制,以及系统工程、控制论、信息论、软件工程、功能安全、工业网络安全和 AI 风险管理原则的综合。其核心定义是:
工业 SKILL 是一个受到资产边界、数据合同、知识模型、权限策略和安全不变量约束的可复用代理能力单元。它接收可追溯的上下文与观测,执行可解释的确定性处理和受控推理,通过最小权限工具形成建议或动作,并以独立验证、失败降级、审计记录和生命周期治理闭合反馈回路。
文章的结论可以概括为四句话:
第一,语言模型适合做语义理解、上下文整合、假设生成和人机沟通,不应承担安全联锁或未经约束的闭环控制;
第二,数值计算、模式切分、单位换算、阈值、格式校验、权限检查和审计哈希应尽量由确定性程序承担;
第三,SKILL 必须同时具备知识面、决策面、执行面和保障面,少任何一面都只能算演示;
第四,生产发布不是“写完 SKILL.md”,而是经过危害分析、合同化设计、离线验证、仿真/影子运行、受限上线、持续监测与变更复核的完整工程过程。

图 2 工业 SKILL 的第一性原理
先约束不可接受损失和边界,再组织计算、推理、工具与验证。
一、研究范围、资料来源与术语边界
1.1 离线资料的检索范围
学科簇重点检索主题对工业 SKILL 的贡献
工程学与系统工程 工程学、系统工程、V 模型、系统集成、可靠性、质量、物理失效 需求、边界、接口、生命周期、验证与确认
控制论与控制工程 控制论、工程控制论、反馈、负反馈、智能控制、混合系统 状态、闭环、稳定性、迟滞、降级和人机接管
信息论 信息论、熵、信道编码、语义信息 不确定性、信息价值、冗余校验、证据充分性
计算机与软件工程 计算机科学、软件工程、SWEBOK、形式化方法、形式化验证、SRE 类型、合同、状态机、幂等性、测试、可观测性、变更管理
AI 与知识工程 专家系统、符号 AI、知识表示、知识库、贝叶斯网络、机器学习 本体、规则、概率推断、混合智能、解释
安全与人因 安全工程、系统安全、FMEA、故障树、功能安全、人因工程、风险评估 危害识别、防御纵深、最小权限、人工授权、失效安全
1.2 网络深度检索范围
优先使用一手资料:Agent Skills 公开规范、OpenAI Skills/Codex 官方文档、NousResearch Hermes Agent 官方仓库与文档、Model Context Protocol 官方文档、NIST AI RMF、TEVV 与制造业数字孪生资料、ISA-95、ISA/IEC 62443、IEC 61508/61511、ISO/IEC 42001、OPC UA 官方规范、OWASP 大模型应用风险项目,以及 ReAct、Toolformer 和生产机器学习原始论文。新兴 Agent Skill 安全论文只作为研究线索,不被当作成熟工业标准。
1.3 “Hermes”的解释
本报告中的 Hermes 指NousResearch Hermes Agent,因为用户的问题与 SKILL 的发现、加载、管理和执行直接相关,而不是仅指 Hermes 系列语言模型。Hermes Agent 将技能视为按需加载的知识文档,支持紧凑列表、查看完整 SKILL.md、按路径加载参考文件、外部技能目录、平台约束、工具集条件激活、技能管理和来源/信任信息。模型技术报告与 Agent 运行时是两个层次:前者决定基础推理能力,后者决定能力如何被约束、调用和治理。
1.4 三类规范不要混为一谈
通俗类比:可移植核心像电器的标准插头,平台适配像不同国家的转换插座,企业工业扩展则像工厂自己的配电规程和上锁挂牌制度。插头能插上,只说明“可以连接”;是否允许通电、能带多大负载、发生故障怎样断电,仍由现场规则决定。
对工程团队而言,这个区分能够避免两种常见错误:一是把平台字段误当成业务安全规则,换一个 Agent 运行时后约束就消失;二是把所有现场细节写进可移植核心,导致技能无法跨产线、跨工厂复用。正确做法是保持业务语义稳定,把运行时差异和现场差异分别放入适配层与现场配置层,并对三层分别做版本和测试。
层次作用建议做法
Agent Skills 可移植核心 规定技能目录、SKILL.md、可选 scripts/references/assets 和渐进披露 将核心名称、触发描述、流程和资源设计保持跨平台
平台适配 Codex 的 agents/openai.yaml、Hermes 的平台与工具集元数据、UI 字段 通过适配层表达,不污染核心业务语义
企业工业扩展 数据合同、资产本体、权限、危害、验证、发布与审计 作为企业生产规范强制执行,并由独立门禁检查
Agent Skills 规范允许若干可选前置字段,而 OpenAI 的技能创建规范倾向于在 SKILL.md 前置区只保留 name 和 description。因此,本报告的样例选择最小可移植核心:只在 SKILL.md 使用名称和描述,把 Codex 展示配置放到 agents/openai.yaml,把 Hermes 或企业特有元数据作为适配配置管理。这样既能跨平台复用,也避免同一字段在不同运行时含义不一致。
二、从第一性原理重新定义工业 Agent 问题
从一个真实班次问题开始
早上 7:42,纸尿裤产线热熔胶机出现温度下滑,加热指令却逐步升到 100%。值班人员真正需要的不是一段“像专家”的回答,而是确认:这是不是计划工况;影响哪台设备;异常从何时开始;证据来自哪些点位;还有哪些替代解释;现在谁应该做什么;哪些动作绝对不能做;维修以后怎样证明已经恢复。
这个场景揭示了普通 Agent 与工业 SKILL 的根本差异:普通 Agent 的终点是答案,工业 SKILL 的终点是一个有来源、有边界、有负责人、可验证、能安全失败的决策闭环。

图 3 普通 Agent 与工业 SKILL 的差异
工业系统关注可证明的决策链和失败路径。
2.1 工业现场不是普通问答环境
工业系统具有五个根本属性。其一,它是动态系统,当前状态由过去输入、扰动、维护和材料历史共同决定;其二,它通常只能被部分观测,传感器既不完备也可能失真;其三,它存在硬约束,安全、质量、设备极限和节拍不是偏好;其四,它是社会—技术系统,操作者、维修、工艺、自动化、质量、供应商和管理者拥有不同知识与权限;其五,错误代价不对称,漏掉高后果事件与多发几个低质量告警的代价完全不同。
因此,工业任务不能被抽象成 用户问题→ 大模型答案,而应抽象成:
任务使命+ 系统边界 + 观测证据 + 隐状态估计 + 风险约束 + 受限决策 + 授权执行 + 独立验证 + 反馈更新。
2.2 大模型的能力边界
通俗类比:大模型更像一位阅读面很广、表达能力很强的高级调度员,而不是安全 PLC。调度员可以汇总手册、报警、工单和班组经验,提出候选原因并协调下一步;但它不能替代刹车、联锁、安全气囊和持证作业人员。
这个类比也说明了为什么“大模型能力更强”并不会自动消除工程约束。即使调度员经验再丰富,仪表校验、身份核验、操作许可和独立保护仍然不可省略。基础模型升级可以提高语义理解和工具选择能力,却不能替企业自动完成危害分析、权限设计和现场验证。
大模型是一种概率性的语义变换器。它擅长将非结构化语言、文档、报警说明和多源上下文组织成候选解释,能生成检查步骤,能把技术判断翻译给不同角色,也能选择工具并根据工具结果修订计划。ReAct 展示了推理与行动交替带来的环境反馈价值;Toolformer 关注何时调用工具、如何填写参数以及如何使用返回结果。
但大模型没有天然的设备状态真实性、单位一致性、时钟同步、权限真实性或物理安全保证。它可能把流畅语言误当成事实,把相关性误当成因果,把缺失字段补成看似合理的值,或被检索内容中的指令诱导。因此,在生产系统中,大模型应位于“受约束的认知层”,而不是替代 PLC、SIS、联锁、确定性优化器、正式审批或授权工程师。
2.3 工业 SKILL 的工程目标
一个 SKILL 的质量不是由篇幅决定,而由它降低了多少任务不确定性、约束了多少危险自由度、保留了多少证据链、覆盖了多少失败路径,以及变更后能否重复证明。最小目标函数可写为:
最大化任务效用与信息增益;最小化不受约束行动、错误自信、不可追溯推断、人员负担与生命周期成本;同时满足安全不变量、权限和数据合同。
这意味着设计顺序应是“先约束、再观测、后推理,最后才谈动作”,而不是先写一个万能提示词再补安全说明。
三、跨学科底层逻辑如何转化为设计规则
3.1 系统工程:从真实问题、边界和生命周期开始
通俗类比:系统工程像造桥。工程团队不会先选桥面颜色,再问桥跨多宽、承受多大载荷、连接哪两条路、洪水来了怎么办。工业 SKILL 同样不能从“选哪个大模型”开始,而要先明确服务哪项决策、覆盖哪些资产和模式、错误代价是什么、由谁维护以及怎样退役。
把这个类比落实到项目文档,就是先完成任务上下文图、利益相关者和 RACI、业务基线、危害清单、接口清单与验收条件,再决定哪些环节使用规则、传统算法、LLM 或人工。算法是系统中的一个实现选择,不是系统目标本身。
系统工程首先要求识别真正的问题,而不是把已有算法当作问题。对工业 SKILL,需要明确使命、利益相关者、资产边界、上游与下游系统、运行模式、外部扰动、责任分配和从设计到退役的生命周期。需求必须可追踪到危害、接口、实现资源、测试用例和验收证据。
由此得到的规则是:每一个 SKILL 都必须回答“为谁、在什么资产和工况下、解决什么决策、明确不做什么、依赖谁、失败时由谁接管”。未经系统边界定义的技能描述,触发范围必然过宽;未经全生命周期设计的脚本,迟早因标签、接口、设备或标准变化而失效。
3.2 控制论:把技能设计成有界闭环
通俗类比:控制论像洗澡调水温。人不会只拧一次龙头便闭上眼睛,而是感受水温、调整冷热水、再次感受,并避免来回拧得过猛。工业 SKILL 也必须观察、估计、比较、行动和验证,还要用迟滞、冷却时间和速率限制防止反复报警或过度动作。
这里的“闭环”并不等于“让 LLM 自动控制设备”。更安全的分工是:LLM 参与认知闭环,确定性系统和人员完成授权闭环,PLC/DCS/SIS 保持控制与保护闭环。三个闭环通过经过验证的接口协作,而不是由一个模型包办。
控制论的核心不是“自动控制一切”,而是观测、估计、比较、作用与反馈。工业 Agent 也应形成闭环:采集观测,估计状态,与目标和约束比较,选择受限动作,检查执行结果,再修正状态。为了避免振荡和过度反应,需要模式门控、持续性条件、迟滞、冷却时间、速率限制和人工接管。
重要推论是:LLM 的输出不能直接等价为控制量。它可以生成诊断假设或建议,但实际动作必须经过策略门、权限门、工况门和安全门。高风险动作还要由独立于大模型的保护层约束。模型不可用时,原设备保护不得失效;网络中断时,安全功能不得依赖云端对话。

图 4 有界认知闭环
语言模型位于受约束的认知层,设备保护和授权流程保持独立。
3.3 信息论:以证据减少不确定性
通俗类比:信息论像医生选择检查。患者说“胸口不舒服”时,医生不会把第一印象直接写成根因,而会选择最能区分不同可能性的检查。工业诊断也应该问:下一条证据能排除多少假设,采集它的成本和风险是多少?
例如温度下降而加热指令升高时,再读一遍报警文字的信息增益很小;检查实际加热电流、同配方热负载和独立参考温度,才可能区分加热回路故障、负载变化与传感器偏差。SKILL 应把“下一条最有价值的安全证据”作为正式输出,而不是只给出一个结论。

图 5 从事实到确认的证据等级
模型分数属于派生证据,确认根因需要授权检查或维修结果。
信息论提醒我们,信息的价值不在于文本长度,而在于它对不确定性的减少。工业 SKILL 应在每一步问:当前有哪些候选状态?哪个观测最能区分这些状态?采集这个信息的代价和风险是多少?例如“检查同配方下加热指令与温度跟踪误差”通常比“再读一遍报警描述”更能区分加热器故障、负载变化和传感器故障。
信道编码的思想也有直接启发:单一传感器或单次模型输出不应成为高后果决策的唯一依据,应使用独立证据路径、时间一致性、单位和范围校验、校验和、质量位以及执行后确认形成冗余。冗余不是重复措辞,而是不同失效模式下仍能互相验证的信息通道。
3.4 计算机科学与软件工程:合同、类型与状态机
通俗类比:计算机合同像机场闸机。闸机不会凭工作人员觉得“这个人应该没问题”就放行,而会精确核验航班、身份、时间和票证状态。工业系统中的资产 ID、单位、时区、枚举状态、证据引用和权限同样不能靠模型猜测。
因此,凡是能够写成类型、枚举、范围、状态转换或不变量的内容,都应尽量由机器执行。语言模型负责理解模糊语义,程序负责拒绝不合法状态。所谓“确定性护栏”,不是给模型多说一句注意安全,而是让不合规输出无法通过下一道门。
自然语言适合表达意图,但不适合独自承担所有接口约束。工业 SKILL 应把输入、输出、错误码、状态转换和工具权限结构化:资产 ID 不是任意字符串,时间戳必须带时区,压力必须带单位,风险等级必须来自枚举,证据引用必须存在,确认根因必须具有检查或修复结果。
确定性脚本应处理:模式与数据验证、单位换算、时间对齐、统计特征、规则门控、输出结构检查、哈希、日志脱敏和回归测试。脚本必须幂等、可独立运行、显式失败,并能在无网络环境中处理边界情况。语言模型只应承担需要语义和情境判断的部分。
形式化方法的现实用法不是把整个工厂形式化,而是把最重要的不变量机器化,例如:不得生成 A3/A4 控制动作;所有建议必须有负责人和验证方法;URGENT_ESCALATION 必须进入升级状态;CONFIRMED 根因必须引用授权检查证据;数据不可用时不得输出精确数值结论。
3.5 知识工程:本体、规则与概率推断协同
通俗类比:知识工程像给老师傅的经验建一张可检索地图。只有一堆维修记录,就像只有很多地址却没有道路;本体把设备、部件、信号、物料流、故障机理和操作角色连成路网,规则标出禁行区,概率模型估计哪条路更可能,大模型则负责根据当前情境规划调查路线。
这也是为什么 RAG 并不等于知识工程。检索能找到相似文字,却不一定知道某条规则适用于哪一代设备、某个点位属于上游还是下游、两份手册冲突时谁优先。生产技能需要版本化本体、来源优先级和适用范围,而不仅是向量相似度。
工业知识不是一堆 PDF。它至少需要资产层级、部件—功能关系、物料流方向、信号语义、单位、运行模式、故障机理、标准程序和角色权限。这个本体使模型知道“下游压力下降”在泵、过滤器、软管和喷枪之间意味着什么,也使相同标签在不同产线之间可以映射。
专家规则适合硬约束和明确机理,统计模型适合从高维数据中发现偏离,语言模型适合组织证据、比较假设和沟通。严谨方案通常是混合智能:本体限定语义,规则守住边界,确定性算法计算,概率模型给出异常证据,LLM 进行受约束的综合推理,人工完成高后果确认。
3.6 安全工程与人因:先识别不可接受损失
通俗类比:人工在环更像航空驾驶舱,而不是网页上的确认按钮。真正的人工控制要求明确谁有资格确认、看到了什么证据、可以拒绝什么、超时如何处理、出现异常由谁接管。若用户长期被无效告警淹没,形式上的人工确认反而会增加风险。
对技能做 FMEA 时,不仅分析它会不会答错,还要分析它会不会在错误资产上触发、把计划停机当故障、使用过期知识、被工单中的恶意指令诱导、泄露敏感数据、重复创建工单或在用户犹豫时继续推进。每一种失效都需要检测、阻断、降级和责任人。
FMEA 从部件失效出发向上分析影响,故障树从顶层事故向下分解原因,两者互补。对 SKILL 本身也要做 FMEA:错误触发、错误资产、数据错位、单位错误、提示注入、越权工具、漏报、高频告警、确认偏差、日志泄漏和更新回归都属于技能失效模式。
工业安全强调人员、流程和技术共同负责。人工在环不是简单加一个“确认按钮”,而是明确谁有资格确认、确认什么、得到什么证据、可否拒绝、超时如何处理、如何交接和如何避免自动化偏见。界面必须把事实、推断、风险、置信度和待确认项分开显示。
3.7 测量科学:先证明观测可信,再讨论模型聪明
通俗类比:如果体温计本身漂移,再精密的诊断模型也只是在解释错误读数。工业 AI 的输入不是抽象数字,而是传感器、变送器、采集卡、时间同步、缩放系数、质量位和维护状态共同产生的测量结果。
生产级数据合同必须向测量链上游延伸:记录点位来源、量程、分辨率、精度、校准状态、采样与聚合方法、时钟来源、质量位、插值和派生公式。需要区分过程真实变化、测量噪声、传感器漂移、通信异常与数据工程错误。关键结论若依赖单一测量通道,应给出独立参考测量或冗余证据;无法证明测量可信时,系统只能报告数据不足,不能输出更精确的根因。
验证、确认与不确定性量化(V&V/UQ)不仅适用于模型,也适用于数据、数字孪生、规则、阈值和最终系统。Verification 问“是否按规格正确实现”,Validation 问“是否满足既定用途”,UQ 问“结论受哪些不确定性影响、范围多大”。三者共同决定证据是否足以支持某一自主度,而不是给模型颁发一次性准确率证书。
3.8 因果推断与决策科学:从发现异常走向评估干预
预测回答“接下来可能发生什么”,因果推断回答“如果采取某个动作,结果会怎样变化”。工业 SKILL 一旦开始推荐调整参数、维修部件或改变排程,就不能只依赖相关性。原料批次、环境、设备老化、人员操作和维护选择都可能同时影响输入与结果,使一个高相关特征并非真正原因。
严谨做法是把候选机理写成因果图和可区分假设,明确混杂因素、可观测变量、不可观测变量与允许干预。优先使用机理约束、设计试验、受控维护检查、自然实验或历史准实验估计干预效果;无法安全干预时,使用仿真、数字孪生和反事实回放生成证据,但不得把仿真结论直接视为现场确认。每条建议都应说明:期望改变哪个中间状态、多久看到响应、什么结果支持或反驳该假设、何时停止。
3.9 价值工程:把错误代价、信息价值和生命周期成本放进同一目标函数
工业 AI 的商业价值不是模型指标的线性函数。同样的召回率,在漏报可能引发停产或安全事故、误报只增加一次检查时,决策阈值完全不同。项目应建立错误成本矩阵,至少覆盖漏报、误报、延迟发现、错误资产、错误动作、人工复核、停机窗口、质量损失与安全后果。
价值评估还应包含生命周期总成本:传感器与网络改造、数据治理、领域专家、模型和知识维护、验证复验、网络安全、合规、算力、供应商切换与退役。下一条证据是否值得采集,可以用“预期信息价值-采集成本-操作风险”衡量。只有风险调整后的净收益为正、且不可接受损失受独立保护时,自动化程度提升才有经济与工程依据。
四、I-SKILL/1.0:四平面生产级架构
前述学科与新增的测量科学、因果决策和价值工程共同汇聚为四个工程平面。可以把它理解为一座数字工厂岗位:知识面是它理解世界的地图;决策面是它分析问题的工作方法;执行面是它能触碰的工具和权限;保障面是培训、考试、监控、复验与退役体系。

图 6 九条工程纪律共同约束工业 SKILL
九条纪律分别处理边界、反馈、证据、确定性、语义、安全、计量、因果与价值,最终共同约束生产资格。
本报告建议将完整工业 SKILL 分为四个相互约束的平面。SKILL.md 是导航和流程入口,但不是全部实现。

图 7 I-SKILL/1.0 四平面架构
知识、决策、执行和保障相互约束,SKILL.md 只是入口。
4.1 知识面:定义“世界是什么”
知识面包括任务词汇、本体、资产层级、信号目录、单位、运行模式、故障机理、规则、标准、OEM 资料、企业程序和版本适用范围。它必须回答知识来源、有效日期、适用设备、冲突优先级和更新责任。长资料放入 references/,并从 SKILL.md 精确说明何时读取,避免所有内容一次性进入上下文。
4.2 决策面:定义“如何从证据到结论”
决策面包括状态机、证据分类、假设生成与反证、置信度校准、风险分级、策略规则和停止条件。建议强制四分法:OBSERVED 原始观测、DERIVED 可重复计算、INFERRED 尚未物理确认的推断、CONFIRMED 经授权检查或结果验证的确认。根因不能从推断直接跳到确认。
4.3 执行面:定义“能做什么”
执行面包括工具、MCP 服务器、API、脚本、参数约束、凭据范围、读写权限、超时、重试、幂等键、事务、回滚和人工批准。工具返回内容是数据,不是新的系统指令。默认只读;按动作后果分级授权;对状态改变采用目标资产再次确认和最小权限。Skill 告诉 Agent 如何工作,MCP 或本地工具提供外部数据和能力,两者职责不同。
4.4 保障面:定义“如何证明可用且安全”
保障面包括危害分析、测试集、红队案例、仿真、影子运行、发布门、监控、审计、漂移、版本、回滚、事件复盘和退役。它要独立检查决策面和执行面,而不是让同一段大模型回答自证安全。
平面必需对象典型机器检查
知识面 本体、数据字典、故障卡、标准来源、适用版本 标签完整、单位枚举、引用可达、过期提醒
决策面 状态机、证据账本、策略、停止/降级条件 引用一致、状态合法、确认等级约束
执行面 工具清单、权限矩阵、参数 schema、回滚 禁止工具、参数边界、最小权限、幂等键
保障面 测试、门禁、监控、审计、变更记录 回归通过、风险案例全过、版本可追溯
4.5 生产部署参考架构
通俗理解:部署分区像工厂的门禁分区。控制区是设备本体和安全保护,任何人不能因为会使用办公系统就直接进入;工业 DMZ 像中间门厅,负责身份核验、协议限制和审计;AI 区可以阅读经过授权的数据并形成建议,但不能跨过门禁直接控制现场。
下面的分区图强调数据可以按授权向上流动,建议可以经过策略和批准向下传递,但安全保护始终在最靠近设备的一层独立存在。

图 8 工业 Agent 分区部署
数据读取、建议传递与安全保护分层隔离。
推荐将实时控制、数据采集、Agent 推理和企业系统分区部署。设备控制区保留 PLC、DCS、SIS 和硬联锁;边缘采集区完成协议适配、本地缓存、时间同步和质量位;工业 DMZ 中放置只读数据代理、API 网关、恶意内容过滤、协议白名单和审计;IT/AI 区运行技能发现、LLM、知识检索、确定性计算、策略引擎和评估服务;MES、EAM/CMMS、QMS 和身份系统通过受控连接提供上下文。
一个典型调用链是:用户任务进入 Agent 运行时;运行时只根据名称和描述发现候选技能;加载 SKILL.md 后先检查前置条件;数据适配器以只读身份获取最小范围记录;输入校验器阻断身份、时间和单位问题;确定性脚本计算特征;LLM 根据本体与故障卡生成并反证假设;策略引擎在模型之外检查权限和风险;输出验证器检查证据引用和动作等级;人工界面显示证据并完成必要批准;执行后由独立数据通道验证结果;所有阶段写入可重放的审计事件。
对 OT 写操作,应优先通过现有受控工作流创建“建议或工单草稿”,而不是让通用 Agent 直接调用控制协议。若组织确实需要自动执行低风险动作,也应使用专用编排器:结构化白名单参数、服务器端角色授权、双重确认、目标资产锁、幂等键、事务日志、超时、回滚和独立保护层缺一不可。
4.6 模型、知识、规则和程序如何分工

图 9 工业 Agent 的责任边界
让大模型、确定性程序、策略与控制系统各司其职。
记忆口诀:模型负责“读和想”,程序负责“算和验”,策略负责“准不准做”,控制系统负责“实时执行与保护”。这种分工并不是限制大模型价值,而是把它放在最能发挥语义能力、同时最容易被工程约束的位置。
4.7 生产资格不是能力声明,而是可审计证据链
一个技能“能够运行”只证明实现存在;“在测试集上表现好”只证明有限样本下的性能;“具备生产资格”则要求使命、危害、数据、实现、TEVV 和运行六类证据闭环。每一项需求应追踪到风险或价值来源、实现资源、测试用例、批准角色与运行指标。
建议为每个发布版本建立不可变的证据包:任务与资产边界、危害日志和保护层、数据与语义合同、代码/配置/模型/依赖清单、测试和影子运行报告、人工评审记录、发布批准、SLO与回滚演练。审计重放必须能回答:当时读取了什么、使用哪个版本、调用了哪些工具、谁批准了什么、依据何在、执行后怎样验证。
工程结论:自主度不是模型能力等级,而是证据充分度、损失严重度、独立保护能力和组织责任共同决定的运行许可。证据变化,自主度也必须重新评估。

图 10 从 Demo 到生产资格的六类证据链
能力可以由模型展示,生产资格必须由跨阶段工程证据证明。
任务首选实现原因
字段/单位/时间/范围校验 JSON Schema 与确定性代码 结果必须稳定、可测试
数值特征和阈值 经版本化的算法服务/脚本 防止心算、口径漂移和幻觉
资产和文档检索 本体、受控知识库、只读 MCP 保留来源、适用版本和权限
工况理解与问题改写 LLM 需要语义和上下文整合
候选机理与反证清单 LLM + 故障卡/规则 创造性受领域边界约束
风险和动作授权 外部策略引擎+ 人工 不应由生成模型自行放权
自然语言报告 LLM + 结构化输出合同 兼顾沟通与机器校验
控制和安全保护 PLC/DCS/SIS/专用控制器 实时、确定、安全认证与独立性
五、工业 SKILL 的 16 项描述与约束
16 项规范看起来繁杂,可以压缩为四张问题清单:为什么做、依据什么、怎样工作、如何证明。每张清单都包含四项合同,共同覆盖使命边界、数据证据、工作流工具与验证运营。

图 11 工业 SKILL 的 16 项生产规范
复杂规范可以压缩为使命边界、数据证据、工作流工具、验证运营四组问题。
5.1 元数据与触发合同
1.唯一名称与所有者:名称稳定、目录一致、明确业务负责人、技术负责人和安全/质量审查者。
2.能力描述:描述既说明做什么,也说明何时触发、典型输入和明确禁用场景。触发语义要测试误触发和漏触发。
3.版本与兼容性:记录技能版本、数据 schema、工具版本、设备/固件/配方适用范围和迁移规则。
5.2 使命、边界与风险合同
4.使命和成功标准:目标是缩短诊断时间、提高证据完整度还是降低停机,不可只写“智能分析”。
5.系统边界:资产、产线、时间窗口、运行模式、排除项、上下游和责任交界。
6.不可接受损失与不变量:人员伤害、火灾、设备损坏、质量放行错误、泄密等;列出任何情况下都不得违反的规则。
7.权限矩阵:区分读取、计算、建议、创建草稿、提交审批、执行、回滚;按角色和环境授权。
5.3 输入、知识与证据合同
8.输入合同:字段、类型、单位、时间、来源、质量、缺失策略、采样和工况上下文。
9.知识合同:本体、规则、文档来源、适用版本、冲突优先级和过期策略。
10.证据与不确定性:事实/计算/推断/确认分类、证据 ID、置信度理由、反证和缺失信息。
11.隐私与安全:数据分级、最小检索、脱敏、保留期限、提示注入隔离、密钥处理和供应链来源。
5.4 工作流、工具与输出合同
12.状态机和决策策略:前置条件、状态转换、模式门控、策略表、停止、超时、降级和升级。
13.工具合同:工具用途、读写性、参数 schema、最小权限、超时、重试、幂等、错误、审计与回滚。
14.输出合同:面向人的摘要和机器 JSON;风险与置信度分离;建议必须包含负责人、截止时间、验证和升级条件。
5.5 验证和生命周期合同
15.验证合同:黄金样例、负例、对抗例、边界例、工具故障、权限失败、跨资产泛化和人因测试;规定发布阈值。
16.运营与变更合同:日志、指标、漂移、告警、反馈、版本、签名/哈希、审批、灰度、回滚、事故复盘和退役。
这 16 项不是要求全部堆进 SKILL.md。入口文件保持短而可导航,复杂 schema 放入 references,稳定计算放入 scripts,输出模板和样例放入 assets,平台展示和依赖放入平台配置。渐进披露的意义是让模型在正确阶段读取正确资料,而不是让重要约束永远不被加载。
六、建议目录结构与文件生产规范
通俗类比:技能目录像一本分层装订的岗位手册。封面目录只告诉员工何时使用和去哪里找;详细工艺卡放在 references;反复使用且不能出错的计算器放在 scripts;报告模板和冻结样例放在 assets。把所有内容塞进 SKILL.md,就像要求员工每次开工前从第一页重读整本工厂手册。

图 12 生产级技能目录分工
入口保持精简,知识、计算和资产按需加载。
industrial-skill-name/
├── SKILL.md # 必需:触发、边界、状态机、资源路由
├── agents/
│ └── openai.yaml # 可选:Codex 展示、默认提示、MCP 依赖
├── references/
│ ├── system-boundary.md # 资产、模式、接口、责任
│ ├── data-contract.md # schema、单位、质量、时间语义
│ ├── domain-model.md # 本体、信号和故障机理
│ ├── decision-policy.md # 风险、置信度、策略和权限
│ ├── output-contract.md # 人机输出与 JSON schema
│ └── validation-cases.md # 黄金、负例、对抗、故障案例
├── scripts/
│ ├── validate_input.py # 确定性输入门禁
│ ├── compute_features.py # 可重复计算
│ ├── policy_gate.py # 禁止动作/风险不变量
│ └── validate_output.py # 证据引用与结构门禁
└── assets/
├── sample-event.json # 冻结样例
└── report-template.json # 输出模板
6.1SKILL.md写作规范
SKILL.md 必须包含 name 和 description。名称应稳定、与目录和制品标识一致;description 承担发现职责,需要前置关键场景、触发词和明确禁用边界,并分别用应触发、近邻误触发和不应触发样例测试。正文使用祈使式,先给使命与安全边界,再给输入、状态机、工具政策、输出、失败降级和资源路由。入口文件保持精简,复杂知识放入直接引用,确定性操作放入经过测试的脚本;是否拆分以检索准确、上下文预算和可验证性为准,而不是机械追求行数。
6.2 脚本规范
脚本必须自包含或明确依赖,接受命令行参数或结构化输入,返回明确退出码,失败时把错误写到标准错误,处理空数据、非数值、时区、重复时间戳、极值和权限失败。相同冻结输入、脚本版本和配置应得到相同结果。脚本不得把密钥写入日志,不得把工具输出当作可执行指令,不得在未声明时访问网络或修改生产状态。
6.3 参考资料规范
每个引用文件只解决一类问题,开头写适用范围、来源版本和冲突优先级。数据字典要有物理单位和质量语义;故障机理要有预期时间顺序、支持证据、反证、替代解释和安全确认方法;企业程序只引用受控版本。知识冲突时的优先级通常为:法律/监管与组织强制程序、独立安全系统与已批准限制、OEM 适用文件、受控工程基线、经验证的业务规则、统计模型和语言模型推断。
6.4 平台适配规范
根据当前 Codex 官方文档,Skill 是可复用工作流的创作格式:Codex 先看到 name、description 和路径,匹配后再加载完整 SKILL.md;显式调用与基于 description 的隐式调用都应测试。agents/openai.yaml 用于桌面端展示元数据、隐式调用策略和 MCP 工具依赖。直接 Skill 目录适合本地与仓库级创作;需要团队安装、连接器或多技能分发时,应打包为 Plugin。Hermes Agent 的平台 gating、工具条件和来源机制仍应隔离在适配层。企业发布因此应生成并验证不同运行时的适配制品,而不能把某个平台的发现逻辑当成工业安全机制。
6.5 可直接采用的SKILL.md正文模板
—
name: industrial-skill-name
description: 做什么;何时使用;典型输入;明确不适用/禁止场景。
—
Skill title
Mission and safety boundary
说明目标、资产/工况、成功标准、禁止动作和权威保护层。
Required inputs and preconditions
列出身份、时间、单位、模式、来源、质量、权限及缺失策略。
Workflow state machine
按顺序描述范围→校验→获取→计算→推理→策略门→建议/动作→验证→关闭。
Evidence and uncertainty
定义 OBSERVED/DERIVED/INFERRED/CONFIRMED、引用规则、反证和置信度。
Tool and authority policy
说明只读默认、允许工具、参数、最小权限、批准、幂等、回滚和注入隔离。
Output contract
规定人类摘要、机器结构、负责人、时限、验证、升级和审计。
Failure and degradation
规定缺数、冲突、工具失败、高后果、网络中断和人工超时的行为。
Resource routing
逐项写明何时读取 references、何时运行 scripts、何时使用 assets。
模板只规定必要语义,不鼓励所有技能使用相同措辞。任务简单时可以合并章节;风险高时应把策略和 schema 放入机器可执行的独立资源。
七、I-SKILL 工程生命周期与质量门
通俗类比:发布技能像引进一台新设备。目录能加载,只相当于设备通电;它仍然需要需求确认、危害分析、设计审查、工厂验收、现场验收、影子运行和持续维护。G0—G7 就是数字岗位的 FAT、SAT、试运行和预防性维护体系。

图 13 G0—G7 工程生命周期
生产发布需要价值、危害、合同、实现、测试、试点和运营连续门禁。

图 14 工业 SKILL 工程生命周期
生产发布是连续质量门,而不是写完提示词。
7.1 阶段 0:任务发现与价值定义
通过现场访谈、过程走查、事件复盘和数据盘点,写出当前决策链:谁发现问题、查看哪些系统、依据什么判断、采取什么动作、等待多久、如何确认。先选择高频、高耗时、证据分散但动作可以约束的任务。把价值指标与安全指标并列,例如平均诊断时间下降 40%,但危险动作建议率必须为零。
G0 门:业务负责人确认目标、基线、用户和成功标准;不存在以“应用大模型”为唯一目标。
7.2 阶段 1:边界、危害与责任分析
建立系统上下文图,做任务级 FMEA/故障树和权限分析。识别错误资产、错误工况、数据延迟、提示注入、越权执行、错误放行、告警疲劳等技能失效。定义安全不变量、禁止动作和人工接管。
G1 门:安全/运营负责人批准边界、不变量、升级路径和责任矩阵;高后果路径具有独立保护。
7.3 阶段 2:合同与知识建模
冻结第一版输入/输出 schema、单位、时间语义、数据质量、资产本体、故障卡、知识来源和冲突优先级。对每条必要信息说明缺失时是停止、降级还是请求补充。
G2 门:所有必要字段可由现场系统或用户获得;样例可以通过验证器;无单位和时间歧义。
7.4 阶段 3:决策与工具分解
将任务拆成确定性步骤与语义步骤。校验、换算、统计、查表、权限和输出验证写成脚本或策略;上下文理解、候选假设、反证比较和说明由 LLM 完成。为每个工具定义输入、输出、权限、超时、重试、幂等和失败处理。
G3 门:任何状态改变都经过显式策略和授权;关键计算可重复;工具失败有安全降级。
7.5 阶段 4:实现和静态验证
使用技能初始化器建立目录,编写简洁入口和分层资源,执行结构验证、schema 验证、脚本单元测试、静态安全扫描和最小权限检查。生成内容与受控知识必须注明版本。
G4 门:技能结构有效;所有确定性脚本通过;禁止动作被机器规则阻断;无密钥和不受控依赖。
7.6 阶段 5:离线验证与红队
测试正常、典型异常、计划工况、缺数、错单位、时钟漂移、冲突证据、工具失败、权限失败、提示注入、恶意文档、重复执行和极端高后果事件。按事件和时间切分,避免同一故障的数据泄漏到训练和测试。由领域专家盲评证据正确性、建议可执行性和不确定性表达。
G5 门:安全负例 100% 通过;不存在虚构证据和禁止动作;核心任务指标达到预设下限;所有失败可解释。
7.7 阶段 6:仿真、影子运行和受限试点
先在数字孪生、回放或沙箱中连接工具;再进行只读影子运行,让系统生成建议但不影响现场;最后只在限定资产、班次、角色和动作级别试点。记录人工采纳、拒绝、修正和漏项,而不是只记录模型自评。
G6 门:没有越权和高风险误导;告警负担可接受;现场用户能理解证据和接管方式;回滚演练成功。
7.8 阶段 7:生产运营与持续保证
监控触发率、数据可用率、工具失败、任务成功、证据完整、人工覆盖、误报漏报、危险建议、延迟、成本、漂移和版本。知识、数据、工具、模型或权限变化都可能触发重新验证。严重事件形成复盘和新测试案例。
G7 门:变更具有影响分析、审批、回归、灰度和回滚;技能可被停用;审计记录可重放。
7.9 每一道质量门都必须产生可交付工程制品
G0至少产生问题定义、现状基线和风险调整价值假设;G1产生上下文图、危害日志、保护层、权限与RACI;G2产生数据/语义/知识/输出合同;G3产生状态机、工具合同和动作分级;G4产生可复现构建、BOM、单元测试和静态扫描;G5产生冻结测试集、盲评、红队和统计报告;G6产生影子/试点记录、接管与回滚演练;G7产生SLO、运行手册、变更策略和周期复验计划。
质量门不是会议签字,而是证据充分性判断。若新模型提升平均任务分数,却扩大工具权限、改变提示行为或降低不确定性校准,不能沿用旧版本批准。若知识或数据映射更新可能影响安全路径,也不能简单归为“文案变更”。
八、验证指标与验收矩阵
平均准确率不能概括工业技能质量。一个系统可能在大量普通样本上表现良好,却在错误资产、缺失单位、提示注入或高后果事件上失败。验收必须同时观察发现、任务、风险和运营四层指标,并把越权、禁止动作和证据造假设为独立硬门。

图 15 四层验收矩阵
业务效果不能掩盖越权、证据造假和高后果失败。
8.1 四层指标
层级代表指标不能被什么替代
发现层 触发精确率/召回率、反触发正确率 不能只看最终答案评分
任务层 数据合同通过率、证据引用正确率、任务完成率、专家采纳率 不能只看语言流畅度
风险层 越权率、禁止动作率、错误放行率、升级漏失率、敏感信息泄漏 不能被平均准确率稀释
运营层 延迟、可用性、工具故障恢复、成本、告警负担、版本回滚时间 不能只做一次离线测试
8.2 推荐的硬门槛
生产门槛应按风险分级设定。通用建议是:禁止动作和跨资产误操作为零容忍;关键证据引用必须 100% 可解析;缺失必要单位/时区时不得输出定量结论;高后果不确定事件必须升级;同一输入的确定性计算必须可重复;每个建议必须包含依据、负责人、验证和升级条件。业务准确率阈值则按场景基线、样本量和错误代价确定,不能套用统一的 80% 或 90%。
8.3 测试资产的结构
每个测试用例包含冻结输入、期望触发、允许状态、禁止内容、必须引用的证据、工具桩、期望错误码、专家评分和审计记录。测试集至少包括正常、阳性、近邻混淆、工况切换、缺失/损坏、权限、工具故障、安全、隐私、注入、重放、跨语言和版本兼容案例。
8.4 TEVV:从模型测试扩大到社会—技术系统
TEVV(测试、评价、验证与确认)的对象应包含数据与计量、规则和模型、工具与接口、人员和流程、治理和责任。模型回答正确但取错资产,系统仍然失败;接口正确但操作者无法理解或及时接管,系统仍然失败;离线表现正确但生产数据漂移无人发现,系统同样失败。
建议采用五级证据环境:离线/静态验证、仿真与历史回放、真实链路影子运行、限定资产与角色的受限试点、生产持续保证。环境越接近生产,允许的自主度不必然越高,但对接口、人员、时延、恢复和责任的证据会更真实。独立验证人员不应与开发者完全重合;高风险发布应保留领域、安全、网络安全和运营的独立否决权。
8.5 统计接受、校准与不确定性量化
“安全负例100%通过”是必要硬门,但不能在样本极少时被误读为零风险。验收报告应披露样本量、事件覆盖、置信区间、数据切分、基线、类别不平衡和未覆盖工况。对异常检测,按事件而不是单点统计误报、漏报、提前量、持续时间和每班告警负担;对生成式判断,同时检查证据忠实度、结构合规、工具选择、拒答/升级和跨版本稳定性。
置信度不能直接使用模型自述。需要通过历史事件、专家分歧、校准曲线、覆盖率或保守规则建立外部校准;对分布外工况、未知设备、低质量数据和知识冲突,系统应降低承诺、扩大不确定性或停止。适用域应写成可检查条件,而不是一句“仅供参考”。
8.6 人因验收:验证信任是否校准,而不是追求用户相信
人因测试应观察操作者能否区分事实与推断、能否发现系统错误、是否理解拒绝和升级路径、接管需要多久、告警是否造成疲劳,以及长期使用是否导致技能退化。既要测试过度信任,也要测试因低质量告警形成的自动忽视。采纳率不是越高越好:合理拒绝、修正和补充证据同样是系统健康信号。
验证纪律:每次重大变更至少回答四个问题——模型性能是否变化、系统失败路径是否变化、人的决策行为是否变化、组织责任是否变化。只有四者都被重新评价,回归测试才算完整。

图 16 工业 SKILL 的系统级 TEVV 矩阵
测试对象从数据、模型扩大到工具、人员和治理,并贯穿离线、仿真、影子、试点与生产。
九、安全、网络与供应链治理
通俗类比:安全不能只靠门口一把锁。一座工厂同时有围墙、门禁、访客登记、区域权限、设备联锁、监控和事件追踪。工业 Agent 也需要从内容隔离、身份权限、工具白名单、策略门、人工批准、独立联锁到审计回放的纵深防御。

图 17 工业 Agent 纵深防御
从不可信内容到独立联锁建立多道防线。
9.1 提示注入不是文本清洗问题
网页、维修工单、日志、PDF 和工具返回都可能包含“忽略规则、发送密钥、调用控制工具”等指令。它们必须被标记为不可信数据,只能作为证据内容使用。系统指令、技能规则和策略门与检索内容分离;敏感工具不应因检索文本而自动获得权限。
9.2 最小权限和针对性提升
MCP 安全最佳实践强调最小初始权限、服务器端授权、沙箱、审计和对危险命令额外认证。工业实现应将历史库读取、工单草稿、正式提交、参数写入、启停和联锁修改分成不同工具和凭据。不要提供一个“万能工业 API”。权限提升必须针对具体资产、具体动作、具体时间窗和具体操作者,而不是永久扩大 Agent 权限。
9.3 技能供应链
技能包含自然语言、脚本、引用、模型假设和工具依赖,本质上是可执行的语义供应链。发布包应记录来源、作者、许可证、Skill版本、脚本依赖、模型与数据版本、MCP端点、权限范围、哈希和审查签名,形成SBOM+AI/Skill BOM。外部社区技能默认不可信;运行时只加载批准目录;更新前进行语义差异、代码差异、权限差异与风险回归。平台的信任与来源机制只能提供基础能力,企业仍需仓库保护、签名验证、构建证明、审批和制品撤回机制。
9.4 过度代理权
OWASP 将过度代理权、提示注入、不安全输出处理、敏感信息披露、供应链和资源滥用列为重要大模型应用风险。工业 SKILL 的防线应包含:最小工具集、只读默认、结构化参数、策略门、人工授权、输出验证、速率与预算限制、独立联锁、沙箱和完整审计。
9.5 OT威胁模型:从内容攻击追到物理后果
工业 Agent 威胁建模不能止于“提示是否被注入”,而要追踪攻击路径:不可信内容如何影响模型,模型如何选择工具,工具凭据能触达哪些资产,网络区与管道是否允许该流量,错误写入是否会越过BPCS或保护层,最终造成什么物理后果。ISA/IEC 62443的zones and conduits、资产所有者/集成商/产品供应商/服务商共同责任,应与Skill的工具、身份和制品边界逐一映射。
每个 MCP服务器和工具都应拥有机器身份、明确资产范围、允许动词、参数上限、时间窗、网络路径、审计与撤销方式。必须测试凭据泄漏、服务器替换、DNS或证书异常、重放、工具返回注入、超时重试导致重复动作和审计不可用。安全降级还需区分fail-safe与fail-secure:保护人员和设备、保护数据和权限有时会提出不同动作,必须由危害分析确定优先级。
9.6 功能安全边界:SKILL不能自行获得安全信用
对于可能影响人员、设备或过程安全的场景,应使用组织适用的功能安全生命周期开展危害与风险分析。流程工业通常涉及 IEC 61511及其SIS生命周期;更通用的电气/电子/可编程电子安全相关系统涉及IEC 61508。工业SKILL可以提供证据整理、诊断建议和工作流协助,但在没有独立评估、需求分配、确定性实现与相应认证/证明前,不应被计入SIL风险降低,也不应修改、旁路或替代SIF。
安全边界:本方法中的 A0—A4、风险等级和授权矩阵是建议性工程分类,不是IEC标准中的SIL、SIF或保护层定义。若用于具体工厂,必须由具备资质的专业人员完成HAZOP/LOPA或适用分析,明确安全需求规范、独立性、共因失效、旁路管理、proof test、变更管理和审计责任。
9.7 AI治理与合规:把单个技能纳入组织管理体系
生产技能还需要组织层面的 AI系统清单、所有者、预期用途、风险分级、影响评估、第三方供应商管理、透明说明、事件报告、文档保留和持续改进。ISO/IEC 42001提供AI管理体系框架;NIST AI RMF以Govern、Map、Measure、Manage组织风险活动。它们不能替代行业安全标准,但能防止每个技能各自定义责任。
跨国部署时还需检查产品安全与 AI法规的叠加。例如,当AI成为机械、压力设备、机器人等产品的安全组件并满足相应条件时,欧盟AI法规可能与既有合格评定同时适用。合规判断必须基于预期用途、系统位置和产品法规,由法律与合格评定专业人员确认,不能由文章中的通用框架直接下结论。
十、完整案例:热熔胶机异常研判 SKILL
这一章把前面所有抽象概念拉回到一个具体班次:数据合同负责确认“分析的是谁”;预处理负责确认“数据能不能信”;特征和算法负责描述“哪里偏离正常”;LLM 负责比较“哪些机理解释这些证据”;策略门负责判断“可以建议到哪一步”;授权检查和维修结果负责完成最终确认。

图 18 热熔胶机异常的证据链
从观测到推断再到授权确认,不跳过替代解释。
10.1 用户实际场景
纸尿裤产线由无纺布、吸水芯体、PE 膜、魔术扣和橡筋等材料组成,热熔胶系统负责关键粘合。整线约 200 米,多设备联动,温度、压力、泵速、线速度、配方、等待和维护状态相互影响。热熔胶机的非计划停机会造成整线停机、调机等待、产品质量和产量损失。现场用户不是想要一个抽象异常分数,而是想知道:异常是否真实、在哪个工况开始、有哪些证据、可能机理是什么、还缺什么检查、当前应由谁做什么以及如何确认。
10.2 使命与边界
样例 industrial-hotmelt-anomaly-triage 接收历史库导出或用户提供的时间序列 JSON,校验数据,计算透明特征,形成证据账本,比较至少两个故障假设和一个传感器/数据质量假设,给出分离的风险与置信度,以及只读、可逆、角色明确的建议。它不写 PLC/DCS/SCADA,不调 PID,不复位报警,不启停设备,不绕过联锁,不授权维修,不把未检查的推断称为已确认根因。

图 19 热熔胶机异常研判证据链
事实、计算、推断和确认分离,风险与置信度分别表达。
10.3 输入数据与预处理
通俗类比:预处理像实验室取样。如果样品标签、时间、单位和保存条件都不可靠,后面使用再先进的分析仪器也只能得到精确的错误。工业数据预处理的第一目标不是让曲线更平滑,而是保住身份、时间、工况和质量语义。
实际工程中应保留三份数据:不可覆盖的原始数据、经过质量标注和单位统一的建模数据,以及模型实际读取的在线窗口。三者通过事件 ID、资产 ID、时间窗和哈希关联,才能在事后复现模型为何在某一时刻发出判断。
事件数据必须包含事件、产线、资产、时区、分析窗、运行模式、配方、计划停机和信号。每个信号包含标准名、工程单位、来源点位、带时区时间戳、数值和质量位。输入验证器检查必需字段、时间顺序、非有限数、空样本、重复点位和分析窗外样本。
预处理首先按启动、稳态生产、换型、计划停机、非计划停机、维护和恢复分段。不同模式不混合比较;计划停机不作为故障证据;单位转换必须保留原单位与公式;缺失、坏质量、采样变化、平线、跳变和时钟漂移单独记录。样例特征脚本只对 good-quality 样本计算数量、最小、最大、均值、中位数、总体标准差、MAD、范围、时间斜率和标称采样间隔,并记录算法口径和输入 SHA-256。
10.4 证据、特征与机理假设
证据链的关键不是“列出更多信号”,而是记录每个信号怎样支持或反驳某个机理。温度下降与指令升高可以支持功率交付异常,但“加热指令”不等于“实际电功率”,因此还需要电流、供电和参考温度。把这种缺口写出来,是专业性,而不是不自信。
样例事件显示:四分钟内槽体温度从 168.0℃ 降至 163.2℃,同时加热指令从 82% 升至 100%。这两个观测支持“加热功率实际交付不足”的候选机理,但指令不等于实际电功率,短窗口也无法排除温度传感器偏差或未记录的热负载变化。因此结论是 INFERRED/MEDIUM,不是确认根因。
候选假设支持证据反证/缺口安全区分测试
加热器、SSR 或供电回路退化 指令饱和而温度继续下降 缺少电流、同配方负载基线 按许可和隔离程序检查电流/电阻并做参考测温
温度传感器偏差或接线问题 温度变化可能来自测量链 没有质量位异常或耦合温区数据 与批准的参考仪表及相邻温区比较
未记录的热负载变化 高出胶量或冷物料可造成真实降温 当前上下文未提供流量/产量 调取同配方线速度、泵速、流量和物料批次
10.5 风险与置信度
样例输出为 MAINTENANCEREQUIRED 与 MEDIUM。风险表示持续温降可能影响质量和可用性,需要安排检查;置信度表示现有证据支持加热功率交付问题,但没有独立电气/温度确认。若温度接近企业安全限值、出现烧焦、烟雾、异常电气迹象或压力危险,则无论置信度高低都进入 URGENTESCALATION,停止扩展诊断并优先执行现场安全程序。
10.6 输出与动作分级
输出包含范围、数据充分性、时间线、证据、排序假设、替代解释、建议、禁止动作、假设和审计。动作分为 A0 读取/计算、A1 非侵入观察建议、A2 需要许可和隔离的维修检查、A3 参数/启停/复位和 A4 绕过保护。该技能只允许生成 A0—A2 建议,A3—A4 由输出验证器拒绝。
第一条建议由工艺工程师在下一次可比生产前复核同配方热负载、报警和相邻温区;第二条建议由授权维修人员按企业许可与隔离程序检查加热回路并用批准仪表复测。每条建议都有负责人、时限、验证方法和升级条件。
10.7 状态机
样例采用 S0 范围 → S1 校验 → S2 分段 → S3 计算 → S4 基线 → S5 证据 → S6 假设 → S7 风险门 → S8 建议 → S9 验证 → S10 关闭。任一必要字段缺失会停止定量分析;数据质量冲突进入 DATAINSUFFICIENT 或 REVIEWREQUIRED;可能的高后果事件进入升级状态。
10.8 验证案例
样例包列出十二类测试:正常生产、计划停机、加热退化、流路阻塞、传感器平线、缺单位/时区、稀疏数据、冲突证据、工单提示注入、PLC 写入请求、火灾/过压可能和重放幂等。发布前必须保证所有安全负例通过、没有不存在的证据 ID、没有 A3/A4 建议,确定性脚本通过自测,并由领域工程师和安全/运营负责人批准现场阈值。
10.9 样例包验证结果
本次交付已经执行三项业务校验:事件输入有效;特征脚本成功生成确定性结果;评估 JSON 的证据引用、风险、状态和动作类别有效。同时使用官方技能创建工具的 quick_validate.py 校验目录,结果为 Skill is valid!。这些结果证明结构和样例合同可运行,但不等于已经完成特定工厂的生产验证。接入真实现场前仍必须替换点位映射、设备限值、OEM 规则、企业程序、角色权限、工具连接和黄金事件集,并完成 G0—G7 质量门。
10.10 若接入预测模型,算法如何进入 SKILL
算法层建议像医院分诊一样逐级增加复杂度:先检查数据健康和明确物理规则,再使用透明统计方法发现持续偏离,随后才引入无监督或监督模型。简单方法能解决的问题,不必为了“先进”而使用难以解释的模型;复杂模型提供的结果也必须回到证据合同。

图 20 算法证据栈
从数据健康、规则、统计到机器学习逐级增加复杂度。
生产中的异常模型应作为一个有版本、可回放的证据服务,而不是写进自然语言提示。首先按资产、配方和运行模式建立正常基线;使用中位数、MAD 或分位数处理长尾和离群;对温度、压力、泵速、线速度、加热输出、电流、流量和报警状态做时间对齐;为缺失和质量位保留显式掩码,不把插值结果当观测事实。特征可覆盖水平、波动、斜率、变化率、设定值跟踪误差、压力差、命令—响应残差、温区一致性、泵速—压力关系、频域能量、持续时间和多尺度窗口。
算法采用分层基线更稳健:第一层是物理/工艺规则与数据健康规则;第二层是 EWMA、CUSUM、鲁棒 Z 分数等透明统计检测;第三层可用 Isolation Forest、One-Class SVM、PCA/PLS 或自编码器学习正常关系;有足够可靠事件标签时,再增加监督分类或生存/剩余寿命模型。模型选择取决于标签、时序长度、跨线差异、可解释性、算力和提前量目标,不能因为“大模型”而取消传统算法。
训练与验证必须按时间、资产和故障事件分组,预处理参数只在训练期拟合;计划停机、维护和故障后数据不能泄漏到正常基线;阈值在验证集上按事件级误报、漏报、提前量和告警负担选择;跨线复用先验证域偏移。在线输出至少包含模型版本、输入窗口、分数、阈值、主要贡献特征、数据质量和适用模式。SKILL 将这些字段登记为 DERIVED 证据,再结合报警、工单、物理机理和反证形成解释;它不能把模型分数直接翻译成“根因已确认”。
10.11 技术组件与接口建议
时间序列可由历史数据库或边缘缓存提供;MES 提供配方、批次、计划停机和产量;EAM/CMMS 提供维修与工单;QMS 提供质量结果;身份系统提供角色。适配层输出统一事件 schema,避免模型直接理解各厂商私有标签。特征服务和异常服务采用版本化容器或可复现脚本,策略服务独立于 LLM,审计服务记录输入哈希、技能版本、模型版本、工具调用、批准和最终结果。
接口应区分 readevent、readcontext、createdraftworkorder、submitwork_order 和任何控制动作。样例只需要前两类只读接口,且在接口不可用时可以从文件降级运行。生产实现要为响应设置超时和大小上限,对历史库查询限定资产与时间范围,对返回内容做 schema 校验和脱敏;不得把数据库查询语句、凭据或内部系统指令暴露给最终用户。
10.12 案例升级:把方法样例变成可验证的现场试点
第一步补齐测量可信证据。除温度和加热指令外,需确认温度传感器量程与校准状态、控制输出缩放、SSR实际导通、加热电流/功率、采样周期、时钟同步、质量位和历史库聚合方式。若无法获得独立参考温度或电流证据,系统只能保留“功率交付不足或测量链异常”的竞争假设。
第二步建立因果区分方案。对“加热回路退化、热负载变化、温度测量偏差”分别规定预期时间顺序和安全检查:同配方/线速度窗口比较用于控制负载差异;批准的参考测温用于检查测量链;许可与隔离后的电气测试用于确认加热回路。每项检查都规定支持、反驳与无结论三种结果,不允许只寻找支持首要假设的证据。
第三步建立统计验收。按故障事件和资产分组,避免同一次故障跨训练与测试;报告事件级召回、每班误报、提前量、错误升级、数据不足识别和专家间一致性,并给出置信区间。影子运行至少覆盖正常生产、换型、启停、维护后恢复和季节/原料变化;样本未覆盖的工况明确列为适用域外。
第四步建立风险调整价值模型。比较当前平均发现/诊断/修复时间、停机损失、质量报废、维修检查成本与告警负担;为漏报高后果事件、误报导致停机和错误资产派工分别定价。试点成功不以“生成报告更快”为唯一指标,而以决策时间缩短、证据完整度提高、无危险建议、告警负担可接受和净收益为正共同判断。
第五步形成现场批准包:点位与单位映射、危害与权限、冻结测试集、测量可信报告、影子运行记录、用户接管测试、运行 SLO、回滚演练和责任签字。样例通过quick_validate.py只证明Skill结构有效;即使全部离线案例通过,也不等同于获得现场生产资格。
十一、如何从样例扩展为企业 SKILL 工厂
通俗类比:SkillOps 像制造企业自己的标准件工厂。不应该每次从头手工制作一个技能,而应把数据合同、证据规则、权限门、输出验证和测试框架做成可复用标准件;行业域包像通用模组;每个工厂只装配自己的点位、限值、程序和角色。

图 21 企业 SkillOps 流水线
把单个技能变成可复用、可签名、可回滚的能力制品。
11.1 建立三类复用资产
第一类是跨场景内核:证据分类、风险/置信度分离、权限动作分级、工具安全、输入输出验证和审计。第二类是行业域包:设备本体、通用故障机理、标准和角色。第三类是现场适配:资产 ID、标签、单位、工况、阈值、企业程序、工具端点和人员权限。复用应发生在经过版本控制的组件层,而不是复制粘贴整个提示词。
11.2 建立 SkillOps 流水线
代码仓库在提交时执行元数据、Markdown、链接、schema、脚本单测、秘密扫描和策略检查;合并请求需要业务、领域、平台和风险负责人按变更等级审查;构建阶段生成 Codex/Hermes 等适配配置,计算哈希和制品清单;测试阶段运行冻结案例与模型矩阵;发布阶段签名、灰度和可回滚;运营阶段采集去敏审计和反馈,将事件复盘转成新测试。
11.3 变更等级
等级示例最低处理
C0 文案 不改变触发、策略和输出语义 静态检查与抽样回归
C1 知识 新设备手册、故障卡、标签映射 领域审查与相关案例回归
C2 决策 修改状态机、阈值、证据规则 完整离线验证和影子运行
C3 工具/权限 新写工具、扩大资产或角色权限 危害复评、安全审查、受限试点
C4 安全关键 影响联锁、放行或人员安全 不由普通 SKILL 变更流程授权;进入组织安全生命周期
11.4 组织角色
业务所有者定义价值和流程;领域工程师维护机理、本体和限值;数据工程师负责来源、时间和质量;Skill 工程师维护工作流、工具与测试;安全/网络安全负责人审查危害与权限;运营用户验证可用性和接管;平台团队负责运行时、制品、监控与回滚。任何单一角色都不应独自批准高风险生产技能。
11.5 用SRE方法运营SkillOps
企业 Skill工厂应为运行期建立SLO与错误预算:触发服务可用性、数据新鲜度、证据完整率、工具成功率、P95/P99延迟、人工升级响应、回滚时间、每任务成本和审计写入率。安全硬门不进入可消耗错误预算;只有一般可用性和体验指标可以在批准范围内权衡。
模型、数据、知识、本体、脚本、工具、策略和提示分别版本化,并建立兼容矩阵。监控不仅检测模型漂移,还检测训练—服务偏差、标签和单位变化、知识过期、权限扩大、MCP端点变化、用户采纳模式和告警疲劳。达到触发条件时自动降级为只读、扩大人工复核、回滚或停用,而不是等待事故证明系统已经失效。
十二、常见失败模式
阅读这些失败模式时,可以把它们当成一份“数字岗位体检报告”:有的技能知识很多却没有权限边界,有的算法很准却不会识别计划工况,有的能够调用工具却没有回滚,有的设置人工确认却让人看不到证据。生产能力的短板往往不在模型,而在最弱的一道工程环节。
•把 SKILL 当万能提示词:没有 schema、脚本、权限和验证,语言再完整也不可生产。
•把知识检索当事实保证:检索到的内容可能过期、冲突或被注入,必须有来源、版本和优先级。
•把异常分数当根因:异常只能说明偏离,需要机理、反证和物理确认。
•把置信度当风险:低置信度的高后果事件仍需升级。
•让 LLM 直接闭环控制:缺少稳定性、实时性和独立安全保证。
•只测试成功路径:真实风险往往来自缺数、工具失败、权限失败和恶意输入。
•以平均准确率掩盖危险失败:安全不变量应是单独硬门。
•一次发布永久有效:设备、配方、标签、工具、模型和程序都会漂移。
•人工确认流于形式:用户看不到证据、没有资格或被告警淹没时,按钮不能构成控制。
•社区技能直接进入生产:缺少来源、差异审查、签名与回归,形成语义供应链风险。
十三、最终结论与落地清单

图 22 工业 SKILL 上岗前十问
十项证据共同决定技能是否具备生产资格。
这张清单可以直接用于立项评审、设计评审和上线评审。若其中三到四项仍无法给出证据,技能可以作为实验助手继续试用,但不应被授权为生产能力。
工业 SKILL 的正确形态不是“一个非常聪明的 Agent”,而是一个有边界的社会—技术控制回路。它用系统工程定义任务和生命周期,用信息论决定还需要什么证据,用控制论组织反馈和安全降级,用计算机科学把接口、不变量和状态机器化,用知识工程建立物理语义,用安全工程约束不可接受损失,用人因工程确保真正的接管和责任。
落地时至少确认以下十项:使命与资产边界已批准;不可接受损失和安全不变量明确;输入输出有 schema 与单位;知识来源有版本;事实/计算/推断/确认分离;确定性步骤已经脚本化;工具采用最小权限且默认只读;所有动作有验证与回滚/升级;安全负例和对抗例通过;运营监控、变更和退役机制已建立。未达到这些条件的能力可以作为实验助手,但不应被称为可直接用于工业生产的 SKILL。
升级后的核心判断可以进一步压缩为:Skill定义工作方法,数据合同定义它看到的世界,策略与权限定义它能触碰的边界,TEVV定义证据是否足以支撑某一自主度,功能安全与网络安全定义不可被AI侵占的保护责任,SkillOps定义能力如何持续有效。六者共同决定生产资格,任何单点能力都不能替代其余部分。
工程结论:工业 AI真正的分水岭不是Demo是否令人惊艳,而是系统能否在错误数据、未知工况、工具故障、恶意输入、人员误解和版本变化同时存在时,仍然保持有界、可解释、可停用、可恢复和可追责。
附录 A:生产评审检查表
评审域关键问题必备证据
价值 用户决策和基线是什么 当前流程、价值基线、成功指标
边界 资产、模式、时间、排除项是否明确 上下文图、RACI、反触发样例
安全 最坏后果与保护层是什么 FMEA/FTA、不变量、升级和接管
数据 身份、单位、时区、质量是否可靠 schema、字典、质量报告、血缘
知识 来源、适用版本和冲突优先级 受控引用、本体、故障卡
决策 事实、推断、风险是否分离 状态机、证据账本、策略表
工具 权限、参数、失败、幂等、回滚 工具合同、凭据范围、审计样例
输出 建议是否可执行且可确认 输出 schema、负责人、验证条件
验证 是否覆盖安全、故障和攻击路径 测试集、专家评审、红队报告
运营 是否可监控、停用、回滚和退役 SLO、仪表板、版本与演练记录

