公司动态
A05 | 硬件安全指标体系:PMHF、SPFM、LFM 三大指标的本质与计算
1. 开篇——一个数字决定的命运2020 年某国内 Tier 1 供应商的制动 ECU 项目进入最终评审阶段。硬件设计团队信心满满——原理图评审通过、EMC 测试通过、环境可靠性测试通过。然而在功能安全评审会上一个数字像一盆冷水浇下来PMHF 计算结果为 2.3 × 10−8/h而 ASIL D 的目标门槛是 10−8/h——超标 2.3 倍。PMHFProbabilistic Metric for random Hardware Failures随机硬件失效概率度量。这个看起来冷冰冰的数字代表的含义是每小时发生危险随机硬件失效的概率是 2.3 × 10−8也就是大约每 4975 年才会发生一次危险失效。听起来似乎很安全但 ISO 26262 对 ASIL D 的要求是更严格的 10−8/h大约每 11415 年一次2.3 倍的差距意味着硬件架构必须重新设计。团队的整改方案很痛苦在主处理通道之外增加一个独立的冗余监控通道让两个通道交叉比对、互相校验。这意味着重新设计 PCB 布局、增加一颗安全 MCU、修改 BOM 清单、重新跑一轮 EMC 测试和温度循环测试。整个项目因此延期 4 个月直接成本增加超过 800 万元。核心教训硬件安全指标不是设计完了算一算的橡皮图章而是从设计初期就要预算的核心约束。就像建筑的结构安全系数必须在画施工图之前就确定硬件安全指标必须在架构设计阶段就进行预估和分配。本文核心论点ISO 26262 Part 5 定义了三个硬件架构度量指标——SPFM单点故障度量、LFM潜伏故障度量、PMHF随机硬件失效概率度量。这三个指标构成了硬件安全评估的铁三角任何一个不达标硬件架构就不合格。理解三大指标的本质、计算方法和工程实践是功能安全工程师的必备技能。本文将逐一拆解这三大指标的定义、公式、ASIL 对应关系和计算思路并通过一个 ASIL D 制动 ECU 的完整案例展示从理论到实践的全过程。硬件安全指标就像汽车的保险杠测试标准。你不能等车造好了才去测保险杠能不能抗住碰撞——标准必须在设计阶段就定好工程师要据此选择材料、设计结构、安排工序。PMHF 就是那个碰撞测试分数SPFM 是正面碰撞得分LFM 是侧面碰撞得分三项都要过线才算合格。2. 为什么需要硬件架构度量2.1 ISO 26262 Part 5 的定位ISO 26262 Part 5 的全称是《产品开发——硬件级》Part 5: Product Development at the Hardware Level它是整个标准中专门针对硬件工程的部分。Part 5 的核心任务有两个硬件安全需求规范Hardware Safety Requirements定义硬件必须实现哪些安全功能包括安全机制、故障检测时间、故障容忍时间等。硬件架构度量与评估Hardware Architectural Metrics通过 SPFM、LFM、PMHF 三个定量指标评估硬件架构是否足够安全。为什么需要量化度量因为觉得安全和证明安全是两回事。ISO 26262 的哲学是安全不能凭经验、不能凭感觉必须用数据说话。硬件架构度量就是这套用数据说话的方法论。2.2 系统性失效 vs 随机失效在理解硬件度量之前必须先搞清两种根本不同的失效类型维度系统性失效Systematic Failure随机失效Random Failure本质设计或制造过程中内嵌的缺陷特定条件下必然触发硬件元器件随时间推移自然老化或随机损坏根因设计错误、规格遗漏、制造工艺缺陷、软件 bug材料疲劳、电迁移、氧化、过电压击穿等物理过程发生规律所有同型号产品都会在相同条件下出现统计概率分布每件产品独立发生应对策略靠流程防——严格的开发流程、评审、测试靠架构 度量防——冗余、诊断、概率量化ISO 26262 对应Part 2-4管理、概念、系统、Part 6软件Part 5硬件度量、Part 8生产一致性系统性失效像设计图纸画错了——如果一栋楼的承重墙设计强度不够那每一栋用这张图纸盖出来的楼都有问题。这不是概率问题是确定性错误。随机失效像灯泡烧了——你不知道哪盏灯什么时候会烧但你统计一万盏灯后发现平均寿命是 1000 小时可以据此做出概率预测。ISO 26262 的硬件架构度量SPFM/LFM/PMHF针对的就是灯泡烧了这类随机失效通过定量指标证明硬件架构足以应对它们。2.3 三大指标的分工ISO 26262 Part 5 定义了三个互补的硬件架构度量指标它们各有分工、缺一不可指标全称管什么核心问题SPFMSingle-Point Fault Metric单点故障的安全机制覆盖率一个零件坏了我能发现吗LFMLatent Fault Metric潜伏故障的安全机制覆盖率两个零件坏了我在第二个坏之前能发现第一个吗PMHFProbabilistic Metric for random Hardware Failures整体危险随机失效概率这个系统每小时出危险故障的概率是多少注意这三个指标的关系不是三选一而是三个都要达标。如果 SPFM 达标了但 PMHF 超标硬件架构仍然不合格。同样PMHF 达标了但 SPFM 不够也不行。三者共同构成硬件安全的铁三角。3. SPFM单点故障度量3.1 什么是单点故障在讲 SPFM 之前先明确单点故障Single-Point Fault, SPF的定义单点故障是指这样一个故障——它本身就直接导致违反安全目标不需要与其他故障组合。换句话说一个单点故障就是一颗螺丝松了整台机器就垮的那种故障。举个例子制动 ECU 中的主 MCU 发生了输出引脚 stuck-at-high输出引脚卡在高电平故障直接导致制动执行器持续施加制动力——这在高速行驶中可能导致车辆失控。这个 MCU 引脚卡死故障就是一个单点故障因为不需要其他任何故障配合它自己就能引发危险。3.2 SPFM 的定义与公式SPFMSingle-Point Fault Metric衡量的是在所有可能的单点故障中有多大比例能够被安全机制检测到。SPFM 公式ISO 26262 Part 5 Clause 9SPFM 1 − ΣλSPF,undetected / Σλtotal其中ΣλSPF,undetected 所有未被安全机制检测到的单点故障含残余故障的失效率之和Σλtotal 所有硬件故障的失效率之和包括安全故障、单点故障、多点故障等全部故障让我们拆解这个公式分子 ΣλSPF,undetected那些坏了但发现不了的单点故障的总失效率。这个值越小越好——意味着漏检的单点故障越少。分母 Σλtotal系统中所有硬件故障的总失效率作为归一化基准。SPFM 值越接近 1说明安全机制对单点故障的覆盖越充分。3.3 ASIL 等级对应的 SPFM 目标值ASIL 等级SPFM 目标值含义QM无要求质量管理体系即可不要求硬件架构度量ASIL A≥ 90%至少 90% 的单点故障能被检测到ASIL B≥ 97%至少 97% 的单点故障能被检测到ASIL C≥ 99%至少 99% 的单点故障能被检测到ASIL D≥ 99%至少 99% 的单点故障能被检测到注意ASIL C 和 ASIL D 的 SPFM 目标值相同≥ 99%这不意味着两者要求一样。ASIL D 在 PMHF 目标值和 LFM 目标值上都比 ASIL C 更严格详见第 6 章汇总表并且软件和流程要求也更高。3.4 SPFM 的工程含义SPFM 回答的核心问题是如果只有一个零件坏了我有多大把握能发现它假设一个 ECU 有 100 种可能发生的故障模式其中 80 种是单点故障。如果你的安全机制看门狗、CRC 校验、电流监控等能检测到其中 79 种那么SPFundetected 1 种漏检 1 种单点故障如果 Σλtotal 100 FIT10−7/h漏检的 SPF 失效率 0.5 FITSPFM 1 − 0.5/100 99.5%满足 ASIL C/D 要求SPFM 就像烟感器覆盖率——你在大楼里装了一百个烟感器SPFM 衡量的是如果只有一个地方着火了烟感器有多大把握能发现如果 SPFM 是 99%意味着平均 100 次着火中有 99 次烟感器能报警只有 1 次可能漏报。对于 ASIL D 这种事关生命安全的等级ISO 26262 要求至少 99% 的覆盖率。4. LFM潜伏故障度量4.1 什么是潜伏故障潜伏故障Latent Fault的定义比单点故障更微妙潜伏故障是指安全机制未能检测到的多点故障。什么是多点故障Multi-Point Fault, MPF就是需要两个或更多故障同时发生才会导致违反安全目标的故障。单独一个故障不会引发危险但加上第二个故障就会。一个多点故障被安全机制检测到了就叫感知多点故障Detected Multi-Point Fault, DPF——系统知道有问题可以报警或进入安全状态。但如果安全机制没检测到它就成了潜伏多点故障Latent Multi-Point Fault, LMPF——两个故障都存在但系统浑然不知。潜伏故障是隐形炸弹第一个故障已经发生了但系统不知道就像定时炸弹已经埋下了但没人发现。等到第二个故障也发生了——砰违反安全目标。潜伏故障之所以危险正是因为它的潜伏性系统运行正常没有任何报警但实际上已经处于一触即发的危险状态。潜伏故障就像飞机的两个引擎中已经有一个出了故障但飞行员不知道。飞机还能飞因为另一个引擎正常但如果第二个引擎也出了问题——那就是灾难。LFM 衡量的是飞行安全监控系统能否在第二个引擎出问题之前发现第一个引擎的故障如果 LFM 是 90%意味着 100 次单引擎故障中有 90 次能被及时发现只有 10 次成了潜伏炸弹。4.2 LFM 的定义与公式LFM 公式ISO 26262 Part 5 Clause 9LFM 1 − ΣλMPF,latent / Σλtotal其中ΣλMPF,latent 所有潜伏多点故障的失效率之和Σλtotal 所有硬件故障的失效率之和关键区别SPFM 的分子是未被检测到的单点故障含残余故障LFM 的分子是未被检测到的多点故障潜伏多点故障两者的分母都是所有硬件故障的总失效率4.3 ASIL 等级对应的 LFM 目标值ASIL 等级LFM 目标值含义QM无要求质量管理体系即可ASIL A≥ 60%至少 60% 的多点故障能被检测到ASIL B≥ 80%至少 80% 的多点故障能被检测到ASIL C≥ 90%至少 90% 的多点故障能被检测到ASIL D≥ 90%至少 90% 的多点故障能被检测到注意LFM 比 SPFM 的门槛低这并不意味着 ISO 26262 对多点故障不重视。实际上多点故障本身已经需要两个故障同时发生才会危险其天然发生概率远低于单点故障。ISO 26262 的思路是对低概率事件适当放宽度量要求但对高概率事件单点故障施加更严格的要求。4.4 LFM 的工程含义LFM 回答的核心问题是如果有两个零件同时坏了我有多大把握在第二个坏之前发现第一个在实际工程中提升 LFM 的常见手段包括启动自检Power-On Self-Test, POST每次上电时对关键元件做全面检查检测之前潜伏的故障运行时周期自检Runtime Periodic Test在系统运行过程中周期性地对冗余通道进行自检看门狗交叉监控两个独立通道互相监控对方的健康状态电流/电压监测通过监测电路的电气特征来判断元件是否已经发生退化或部分失效5. PMHF随机硬件失效概率度量5.1 PMHF 的定义与本质PMHFProbabilistic Metric for random Hardware Failures是 ISO 26262 Part 5 中最重要的一个定量指标也是唯一一个直接给出概率数值而非百分比的度量指标。PMHF 的定义每小时发生危险随机硬件失效的概率。单位h−1每小时典型数量级10−6 ~ 10−8/hPMHF 的物理含义非常直观假设有 109 辆车每辆车每小时有 1 次机会发生危险硬件失效如果 PMHF 10−8/h那么平均每 109 个车辆运行小时中会发生 10 次危险失效。听起来概率极低但考虑到全球有超过 10 亿辆汽车在运行每小时的总暴露量是巨大的。5.2 ASIL 等级对应的 PMHF 目标值ASIL 等级PMHF 目标值平均失效间隔QM无要求—ASIL A 10−6/h约 114 年ASIL B 10−7/h约 1142 年ASIL C 10−8/h约 11415 年ASIL D 10−8/h约 11415 年注意ASIL C 和 ASIL D 的 PMHF 目标值相同 10−8/h但 ASIL D 在 SPFM 和 LFM 上要求更严格。ISO 26262 在 PMHF 上没有进一步区分 C 和 D但在实践中很多整车厂会为 ASIL D 设定更严格的内部门槛值如 5 × 10−9/h。5.3 PMHF 与 PFHd 的对比熟悉 ISO 13849 的读者会注意到PMHF 与 ISO 13849 的 PFHdPerformance Level 的平均危险失效概率概念类似。两者对比如下维度PMHFISO 26262PFHdISO 13849标准ISO 26262 Part 5ISO 13849-1适用领域道路车辆 E/E 系统机械安全控制系统含义每小时随机硬件危险失效概率每小时平均危险失效概率计算方式FMEDA 概率模型Part 5 Annex D/EMTTFd × DC × CCF简化公式目标等级ASIL A~D 对应 10−6~10−8PL a~e 对应 10−5~10−8特点更精细的概率建模区分 SPF/MPF更简化的查表法依赖分类架构5.4 PMHF 是针对相关项的关键理解PMHF 不是针对某个芯片、某个电阻的指标而是针对相关项item的——即整个安全相关系统。ISO 26262 第 1 部分将相关项定义为在 ISO 26262 中进行安全评估的、在车辆层面实现一个或多个安全功能的系统或子系统。这意味着 PMHF 的计算必须覆盖从传感器到 ECU 到执行器的完整链路而不能只算其中一部分。在工程实践中PMHF 通常通过 FMEDA失效模式、影响及其诊断分析方法将每个元件的失效率按照故障模式和安全机制覆盖率进行汇总计算。6. 三大指标与 ASIL 的对应关系6.1 汇总表格下面是 ISO 26262 Part 5 Clause 9 给出的三大硬件架构度量指标的完整目标值汇总表ASIL 等级SPFM 目标值LFM 目标值PMHF 目标值QM无要求无要求无要求ASIL A≥ 90%≥ 60% 10−6/hASIL B≥ 97%≥ 80% 10−7/hASIL C≥ 99%≥ 90% 10−8/hASIL D≥ 99%≥ 90% 10−8/h三个必须同时满足对于任何 ASIL 等级A/B/C/DSPFM、LFM、PMHF 三个指标必须全部达标。如果 SPFM 99.5%达标 ASIL DLFM 85%不达标 ASIL D 的 90%PMHF 0.5 × 10−8达标 ASIL D那么硬件架构评估结论仍然是不合格。6.2 三脚凳模型三大指标的关系可以用一个三脚凳来形象比喻一条凳子需要三条腿才能站稳——SPFM、LFM、PMHF 就是三条腿。任何一条腿短了凳子就会歪。6.3 QM 等级的特殊性QMQuality Management等级不要求满足 SPFM、LFM 或 PMHF 的目标值。这意味着 QM 元件如车载娱乐系统的音频功放芯片不需要进行硬件架构度量评估。但要注意QM 元件如果用在 ASIL 系统中其失效仍然需要纳入 PMHF 的计算——因为 PMHF 是针对整个相关项的不分元件的 ASIL 等级。7. 故障分类体系——理解指标的前提要正确计算 SPFM 和 LFM必须先理解 ISO 26262 Part 5 定义的一套完整的故障分类体系。这套体系将硬件故障分为六类理解每一类的定义是理解三大指标公式的前提。7.1 六类故障定义故障类型缩写定义是否导致危险安全故障SF不导致违反安全目标的故障如 LED 指示灯故障否单点故障SPF单独发生就直接违反安全目标的故障是如无安全机制覆盖残余故障RF安全机制无法检测到的单点故障是多点故障MPF需要与其他故障组合才会违反安全目标的故障否单独发生时感知多点故障DPF被安全机制检测到的多点故障否已检测到潜伏多点故障LMPF未被安全机制检测到的多点故障潜在危险关键关系残余故障RF是单点故障SPF的一个子集——当安全机制覆盖了某个 SPF 时它就不再是 RF当安全机制没能覆盖某个 SPF 时它就是 RF。类似地潜伏多点故障LMPF是多点故障MPF的一个子集——被安全机制检测到的是 DPF未被检测到的是 LMPF。7.2 故障分类树7.3 故障分类与指标公式的关系理解了故障分类之后三大指标公式的含义就清晰了指标公式中的分子公式中的分母直观理解SPFMΣλRF残余故障失效率Σλtotal全部故障失效率漏检的单点故障占比越小越好LFMΣλLMPF潜伏多点故障失效率Σλtotal全部故障失效率潜伏的多点故障占比越小越好PMHF经过安全机制打折后的残余危险失效率时间h最终每小时危险失效概率8. 安全机制与诊断覆盖率8.1 安全机制的定义和分类安全机制Safety Mechanism是 ISO 26262 中的一个核心概念安全机制是设计用来检测故障、控制故障影响、或使系统进入安全状态的工程手段。没有安全机制硬件架构度量指标就无法达标——因为检测覆盖率为零意味着 SPFM 和 LFM 都是零。ISO 26262 Part 5 Clause 7 将安全机制分为两大类类别实现方式典型手段计入 SPFM/LFM硬件安全机制由纯硬件电路实现看门狗定时器、CRC 校验电路、冗余比较器、电流监控、电压监控、温度保护、双核锁步比较直接计入软件实现的安全机制由软件代码执行软件 CRC 校验、RAM 检测March 算法、栈溢出监控、程序流监控可以计入但需额外论证软件实现的安全机制需要额外论证如果安全机制是由软件实现的那么必须证明安全机制本身的软件不会因为软件 bug 而失效。这意味着需要为安全机制软件也分配 ASIL 等级并按照 Part 6 的要求进行开发。在实际工程中为简化论证高 ASIL 等级的安全机制通常优先采用硬件实现。8.2 诊断覆盖率的概念诊断覆盖率Diagnostic Coverage, DC是指安全机制能检测到的故障比例。它是 SPFM 和 LFM 计算的核心输入参数。对于某个特定的故障模式诊断覆盖率 DC 的定义是DC 被检测到的故障失效率 / 该故障模式的总失效率例如MCU 的某个 RAM 故障模式总失效率为 100 FIT其中 90 FIT 能被 March C 算法检测到那么这个故障模式的 DC 90%。8.3 不同安全机制的典型诊断覆盖率安全机制典型检测目标典型 DC 范围备注看门狗定时器程序跑飞、死循环60%~90%取决于看门狗的类型窗口看门狗 普通看门狗CRC 校验数据存储器/通信数据损坏90%~99%取决于 CRC 多项式和位宽CRC-32 CRC-8RAM 检测March 算法RAM 单元 stuck-at、耦合故障90%~99%March C-/L 算法覆盖率较高双核锁步比较CPU 逻辑错误95%~99%检测逻辑错误能力强但共享故障除外电流/电压监控输出短路、过流、欠压70%~95%取决于监控阈值和响应速度温度监控过温导致的元件退化50%~80%间接检测手段DC 较低端到端通信保护通信链路数据错误90%~99%Alive Counter CRC 组合使用启动自检POST上电时的潜在故障80%~95%仅在上电时执行对运行时故障无效诊断覆盖率就像安检系统的检出率。机场安检用 X 光机、金属探测器、手持探测仪多层检测综合检出率可达 99%。但每种手段各有擅长——X 光机擅长检液体和爆炸物金属探测器擅长检金属武器。硬件安全机制也是如此CRC 擅长检数据损坏看门狗擅长检程序跑飞双核锁步擅长检 CPU 逻辑错误。没有一种安全机制能检测所有故障所以需要多种安全机制组合使用。8.4 诊断覆盖率与 ISO 13849 DC 的异同熟悉 ISO 13849 S05 篇的读者会发现ISO 13849 也有诊断覆盖率Diagnostic Coverage, DC的概念。两者的关系维度ISO 26262 的 DCISO 13849 的 DC用途作为 FMEDA 的输入计算 SPFM/LFM/PMHF直接对应 PL 等级DC 60% / 60-90% / ≥ 90%取值方式精确到具体故障模式的失效率级别分三档低/中/高计算粒度每个故障模式单独计算 DC整通道的综合 DC数据来源FMEDA 分析 元器件失效率数据库制造商数据 经验值查表9. PMHF 计算方法概述PMHF 的计算是硬件安全度量中最复杂、最耗时的部分。ISO 26262 Part 5 提供了两种计算方法分别在 Annex D附录 D和 Annex E附录 E中描述。9.1 简化计算公式Part 5 Annex D简化公式适用于故障独立性假设成立的场景即不同元件的故障相互独立。其核心思想是PMHF_simplified Sum[ lambda_RF Sum( lambda_MPF_latent * lambda_MPF_intermediate * T_mission ) ]其中λRF残余故障的失效率单点故障中未被检测的部分λMPF,latent潜伏多点故障的失效率第一个故障未被检测λMPF,intermediate中间多点故障的失效率第二个故障Tmission任务时间通常取 1 小时简化公式的核心思路PMHF 残余故障的直接贡献 多点故障的组合贡献残余故障RF本身就是危险的所以直接计入 PMHF。多点故障需要两个故障同时发生其概率近似等于两个故障失效率的乘积再乘以任务时间。9.2 完整计算方法Part 5 Annex E完整计算方法考虑了更多因素包括安全机制故障自身的影响安全机制本身也可能失效比如看门狗电路坏了共因故障Common Cause Failure, CCF两个本应独立的通道因为同一根因而同时故障故障暴露时间间隔第一个故障发生后到被检测到或第二个故障发生的时间窗口不同运行模式系统可能在不同工况下有不同的失效率完整方法的计算公式更为复杂通常需要借助专门的 FMEDA 工具如 Exida SILver、TUV SUD FSE、ReliaSoft 等来完成。9.3 两种方法的适用场景维度简化公式Annex D完整方法Annex E复杂度低手工计算可行高通常需要专业工具精度偏保守倾向高估 PMHF更精确适用场景架构评估初期、方案选型比较最终硬件架构评估、安全案例分析CCF 处理不详细考虑 CCF显式建模 CCF安全机制故障忽略安全机制自身失效计入安全机制自身失效9.4 PMHF 计算的输入数据来源无论是简化公式还是完整方法PMHF 计算都需要大量基础数据主要来源包括数据类型来源说明元器件失效率SN29500西门子工业界广泛使用的失效率手册覆盖大部分电子元件元器件失效率FIDES Guide法国考虑使用环境应力的可靠性预测方法元器件失效率IEC TR 62380国际电工委员会的技术报告适用于电子元器件元器件失效率MIL-HDBK-217F美国军用手册早期标准逐渐被 SN29500 取代故障模式分布IEC 61709 / FNEA各类元件不同故障模式的比例分布安全机制 DC供应商数据、工程经验、测试数据特定安全机制对特定故障模式的诊断覆盖率关于数据质量的提示Garbage in, garbage out——PMHF 计算结果的可靠性完全取决于输入数据的质量。在实际项目中元器件失效率数据应优先使用供应商提供的实测数据或经过验证的工业数据库数据而非简单查表。FMEDA 分析中使用的 DC 值也应有工程依据如安全机制的详细设计规格、测试报告等。关于详细的 FMEDA 方法论将在 A06 篇中深入讲解。10. 工程实战ASIL D 制动 ECU 的硬件度量理论讲完了现在用一个完整的工程案例来演示三大指标的计算过程。10.1 场景描述某电子稳定控制系统ESC的制动 ECU安全目标为不得因 ECU 故障导致非预期制动或制动力丧失ASIL 等级为ASIL D。ECU 的关键硬件组件包括组件功能总失效率FIT关键故障模式主 MCU双核锁步制动控制算法运算120stuck-at, 信号线断开安全 MCU独立监控交叉监控主 MCU80stuck-at, 时钟失效供电监控 IC电压/电流异常检测30阈值漂移, stuck-at制动驱动桥驱动制动执行器200输出 stuck-at, 半桥短路扭矩传感器接口采集制动扭矩信号60信号丢失, 信号漂移CAN 收发器车辆网络通信50bus-off, 数据错误10.2 Step 1故障模式分类首先对每个组件的故障模式进行分类SPF / RF / MPF / SF组件故障模式失效率 (FIT)故障类型分类理由主MCU stuck-at15MPF有双核锁步 安全MCU 监控单独发生不直接危险主MCU 信号线断开8MPF安全MCU 通过 SPI 可检测安全MCU stuck-at10MPF主MCU 有自检能力可检测安全MCU异常安全MCU 时钟失效5MPF看门狗可检测供电监控阈值漂移6RF无二次检测手段供电监控 stuck-at4MPF安全MCU 可通过电压采样二次校验驱动桥输出 stuck-at40MPF电流监控 安全MCU 可检测驱动桥半桥短路25MPF电流监控可检测扭矩传感器信号丢失15MPF信号范围检查 冗余传感器可检测扭矩传感器信号漂移8RF漂移幅度小于检测阈值CAN bus-off12SF通信中断不直接导致制动失效CAN 数据错误8MPFCRC 端到端保护可检测10.3 Step 2安全机制配置为每个故障模式分配安全机制并评估诊断覆盖率DC10.4 Step 3SPFM 计算根据故障分类和安全机制配置分子未检测的单点故障失效率之和残余故障供电监控阈值漂移 6 FIT 扭矩传感器信号漂移 8 FIT 14 FIT其他未检测 SPF本设计中所有 SPF 均有安全机制覆盖或属于 MPFΣλSPF,undetected 14 FIT分母所有硬件故障失效率之和Σλtotal 主MCU(120) 安全MCU(80) 供电监控(30) 驱动桥(200) 扭矩传感器接口(60) CAN收发器(50) 540 FITSPFM 计算SPFM 1 − 14 / 540 1 − 0.0259 97.41%判定不达标。ASIL D 要求 SPFM ≥ 99%当前 97.41% 差距明显。主要原因是供电监控 IC 的阈值漂移和扭矩传感器信号漂移这两项残余故障。改进措施增加安全 MCU 的 ADC 采样通道对供电电压进行二次校验消除供电监控残余故障增加冗余扭矩传感器消除扭矩传感器漂移残余故障。改进后残余故障降至约 2 FITSPFM 提升至 1 − 2/540 99.63%达标。10.5 Step 4LFM 计算对于潜伏多点故障需要找出那些未检测到的 MPF主MCU stuck-at15 FITDC 98%未检测部分 15 × 2% 0.3 FIT安全MCU stuck-at10 FITDC 95%未检测部分 10 × 5% 0.5 FIT驱动桥输出 stuck-at40 FITDC 92%未检测部分 40 × 8% 3.2 FIT驱动桥半桥短路25 FITDC 90%未检测部分 25 × 10% 2.5 FITCAN 数据错误8 FITDC 97%未检测部分 8 × 3% 0.24 FITΣλMPF,latent 0.3 0.5 3.2 2.5 0.24 6.74 FITLFM 计算LFM 1 − 6.74 / 540 1 − 0.0125 98.75%判定达标。ASIL D 要求 LFM ≥ 90%当前 98.75% 远超要求。10.6 Step 5PMHF 计算简化公式使用 Part 5 Annex D 的简化公式PMHF lambda_RF Sum( lambda_MPF_latent * lambda_MPF_intermediate * T_mission )残余故障直接贡献λRF 14 FIT 14 × 10−9/h 1.4 × 10−8/h多点故障组合贡献典型项主MCU潜伏0.3 FIT× 安全MCU潜伏0.5 FIT× 1h 0.15 × 10−18/h可忽略驱动桥潜伏3.2 FIT× 供电监控潜伏4 FIT× 1h 12.8 × 10−18/h可忽略多点故障组合贡献在数量级上远小于残余故障贡献10−18 vs 10−8可以忽略不计。PMHF 估算PMHF ≈ 1.4 × 10−8/h判定不达标。ASIL D 要求 PMHF 10−8/h当前 1.4 × 10−8/h 超标 40%。这与本章开篇的案例吻合——残余故障是 PMHF 超标的主因。采取 SPFM 改进措施消除残余故障后λRF 降至约 2 FITPMHF 降至 0.2 × 10−8/h达标。10.7 结果判定汇总指标改进前ASIL D 目标改进后判定SPFM97.41%≥ 99%99.63%达标LFM98.75%≥ 90%98.75%达标PMHF1.4 × 10−8/h 10−8/h0.2 × 10−8/h达标最终结论通过消除残余故障增加供电电压二次校验通道和冗余扭矩传感器三个指标全部达标硬件架构评估合格。这个案例展示了残余故障RF对 SPFM 和 PMHF 的双重影响——RF 既降低 SPFM因为分子增大又直接计入 PMHF因为它是未经安全机制保护的残余风险。消除残余故障就像给大楼加固承重墙的最薄弱点。你不需要加固每一面墙成本太高只需要找到那几块可能被震裂但没人发现的砖残余故障给它们加上额外的支撑。在这个案例中供电监控和扭矩传感器的残余故障就是那几块危险的砖——它们各自只有几个 FIT 的失效率但在 ASIL D 的严格标准下这几个 FIT 就足以让整个硬件架构不达标。11. 常见误区11.1 误区一PMHF 只算处理器不算传感器和执行器错误做法某团队在计算制动 ECU 的 PMHF 时只计算了 MCU 和供电电路的失效率没有把制动驱动桥、扭矩传感器、轮速传感器的失效率纳入。结果 PMHF 看起来达标了但实际系统危险失效概率远高于计算值。正确做法PMHF 的计算范围是整个相关项item从传感器到 ECU 到执行器的完整链路都必须纳入。如果制动 ECU 对外有传感器接口和执行器驱动接口那么这些接口电路的故障模式也需要计入 PMHF。11.2 误区二SPFM/LFM 计算时把安全故障也算进分母这是一个容易混淆的点。回顾公式Σλtotal所有硬件故障的失效率之和包括安全故障是的安全故障SF确实在分母中。但不在分子中——安全故障既不是单点故障也不是多点故障它们对安全目标没有影响。把它们放在分母中是为了归一化确保 SPFM 和 LFM 的值在 [0, 1] 之间。一些工程师错误地把分母理解为只有安全相关故障这是不对的。11.3 误区三认为 ASIL D 就必须用双核锁步架构纠正ISO 26262 并没有规定ASIL D 必须用双核锁步。ISO 26262 只给出了硬件架构度量的目标值SPFM ≥ 99%, LFM ≥ 90%, PMHF 10−8/h而不规定具体的架构形式。理论上你可以用完全不同的架构如异构冗余、时分冗余、检查-确认架构等来达到同样的指标值。双核锁步只是最常见、最成熟的 ASIL D 架构之一但不是唯一选择。11.4 误区四混淆 PMHF 和 FITFailure In Time维度PMHFFIT定义每小时危险随机硬件失效概率每小时所有失效概率10−9 FIT 1 FIT范围只计算违反安全目标的故障计算所有故障包括安全故障安全机制打折已扣除安全机制覆盖的部分不扣除数值关系PMHF 远小于总 FITFIT 是元器件原始失效率简单来说FIT 是元器件的原始失效率PMHF 是经过安全机制打折后的残余危险失效率。一个 100 FIT 的元器件如果安全机制 DC 99%那么它对 PMHF 的贡献只有 1 FIT 10−9/h。11.5 误区五用元器件总失效率代替危险失效率一个 MCU 的总失效率可能是 120 FIT但这 120 FIT 包括了很多故障模式——其中只有一部分会导致违反安全目标。例如MCU 的 GPIO 口 stuck-at如果是用于驱动 LED 的 GPIO这是安全故障SF不计入 PMHFMCU 的 PWM 输出 stuck-at如果用于制动驱动这是危险故障需要计入 PMHFMCU 的调试接口失效通常不影响运行可能是安全故障正确的做法是按故障模式逐一分析而不是用元器件的总失效率一刀切。这就是 FMEDA 方法的价值——它把总失效率按故障模式分解再按安全影响分类最后按安全机制覆盖率打折。12. 与 ISO 13849 的硬件指标对比如果读者已经读过 ISO 13849 系列特别是 S04 的 MTTFd 和 S05 的诊断覆盖率可能会对 ISO 26262 的硬件指标感到既熟悉又陌生。本节做一个系统的横向对比。12.1 PMHF vs PFHd维度PMHFISO 26262PFHdISO 13849标准出处ISO 26262 Part 5 Clause 9ISO 13849-1 Clause 3.1.6全称Probabilistic Metric for random Hardware FailuresAverage probability of a dangerous failure per hour覆盖范围仅计算硬件随机失效计算所有系统危险失效含软件系统性失效的间接影响计算方法FMEDA Annex D/E 概率模型简化公式MTTFd × DC × CCF故障分类SPF / RF / MPF / DPF / LMPF / SF 六类无精细故障分类用 DC 三档替代安全机制建模显式建模安全机制的覆盖率通过 DC 查表简化目标值ASIL A: 10−6, B: 10−7, C/D: 10−8PL c: 10−6, d: 10−7, e: 10−812.2 SPFM/LFM vs DCavgISO 13849 的诊断覆盖率DC和 ISO 26262 的 SPFM/LFM 在概念上相似——都是衡量安全机制对故障的检测能力——但在细节上有显著差异维度SPFM/LFMISO 26262DCavgISO 13849定义方式基于失效率的精确百分比计算基于分类的查表估算取值范围0%~100% 的连续值三个离散档位60% / 60~90% / ≥90%区分对象SPFM 和 LFM 分别计算只用一个综合 DC在标准中的角色独立的硬件架构度量指标PL 确定的输入参数之一12.3 ASIL vs PL硬件度量的不同思路核心差异ISO 26262 的 ASIL 体系通过三个独立的硬件指标SPFM LFM PMHF来约束硬件架构而 ISO 13849 的 PL 体系通过三个输入参数MTTFd DC CCf查表确定等级。ISO 26262 的方法更精确概率建模但更复杂、更耗时ISO 13849 的方法更简洁查表法但精度较低。两个标准各有适用场景——ISO 26262 适合高安全性要求的汽车电子系统ISO 13849 适合需要快速评估的机械安全控制系统。12.4 ISO 26262 vs ISO 13849 硬件指标全面对比对比维度ISO 26262Part 5ISO 13849Part 1随机失效量化指标PMHF概率值PFHd概率值单点故障覆盖率SPFM连续百分比DC三档离散值潜伏故障覆盖率LFM连续百分比无独立指标融入 DC可靠性基础指标FIT元器件失效率MTTFd平均危险失效时间安全机制建模FMEDA 中逐故障模式建模DC 查表 经验值共因故障处理Annex E 显式建模CCF 评分6 项打分验证工具FMEDA 工具Exida, TUV 等SISTEMA 工具免费适用行业道路车辆电子系统机械安全控制系统如果本文对你有帮助欢迎点赞 收藏⭐关注我我会持续更新同系列技术干货专栏《ISO 26262 功能安全深度解读和避坑指南》会汇总完整系列文章和学习路线欢迎查看你在功能安全中遇到的问题欢迎评论区交流