第17章 · 播客 第1集

系统的可靠性分析与设计 · 可靠性指标与串并联模型

🎙️ 本集播客第1集:可靠度、可用度、可维度三个「t 概率」一字不差背下来,再把 MTTF、MTTR、MTBF 的加减关系掰清楚;接着上计算题:串联模型 R 的 n 次方、并联模型 1 减 Q 连乘,连同 0.9 和 0.8 部件的逐例代入演算,以及串并联组合系统的两步套路。 语音由微软 Edge 神经网络语音预生成(女声·晓伊,男声·云希)。点击下方任意对话可直接从该句开始播,当前句朗读时下一句已预先加载,无缝衔接。
🎙️ 第17章播客 第1集
⬇ 下载本集 点击播放
阿明
师姐救命,我模拟卷有道可靠性大题:三个模块串联求系统可靠度,我算得挺顺,答案一对,差了一个数量级。
小雅
十有八九是串联算成并联了。今天第17章,系统的可靠性分析与设计,就从这道题的根上讲起:先搞清可靠性用什么指标来量,再把串联、并联这两套可靠度公式算熟。这章全是定义送分加计算送分,丢了真冤。
阿明
那可靠性这个词,教材有正式定义吗?我记得第5章讲硬件的时候提过一嘴。
小雅
第5章说过,可靠性是计算机系统在规定的工作条件下和规定的工作时间内持续正确运行的概率,衡量它常用平均无故障时间或平均故障间隔时间;还有个 RASIS 特性,是可靠性、可用性、可维护性、完整性、安全性五者的统称。今天第17章是深水区,指标逐个精确定义。
小雅
原文说,与可靠性相关的概念主要有:可靠度、可用度、可维度、平均无故障时间、平均故障修复时间及平均故障间隔时间。前三个都是带时间 t 的函数,我连着念,你抓每个的条件。
小雅
第一,系统的可靠度 R(t),是指在 t 等于 0 时系统正常的条件下,系统在时间区间 0 到 t 内能正常运行的概率。第二,系统的可用度 A(t),是指系统在时刻 t 可运行的概率。第三,系统的可维度 M(t),是指系统失效后,在时间间隔内被修复的概率。
阿明
等一下,可靠度和可用度我只差一个字,考试的时候怎么反应过来是哪个?
小雅
抓「区间」和「时刻」。可靠度盯一段区间:起点 t 等于 0 系统正常,问 0 到 t 之间一直正常运行的概率。可用度只问「时刻 t 这一刻可运行的概率」,不看历史,中间坏过又修好、此刻活着就算数。选项写「时刻 t 可运行」选可用度;写「t 等于 0 正常的条件下、区间 0 到 t 内正常运行」才是可靠度。
阿明
我明白了,可靠度问区间、可用度问时刻,那可维度呢?它的条件最特别。
小雅
可维度的前提是「系统失效后」,问的是在时间间隔内被修复的概率——它管的是修。三个摆在一起记:R(t) 从正常出发看区间,A(t) 只看此刻,M(t) 已经失效看修复。练习第1题就考这个:四个选项分别是可靠度、可用度、可维度、失效率的原话,选「t 等于 0 时系统正常的条件下、区间 0 到 t 内正常运行的概率」那一项。
阿明
刚才最后那个选项里冒出个「失效率」,这是第四个指标?
小雅
对,它就埋在原文里:λ 为失效率,指器件或系统在单位时间内发生失效的预期次数,此处假设为常数。选项里写这句的选失效率。MTTF 的定义:可靠度为 R(t) 的系统,平均无故障时间 MTTF,全称 Mean Time To Failure,定义为从 t 等于 0 时到故障发生时系统持续运行时间的期望值。
小雅
失效率为常数时可得 MTTF 等于 1 除以 λ:比如万分之一次每小时,平均无故障时间就是一万小时,考题来回倒这个倒数。修复侧对称:修复率 μ 指单位时间内可修复系统的平均次数,同样 MTTR 等于 1 除以 μ。
阿明
好,那 MTTR 到底是哪几个词?我老跟 MTTF 打架。
小雅
先把三个缩写摆正。MTTF,Mean Time To Failure,平均无故障时间,「到出故障为止」平均撑多久,量的是无故障运行。MTTR,Mean Time To Repair,平均故障修复时间,「把故障修好」平均花多久。MTBF,Mean Time Between Failure,平均故障间隔时间,「这次故障到下次故障」隔多久。看第二个词就行:To Failure、To Repair、Between Failure。
阿明
那 MTBF 和 MTTF 差在哪?我一直以为它俩差不多大。
小雅
这就是本章第一坑,原文专门点了:MTBF 常常与 MTTF 发生混淆。为什么更大?理由是两次故障之间必然有修复行为,因此 MTBF 中应包含 MTTR。从这次故障到下次故障分两段:正常运行的 MTTF,加上修机器的 MTTR,都算在「间隔」里。所以 MTBF 等于 MTTR 加 MTTF。
阿明
等号右边是加号?!我一直以为故障间隔是纯运行时间,那不就该减掉修复时间吗?
小雅
直觉都这么想,题目就敢把「MTTF 减 MTTR」放在 A 选项钓鱼。按定义推一遍就死心:Between 是「两次故障之间」,中间必然夹着一次修复,只能加进去。数值上验证:平均运行九百九十小时坏一次、修一次十小时,MTBF 就是一千小时,九百九十加十。练习第2题就考这个关系,选项分别是减、加、乘、除,答案选「MTBF 等于 MTTF 加 MTTR」。
小雅
补充一句防身:原文说对可靠度服从指数分布的系统,从任一时刻到故障的期望时间都相等,这是该关系式的前提。考「为什么 MTBF 包含 MTTR」,答「两次故障之间必然有修复行为」这句原话。
阿明
行,指标我扛住了。快进入我翻车的那道题:串联到底怎么算?
小雅
先立前提,组合模型有几条假设:系统只有运行和失效两种状态;每个部件也只有运行和失效两种状态;部件的失效是独立的。计算思路是把系统分解成简单子系统,先算子系统再组合,最简单的就是串联和并联。
小雅
串联系统的定义:由 n 个模块构成的系统中,任意一个模块失效将导致系统失败。原文说得很精确:系统的最低资源要求是所有模块全部运行,只有全 0 系统能使系统运行——0 表示运行、1 表示失效,n 个模块得全是 0。像一串珠子,断一颗整串就断。
小雅
结论:串联系统的可靠度是各个模块可靠度的乘积,R_sys 等于 R1 乘 R2 一直乘到 Rn。如果 n 个模块可靠度相同都是 R,那就是 R 的 n 次方。这个公式念出来就是「谁都要活着,所以概率连乘」。
阿明
来道题我上手试试,光听公式我记不牢。
小雅
就从你翻车那道入手:某系统由 3 个相同模块串联构成,每个模块的可靠度为 0.9,求系统可靠度。逐步来:第一步,判断结构,三个模块串成一串,任意一个失效系统就失效,是串联系统。第二步,套公式,系统可靠度等于各模块可靠度的连乘积;三个模块相同,即 0.9 的 3 次方。第三步,算数:0.9 乘 0.9 等于 0.81,0.81 再乘 0.9 等于 0.729。答案 0.729。
阿明
0.729?我那天填的是 0.999,怪不得差一个数量级。看来我就是把并联的算法安到串联头上了。
小雅
0.999 是三个 0.9 并联的结果,马上验证给你看。先记这个冲击:三个九成的部件串起来只剩七成出头,比最差那个模块还低——链路越长系统越脆,道理在这。练习第8题直接问「n 个模块构成的串联系统可靠度」,选项里那个 1 减失效概率连乘其实是并联公式,专钓背混的人;正确答案是各模块可靠度的连乘积。
阿明
那并联系统呢?我隐约记得是用「失效概率」算的。
小雅
并联系统的定义:由 n 个模块构成的系统中,只要有一个模块可运行,系统就可运行。原文同样精确:系统的基本资源是一个模块,除了全 1 系统状态外系统都可运行——只有 n 个模块全部失效系统才失败。算它要反面思考:正着算「至少一个活着」太繁,反着算「全死」只有一种情况,概率是各失效概率的乘积,再用 1 减。所以并联可靠度:R_sys 等于 1 减 Q1 乘 Q2 一直乘到 Qn,Qi 等于 1 减 Ri,是模块 i 的失效概率。
阿明
我复述一遍:并联是先算所有模块同时失效的概率,再用 1 去减,对吧?
小雅
完全正确。上例题,还和刚才对照:3 个相同模块并联,每个可靠度 0.9,求系统可靠度。第一步,判断结构,只要一个活着系统就活着,是并联。第二步,先把可靠度换算成失效概率:每个模块 Q 等于 1 减 0.9,等于 0.1。第三步,套公式:系统可靠度等于 1 减 0.1 的 3 次方。第四步,算数:0.1 乘 0.1 乘 0.1 等于 0.001,1 减 0.001 等于 0.999。这就是你那天填错的 0.999 的真实身份。
阿明
这下它从哪来的都懂了:0.9 串联是 0.729,并联是 0.999,正是那道题的两个选项。
小雅
考试就爱这么出。再换个数字:两模块并联,各 0.8。失效概率 Q 等于 0.2;两个 0.2 相乘得 0.04;1 减 0.04 等于 0.96。对称结论:n 个相同模块并联,公式是 1 减去 1 减 R 的 n 次方。练习第9题考原公式:选项 A 连乘可靠度是串联;D 是 1 减 Ri 连乘,符号套错;C 直接求和,概率不能相加;正确答案是 1 减 Qi 连乘。
阿明
我发现串并联的口诀刚好是镜像的:串联连乘可靠度,并联连乘失效概率再取反。
小雅
总结得好,就这么背。考题再升一级就是串并联组合系统,下午案例分析的常客。定义:一个系统由 N 个子系统并联而成,每个子系统又由 n 个元件串联而成,称为串并联系统。算法先内后外:子系统内部串联连乘得可靠度,再把各子系统的失效概率相乘、用 1 减,完成外层并联。
阿明
真考起组合的,我该怎么下手?中间哪步最容易错?
小雅
套路固定三步。一,看图切结构,认清每条并联臂里的元件是不是串联。二,算每条臂,臂内串联连乘。三,臂间并联,各自取失效概率、相乘后用 1 减。最常见的错法是「串并联不分、一步连乘到底」。防错窍门:每步问自己,手里这个数是可靠度还是失效概率。
小雅
再补一个结论:若每个元件可靠度都是 R、每条臂 n 个元件、共 N 条臂,整个系统可靠度等于 1 减去 1 减 R 的 n 次方的 N 次方。这个形式原文明确给出,选择题认得出就行。
阿明
串联越串越不可靠、并联越并越可靠,这个方向性也是考点吧?
小雅
是常识级考点,要能举数说明:三个 0.9 串联得 0.729,低于 0.9;三个 0.9 并联得 0.999,高于 0.9。但并联收益递减:两个 0.8 并联已到 0.96,再堆提升越来越小而成本线性加,所以工程里冗余通常二重、三重就打住——这个话题第3集讲冗余时再展开。
小雅
本集必背,跟我过一遍。一,三大指标原话:可靠度 R(t),t 等于 0 时系统正常的条件下,区间 0 到 t 内正常运行的概率;可用度 A(t),时刻 t 可运行的概率;可维度 M(t),系统失效后在时间间隔内被修复的概率;失效率,单位时间内发生失效的预期次数。
阿明
二三四我来:MTBF 等于 MTTR 加 MTTF,理由是两次故障之间必然有修复行为;MTTF 等于 1 除以 λ,MTTR 等于 1 除以 μ;串联连乘可靠度、相同模块就是 R 的 n 次方,三个 0.9 串联得 0.729;并联是 1 减失效概率连乘,三个 0.9 并联得 0.999;串并联组合,先内连乘、后外取补。这句口诀我刻在脑子里了。
小雅
下一集讲故障:失效、故障、错误三兄弟怎么区分,永久性、间歇性、瞬时性三种表现形式,还有逻辑级、数据结构级、软件级、系统级四级故障模型——那边的干扰项,坑得比今天还刁钻。