|支付宝| |运维| |MTTR|

从携程到知乎，运维人该如何觉醒？(2)

发布时间:2015-06-17 08:59 作者:佚名来源:互联网运维杂谈点击:加载中...次

　　一、什么是可用性和可靠性

可靠性是在给定的时间间隔和给定条件下，系统能正确执行其功能的概率。可用性是指系统在执行任务的任意时刻能正常工作的概率。先来看一些指标定义：

1. MTBF——全称是Mean Time Between Failure，即平均无故障工作时间。就是从新的产品在规定的工作环境条件下开始工作到出现第一个故障的时间的平均值。MTBF越长表示可靠性越高正确工作能力越强。

2. MTTR——全称是Mean Time To Repair，即平均修复时间。是指可修复产品的平均修复时间，就是从出现故障到修复中间的这段时间。MTTR越短表示易恢复性越好。

3. MTTF——全称是Mean Time To Failure，即平均失效时间。系统平均能够正常运行多长时间，才发生一次故障。系统的可靠性越高，平均无故障时间越长。

可用性Availability = MTBF / (MTBF + MTTR)，一般我们都是用N个9来表达系统可用性，用宕机时长来说更好理解，如果以全年为周期(24*365=8760个小时)，3个9(99.9%)就意味着全年宕机时长是525.6分钟，4个9(99.99%)是52.6分钟，5个9(99.999%)是5分钟。

从这些时间指标上可以反向去推导IT能力不足的地方，比如说一个故障恢复时间很长，一定是自动恢复、运维意识、处理过程、系统架构等地方不对，导致了这个宕机时间过长；平均失效时间短，一定是系统的可靠性出了问题，找技术设计的问题，找依赖的硬件环境问题等等

　　二、影响可用性的因素

影响可用性的因素非常的多，但是可以从几个维度去看，人与组织、流程、技术和业务管理等四个维度。

1、人与组织

其实这个地方可以谈谈你的人和组织类型了，领导是否重视IT？是否重视运维？组织是否已经认识IT带来的价值，把IT当作自己的一个核心能力来看待？是否把面向用户的业务能力和IT能力很好的对接？是否建立起用户质量的组织文化？等等。

2、流程

流程是梳理多个角色自己的关系和职责。我们第一个要去看这个流程在面对故障的是否起到了积极的作用，比如说能够确保故障信息的准确送达，同时保证处理人的角色和职责是清晰的。其次不断去检查流程是否可以自动化驱动，而非人为驱动。人是不可靠之源！我们最终希望形成是一个自动化、标准化的流程，这样的流程不容易被异化，且能保证预期执行结果一致。

3、技术

很多时候大家看到的技术是运维技术，其实恰恰相反对于互联网业务来说，对其高可用的影响，必然是业务IT技术架构，因此在其中需要遵循很多原则，有一些原则需要有普适的参考价值。比如说服务降级、灰度发布、过载保护、服务公共化等等。这些方法论是否已经融入到研发和运维的架构设计哲学之中？现实是产品功能需求优先，而非可运维性优先，可运维性最终就是业务的质量。

4、业务管理

把你的IT能力最终都业务能力看板化，你可以转换成我们多个业务指标，比如说质量、可用性、用户体验、用户满意度、成本等等，有了这些业务导向性指标，才能把IT能力和业务更好的对接起来。否则很容易在组织内，形成“IT是支撑部门”认识，而非创造价值部门。这一点还有一个重要性，就是让IT部门也要足够的认识到，他们的能力直接和业务相关，需要增强业务敏感度。

　　三、如何提高系统的可用性

刚刚上面讲到了影响可用性的因素，分成了四个方面，但我想提高系统的可用性从另外一个角度来描述，能把握一些核心准则(其实还有更多)。

1、故障发生前，建立运维质量仪表盘

我们一定要建立运维数据看板，这个看板的数据并且要在业务、研发、测试和运维达成一致，让大家足够重视这份数据，这样数据便有了推动力。建议这个地方的核心数据指标不要太多，因为涉及到多个团队，大家不能够一致理解，特别是传达到管理层，太多的指标，容易失去关注的焦点。

通行的做法，就是用可用性来做运维的数据看板。可用性的计算方法有简单的方法，也有复杂的方法。简单的方法就是在监控系统中搞一些探针来模拟用户监控，最后我们能得出故障的时长和可用性的时间，这样我们可以建立每天、每周、每月、每Q的可用性，可以做到分业务、分服务(更细粒度)等等；复杂的方法在模拟数据的基础上，可以把事件系统记录的时间数据拿过来作为评估的标准。另外可以把可用性上升到质量层面，这个里面涉及到的评估维度(成本、用户体验、满意度)就更多了，数据获取的来源也变得更多，有些是来自于客服系统，有些是来自于舆情监控，有些是来自于运维容量系统，有些是来自于事件系统等等，不过最终呈现的指标就是一个---质量。

运维的数据看板，最好能变成产研侧KPI的一部分，同时在运维和研发侧，需要周期性的把这份数据推送到他们面前。有了KPI，同时有了持续滚动机制，一定能建立起很好的业务质量意识。

一直觉得，数据文化，是运维能够建立影响力的重要一步，否则你就是一个支撑的支撑部门！

2、故障发生前，设定技术准则和要求

运维需要和研发建立整体的技术标准和规范要求，这块是腾讯做得非常好的地方，把海量服务提炼成多个关键词【海量服务运营之道】，网上可以搜索到。当然这些关键词对于很多企业来说，想理解准确，也会非常的困难。因此从运维的角度来说，我们需要设定一个路线图，最终服务于这个技术目标。比如说之前我提到的【运维三部曲】里面讲到了先做标准化(修炼运维内功)，然后做公共服务化(修炼架构内功)、最终服务无状态化(修炼业务内功)。

(责任编辑：安博涛)