为什么一个组织看起来更高效,却可能变得更脆弱?

同一种效率优化可能同时删除备用能力和替代路径,使系统在正常状态更快、在异常状态更脆弱。

什么样的组织,看起来最有效率?

通常是这样的:人员精简,库存很低,流程很短,很少有人闲着;关键任务交给最熟练的人,采购尽量集中给最稳定的供应商,每个人的时间都排得很满,每一份资源都尽可能被充分利用。

从日常经营指标来看,这样的组织往往确实很漂亮。

成本更低,响应更快,人均产出更高,资源利用率也更好。

而且这并不只是“看起来”高效。

只要现实按照预期运行,这种优化通常真的能够提高效率。

问题在于,同一套让组织越来越高效的方法,也可能在不知不觉中让它越来越脆弱。

关键要看:为了获得这些效率,我们究竟删掉了什么。

高效率通常是怎样一步一步做出来的?

组织优化很少是一次完成的。

它通常由许多个看起来非常合理的小决定组成。

管理者可能会发现:

这个岗位平时好像没有那么忙,能不能少一个人?

为什么两个人都要掌握同一个系统,一个人负责不就够了吗?

第二家供应商价格更高,而且过去几年都没有真正派上用场,为什么还要保留?

团队明明还有一些空余时间,为什么不能再多接一点任务?

备用流程已经很久没有启动,是不是可以取消?

每做一次这样的调整,成本可能都会下降一点,资源利用率也会提高一点。

于是,组织继续优化。

人员越来越精简,库存越来越少,任务越来越集中,时间安排越来越紧,替代路径也越来越少。

从正常状态看,系统越来越漂亮。

但与此同时,另一件事情也正在发生:

那些平时很少使用的备用能力、缓冲空间和替代路径,也在被一点点删除。

被删掉的到底是浪费,还是选择空间?

这是整个问题的关键。

有些重复确实只是浪费。

如果一个岗位、流程或资源被拿掉以后,无论正常情况还是异常情况,系统几乎都不受影响,那么删除它很可能就是合理优化。

但还有一些东西,平时看起来利用率很低,却承担着完全不同的功能。

它们不是为了让系统在正常情况下跑得更快,而是为了让系统在正常情况被打破以后,仍然有别的办法可以走。

比如,一个关键系统虽然平时只需要一个人维护,但还有第二个人真正理解它;一家主要供应商一直工作良好,但企业仍然保留另一条供应渠道;团队的工作安排没有每天都压到极限,而是保留了一些余量。

这些东西平时不会直接制造更高产出。

所以在只看日常效率时,它们很容易显得“多余”。

但它们保存的是另一种能力:

现实一旦偏离计划,组织还能够重新调整。

为什么打仗一定要留预备队?

军事上的预备队,是理解这个问题很直观的例子。

战斗开始以后,前线每个位置都需要力量。从眼前看,把所有兵力立刻投入战斗似乎最有效率。

但真正的作战通常不会这样安排。

必须留预备队。

原因很简单:战场不会完全按照原来的计划发展。

某个方向可能突然被突破,原来的判断可能出现错误,敌人的主攻方向可能发生变化,也可能在另一个位置突然出现一个机会。

如果全部兵力一开始就已经投入固定位置,那么系统虽然把眼前资源利用到了极致,却失去了应对变化的余地。

一旦某个关键位置崩掉,就没有新的力量可以补上。

预备队平时看起来没有直接参加战斗,似乎降低了即时效率。

但它真正保存的是:

当现实和原计划不一样时,仍然能够重新配置力量的能力。

组织里的很多“冗余”,其实承担着类似作用。

它未必是一群真正闲着的人,也可以是一段空余时间、一个备用供应商、一套备份系统、第二个掌握关键知识的人,或者一条平时很少使用的替代流程。

为什么优化会逐渐制造单点失效?

一旦理解了预备队,就很容易看懂另一种现象:单点失效。

假设团队里有一个人做某项关键工作最快、最好。

最自然的选择,就是把越来越多相关任务交给他。

每一次决定都很合理。

但几年以后,可能出现一种结果:越来越多关键知识、判断方式和工作关系,都集中到了这个人身上。

只要他在,整个系统非常高效。

一旦他突然离开,组织才发现自己失去的不只是一个员工,而是一整套其他人无法迅速接替的能力。

供应链也是一样。

如果一家供应商价格最低、质量最好、交付最稳定,那么把更多订单集中过去,在正常情况下完全说得通。

但随着第二、第三条供应路径逐渐消失,组织也越来越依赖唯一的一条路径。

所以,单点失效往往不是某一天突然设计出来的。

它更可能是长期优化的结果:

表现最好的路径不断获得更多资源,表现稍差但可以备用的路径不断被删除。

最后,系统在正常状态下效率越来越高,同时对少数关键节点的依赖也越来越强。

为什么满负荷运行会让组织更脆弱?

这种逻辑不仅适用于人员和供应链,也适用于时间和资源。

假设一个团队每天只使用大约八成能力。

从表面看,还有一部分时间没有被充分利用。

另一个团队则每天都排得满满的,每个人几乎没有空闲,所有资源都接近百分之百使用。

第二个团队的效率指标可能更漂亮。

但只要突然出现一个紧急任务,区别就会马上出现。

第一个团队还有空间吸收变化。

第二个团队则必须把新任务插进已经满负荷的系统,只能通过延期、加班或者牺牲其他工作来处理。

如果几个异常同时发生,局部问题就可能开始互相传递。

所以,没有空余,不一定意味着设计得更好。

有时候,那部分没有被日常任务占满的空间,本身就是组织的“预备队”。

为什么脆弱性在平时很难被看见?

这里还有一个特别容易误判的地方。

一个组织是否脆弱,通常不是在正常状态下最容易看出来。

恰恰相反,一个非常脆弱的组织,在平时可能表现得极其优秀。

因为它已经把大量备用能力删掉了。

人员更少,库存更低,流程更短,资源利用率更高,几乎没有明显闲置。

只要现实没有偏离预期,这些选择甚至会持续证明自己“是对的”。

于是组织还会继续优化。

真正的问题通常要等到异常发生以后才暴露。

某个关键员工突然离开,唯一供应商中断,核心系统故障,需求短时间暴增,或者几个小问题同时出现。

这时人们才会发现,过去被当成成本删除掉的,不只是浪费。

其中还包括了替代、恢复和重新配置的能力。

所以,正常时期的优秀表现,并不能自动证明一个组织具有很强的鲁棒性。

它只能证明:

在目前这些条件下,这个结构运转得很好。

那是不是应该保留越多冗余越好?

当然不是。

冗余本身也有成本。

如果为了应对任何可能发生的事情,都保留大量备用人员、库存、设备和流程,组织会变得昂贵、迟缓,甚至失去竞争力。

所以真正的问题不是:

“效率和冗余到底选哪个?”

而是:

什么样的失败值得我们为它提前保留多少备用能力?

如果某个环节失败以后影响很小,而且很容易恢复,那么备用可以少一些。

如果某个节点一旦失效就可能导致整个系统停止,或者造成难以挽回的后果,那么保留第二条路径的价值就会明显提高。

因此,合理的组织设计,不是简单追求最高效率,也不是简单追求最多冗余。

它需要同时考虑两件事:

正常状态下,系统怎样更有效率地运行;

异常出现以后,系统还能不能继续行动。

真正应该问:拿掉以后会怎样?

这也是判断一项资源到底是“浪费”还是“备用能力”的一个实用方法。

不要只问:

它平时用了多少次?

还应该问:

如果把它拿掉,会发生什么?

哪些工作还能继续?

哪些知识会一起消失?

有没有其他人可以接替?

有没有替代路径?

系统需要多久才能恢复?

一个局部问题会不会继续向其他部分扩散?

如果拿掉以后几乎没有变化,那么它可能确实可以删除。

如果拿掉以后,原本局部的故障会迅速变成整体失效,那么它即使平时利用率很低,也可能具有很高的结构价值。

高效和脆弱,为什么可以同时存在?

现在再回到最开始的问题。

为什么一个组织看起来越来越高效,却可能同时越来越脆弱?

因为这两件事并不矛盾。

高效率通常来自减少闲置、减少重复、缩短路径和集中资源。

而脆弱性增加,往往也来自同一个过程:备用能力减少,替代路径减少,关键能力越来越集中,系统面对意外时可以重新选择的空间越来越小。

所以,同一种优化可以同时产生两个结果:

在预期条件下,跑得更快; 在意外条件下,更容易失去继续运行的能力。

真正健康的组织,不是把所有资源都压到极限。

而是在追求效率的同时,仍然为现实可能出现的偏差保留适当的选择空间。

如果一定要用一句话概括:

效率衡量的是系统在正常状态下能跑多快;鲁棒性衡量的是现实偏离预期以后,它还有多少路可以走。


延伸阅读

《为什么公司不是人的集合?》
为什么组织能力不仅取决于有哪些人,也取决于这些人之间怎样连接和持续运行。