什么样的组织,看起来最有效率?
通常是这样的:人员精简,库存很低,流程很短,很少有人闲着;关键任务交给最熟练的人,采购尽量集中给最稳定的供应商,每个人的时间都排得很满,每一份资源都尽可能被充分利用。
从日常经营指标来看,这样的组织往往确实很漂亮。
成本更低,响应更快,人均产出更高,资源利用率也更好。
而且这并不只是“看起来”高效。
只要现实按照预期运行,这种优化通常真的能够提高效率。
问题在于,同一套让组织越来越高效的方法,也可能在不知不觉中让它越来越脆弱。
关键要看:为了获得这些效率,我们究竟删掉了什么。
高效率通常是怎样一步一步做出来的?
组织优化很少是一次完成的。
它通常由许多个看起来非常合理的小决定组成。
管理者可能会发现:
这个岗位平时好像没有那么忙,能不能少一个人?
为什么两个人都要掌握同一个系统,一个人负责不就够了吗?
第二家供应商价格更高,而且过去几年都没有真正派上用场,为什么还要保留?
团队明明还有一些空余时间,为什么不能再多接一点任务?
备用流程已经很久没有启动,是不是可以取消?
每做一次这样的调整,成本可能都会下降一点,资源利用率也会提高一点。
于是,组织继续优化。
人员越来越精简,库存越来越少,任务越来越集中,时间安排越来越紧,替代路径也越来越少。
从正常状态看,系统越来越漂亮。
但与此同时,另一件事情也正在发生:
那些平时很少使用的备用能力、缓冲空间和替代路径,也在被一点点删除。
被删掉的到底是浪费,还是选择空间?
这是整个问题的关键。
有些重复确实只是浪费。
如果一个岗位、流程或资源被拿掉以后,无论正常情况还是异常情况,系统几乎都不受影响,那么删除它很可能就是合理优化。
但还有一些东西,平时看起来利用率很低,却承担着完全不同的功能。
它们不是为了让系统在正常情况下跑得更快,而是为了让系统在正常情况被打破以后,仍然有别的办法可以走。
比如,一个关键系统虽然平时只需要一个人维护,但还有第二个人真正理解它;一家主要供应商一直工作良好,但企业仍然保留另一条供应渠道;团队的工作安排没有每天都压到极限,而是保留了一些余量。
这些东西平时不会直接制造更高产出。
所以在只看日常效率时,它们很容易显得“多余”。
但它们保存的是另一种能力:
现实一旦偏离计划,组织还能够重新调整。
为什么打仗一定要留预备队?
军事上的预备队,是理解这个问题很直观的例子。
战斗开始以后,前线每个位置都需要力量。从眼前看,把所有兵力立刻投入战斗似乎最有效率。
但真正的作战通常不会这样安排。
必须留预备队。
原因很简单:战场不会完全按照原来的计划发展。
某个方向可能突然被突破,原来的判断可能出现错误,敌人的主攻方向可能发生变化,也可能在另一个位置突然出现一个机会。
如果全部兵力一开始就已经投入固定位置,那么系统虽然把眼前资源利用到了极致,却失去了应对变化的余地。
一旦某个关键位置崩掉,就没有新的力量可以补上。
预备队平时看起来没有直接参加战斗,似乎降低了即时效率。
但它真正保存的是:
当现实和原计划不一样时,仍然能够重新配置力量的能力。
组织里的很多“冗余”,其实承担着类似作用。
它未必是一群真正闲着的人,也可以是一段空余时间、一个备用供应商、一套备份系统、第二个掌握关键知识的人,或者一条平时很少使用的替代流程。
为什么优化会逐渐制造单点失效?
一旦理解了预备队,就很容易看懂另一种现象:单点失效。
假设团队里有一个人做某项关键工作最快、最好。
最自然的选择,就是把越来越多相关任务交给他。
每一次决定都很合理。
但几年以后,可能出现一种结果:越来越多关键知识、判断方式和工作关系,都集中到了这个人身上。
只要他在,整个系统非常高效。
一旦他突然离开,组织才发现自己失去的不只是一个员工,而是一整套其他人无法迅速接替的能力。
供应链也是一样。
如果一家供应商价格最低、质量最好、交付最稳定,那么把更多订单集中过去,在正常情况下完全说得通。
但随着第二、第三条供应路径逐渐消失,组织也越来越依赖唯一的一条路径。
所以,单点失效往往不是某一天突然设计出来的。
它更可能是长期优化的结果:
表现最好的路径不断获得更多资源,表现稍差但可以备用的路径不断被删除。
最后,系统在正常状态下效率越来越高,同时对少数关键节点的依赖也越来越强。
为什么满负荷运行会让组织更脆弱?
这种逻辑不仅适用于人员和供应链,也适用于时间和资源。
假设一个团队每天只使用大约八成能力。
从表面看,还有一部分时间没有被充分利用。
另一个团队则每天都排得满满的,每个人几乎没有空闲,所有资源都接近百分之百使用。
第二个团队的效率指标可能更漂亮。
但只要突然出现一个紧急任务,区别就会马上出现。
第一个团队还有空间吸收变化。
第二个团队则必须把新任务插进已经满负荷的系统,只能通过延期、加班或者牺牲其他工作来处理。
如果几个异常同时发生,局部问题就可能开始互相传递。
所以,没有空余,不一定意味着设计得更好。
有时候,那部分没有被日常任务占满的空间,本身就是组织的“预备队”。
为什么脆弱性在平时很难被看见?
这里还有一个特别容易误判的地方。
一个组织是否脆弱,通常不是在正常状态下最容易看出来。
恰恰相反,一个非常脆弱的组织,在平时可能表现得极其优秀。
因为它已经把大量备用能力删掉了。
人员更少,库存更低,流程更短,资源利用率更高,几乎没有明显闲置。
只要现实没有偏离预期,这些选择甚至会持续证明自己“是对的”。
于是组织还会继续优化。
真正的问题通常要等到异常发生以后才暴露。
某个关键员工突然离开,唯一供应商中断,核心系统故障,需求短时间暴增,或者几个小问题同时出现。
这时人们才会发现,过去被当成成本删除掉的,不只是浪费。
其中还包括了替代、恢复和重新配置的能力。
所以,正常时期的优秀表现,并不能自动证明一个组织具有很强的鲁棒性。
它只能证明:
在目前这些条件下,这个结构运转得很好。
那是不是应该保留越多冗余越好?
当然不是。
冗余本身也有成本。
如果为了应对任何可能发生的事情,都保留大量备用人员、库存、设备和流程,组织会变得昂贵、迟缓,甚至失去竞争力。
所以真正的问题不是:
“效率和冗余到底选哪个?”
而是:
什么样的失败值得我们为它提前保留多少备用能力?
如果某个环节失败以后影响很小,而且很容易恢复,那么备用可以少一些。
如果某个节点一旦失效就可能导致整个系统停止,或者造成难以挽回的后果,那么保留第二条路径的价值就会明显提高。
因此,合理的组织设计,不是简单追求最高效率,也不是简单追求最多冗余。
它需要同时考虑两件事:
正常状态下,系统怎样更有效率地运行;
异常出现以后,系统还能不能继续行动。
真正应该问:拿掉以后会怎样?
这也是判断一项资源到底是“浪费”还是“备用能力”的一个实用方法。
不要只问:
它平时用了多少次?
还应该问:
如果把它拿掉,会发生什么?
哪些工作还能继续?
哪些知识会一起消失?
有没有其他人可以接替?
有没有替代路径?
系统需要多久才能恢复?
一个局部问题会不会继续向其他部分扩散?
如果拿掉以后几乎没有变化,那么它可能确实可以删除。
如果拿掉以后,原本局部的故障会迅速变成整体失效,那么它即使平时利用率很低,也可能具有很高的结构价值。
高效和脆弱,为什么可以同时存在?
现在再回到最开始的问题。
为什么一个组织看起来越来越高效,却可能同时越来越脆弱?
因为这两件事并不矛盾。
高效率通常来自减少闲置、减少重复、缩短路径和集中资源。
而脆弱性增加,往往也来自同一个过程:备用能力减少,替代路径减少,关键能力越来越集中,系统面对意外时可以重新选择的空间越来越小。
所以,同一种优化可以同时产生两个结果:
在预期条件下,跑得更快; 在意外条件下,更容易失去继续运行的能力。
真正健康的组织,不是把所有资源都压到极限。
而是在追求效率的同时,仍然为现实可能出现的偏差保留适当的选择空间。
如果一定要用一句话概括:
效率衡量的是系统在正常状态下能跑多快;鲁棒性衡量的是现实偏离预期以后,它还有多少路可以走。
延伸阅读
《为什么公司不是人的集合?》
为什么组织能力不仅取决于有哪些人,也取决于这些人之间怎样连接和持续运行。