如果把几个 AI 放在一起,它们就自动变成一个“AI 组织”了吗?
不一定。
十个模型可以只是十个彼此重复的回答器;一个足够强的模型加上工具、记忆和不同功能模块,也可能完成过去需要多个 agent 才能完成的工作。所以,这篇文章的主张从来不是“模型越多越好”,更不是“未来 AGI 一定要由很多大模型组成”。
这里真正关心的是另一个问题:
当任务需要的能力、信息、验证、持续性或协调行动已经超出单一节点能够有效覆盖的范围时,组织本身会不会成为一种真实的系统能力变量?
这也是理解 AI 组织最重要的第一步:模型数量不是组织的定义,功能关系才是。
一个角色,不等于一个模型
公司里有销售、审核、执行、复核等角色,但“一个角色”并不等于“一个人”。一个人可以同时承担多个角色,同一个角色也可以由多人共同完成。
AI 也一样。
发起任务、获取外部信息、提出方案、检查证据、批准行动、观察结果,这些首先是功能角色(functional roles)。它们可以由不同模型承担,也可以由同一个模型在不同状态下承担;还可以由 AI、确定性软件、工具、传感器和人共同完成。
因此:
Role ≠ Model。
Connection Theory 对“必须一个大模型还是多个模型”保持架构中立。理论规定的是需要解释哪些功能关系,而不是预先指定这些关系必须由几个 LLM 实现。
这一区分很重要。否则,我们很容易把“多 agent”本身误当成“组织”,也容易把某个具体工程架构误当成理论要求。
单个节点很强时,组织完全可能是额外成本
对于边界清楚的小任务,一个很强的个体往往比组织更有效率。优秀工程师解决一个局部技术问题,可能比先开会协调更快;一个强模型完成一次明确推理,也可能比多个 agent 互相讨论更便宜、更稳定。
所以,组织不是默认更优。
真正需要比较的是:任务需求、单节点能力、差异化贡献和协调成本之间的关系。
如果一个节点已经能覆盖相关任务,新增组织主要带来通信、等待和错误传播,那么组织可能只是在增加开销。只有当任务真正需要超出单节点覆盖范围的能力时,组织才更可能产生净增益。
人类集体解决问题的实验,早就出现过同一种现象
这个问题并不是从 multi-agent AI 才开始的。
早在 1951 年,Leavitt 就用五人小组比较了不同的 communication network,包括 wheel、chain、Y 和 circle。参与者面对的是可比较的任务,但通信结构不同。结果不仅影响准确率和活动量,还影响成员满意度、领导者是否出现,以及小组最终形成怎样的组织方式。
这里不能推出“中心化永远更好”。真正值得保留的是一个更窄的结果:当任务和参与者总体可比时,仅仅改变人与人之间可以怎样通信,集体行为就会改变。
Mason 与 Watts(2012)把这个问题控制得更干净。他们让 16 人小组共同搜索一个复杂问题,每个人都固定只有 3 个邻居。也就是说,节点数量不变,每个节点的局部连接数也不变,主要改变的是:谁和谁连接。
结果表明,集体搜索表现会随着网络拓扑改变。
可以把这个结果压缩成:
但这还没有走到“组织”的全部含义。
Bernstein、Shore 与 Lazer(2018)进一步改变的不是“谁和谁能连接”,而是什么时候允许彼此影响。三人小组解决同一种旅行商问题,有的始终能看到彼此的解法,有的间歇性开放互动,有的完全独立。间歇性互动在保留探索能力的同时,又获得了社会学习的收益。
这说明:
一条连接在结构上“存在”,并不意味着它在组织运行中必须持续处于激活状态。
Almaatouq 等人(2021)又补上了另一层条件。他们在 1,200 名参与者中系统改变任务复杂度,并比较互动小组与独立个体。随着任务变复杂,集体协作带来的 synergy 与 process loss 之间的平衡发生变化:复杂任务上,小组相对更有效;简单任务上,协调成本更容易抵消收益。
因此,组织价值是相对于任务的。不能离开任务结构,抽象地说某种协作方式“本身更好”。
把这些人类实验放在一起,可以看到一条很稳定的经验线索:集体能力不仅取决于节点本身,还取决于通信结构、互动时间以及任务结构。
Multi-agent AI 现在也出现了结构上类似的结果
最近的 multi-agent AI 实验,在完全不同的物理载体上重新出现了这种组织层差异。
Kim 等人(2026)在一个受控实验中比较 single-agent 和四种 multi-agent coordination architecture。他们保持 task prompt、tool interface 和 system-level compute ceiling 一致,主要改变 coordination structure 和 model capability。实验覆盖 260 个配置、6 个 agentic benchmark 和 3 个 LLM family。
结果并不存在一个“多 agent 必然更强”的方向。Finance 类任务可以从合适的 multi-agent coordination 中获得很大收益;而在 PlanCraft 这类强顺序依赖任务上,多 agent 反而明显变差。单 agent 基线能力,也是判断额外协作是否有价值的重要预测因素。
这里真正重要的不是哪一种 architecture 赢了,而是:没有任何一种固定协作方式在所有任务上都占优。
可以把 AI 侧的结果写成:
这并不意味着人类小组和 LLM agents 的机制相同。能够得到的只是一个更谨慎的结论:organization 本身值得作为独立研究对象。
拓扑不是组织
这些实验还把另一个容易混淆的问题变得很清楚。
拓扑告诉我们哪些节点可以互动,但它并不能告诉我们这些连接在真实运行中怎样被使用。
两个系统可以拥有同一张 graph,却在实际运行中完全不同:哪些连接现在被激活、信息什么时候发送、谁先行动、谁负责验证、哪些信号被放大或抑制、不同路径的权重有多大,以及这些关系会不会随着时间而改变。
Topology 告诉我们谁可以互动;organization 告诉我们系统实际上怎样运行。
为了分析这个区别,可以暂时把某个时刻的组织拆成:
其中:
- :节点及其当前能力;
- :可用的连接拓扑;
- :功能角色或局部运行规则;
- :真实的信息流动力学,例如 routing、timing、sequencing、validation、synchronization 和 coordination intensity;
- :与当前运行相关的组织历史或保留状态。
这里的 tuple 只是一个分析性拆分,不是新的正式 Connection Theory 方程,也不意味着所有组织都必须按照这种形式被实现。
它真正想强调的,是 Connection Theory 一直区分的几个层次:
因此,拥有一张“连接清单”还不等于拥有组织。稳定连接当然重要,但只有进一步考虑这些连接怎样被 routing、activated、sequenced、synchronized、combined、inhibited,以及怎样在时间中重新使用,才能描述一个系统实际怎样运行。
Bernstein 的间歇互动实验恰好提供了一个非常直观的例子:graph 大体可比,但互动在时间上的开启方式不同,集体表现就会不同。
所以:
这会把问题推进到下一层:
我们能不能把 organization 描述得足够清楚,以至于在给定任务、节点群体和环境时,预测什么样的运行组织更合适?
目前很多 multi-agent 实验比较的是少数几个预先定义好的 coordination architecture。更广义的 organizational science 还需要问:当任务结构、节点能力、反馈和环境改变时,角色、连接、互动时机、专业分工、信息流和协调强度应该怎样变化?
这里真正值得研究的,已经不只是“哪个固定 topology 最好”,而是:如果 organization 本身也成为一个会随时间变化的 state variable,会发生什么?
峰值节点能力,不等于有效系统能力
单个模型在某一项 benchmark 上的最高成绩,回答的是“这个节点现在能做到什么”。一个长期运行的系统还可能面对其他要求:
- 不同专业能力能否同时被调用;
- 不同证据能否互相校验;
- 一个节点出错后有没有恢复路径;
- 长流程中的状态和责任能否持续;
- 外部世界发生变化后,系统能否继续获得新的现实信息;
- 结果是否能够在成本、延迟和可靠性之间维持可接受平衡。
这些共同决定 Effective System Capability / 有效系统能力。
因此,更有用的问题不是“最强的模型有多强”,而是:
这个组织化系统,能否稳定实现同样资源在无组织状态、或集中到单一节点时难以同样有效实现的结果?
多个模型,也可能只是重复同一个盲点
数量增加不会自动带来真正的差异化。
十个相同模型看同一份材料,可能只是把同一个盲点重复十遍。即使最后十票一致,这种内部共识也不等于现实已经得到验证。
真正有价值的是部分不冗余的能力和证据路径。差异可以来自:
- 不同专业能力;
- 不同数据源、传感器或工具;
- 不同时间尺度和观察位置;
- 不同的提出、验证、挑战和执行功能;
- 不同的环境接口。
这里也不要求统计意义上的完全独立。现实组织很少拥有真正独立的所有节点。更实际的要求是:额外路径是否提供了单一路径没有的、能够改变判断的因果或证据信息。
现实约束不是内部投票
多个组件一致,并不会让一个系统自动变正确。
公司可以集体误判市场,委员会可以一致忽略风险,多个 AI 也可以共享同一个训练偏差。内部一致性只是系统内部发生的事情,最终仍然要接受实际环境后果的约束。
这也是为什么组织价值不能只看“内部讨论是否充分”。更关键的是,系统能不能通过客户、工具、传感器、运行结果、法规、部署反馈等不同接口接触现实,并让这些后果真正进入后续行动。
当然,所谓“现实反馈”也不是一个无噪声的神谕。传感器会漂移,数据会漏变量,用户会误报,奖励也可能被利用。因此:
Feedback ≠ truth。
反馈提供新的证据和现实约束,但证据仍然需要被解释、比较和验证。
这也是为什么一个组织需要的不只是更多输入,而是能够把不同来源的信息放到一个可检验的因果链里。
一个简单的 AI 边界例子
可以想象一个 AI 系统由模型、共享工作状态和一组获准使用的工具构成;外部用户、未被纳入系统的服务和数据库属于环境。
API 凭证、工具权限、身份验证和数据访问规则,决定哪些信息或行动能够跨越系统边界。系统如果还能在外部授予的权限范围内,对这些跨越进行选择、接受、拒绝或限制,就体现了更明确的边界调节能力。
这里并不是说 API 权限和细胞膜在物理机制上相同。可以跨系统比较的只是一个更窄的关系:两者都可能形成真实的内部—外部区分,并通过受调节的接口(interface) 让信息、物质或行动跨越边界。
这也是 Connection Theory 一贯的比较方式:比较因果关系,不把不同系统硬说成同一种东西。
组织可以提高可靠性,但条件必须写出来
设计良好的组织有机会降低部分失败模式:不同证据可以互相挑战,专业能力可以减少明显误判,备用路径可以提高恢复能力。
但组织也可能产生新的错误。多个节点会增加通信延迟,责任可能被稀释,相关错误可能被放大,糟糕的协调甚至会让整体不如一个强节点。
因此,公开主张必须是条件性的:
只有当差异化能力、证据、验证、持续性或恢复带来的收益超过协调成本和新增错误时,组织才应当提高系统能力。
这不是“看到结果以后再把赢家叫作好组织”,而是一条需要事前预测、事后检验的 区间假说(regime hypothesis)。
三种最基本的组织状态
可以先用三个很粗的区域理解这件事:
Single-node regime / 单节点区间:一个节点已经足够覆盖任务,额外组织主要增加成本。
Organized-capability regime / 组织能力区间:能力、信息、验证、持续性或协调行动已经分布到单节点难以有效覆盖的范围,合适的组织产生净增益。
Misorganized regime / 失配组织区间:虽然有多个节点,但它们高度重复、共享盲点、角色错配或协调成本过高,整体反而没有变好。
所以:
N agents ⇏ greater system capability。
真正的科学问题,是能不能根据任务需求、节点能力、差异化程度和协调成本,在看到最终结果以前,就预测更可能落在哪个区间。
目前这些仍然是方向性的变量,而不是已经校准好的通用数值公式。要形成严格边界,还需要专门的实验和测量。
系统层能力必须经得起“更简单解释”的挑战
复杂系统表现更好,也不能立刻证明“组织产生了新能力”。
也许真正原因只是用了更多算力、更长上下文、更多工具,或者简单的 best-of-N、majority vote 就能得到同样结果。也可能一个位于系统边界之外的人类 manager 持续提供关键判断,却被错误地记到了 AI collective 的账上。
因此,在把能力归因给“组织”以前,需要主动尝试更简单的解释:
- 一个更强的单节点能不能做到?
- 同一个模型增加采样能不能做到?
- 简单投票或集中聚合能不能做到?
- 增加同样的工具、上下文或观察预算能不能做到?
- 系统边界之外的人类操作方是否贡献了真正关键的能力?
如果更简单、资源匹配的解释已经足够,现有证据就还不足以支持更强的 组织层归因。
论文 From Microscopic Capability to Collective Function 进一步讨论了这种 evidential ladder 和 reducibility audit。
AI 组织最重要的下一步,不是继续加节点
固定 orchestration 解决的是:“工程师预先设计什么组织最好?”
更进一步的问题是:
组织本身能不能因为运行经验而改变?
也就是说,系统不只是执行预先写好的 workflow,而是让交互产生后果,让后果形成证据,再让这些证据影响以后怎样协同。
公开理论层可以把这条链写得很简单:
这里有两个限制非常重要。
第一,provisional assessment 不是永久判决。一条关系短期有效,不等于永远有效;新的后果出现以后,原来的判断必须允许被修正。
第二,可修正也不等于靠猜。系统不需要像“塞翁”一样预见遥远未来;调整应该受到当前已经获得证据的约束。关于这一点,可继续阅读 《适应不是预测未来:经历过一次以后,下一次应该有什么不同?》。
这就从固定编排(static orchestration)走向了适应性组织(adaptive organization)。
适应和安全,是两个相关但不同的问题
这里还需要避免另一个容易出现的误解。
“组织怎样根据后果改变自己”和“哪些改变、哪些外部行动应该被允许”不是同一个问题。
前者属于适应:现实后果怎样进入未来状态。
后者属于 governance / safety:即使某种变化在局部指标上有效,它是否满足安全、权限、法律和其他治理约束。
一个系统可以很会适应,却学到危险策略;也可以被治理得很严格,却完全不会从经验中更新。因此,Adaptive Organization 与 Governed Autonomy 应当被看作互相连接但不能混为一谈的两条工程问题。
AI 的连续性问题也不能直接照搬人类公司
人类组织面对一个明显限制:人会离开、遗忘、失去工作能力,而且不能被完整复制。AI 节点则可能被 checkpoint、复制、恢复或替换。
所以,我们不能简单照搬公司类比,说 AI 一定因为“成员可以更换”而获得同样的组织连续性优势。
但节点容易恢复,也不等于系统层组织自动连续。长期系统仍可能需要保持任务历史、权限关系、共享状态、外部依赖、角色分工以及跨节点积累的证据。
因此更窄、也更可靠的主张是:
model identity 和 system identity 不必相同;节点可以被替换,也不自动保证产生系统能力的组织层仍然连续。
这篇文章真正主张什么?
把前面的内容压缩起来,公开理论可以归纳成五点:
- 组织不等于节点数量。 一个模型可以承担多个功能角色,多个模型也可能只重复同一种功能。
- 拓扑很重要,但拓扑不是组织。 graph 说明哪些关系可以存在;真正的组织还取决于这些关系怎样在时间中被激活和协调。
- 组织价值具有条件。 当任务需求超出单节点有效覆盖范围,并且差异化收益超过协调成本时,组织才更可能成为能力变量。
- 系统层归因需要证据。 如果更简单的解释足够,就不能把结果直接归因给组织。
- 更强的问题是组织能否适应。 经验是否能够在不依赖永久正确判断的前提下,持续改变系统后来的组织和行为。
因此,最值得带走的是三句话:
集体能力不能只从节点能力推出。
拓扑会影响结果,但连接在时间中怎样被实际使用,同样属于组织的一部分。
下一步真正的问题,不只是找到最好的固定 multi-agent architecture,而是理解适合的组织怎样随着任务、节点能力、反馈和环境改变。
这一区分在 Connection Theory 总览 中有更一般的展开:interaction、feedback、connection 和 organization 被分成不同层次,系统能力则被放在时间延展的组织动力学中理解。
公开边界
本文公开的是理论和功能层要求:什么情况下组织可能成为能力变量、功能角色为什么不等于模型、现实反馈为什么必须进入系统,以及适应性组织需要解决什么问题。
至于角色如何被具体形成和选择、组织关系如何被长期评价和调整、证据如何被工程化保存并进入重构,以及相关治理机制如何实现,属于 patent-pending engineering work,不在公开页面说明。
如需技术验证或合作讨论,可联系 wangkai@connection-theory.org。
参考资料
- Leavitt, H. J. (1951). Some effects of certain communication patterns on group performance. Journal of Abnormal and Social Psychology, 46(1), 38–50. https://doi.org/10.1037/h0057189
- Mason, W., & Watts, D. J. (2012). Collaborative learning in networks. Proceedings of the National Academy of Sciences, 109(3), 764–769. https://doi.org/10.1073/pnas.1110069108
- Bernstein, E., Shore, J., & Lazer, D. (2018). How intermittent breaks in interaction improve collective intelligence. Proceedings of the National Academy of Sciences, 115(35), 8734–8739. https://doi.org/10.1073/pnas.1802407115
- Almaatouq, A., Alsobay, M., Yin, M., & Watts, D. J. (2021). Task complexity moderates group synergy. Proceedings of the National Academy of Sciences, 118(36), e2101062118. https://doi.org/10.1073/pnas.2101062118
- Kim, Y., Gu, K., Park, C., et al. (2026). Capable language models can outgrow the benefits of collaboration. Nature Machine Intelligence, 8, 1157–1172. https://doi.org/10.1038/s42256-026-01268-y