第 5 篇 · 从相互作用到组织化能力

为什么 AI 组织不只是模型的集合?

为什么当任务需要超出单一节点的差异化能力、证据、验证、持续性或协调行动时,组织会成为真实的系统能力变量。

如果把几个 AI 放在一起,它们就自动变成一个“AI 组织”了吗?

不一定。

十个模型可以只是十个彼此重复的回答器;一个足够强的模型加上工具、记忆和不同功能模块,也可能完成过去需要多个 agent 才能完成的工作。所以,这篇文章的主张从来不是“模型越多越好”,更不是“未来 AGI 一定要由很多大模型组成”。

这里真正关心的是另一个问题:

当任务需要的能力、信息、验证、持续性或协调行动已经超出单一节点能够有效覆盖的范围时,组织本身会不会成为一种真实的系统能力变量?

这也是理解 AI 组织最重要的第一步:模型数量不是组织的定义,功能关系才是。

一个角色,不等于一个模型

公司里有销售、审核、执行、复核等角色,但“一个角色”并不等于“一个人”。一个人可以同时承担多个角色,同一个角色也可以由多人共同完成。

AI 也一样。

发起任务、获取外部信息、提出方案、检查证据、批准行动、观察结果,这些首先是功能角色(functional roles)。它们可以由不同模型承担,也可以由同一个模型在不同状态下承担;还可以由 AI、确定性软件、工具、传感器和人共同完成。

因此:

Role ≠ Model。

Connection Theory 对“必须一个大模型还是多个模型”保持架构中立。理论规定的是需要解释哪些功能关系,而不是预先指定这些关系必须由几个 LLM 实现。

这一区分很重要。否则,我们很容易把“多 agent”本身误当成“组织”,也容易把某个具体工程架构误当成理论要求。

单个节点很强时,组织完全可能是额外成本

对于边界清楚的小任务,一个很强的个体往往比组织更有效率。优秀工程师解决一个局部技术问题,可能比先开会协调更快;一个强模型完成一次明确推理,也可能比多个 agent 互相讨论更便宜、更稳定。

所以,组织不是默认更优。

真正需要比较的是:任务需求、单节点能力、差异化贡献和协调成本之间的关系。

如果一个节点已经能覆盖相关任务,新增组织主要带来通信、等待和错误传播,那么组织可能只是在增加开销。只有当任务真正需要超出单节点覆盖范围的能力时,组织才更可能产生净增益。

人类集体解决问题的实验,早就出现过同一种现象

这个问题并不是从 multi-agent AI 才开始的。

早在 1951 年,Leavitt 就用五人小组比较了不同的 communication network,包括 wheel、chain、Y 和 circle。参与者面对的是可比较的任务,但通信结构不同。结果不仅影响准确率和活动量,还影响成员满意度、领导者是否出现,以及小组最终形成怎样的组织方式。

这里不能推出“中心化永远更好”。真正值得保留的是一个更窄的结果:当任务和参与者总体可比时,仅仅改变人与人之间可以怎样通信,集体行为就会改变。

Mason 与 Watts(2012)把这个问题控制得更干净。他们让 16 人小组共同搜索一个复杂问题,每个人都固定只有 3 个邻居。也就是说,节点数量不变,每个节点的局部连接数也不变,主要改变的是:谁和谁连接。

结果表明,集体搜索表现会随着网络拓扑改变。

可以把这个结果压缩成:

相同节点数量+相同局部连接度+不同拓扑→不同集体表现\text{相同节点数量} + \text{相同局部连接度} + \text{不同拓扑} \rightarrow \text{不同集体表现}

但这还没有走到“组织”的全部含义。

Bernstein、Shore 与 Lazer(2018)进一步改变的不是“谁和谁能连接”,而是什么时候允许彼此影响。三人小组解决同一种旅行商问题,有的始终能看到彼此的解法,有的间歇性开放互动,有的完全独立。间歇性互动在保留探索能力的同时,又获得了社会学习的收益。

这说明:

相同类型的节点+可比较的潜在关系+不同互动时间→不同集体能力\text{相同类型的节点} + \text{可比较的潜在关系} + \text{不同互动时间} \rightarrow \text{不同集体能力}

一条连接在结构上“存在”,并不意味着它在组织运行中必须持续处于激活状态。

Almaatouq 等人(2021)又补上了另一层条件。他们在 1,200 名参与者中系统改变任务复杂度,并比较互动小组与独立个体。随着任务变复杂,集体协作带来的 synergy 与 process loss 之间的平衡发生变化:复杂任务上,小组相对更有效;简单任务上,协调成本更容易抵消收益。

因此,组织价值是相对于任务的。不能离开任务结构,抽象地说某种协作方式“本身更好”。

把这些人类实验放在一起,可以看到一条很稳定的经验线索:集体能力不仅取决于节点本身,还取决于通信结构、互动时间以及任务结构。

Multi-agent AI 现在也出现了结构上类似的结果

最近的 multi-agent AI 实验,在完全不同的物理载体上重新出现了这种组织层差异。

Kim 等人(2026)在一个受控实验中比较 single-agent 和四种 multi-agent coordination architecture。他们保持 task prompt、tool interface 和 system-level compute ceiling 一致,主要改变 coordination structure 和 model capability。实验覆盖 260 个配置、6 个 agentic benchmark 和 3 个 LLM family。

结果并不存在一个“多 agent 必然更强”的方向。Finance 类任务可以从合适的 multi-agent coordination 中获得很大收益;而在 PlanCraft 这类强顺序依赖任务上,多 agent 反而明显变差。单 agent 基线能力,也是判断额外协作是否有价值的重要预测因素。

这里真正重要的不是哪一种 architecture 赢了,而是:没有任何一种固定协作方式在所有任务上都占优。

可以把 AI 侧的结果写成:

可比较的计算节点+不同协调方式→不同系统能力\text{可比较的计算节点} + \text{不同协调方式} \rightarrow \text{不同系统能力}

这并不意味着人类小组和 LLM agents 的机制相同。能够得到的只是一个更谨慎的结论:organization 本身值得作为独立研究对象。

拓扑不是组织

这些实验还把另一个容易混淆的问题变得很清楚。

拓扑告诉我们哪些节点可以互动,但它并不能告诉我们这些连接在真实运行中怎样被使用。

两个系统可以拥有同一张 graph,却在实际运行中完全不同:哪些连接现在被激活、信息什么时候发送、谁先行动、谁负责验证、哪些信号被放大或抑制、不同路径的权重有多大,以及这些关系会不会随着时间而改变。

Topology 告诉我们谁可以互动;organization 告诉我们系统实际上怎样运行。

为了分析这个区别,可以暂时把某个时刻的组织拆成:

Ot=(Nt,Gt,Πt,Φt,Ht)O_t=(N_t, G_t, \Pi_t, \Phi_t, H_t)

其中:

  • NtN_t:节点及其当前能力;
  • GtG_t:可用的连接拓扑;
  • Πt\Pi_t:功能角色或局部运行规则;
  • Φt\Phi_t:真实的信息流动力学,例如 routing、timing、sequencing、validation、synchronization 和 coordination intensity;
  • HtH_t:与当前运行相关的组织历史或保留状态。

这里的 tuple 只是一个分析性拆分,不是新的正式 Connection Theory 方程,也不意味着所有组织都必须按照这种形式被实现。

它真正想强调的,是 Connection Theory 一直区分的几个层次:

Interaction→Feedback→Connection→Organization\text{Interaction} \rightarrow \text{Feedback} \rightarrow \text{Connection} \rightarrow \text{Organization}

因此,拥有一张“连接清单”还不等于拥有组织。稳定连接当然重要,但只有进一步考虑这些连接怎样被 routing、activated、sequenced、synchronized、combined、inhibited,以及怎样在时间中重新使用,才能描述一个系统实际怎样运行。

Bernstein 的间歇互动实验恰好提供了一个非常直观的例子:graph 大体可比,但互动在时间上的开启方式不同,集体表现就会不同。

所以:

静态连接关系≠实际运行中的组织\boxed{\text{静态连接关系} ≠ \text{实际运行中的组织}}

这会把问题推进到下一层:

我们能不能把 organization 描述得足够清楚,以至于在给定任务、节点群体和环境时,预测什么样的运行组织更合适?

目前很多 multi-agent 实验比较的是少数几个预先定义好的 coordination architecture。更广义的 organizational science 还需要问:当任务结构、节点能力、反馈和环境改变时,角色、连接、互动时机、专业分工、信息流和协调强度应该怎样变化?

这里真正值得研究的,已经不只是“哪个固定 topology 最好”,而是:如果 organization 本身也成为一个会随时间变化的 state variable,会发生什么?

峰值节点能力,不等于有效系统能力

单个模型在某一项 benchmark 上的最高成绩,回答的是“这个节点现在能做到什么”。一个长期运行的系统还可能面对其他要求:

  • 不同专业能力能否同时被调用;
  • 不同证据能否互相校验;
  • 一个节点出错后有没有恢复路径;
  • 长流程中的状态和责任能否持续;
  • 外部世界发生变化后,系统能否继续获得新的现实信息;
  • 结果是否能够在成本、延迟和可靠性之间维持可接受平衡。

这些共同决定 Effective System Capability / 有效系统能力。

因此,更有用的问题不是“最强的模型有多强”,而是:

这个组织化系统,能否稳定实现同样资源在无组织状态、或集中到单一节点时难以同样有效实现的结果?

多个模型,也可能只是重复同一个盲点

数量增加不会自动带来真正的差异化。

十个相同模型看同一份材料,可能只是把同一个盲点重复十遍。即使最后十票一致,这种内部共识也不等于现实已经得到验证。

真正有价值的是部分不冗余的能力和证据路径。差异可以来自:

  • 不同专业能力;
  • 不同数据源、传感器或工具;
  • 不同时间尺度和观察位置;
  • 不同的提出、验证、挑战和执行功能;
  • 不同的环境接口。

这里也不要求统计意义上的完全独立。现实组织很少拥有真正独立的所有节点。更实际的要求是:额外路径是否提供了单一路径没有的、能够改变判断的因果或证据信息。

现实约束不是内部投票

多个组件一致,并不会让一个系统自动变正确。

公司可以集体误判市场,委员会可以一致忽略风险,多个 AI 也可以共享同一个训练偏差。内部一致性只是系统内部发生的事情,最终仍然要接受实际环境后果的约束。

这也是为什么组织价值不能只看“内部讨论是否充分”。更关键的是,系统能不能通过客户、工具、传感器、运行结果、法规、部署反馈等不同接口接触现实,并让这些后果真正进入后续行动。

当然,所谓“现实反馈”也不是一个无噪声的神谕。传感器会漂移,数据会漏变量,用户会误报,奖励也可能被利用。因此:

Feedback ≠ truth。

反馈提供新的证据和现实约束,但证据仍然需要被解释、比较和验证。

这也是为什么一个组织需要的不只是更多输入,而是能够把不同来源的信息放到一个可检验的因果链里。

一个简单的 AI 边界例子

可以想象一个 AI 系统由模型、共享工作状态和一组获准使用的工具构成;外部用户、未被纳入系统的服务和数据库属于环境。

API 凭证、工具权限、身份验证和数据访问规则,决定哪些信息或行动能够跨越系统边界。系统如果还能在外部授予的权限范围内,对这些跨越进行选择、接受、拒绝或限制,就体现了更明确的边界调节能力。

这里并不是说 API 权限和细胞膜在物理机制上相同。可以跨系统比较的只是一个更窄的关系:两者都可能形成真实的内部—外部区分,并通过受调节的接口(interface) 让信息、物质或行动跨越边界。

这也是 Connection Theory 一贯的比较方式:比较因果关系,不把不同系统硬说成同一种东西。

组织可以提高可靠性,但条件必须写出来

设计良好的组织有机会降低部分失败模式:不同证据可以互相挑战,专业能力可以减少明显误判,备用路径可以提高恢复能力。

但组织也可能产生新的错误。多个节点会增加通信延迟,责任可能被稀释,相关错误可能被放大,糟糕的协调甚至会让整体不如一个强节点。

因此,公开主张必须是条件性的:

只有当差异化能力、证据、验证、持续性或恢复带来的收益超过协调成本和新增错误时,组织才应当提高系统能力。

这不是“看到结果以后再把赢家叫作好组织”,而是一条需要事前预测、事后检验的 区间假说(regime hypothesis)。

三种最基本的组织状态

可以先用三个很粗的区域理解这件事:

Single-node regime / 单节点区间:一个节点已经足够覆盖任务,额外组织主要增加成本。

Organized-capability regime / 组织能力区间:能力、信息、验证、持续性或协调行动已经分布到单节点难以有效覆盖的范围,合适的组织产生净增益。

Misorganized regime / 失配组织区间:虽然有多个节点,但它们高度重复、共享盲点、角色错配或协调成本过高,整体反而没有变好。

所以:

N agents ⇏ greater system capability。

真正的科学问题,是能不能根据任务需求、节点能力、差异化程度和协调成本,在看到最终结果以前,就预测更可能落在哪个区间。

目前这些仍然是方向性的变量,而不是已经校准好的通用数值公式。要形成严格边界,还需要专门的实验和测量。

系统层能力必须经得起“更简单解释”的挑战

复杂系统表现更好,也不能立刻证明“组织产生了新能力”。

也许真正原因只是用了更多算力、更长上下文、更多工具,或者简单的 best-of-N、majority vote 就能得到同样结果。也可能一个位于系统边界之外的人类 manager 持续提供关键判断,却被错误地记到了 AI collective 的账上。

因此,在把能力归因给“组织”以前,需要主动尝试更简单的解释:

  • 一个更强的单节点能不能做到?
  • 同一个模型增加采样能不能做到?
  • 简单投票或集中聚合能不能做到?
  • 增加同样的工具、上下文或观察预算能不能做到?
  • 系统边界之外的人类操作方是否贡献了真正关键的能力?

如果更简单、资源匹配的解释已经足够,现有证据就还不足以支持更强的 组织层归因。

论文 From Microscopic Capability to Collective Function 进一步讨论了这种 evidential ladder 和 reducibility audit。

AI 组织最重要的下一步,不是继续加节点

固定 orchestration 解决的是:“工程师预先设计什么组织最好?”

更进一步的问题是:

组织本身能不能因为运行经验而改变?

也就是说,系统不只是执行预先写好的 workflow,而是让交互产生后果,让后果形成证据,再让这些证据影响以后怎样协同。

公开理论层可以把这条链写得很简单:

interaction→consequence→evidence→provisional assessment→changed future organization or behaviour→new consequence\text{interaction} \rightarrow \text{consequence} \rightarrow \text{evidence} \rightarrow \text{provisional assessment} \rightarrow \text{changed future organization or behaviour} \rightarrow \text{new consequence}

这里有两个限制非常重要。

第一,provisional assessment 不是永久判决。一条关系短期有效,不等于永远有效;新的后果出现以后,原来的判断必须允许被修正。

第二,可修正也不等于靠猜。系统不需要像“塞翁”一样预见遥远未来;调整应该受到当前已经获得证据的约束。关于这一点,可继续阅读 《适应不是预测未来:经历过一次以后,下一次应该有什么不同?》。

这就从固定编排(static orchestration)走向了适应性组织(adaptive organization)。

适应和安全,是两个相关但不同的问题

这里还需要避免另一个容易出现的误解。

“组织怎样根据后果改变自己”和“哪些改变、哪些外部行动应该被允许”不是同一个问题。

前者属于适应:现实后果怎样进入未来状态。

后者属于 governance / safety:即使某种变化在局部指标上有效,它是否满足安全、权限、法律和其他治理约束。

一个系统可以很会适应,却学到危险策略;也可以被治理得很严格,却完全不会从经验中更新。因此,Adaptive Organization 与 Governed Autonomy 应当被看作互相连接但不能混为一谈的两条工程问题。

AI 的连续性问题也不能直接照搬人类公司

人类组织面对一个明显限制:人会离开、遗忘、失去工作能力,而且不能被完整复制。AI 节点则可能被 checkpoint、复制、恢复或替换。

所以,我们不能简单照搬公司类比,说 AI 一定因为“成员可以更换”而获得同样的组织连续性优势。

但节点容易恢复,也不等于系统层组织自动连续。长期系统仍可能需要保持任务历史、权限关系、共享状态、外部依赖、角色分工以及跨节点积累的证据。

因此更窄、也更可靠的主张是:

model identity 和 system identity 不必相同;节点可以被替换,也不自动保证产生系统能力的组织层仍然连续。

这篇文章真正主张什么?

把前面的内容压缩起来,公开理论可以归纳成五点:

  1. 组织不等于节点数量。 一个模型可以承担多个功能角色,多个模型也可能只重复同一种功能。
  2. 拓扑很重要,但拓扑不是组织。 graph 说明哪些关系可以存在;真正的组织还取决于这些关系怎样在时间中被激活和协调。
  3. 组织价值具有条件。 当任务需求超出单节点有效覆盖范围,并且差异化收益超过协调成本时,组织才更可能成为能力变量。
  4. 系统层归因需要证据。 如果更简单的解释足够,就不能把结果直接归因给组织。
  5. 更强的问题是组织能否适应。 经验是否能够在不依赖永久正确判断的前提下,持续改变系统后来的组织和行为。

因此,最值得带走的是三句话:

集体能力不能只从节点能力推出。

拓扑会影响结果,但连接在时间中怎样被实际使用,同样属于组织的一部分。

下一步真正的问题,不只是找到最好的固定 multi-agent architecture,而是理解适合的组织怎样随着任务、节点能力、反馈和环境改变。

这一区分在 Connection Theory 总览 中有更一般的展开:interaction、feedback、connection 和 organization 被分成不同层次,系统能力则被放在时间延展的组织动力学中理解。

继续阅读底层理论 →

公开边界

本文公开的是理论和功能层要求:什么情况下组织可能成为能力变量、功能角色为什么不等于模型、现实反馈为什么必须进入系统,以及适应性组织需要解决什么问题。

至于角色如何被具体形成和选择、组织关系如何被长期评价和调整、证据如何被工程化保存并进入重构,以及相关治理机制如何实现,属于 patent-pending engineering work,不在公开页面说明。

如需技术验证或合作讨论,可联系 wangkai@connection-theory.org。

参考资料

  • Leavitt, H. J. (1951). Some effects of certain communication patterns on group performance. Journal of Abnormal and Social Psychology, 46(1), 38–50. https://doi.org/10.1037/h0057189
  • Mason, W., & Watts, D. J. (2012). Collaborative learning in networks. Proceedings of the National Academy of Sciences, 109(3), 764–769. https://doi.org/10.1073/pnas.1110069108
  • Bernstein, E., Shore, J., & Lazer, D. (2018). How intermittent breaks in interaction improve collective intelligence. Proceedings of the National Academy of Sciences, 115(35), 8734–8739. https://doi.org/10.1073/pnas.1802407115
  • Almaatouq, A., Alsobay, M., Yin, M., & Watts, D. J. (2021). Task complexity moderates group synergy. Proceedings of the National Academy of Sciences, 118(36), e2101062118. https://doi.org/10.1073/pnas.2101062118
  • Kim, Y., Gu, K., Park, C., et al. (2026). Capable language models can outgrow the benefits of collaboration. Nature Machine Intelligence, 8, 1157–1172. https://doi.org/10.1038/s42256-026-01268-y

继续本主题

从相互作用到组织化能力