论文 · TOKI: A Bitemporal Operator Algebra for Contradiction Resolution in LLM-Agent Persistent Memory
基础信息
- 作者:Ziming Wang
- 期刊/日期:arXiv preprint, 2026-06-04
- 核心贡献:TOKI 把 agent memory 的矛盾解决视为 write-time concurrency control,把 last-writer-wins、evidence-weighted、await-confirmation、per-rule policy 四类生产启发式类型化为双时间 operator,并显式声明 isolation precondition、admitted anomaly 和 audit provenance。
Q1. 研究动机
持久化 agent memory 是写密集系统:每次信念更新都是带 valid time、system time、provenance 和 confidence 的版本化写入。现有系统遇到矛盾事实时常用启发式策略,但不声明需要什么隔离级别,也不说明会允许哪些写时异常。
Q2. 核心问题
论文试图解决的问题是:LLM agent memory 在新事实与旧事实冲突时,如何给出可审计、可重放、隔离级别明确的矛盾解决契约。核心不是提高检索分数,而是给生产策略补上 write-time correctness specification。
Q3. 现有不足 & 本文改进
作者认为生产系统常见四种策略都不完整:last-writer-wins 可暴露 lost update,evidence-weighted merge 可暴露 write skew,await-confirmation 有 callback/replay 风险,per-rule policy 需要更强隔离。mem0、Graphiti、Letta、Zep、MIRIX 等系统没有把这些策略类型化,也普遍缺少能保存 loser fact 的版本化 audit row。
TOKI 的改进是:用双时间 fact schema 存储 subject、predicate、object、valid/system periods、provenance、confidence、strategy,并用 hidden row_kind 区分 current/audit;每个 operator 在提交 winner 的同时写入 loser 的 audit row;用 keyed judge log 固定 LLM judge 的裁决,排除 replay inconsistency。
Q4. 方法流程
输入是同一 subject-predicate key 上 valid-time 重叠且 object 不同的两个事实。TOKI 先检测矛盾对,再根据 resolution_strategy_id 进入对应 operator,并检查 isolation precondition。operator 选择 winner,关闭 loser 的 system-time 当前期,合并 provenance,把 winner 写为 current row,同时把 loser、策略和 witness 写入 audit row。若需要 LLM judge,系统先把裁决按 read set、decoder tuple、hash 写入 keyed judge log,后续重放只读已提交裁决。
Q5. 实验设计与结论
| 实验 | 目的 | 关键结果与结论 |
|---|---|---|
| Verdict matrix(Table 4) | 检查 8 个系统对 N1 replay inconsistency、N2 belief-drift skew、N3 audit erasure 的承认/排除 | 每个 agent-memory baseline 至少承认一个异常;WorldDB 排除三者但移除了 write-path judge;TOKI 是唯一在保留 judge 的同时排除三者的设计。 |
| Defence stress grid(Figure 2, Table 19) | 验证 audit-row、judge-pin、partition-SR 各自是否移动目标 slice | audit-row 在 LoCoMo primary slice 上 Δ=+0.86,CI [0.76,0.94];partition-SR 在 MultiTQ primary 上 +1.00;judge-pin 在该 benchmark movement 上为 +0.00,证据主要来自结构网格。 |
| Latency/scaling(Figure 3, Table 20) | 给出单进程性能边界 | memory size 从 0 到 10^5 facts 时 p50 约 3.88-4.15ms,p99 低于 18.20ms;writer concurrency mean 约按 x^0.86 增长,R2=0.992。作者明确不声称分布式扩展性。 |
| Carrier ablation(Table 5, Table 22) | 检查 provenance semiring 是否影响 anomaly verdict 和 audit recall | 匹配 defence 在三种 carrier 上 verdict 都为 1.00;Boolean carrier 可保持存在性但 token recall 为 0.00,说明判定与具体写事件可恢复性分离。 |
| Structural grids(Figure 4, Figure 5) | 验证定理预测的 0/1 边界 | iso-axis 54 个 cell 中 32 个 dominating cell admit 0、22 个 weaker cell admit 100%;H1-compliant reference 0/245 replay inconsistency,非合规变体均值 0.167-0.204,闭式 2p(1-p) 拟合 MAD=0.017、R2=0.98。 |
| Memory-layer ablation(Section 4.7) | 隔离 typed memory layer 对可回答事实池的贡献 | LoCoMo answerable factual pool 上有 memory 为 0.540,无 memory 为 0.048,paired Δ=+0.492,CI [+0.465,+0.519]。 |
Q6. 局限性
作者明确给出三类限制:第一,partition-SR 的 MultiTQ slice 是 controlled-grid evidence,三组 cross-system LoCoMo cell 的 CI 覆盖 0,power 只有 0.42,因此不声称下游 utility superiority;第二,多 writer Postgres 实验是 single-node,不能推出分布式部署性能;第三,N1 defence 只在固定 decoder tuple 的 intra-deployment replay granularity 下成立,lower bound 只覆盖 boundedly nondeterministic oracle。
以下为分析归纳,非原文明确说明:TOKI 的理论与审计契约很强,但需要系统接受更严格写路径、audit row、judge log 和隔离级别要求;对只在 retrieval time 做临时冲突处理的系统,迁移成本较高。
Q7. 学术价值
理论价值:把 LLM judge 引入的 replay inconsistency、belief-drift skew、audit erasure 映射到数据库隔离和 provenance 框架中,提供可证明契约。
方法价值:给出双时间 schema、typed operator、audit row、keyed judge log、K-semiring provenance 的组合实现。
应用价值:适合高风险 agent memory,如医疗偏好、法律事实、企业客户状态、需要审计历史和矛盾裁决可重放的长期记忆系统。
Q8. 延伸研究方向
- 将 TOKI 的 operator algebra 与 GEM/FadeMem 的 salience/forgetting 结合,处理“矛盾解决之后是否遗忘”的问题。
- 在真实企业长会话和多租户场景中验证 audit row 与 keyed judge log 的成本。
- 扩展到分布式事务、跨区域部署和多 writer agent 集群。
- 为不同 LLM judge、temperature、prompt 设计跨部署 replay equivalence,而不只固定 decoder tuple。
- 把 TOKI 的异常测试做成 agent memory benchmark,让系统可自动报告 N1/N2/N3 风险。
Q9. 反直觉发现与方法失效分析
- Table 4 中 WorldDB 排除 N1/N2/N3,但原因是移除了 write-path judge;这不是证明 agent memory judge 可以安全,而是说明如果需要 evidence-weighted LLM judge,仍要 TOKI 这样的 keyed log 契约。
- Table 4 的 mem0 v3 imported N2 出现设计与运行不一致:设计上应 admit belief-drift skew,但运行时 deterministic judging 折叠 competing rows,Wire 结果为 X。作者把它作为 runtime divergence,而不是基线真正具备完整契约。
- Table 5/22 表明 Boolean provenance carrier 的 anomaly verdict 仍全为 1.00,但 token recall 为 0.00;也就是说系统可以“知道有 loser”,却无法恢复具体写事件身份。
- Figure 8 披露 p99 非单调:例如 memory size 10^3 到 10^4 时 8.71ms 降到 5.65ms,writer concurrency 2 到 4 时 49.28ms 降到 22.58ms。作者解释为小样本 tail variance/cold-cache effect,因此不做 tail ranking claim。
- Section 4.6 中跨系统 LoCoMo 对比 mem0 v3 Δ=-0.04、Graphiti -0.08、Zep +0.02,CI 都覆盖 0。TOKI 的强项是 correctness contract,不是已证明端到端任务准确率优于所有 memory 系统。
WeChat Pay