# 论文 · TOKI: A Bitemporal Operator Algebra for Contradiction Resolution in LLM-Agent Persistent Memory


## 基础信息
* 作者：Ziming Wang
* 期刊/日期：arXiv preprint, 2026-06-04
* 核心贡献：TOKI 把 agent memory 的矛盾解决视为 write-time concurrency control，把 last-writer-wins、evidence-weighted、await-confirmation、per-rule policy 四类生产启发式类型化为双时间 operator，并显式声明 isolation precondition、admitted anomaly 和 audit provenance。

## Q1. 研究动机

持久化 agent memory 是写密集系统：每次信念更新都是带 valid time、system time、provenance 和 confidence 的版本化写入。现有系统遇到矛盾事实时常用启发式策略，但不声明需要什么隔离级别，也不说明会允许哪些写时异常。

## Q2. 核心问题

论文试图解决的问题是：LLM agent memory 在新事实与旧事实冲突时，如何给出可审计、可重放、隔离级别明确的矛盾解决契约。核心不是提高检索分数，而是给生产策略补上 write-time correctness specification。

## Q3. 现有不足 &amp; 本文改进

作者认为生产系统常见四种策略都不完整：last-writer-wins 可暴露 lost update，evidence-weighted merge 可暴露 write skew，await-confirmation 有 callback/replay 风险，per-rule policy 需要更强隔离。mem0、Graphiti、Letta、Zep、MIRIX 等系统没有把这些策略类型化，也普遍缺少能保存 loser fact 的版本化 audit row。

TOKI 的改进是：用双时间 fact schema 存储 subject、predicate、object、valid/system periods、provenance、confidence、strategy，并用 hidden row_kind 区分 current/audit；每个 operator 在提交 winner 的同时写入 loser 的 audit row；用 keyed judge log 固定 LLM judge 的裁决，排除 replay inconsistency。

## Q4. 方法流程

输入是同一 subject-predicate key 上 valid-time 重叠且 object 不同的两个事实。TOKI 先检测矛盾对，再根据 resolution_strategy_id 进入对应 operator，并检查 isolation precondition。operator 选择 winner，关闭 loser 的 system-time 当前期，合并 provenance，把 winner 写为 current row，同时把 loser、策略和 witness 写入 audit row。若需要 LLM judge，系统先把裁决按 read set、decoder tuple、hash 写入 keyed judge log，后续重放只读已提交裁决。

## Q5. 实验设计与结论

| 实验 | 目的 | 关键结果与结论 |
| --- | --- | --- |
| Verdict matrix（Table 4） | 检查 8 个系统对 N1 replay inconsistency、N2 belief-drift skew、N3 audit erasure 的承认/排除 | 每个 agent-memory baseline 至少承认一个异常；WorldDB 排除三者但移除了 write-path judge；TOKI 是唯一在保留 judge 的同时排除三者的设计。 |
| Defence stress grid（Figure 2, Table 19） | 验证 audit-row、judge-pin、partition-SR 各自是否移动目标 slice | audit-row 在 LoCoMo primary slice 上 Δ=&#43;0.86，CI [0.76,0.94]；partition-SR 在 MultiTQ primary 上 &#43;1.00；judge-pin 在该 benchmark movement 上为 &#43;0.00，证据主要来自结构网格。 |
| Latency/scaling（Figure 3, Table 20） | 给出单进程性能边界 | memory size 从 0 到 10^5 facts 时 p50 约 3.88-4.15ms，p99 低于 18.20ms；writer concurrency mean 约按 x^0.86 增长，R2=0.992。作者明确不声称分布式扩展性。 |
| Carrier ablation（Table 5, Table 22） | 检查 provenance semiring 是否影响 anomaly verdict 和 audit recall | 匹配 defence 在三种 carrier 上 verdict 都为 1.00；Boolean carrier 可保持存在性但 token recall 为 0.00，说明判定与具体写事件可恢复性分离。 |
| Structural grids（Figure 4, Figure 5） | 验证定理预测的 0/1 边界 | iso-axis 54 个 cell 中 32 个 dominating cell admit 0、22 个 weaker cell admit 100%；H1-compliant reference 0/245 replay inconsistency，非合规变体均值 0.167-0.204，闭式 2p(1-p) 拟合 MAD=0.017、R2=0.98。 |
| Memory-layer ablation（Section 4.7） | 隔离 typed memory layer 对可回答事实池的贡献 | LoCoMo answerable factual pool 上有 memory 为 0.540，无 memory 为 0.048，paired Δ=&#43;0.492，CI [&#43;0.465,&#43;0.519]。 |

## Q6. 局限性

作者明确给出三类限制：第一，partition-SR 的 MultiTQ slice 是 controlled-grid evidence，三组 cross-system LoCoMo cell 的 CI 覆盖 0，power 只有 0.42，因此不声称下游 utility superiority；第二，多 writer Postgres 实验是 single-node，不能推出分布式部署性能；第三，N1 defence 只在固定 decoder tuple 的 intra-deployment replay granularity 下成立，lower bound 只覆盖 boundedly nondeterministic oracle。

以下为分析归纳，非原文明确说明：TOKI 的理论与审计契约很强，但需要系统接受更严格写路径、audit row、judge log 和隔离级别要求；对只在 retrieval time 做临时冲突处理的系统，迁移成本较高。

## Q7. 学术价值

理论价值：把 LLM judge 引入的 replay inconsistency、belief-drift skew、audit erasure 映射到数据库隔离和 provenance 框架中，提供可证明契约。

方法价值：给出双时间 schema、typed operator、audit row、keyed judge log、K-semiring provenance 的组合实现。

应用价值：适合高风险 agent memory，如医疗偏好、法律事实、企业客户状态、需要审计历史和矛盾裁决可重放的长期记忆系统。

## Q8. 延伸研究方向

1. 将 TOKI 的 operator algebra 与 GEM/FadeMem 的 salience/forgetting 结合，处理“矛盾解决之后是否遗忘”的问题。
2. 在真实企业长会话和多租户场景中验证 audit row 与 keyed judge log 的成本。
3. 扩展到分布式事务、跨区域部署和多 writer agent 集群。
4. 为不同 LLM judge、temperature、prompt 设计跨部署 replay equivalence，而不只固定 decoder tuple。
5. 把 TOKI 的异常测试做成 agent memory benchmark，让系统可自动报告 N1/N2/N3 风险。

## Q9. 反直觉发现与方法失效分析

* Table 4 中 WorldDB 排除 N1/N2/N3，但原因是移除了 write-path judge；这不是证明 agent memory judge 可以安全，而是说明如果需要 evidence-weighted LLM judge，仍要 TOKI 这样的 keyed log 契约。
* Table 4 的 mem0 v3 imported N2 出现设计与运行不一致：设计上应 admit belief-drift skew，但运行时 deterministic judging 折叠 competing rows，Wire 结果为 X。作者把它作为 runtime divergence，而不是基线真正具备完整契约。
* Table 5/22 表明 Boolean provenance carrier 的 anomaly verdict 仍全为 1.00，但 token recall 为 0.00；也就是说系统可以“知道有 loser”，却无法恢复具体写事件身份。
* Figure 8 披露 p99 非单调：例如 memory size 10^3 到 10^4 时 8.71ms 降到 5.65ms，writer concurrency 2 到 4 时 49.28ms 降到 22.58ms。作者解释为小样本 tail variance/cold-cache effect，因此不做 tail ranking claim。
* Section 4.6 中跨系统 LoCoMo 对比 mem0 v3 Δ=-0.04、Graphiti -0.08、Zep &#43;0.02，CI 都覆盖 0。TOKI 的强项是 correctness contract，不是已证明端到端任务准确率优于所有 memory 系统。


---

> Author: [Ting](Tin10g.github.io)  
> URL: http://localhost:1313/posts/%E8%AE%BA%E6%96%87%E9%98%85%E8%AF%BB-toki-a-bitemporal-operator-algebra-for-contradiction-resolution-in-llm-agent-persistent-memory/  

