82.2 ms
平均检索延迟
H800 · 10 QPS
Mandol 是一个面向智能体检索实验的进程内语义记忆包。索引与图拓扑保持常驻,冷 MemoryUnit payload 可选择通过 RocksDB-backed 换页管理。
检索由 MultiRetriever 负责,覆盖 BM25、SPLADE、余弦搜索、图扩展、分数融合和 reranker 编排。当前开发位于 main;精确复现已发表实验时应使用冻结的 paper-repro 分支。

维护中的运行时由明确、可检查的记忆原语组成
MemoryUnit 存储载荷,MemorySpace 存储逻辑归属,MemorySpaceRegistry 定义三塔检索使用的规范空间。
SemanticMap 管理 embedding、FAISS、稀疏向量和空间过滤搜索;SemanticGraph 增加 rustworkx 关系图和图级持久化。
MultiRetriever 与 TripleTowerRetriever 为稠密、稀疏、图、情景和实体关系路径提供检索编排。
在长期对话记忆基准上以更低 Token 消耗达到 SOTA 级正确率
| GPT-4o-mini | Avg. Tok | Single | Multi | Temp. | Open | Overall |
|---|---|---|---|---|---|---|
| Mem0 | 1.0k | 66.71 | 58.16 | 55.45 | 40.62 | 61.00 |
| MemU | 4.0k | 72.77 | 62.41 | 33.96 | 46.88 | 61.15 |
| MemOS | 2.5k | 81.45 | 69.15 | 72.27 | 60.42 | 75.87 |
| Zep | 1.4k | 88.11 | 71.99 | 74.45 | 66.67 | 81.06 |
| EverMemOS | 2.5k | 91.68 | 82.74 | 79.34 | 70.14 | 86.13 |
| Mandol | 2.0k | 93.82 | 85.11 | 89.10 | 65.63 | 89.48 |
| GPT-4.1-mini | Avg. Tok | Single | Multi | Temp. | Open | Overall |
|---|---|---|---|---|---|---|
| Mem0 | 1.0k | 68.97 | 61.70 | 58.26 | 50.00 | 64.20 |
| MemU | 4.0k | 74.91 | 72.34 | 43.61 | 54.17 | 66.67 |
| MemOS | 2.5k | 85.37 | 79.43 | 75.08 | 64.58 | 80.76 |
| Zep | 1.4k | 90.84 | 81.91 | 77.26 | 75.00 | 85.22 |
| EverMemOS | 2.3k | 95.32 | 89.01 | 90.13 | 77.43 | 91.97 |
| Mandol | 1.9k | 95.36 | 92.20 | 87.85 | 79.17 | 92.21 |
Mandol 在 LoCoMo 上以 1.9k tokens 达到 92.21% 的总体正确率。论文表格使用生成好的三塔图,并启用 router + quantification;Qwen/DeepSeek 用于记忆生成和去重,GPT-4.1-mini/GPT-4o-mini 用于 task-eval 与 judge。
| GPT-4o-mini | Avg. Tok | SS-Pref | SS-Asst | Temporal | Multi-S | Know. Upd. | SS-User | Overall |
|---|---|---|---|---|---|---|---|---|
| MemU | 0.5k | 76.70 | 19.60 | 17.30 | 42.10 | 41.00 | 67.10 | 38.40 |
| Mem0 | 1.1k | 90.00 | 26.78 | 72.18 | 63.15 | 66.67 | 82.86 | 66.40 |
| Zep | 1.6k | 53.30 | 75.00 | 54.10 | 47.40 | 74.40 | 92.90 | 63.80 |
| MemOS | 1.4k | 96.67 | 67.86 | 77.44 | 70.67 | 74.26 | 95.71 | 77.80 |
| Mandol | 2.1k | 96.67 | 98.21 | 78.95 | 74.44 | 88.46 | 97.14 | 85.00 |
| GPT-4.1-mini | Avg. Tok | SS-Pref | SS-Asst | Temporal | Multi-S | Know. Upd. | SS-User | Overall |
|---|---|---|---|---|---|---|---|---|
| EverMemOS | 2.8k | 93.33 | 85.71 | 77.44 | 73.68 | 89.74 | 97.14 | 83.00 |
| Mandol | 2.3k | 96.67 | 98.21 | 87.22 | 77.44 | 89.74 | 98.57 | 88.40 |
Mandol 在 LongMemEval 上以 2.3k tokens 达到 88.40% 的总体正确率。复现时需要先准备 cleaned 数据集,并生成 hierarchical、episodic 与 entity-relation 三类图产物后再运行 task_eval。
完整展示尾延迟与平均延迟,服务器和本地部署分别报告
82.2 ms
H800 · 10 QPS
39.7 ms
H800 · 10 QPS
5.4×
服务器平均延迟 · 相比最佳非 Mandol 基线
4.8×
服务器平均延迟 · 相比最佳非 Mandol 基线
NVIDIA H800 80GB · 检索 10 QPS · 写入 10 QPS
| 系统 | 检索 | 写入 | ||||
|---|---|---|---|---|---|---|
| P99 | P90 | 平均值 | P99 | P90 | 平均值 | |
| MemU | 63000.7 | 60539.5 | 47554.5 | 12070.6 | 7273.1 | 5077.9 |
| EverMemOS† | 37192.4 | 35220.4 | 20092.1 | 790.2 | 555.5 | 317.7 |
| Mem0 | 4637.0 | 1397.0 | 1089.0 | 2841.0 | 1650.0 | 888.0 |
| Zep | 5348.7 | 614.8 | 571.7 | 375.1 | 254.5 | 239.0 |
| MemOS | 777.1 | 528.4 | 440.5 | 376.4 | 211.6 | 191.9 |
| Mandol (本系统) | 94.8 | 88.5 | 82.2 | 67.3 | 46.9 | 39.7 |
所有数值单位均为毫秒。服务器实验使用 NVIDIA H800 80GB,检索和写入均为 10 QPS;本地实验使用 NVIDIA RTX 5090 Laptop 24GB,检索为 5 QPS,写入为 10 QPS。
† EverMemOS 使用其官方实现复现。
以上数据对应冻结的 论文复现 artifact。
安装发布包或源码环境,添加 MemoryUnit,用 MultiRetriever 检索,再持久化图快照
如果您的研究受益于本工作,请引用我们的论文
@misc{zhang2026mandol,
title={Mandol: An Agglomerative Agent Memory System for Long-Term Conversations},
author={Yuhan Zhang and Zhiyuan Guo and Ziheng Zeng and Wei Wang and Wentao Wu and Lijie Xu},
year={2026},
eprint={2606.29778},
archivePrefix={arXiv},
primaryClass={cs.DB},
doi={10.48550/arXiv.2606.29778},
url={https://arxiv.org/abs/2606.29778}
}论文已发布于 arXiv:2606.29778。