AI 也有「共享记忆」了,但怎么保证你的隐私不被别人看见?
你有没有过这种经历:刚跟 AI 助理说过自己对芒果过敏,换个设备再问「推荐下午茶」,它又给你推芒果班戟——因为 AI 记不住你。可如果 AI 真的能记住所有人的偏好,又怎么保证你的过敏史、住址这些私人信息,不会被别的用户搜出来?
多用户共享的 AI 记忆系统,要怎么在「让知识流动起来」和「把隐私锁起来」之间找到平衡?
一、从「一次性对话」到「有记忆的 AI」:我们走了多远
早期的大语言模型本质上是「一次性聊天机器」:每次对话都是独立的,关了窗口就什么都忘了。你得反复告诉它你是谁、喜欢什么、有什么禁忌,时间一长,交互就变得很冗余。
为了解决这个问题,研究者开始给 AI 加上「长期记忆」。比如 2025 年提出的 SECOND ME 系统,就是一个 AI 原生的个人记忆方案:它把你的个人偏好、历史交互都存下来,自动组织和检索,帮你在不同场景下预填信息、生成上下文相关的回复,减少重复输入 [7]。你可以把它想象成一个专属的 AI 记忆管家,只服务你一个人。
但单用户记忆有个局限:很多知识其实是可以共享的。比如「这家餐厅的招牌菜是麻辣香锅」「去机场最快的路线是坐地铁 2 号线」,这些信息对所有人都有用,没必要每个人都重新问一遍、存一遍。于是又有了多智能体共享记忆的思路,比如 INMS 框架,它建了一个共享的对话记忆池,让多个智能体之间可以动态交换知识,实现集体自我增强 [6]。
问题来了:如果记忆可以共享,那隐私怎么办?你的家庭住址、病历信息、工作密码,这些总不能也放进共享池里吧?2026 年一篇关于「记忆织物」(memory fabric)的综述就明确点出了这个缺口:现有的对话 AI 架构大多只关注单用户场景,多用户共享记忆系统还缺乏成熟的隐私保护设计和统一的评估标准 [8]。
这就是 AIM(Agentic Interoperable Memory)框架要解决的核心问题:怎么让 AI 同时拥有私人记忆和公开记忆,还能保证私人记忆绝对不会被别人看到 [1]。
二、AIM 框架:给记忆上一把「索引级」的锁
AIM 的设计思路可以用一句话概括:先分清哪些能说、哪些不能说,再从根上保证不该你看的东西,你连搜都搜不到。
自动区分「私人记忆」和「公开记忆」
第一条设计,是让系统自动判断一条信息该存成私人的还是公开的。你说「我对芒果过敏」,系统会标成 PRIVATE,只有你能访问;你说「北京今年秋天特别热」,系统会标成 PUBLIC,所有人都能搜到 [1]。
这个分类是由大语言模型加上显式规则提示来完成的,不需要用户手动打标签。而且它支持「一句话同时做两件事」——比如你说「我刚搬到旧金山,能推荐餐厅吗」,AIM 会一边把「我住在旧金山」存成你的私人记忆,一边去搜公开的餐厅知识,两个操作同时进行 [1]。这和以往一轮对话只做一种操作的系统很不一样。
当然,实际情况比这个比喻更复杂:分类不是每次都 100% 准确,后面我们会讲到具体的准确率数字。
索引级访问控制:不是「搜出来再筛」,而是「压根搜不到」
光分类还不够。很多系统的做法是:先把所有相关记忆都搜出来,再过滤掉不该看的。但这有风险——万一过滤环节出 bug,隐私就泄露了。
AIM 用的是「索引级访问控制」:把可见性规则直接下推到向量索引层,在检索的第一步就把越权的记忆排除在候选之外 [1]。
打个比方:普通的过滤方式像图书馆管理员先把所有书都抱出来,再把不让你看的挑回去;而 AIM 是直接给你一把只能打开特定书架的钥匙,别的书架你根本靠近不了。显然后者更安全,因为从结构上就杜绝了泄露的可能。
三级检索级联:又快又准
为了在保证安全的同时兼顾效率和相关性,AIM 设计了三级检索流水线 [1]:
第一级,先做带可见性约束的稠密向量检索,把范围缩小到你有权看的记忆里; 第二级,用标签相似度做双阈值过滤,进一步筛掉不相关的; 第三级,才用大语言模型做重排,同时融合时效性分数,把最新、最相关的结果排在前面。
这样设计的好处是,把昂贵的大模型调用留到最后一步,前面用更轻量的方法过滤掉大部分不相关内容,既省算力又保证质量。
三、效果怎么样?用 MUMBench 测一测
光说设计好没用,得有数据说话。AIM 论文同时发布了首个专门评估多用户记忆系统的基准数据集,叫 MUMBench(Multi-User Memory Benchmark)[1]。
MUMBench 测什么?
这个基准包含 672 条人工验证的时序交互,覆盖 93 个用户、4 个领域(编程、客服、教育、旅行规划),里面有 150 条私人记忆、56 条公开记忆,还有 60 条专门用来「刁难」系统的对抗查询 [1]。
它主要考察三个维度的能力:
- 可见性分类准确率:能不能正确判断一条信息该是私人的还是公开的;
- 操作准确率:能不能正确执行存、取、改、删这四种记忆操作,还分「严格准确率」和「状态感知准确率」(后者允许一定的级联误差);
- 内容质量:返回的记忆内容对不对、有没有用。
核心数字
在三次独立运行的平均结果里,AIM 取得了这样的成绩 [1]:
- 可见性分类准确率最高达到 96.0%(用 GPT-5.4 模型);
- 状态感知操作准确率最高达到 70.5%(用 GPT-5.4-mini 模型);
- 内容质量最高达到 91.6%(同样是 GPT-5.4-mini)。
这里有个挺反直觉的发现:更小的模型反而更适合管记忆。实验里,参数更小的 GPT-5.4-mini 在多数记忆管理指标上都比更大的 GPT-5.4 表现还好 [1]。这说明记忆管理这种任务,不一定需要最强大的模型,选对合适规模的模型反而又好又省算力。
不过也要客观看待这些数字:70.5% 的状态感知准确率听起来不算特别高,严格准确率就更低了(最高 58.8%)[1]。这说明多用户记忆管理还是个挺难的问题,离完美还有不小的距离。而且不同领域表现差异也挺大,编程领域最好(状态感知最高 79.8%),旅行规划领域最低(62.7%)[1]。
四、放在整条研究脉络里看:AIM 站在哪一步
把 AIM 放进 AI 记忆系统的发展脉络里,你会看得更清楚它的位置。
最早的一步是个人记忆:以 SECOND ME 为代表,目标是让 AI 记住单个用户的偏好和历史,减少重复交互 [7]。这一步解决的是「AI 记不住你」的问题。
然后是多智能体共享记忆:以 INMS 为代表,让多个 AI 智能体之间可以共享知识,互相学习,提升整体能力 [6]。这一步解决的是「知识不能流动」的问题,但它主要关注的是智能体之间的共享,没太考虑多用户场景下的隐私。
再后来,记忆织物(memory fabric)的综述把这些工作系统梳理了一遍,明确指出了一个缺口:现有的架构大多是单用户的,多用户共享记忆还缺乏成熟的隐私保护方案,也没有统一的评估标准 [8]。
而 AIM 正好补上了这块缺口——它提出了隐私感知的多用户多智能体记忆框架,既支持私人记忆和公开记忆的统一管理,又在索引层面做了访问控制,还配套了第一个专门的多用户记忆基准 MUMBench [1]。
当然,这远不是终点。AIM 只是在「多用户 + 隐私」这个方向上迈出了第一步,后面还有很多问题要解决。
五、还没解决的问题:共享记忆的四道坎
论文自己也很坦诚地列了不少局限和开放问题。总结下来,共享记忆至少还有四道坎要过。
第一道坎:标签提取还不够准。 AIM 用标签来辅助检索,但实验里标签重叠率最高只有 35.5%,说明标签提取的策略还需要改进 [1]。标签不准,直接影响后面的检索相关性——实验里检索相关性最高也只有 45.0%,还有很大提升空间 [1]。
第二道坎:公共记忆会被「乱写」。 现在 AIM 里的公开记忆任何人都可以写,这就带来一个问题:如果有人故意或无意地写入错误信息怎么办?比如有人把「北京是中国的首都」改成「上海是中国的首都」,后面的用户搜到的就是错的 [1]。怎么在记忆创建的时候就做事实核查,是个待解决的问题。
第三道坎:隐私粒度还太粗。 现在 AIM 只有「私人」和「公开」两级,非黑即白。但现实中很多信息不是这样的——比如你可能想让家人看到你的住址,但不想让同事看到;想让同部门的人看到项目文档,不想让别的部门看到。怎么实现「只给特定人群看」的细粒度分组,论文也明确列在了开放问题里 [1]。
第四道坎:真实场景的考验。 现在的评估用的是合成的对话数据,虽然经过人工验证,但和真实用户的行为分布可能还是有差距 [1]。真实环境里隐私分类的歧义会更多,还会有并发写入冲突、跨智能体同步等等问题,这些都还没被测试过。
如果你只记住一件事
AIM 框架用「自动分类 + 索引级访问控制」的思路,为多用户共享 AI 记忆的隐私保护提供了一个从结构上降低泄露风险的方案。
参考文献
- AIM: A Privacy-Aware Interoperable Memory Framework for Multi-Agent Multi-User LLM Systems(arXiv、2026、全文精读)
- AI-Research Agents in the Wild. From GitHub and arXiv to Regularities and Gaps(arXiv、2026、全文精读)
- Kraken: LLM-based Speech-to-Speech Translation via Low-bitrate VQ and Dual-path Source Conditioning(arXiv、2026、全文精读)
- LLM Agents as Computational Typologists(arXiv (Cornell University)、2026、全文精读)
- A Cognitive Agentic AI Framework for Early-Phase Process Design and Optimization(SSRN、2026、仅摘要)
- INMS: Memory Sharing for Large Language Model based Agents(arXiv (Cornell University)、2024、仅摘要)
- AI-native Memory 2.0: Second Me(ArXiv.org、2025、仅摘要)
- A memory fabric for conversational AI agents enabling shared and persistent multiuser memory(Discover Artificial Intelligence、2026、仅摘要)