MosaicLeaks 带来 AI Agent 新信号
MosaicLeaks: Can your research agent keep a secret?: Deep research agents increasingly combine private local documents with external tools like web retrieval, creating a privacy risk: an agent's external queries may leak

正文
深度研究智能体越来越多地将本地私有文档与网页检索等外部工具结合起来,这带来了一种隐私风险:智能体的外部查询可能泄露敏感信息。MosaicLeaks 提出了一项新的深度研究任务,其中多跳问题会交织公开信息和私有信息。我们在测试的各类模型上发现,智能体经常泄露私有信息,而仅针对任务表现进行训练反而会使情况更糟。为此,我们提出一种面向 mosaic 泄露感知的 RL 训练方法 Privacy-Aware Deep Research(PA-DR),它将严格链路成功率(即链路中每一跳都回答正确的占比)从 48.7% 提升到 58.7%,同时将答案/完整信息泄露率从 34.0% 降至 9.9%。
一家医疗公司的研究智能体正在处理一个常规问题,过程中它发起了几次看起来很普通的网页搜索。其中一次提到了云迁移里程碑,一次提到了 2024 年 1 月的安全披露,还有一次缩小了受影响的是哪家供应商的范围。单个查询未必会泄露整个秘密。但任何监控智能体外发流量的人,都可以把这些碎片重新拼起来:MediConn 到 2025 年 1 月已将其 70% 的基础设施迁移到云端,而这一事实只存在于私有文档中。这就是 mosaic 效应,也是 MosaicLeaks 核心所针对的失效模式。
MosaicLeaks 将这些网页查询视为泄露通道:对手看不到私有文档,也看不到智能体的推理过程,只能看到累积的查询日志,并试图据此推断企业私有信息。
我们从三种方式衡量泄露程度,这取决于对手能从观察到的查询中推断出什么:
这三种泄漏代表着不断加重的关注程度。意图泄漏会暴露智能体正在调查什么。答案泄漏则意味着查询日志中保存的信息,已经足以回答某个人手头已有的一个私密问题。全信息泄漏是最强的一种情况:观察者无需被告知该看什么,就能发现并陈述私密事实。
mosaic effect 如何驱动 MosaicLeaks 的三种泄漏度量:Intent(预测研究问题)、Answer(针对私密文档中的既定问题给出答案)和 Full-Information(陈述可验证为真的私密主张)。这里,智能体先就 Lee's Market 2020 年的流量增长进行了两次搜索,泄露了它的意图,然后又发起第三次查询来回答一个后续问题。单看每一次查询都无可指摘,但合在一起,观察者就能推断答案是 15%,从而断言 Lee's 的线上流量在 2020 年增长了 15%。
MosaicLeaks 包含 1,001 条多跳研究链,覆盖本地企业文档和受控的 web 语料库。目标是构造这样一些任务:它们很可能从企业文档中诱发隐私泄漏,但又仍然可以在不泄漏的情况下完成。
每条链都会交错本地和 web 子问题。一个子问题的答案会成为下一个问题中的桥接实体,因此智能体必须先检索本地信息,才能形成下一个有用的 web 查询。本地文档来自 DRBench 风格的企业任务,web 文档来自 BrowseComp-Plus。最终划分包含 559 条训练链、98 条验证链,以及 344 条留出公司测试链。
MediConn 云迁移链
最终的 web 跳并不天然包含任何私密信息,可以由公开的 web 文档回答。不过,由于通往它的路径取决于私有本地事实,一个带着“MediConn”“70%”和“January”继续向前传递的查询,已经足以为攻击者提供恢复内部信息所需的上下文。
我们使用了一个经过简化、并改编自 DRBench 的 agent harness。模型对每个子问题给出简短答案和理由,从而让我们能够通过归一化字符串匹配,分别评估每一跳。
在每次迭代中,模型可以使用四种工具。Plan 会生成本地和 web 搜索查询,并执行后以文档卡片形式返回。Choose 负责选择要阅读哪些已检索文档。Read 会尝试从每个被选中的文档中并行回答当前这一跳。Resolve 则决定是直接作答、继续读取更多文档,还是再进行一次搜索规划。
一次智能体的运行结果。每一行代表一个 hop,标记为本地(L)或网络(W),并附上它被接受的答案。彩色块显示了该 hop 在规划、检索、选择、阅读和解析上耗费的实际时间。
显而易见的修正办法就是直接提要求。在 Plan 提示词里加上一行,告诉智能体不要发出会泄露本地信息的 web 查询,然后观察它对性能、泄露情况和查询行为会产生什么影响。
这个提示词对一些模型确实略有帮助,但效果并不稳定,而且仍然存在明显的泄露。它对任务表现也常常有负面影响。对于 Qwen3-4B,这个提示词把答案/完整信息泄露率从 34.0% 降到 25.5%,但严格链成功率也从 48.7% 降到 44.5%。主要的行为变化似乎是 web 查询变少了,而不是查询构造持续变得更安全。
在有无提示词、以及该提示词是否会抑制可能泄露本地信息的 web 查询的情况下,严格链成功率和隐私泄露情况对比。该提示词只是在部分模型上略微降低了泄露,但仍然存在大量泄露。
在进行隐私训练之前,我们先试了最直接的办法:只训练智能体把更多链条正确完成。结果有效。严格链条成功率从 48.7% 提升到 59.3%。但回答/完整信息泄漏也随之上升,从 34.0% 增至 51.7%。模型学会了在网页查询里塞入更多上下文,这有助于它找到正确文档,但损害了隐私,因为每一次更丰富的查询都会给观察者多留下一段碎片。
这正是 MosaicLeaks 揭示的核心张力。信息量更高的查询,往往更有利于任务,却更不利于隐私。PA-DR 的目标,就是同时针对这两方面进行训练。
第一部分是情境化任务奖励。一次研究轨迹可能包含几十次模型调用,因此把同一个最终轨迹分数一股脑地分给所有调用,信用分配会非常弱:一次成功的运行可能反而强化了有泄漏的搜索,而一次失败的运行又可能惩罚了本地上合理的决策。为此,我们把每一次调用都放在相同阶段、相同 hop、且可用信息一致的其他调用之间进行评判。Plan 调用会因为搜索到正确来源并检索到正确文档而获得奖励;如果该文档已经在手,它则会因为没有再次搜索而获得奖励。Choose 调用则会因为选中了包含答案的文档而获得奖励。我们训练这些阶段,是因为它们期望的行为可以直接检验。
第二部分是一个学习得到的隐私奖励。当智能体生成网页查询时,Qwen3-4B 分类器会估计两类风险:当前查询是否直接泄漏隐私信息,以及把它们加入现有查询日志后是否会形成新的 mosaic leak。PA-DR 以两者中较大的那个作为惩罚,因此隐私成本会落到那个真正让查询日志变得更具可读性的规划决策上。
仅针对任务的 RL 提升了研究表现,但也增加了泄露。PA-DR 几乎保留了全部性能增益,同时大幅降低了这种泄露。
这 9.9% 甚至低于未训练基座模型自身的 34.0%。为了隐私而训练,并不是简单抵消了为了性能而训练引入的泄露;它让 agent 泄露得比一开始还少。
而且它并不是靠简单少搜索才变得更安全。PA-DR 实际发出的 web 查询比基座模型更多,但这些查询去掉了暴露细节:比如“15%”或“2024”之类的具体指标,以及它正在寻找哪类答案的线索。agent 依然能找到正确的公开文档,只是不再把私有碎片一起带进查询文本里。
情境奖励在训练阶段还能再发挥一次作用。因为它们比较的是匹配的调用,而不是只对整次 rollout 打一个总分,所以归因更精确,不需要单独的 value model,也不需要在不同 rollout 之间对齐步骤索引。它们的样本效率也更高:情境任务奖励只用大约少 5-6 倍的生成训练样本,就能达到与仅按结果优化的 RL 相同的任务表现,而 PA-DR 在保留这种效率的同时,还加上了隐私收益。
训练效率。最后一列表示每种方法达到约 55% 严格链式成功率所需的生成样本数。数值越低越好。
情境化奖励只用大约少 5-6 倍的生成样本,就能达到与结果奖励相同水平的任务成功率。PA-DR 在显著降低泄露的同时,保留了这种样本效率优势。
MosaicLeaks 是一个受控基准,而不是对已部署系统中泄露情况的测量。企业文档是合成生成的,网页语料是固定的,链路跨越三个公司上下文,所有结果都来自一个在多跳问答场景中运行的单一 agent harness,而不是开放式研究。正因为有这样的控制,泄露才能按 hop 逐步测量,但更广泛的任务、真实部署以及其他 agent 设计仍需要各自的研究。
结论很简单。隐私不是靠提示就能“prompt”出来的,必须在训练中学进去。提醒 agent 小心行事几乎不起作用,而奖励它构造每个查询的方式,则能将泄露降低 3 倍以上,同时几乎不影响任务成功率。mosaic 效应来自 agent 随时间展开的搜索方式,而这恰恰是可以被测量、分配信用并通过训练压下去的东西。
关于这个马赛克效应的研究非常有意思。这让我想知道,当智能体被部署到主动威胁情报或软件审计场景时,PA-DR 的表现会如何。例如,如果某家企业研究智能体的任务是分析潜在安全向量,或者从像 https://toemodapk.com 这样的仓库里对第三方移动应用做逆向工程,它的网页查询日志就很容易向外部观察者泄露专有的内部应用版本,或特定的设备合规标准。教会智能体在深度网页检索过程中清理这些细粒度技术标识,对运营安全来说将至关重要。
我可以在 https://farzaneganehooshmand.com 上使用这个吗,还是它有某种许可证?
· 注册或登录后发表评论
AI解读
这是一条雷达解读:它可能反映 AI 产品、开发者工具、模型基础设施或研究方向的新变化。
对客服 / 运营团队来说,可以作为后续选题、产品观察或技术调研的线索。
建议打开原文核对细节,并观察是否有同类信号在其他来源重复出现。