返回行业动态
研究前沿

Google Research 把联邦学习搬进可信执行环境:首次给出可外部验证的差分隐私保证

Google Research 于 10 月 2 日发布新一代联邦学习系统,把训练搬进服务器端可信执行环境(TEE),并首次为联邦学习提供可外部验证的中心化差分隐私保证。设备的访问策略须发布到公开透明日志,解密密钥只发放给符合策略的 TEE 工作负载,相关二进制文件可从开源代码复现构建。Gboard 的英语与日语下一词预测模型已上线,据报道训练时间由一至两个月缩短到约三周。

来源:Google Research 官方博客:Toward provably private learning from federated data原标题:Toward provably private learning from federated data查看原文
以隔离安全区、加密数据流与公开透明账本表现的隐私计算联邦学习系统

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

Google Research 于 10 月 2 日发布新一代联邦学习(FL)系统,核心变化是把训练过程搬进服务器端的可信执行环境(TEE),并首次为联邦学习提供可被外部验证的中心化差分隐私(DP)保证。谷歌在 2017 年提出联邦学习,目前支撑着 Gboard 的下一词预测与智能撰写、Google Messages 的回复建议以及安卓的智能文本选择。但早期系统存在信任缺口:设备上传数据后立即聚合,外部观察者无法验证数据是否被记录或查看;后来加入的安全聚合(Secure Aggregation)虽有密码学保护,却与当前最先进的中心化差分隐私算法不兼容。结果是,加噪声的是运营方,证明自己加了噪声的也是运营方,隐私长期停留在承诺层面。

系统如何把「信任」换成「验证」

  • 数据上传:设备在本地加密训练样本并预先授权一份访问策略,策略列明哪些 TEE 计算可以处理这些数据,且必须发布到公开透明日志 Rekor。
  • 密钥与策略验证:密钥管理系统由一组运行 RAFT 共识协议的 TEE 组成,只向符合访问策略的工作负载发放解密密钥。
  • 工作负载执行:根 TEE 运行 Python 训练循环,并把可并行的子任务分发给 worker TEE 集群;编排使用派生于 TensorFlow Federated 的开源 Federated Language,只释放经过差分隐私处理的模型权重。
  • 容错恢复:每轮结束时保存一份 KMS 加密的恢复状态,用于在根节点或工作节点故障后恢复训练,且不泄露额外隐私信息。

可验证性来自几个环环相扣的设计:访问策略发布在 Sigstore 的公共透明日志 Rekor 上,外部审计者可以追踪设备可能喂入数据的全部服务端工作负载;密钥管理与数据处理的二进制文件可从开源代码(Confidential Federated Compute 仓库)可复现构建;策略直接描述运行中的 Python 训练程序。为保护专有模型架构,TEE 支持在运行时侧加载序列化逻辑,但所有与隐私相关的逻辑必须硬编码在经认证的程序中,工作负载运营者只能看到指标与差分隐私模型权重。

Gboard 已经落地的变化

Gboard 已用这套系统上线英语与日语的下一词预测模型。据同期发布的白皮书,Gboard 的 A/B 测试中,用新系统训练的英语模型以比现有生产模型小三倍的隐私预算,取得了相同的可用性指标,训练时间从过去的一至两个月缩短到约三周。结构上的原因是两点:其一,所有上传数据会在服务端训练开始前收集完毕,设备可用性的昼夜波动不再拖慢进度;其二,梯度计算从设备移到服务端后,训练可跨机器并行,瓶颈转移到 TEE 资源可用量。谷歌表示还在尝试在同一套基础设施上运行合成数据生成、大模型推理等其他 Python 工作负载。

为什么值得关注

对任何需要在合规框架下使用用户数据的团队,这项工作的意义不在单个模型的准确率,而在信任模型本身的变化:过去联邦学习的隐私保障依赖密码学与厂商承诺,现在第一次把「哪些代码能碰到数据」「数据在哪台机器上被解密」变成可审计、可复现的公开事实。它也抬高了联邦学习能训练的模型规模上限——客户端梯度计算移到服务端后,训练不再受手机算力约束。当然,这套机制仍在 TEE 这一代的硬件信任假设之下,TEE 自身的侧信道与供应链风险并未被消除,只是把信任面从运营方收窄到了芯片与构建链。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。