返回行业动态
企业AI落地

牛津博德利图书馆数字化材料被曝进入 OpenAI 训练集

据《卫报》援引信息自由请求取得的牛津大学内部文件,该校 2025 年 3 月与 OpenAI 公布的博德利图书馆数字化合作,其扫描材料已被用于填充 OpenAI 训练集:截至 2025 年 6 月已提供约 12.5 万张历史学位论文图像,另有约 1 万份都铎时期单页歌谣。牛津回应称材料均已过版权保护期、规模有限且非独家,扫描件权利仍归图书馆并将在数月内公开上线。

来源:《卫报》:牛津允许 OpenAI 使用博德利图书馆馆藏训练模型(援引信息自由请求取得的内部文件)原标题:Oxford lets OpenAI train its AI models on Bodleian Library texts查看原文
古老图书馆的长廊纵深,前景是成排木质阅览桌与摊开的空白书册,中景高耸拱形书架沿透视延伸并有尘埃光柱斜射,远处长廊尽头温暖明亮,顶部深色木质穹顶下有一行白色中文标题

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

《卫报》援引通过信息自由请求取得的牛津大学内部文件报道,牛津博德利图书馆与 OpenAI 合作中完成数字化的历史材料,已被用于「填充 OpenAI 的训练集」。牛津大学与 OpenAI 于 2025 年 3 月公布该合作时,表述为测试公共领域馆藏的大规模数字化、让此前难以获取的材料对学生与研究者可检索,未提及模型训练用途。

  • 截至 2025 年 6 月,博德利图书馆已向 OpenAI 提供约 12.5 万张 19 至 20 世纪欧美高校博士论文的扫描图像
  • 同期数字化对象还包括约 1 万份都铎王朝时期的单页歌谣,内容含歌词与乐谱
  • 内部讨论中的后续候选包括多萝西·霍奇金关于青霉素的笔记、18 世纪爱尔兰政府文书与小说家玛丽亚·埃奇沃思的私人信件
  • 牛津是 OpenAI 校企合作计划 NextGenAI 中唯一的英国成员,该计划还包括麻省理工、波士顿公共图书馆、加州理工与密歇根大学

校方回应与员工关切

牛津大学发言人称,涉及的数字化材料「规模有限且均已过版权保护期」,OpenAI 的使用「非独家」,博德利图书馆保留扫描件的权利,并将在未来数月内免费公开上线。校方不认可「隐瞒机器学习用途」的说法,表示数字化是主要目标,同时工作人员一直公开说明该项目也会贡献训练数据。

会议纪要显示,包括图书馆治理委员会成员在内的工作人员,对与 OpenAI 合作带来的声誉风险,以及能源密集型技术同大学环境承诺之间的冲突提出担忧。合同还涉及博德利图书馆 2300 万件馆藏进一步数字化的可能,以及一款名为 Ask the Bod 的问答机器人设想。

为什么重要

这条线索的价值在于把「训练数据从哪来」拆成四个权利层次:原始作品的归属、作品的版权状态、数字化复制件的权利,以及把数据用于模型训练的许可。对握有馆藏的机构而言,档案正在从公共资源变成可被授权、可被交易的资产;对模型厂商而言,公开网页越来越多被 AI 生成内容污染,物理与历史馆藏成为稀缺的干净数据来源。合作的治理条款——训练用途、排他性、留存、公开与署名——因此成为后续同类协议的必谈项。

不确定之处

  • OpenAI 未公开该合作的具体数据条款,训练集实际纳入的规模与范围仍不清晰
  • 校方称公开上线扫描件在「数月内」完成,目前尚无明确时间表;候选名单中的材料是否已提供亦无确认
  • 该披露来自信息自由请求与媒体转述,属于合作透明度的争议,而非版权侵权的司法认定
编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。