返回行业动态
研究前沿

OceanBase 数据智能体登顶国际基准 DAB:准确率 90.62%,用国产数据库与 GLM-5.2 跑出首个 90%+ 方案

OceanBase 团队提交的数据智能体方案在国际基准 Data Agent Benchmark(DAB)中以 90.62% 的准确率位列第一,成为该榜单首个突破 90% 的参评方案。该方案内部代号 Scout,基于国产大模型 GLM-5.2 构建,超过多项基于 GPT、Claude Opus、Claude Fable 搭建的方案:榜单第二名 Camber 为 87.9%,第三名 Permute EQ 为 87.1%。DAB 由 UC Berkeley EPIC Data Lab 与 Hasura PromptQL 联合推出,覆盖互联网与本地生活、金融股票、生物医学、企业运营、政务等十余个领域。与主要考察自然语言转 SQL 的传统测试不同,DAB 要求智能体完成理解数据、选择数据、规划分析路径、执行计算并验证结果的完整链路。相关技术将并入 OceanBase DataPilot 产品。

来源:OceanBase 官方技术公告(Data Agent 方案登顶 DAB 榜单)原标题:OceanBase 团队 Data Agent 方案登顶国际基准 Data Agent Benchmark查看原文
现代数据中心展厅中,透明亚克力柱与金色数据管线交织成立体数据塔,塔内流动蓝色数据粒子,地面为深色镜面并带网格倒影

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

OceanBase 团队提交的数据智能体方案在国际基准 Data Agent Benchmark(DAB)上以 90.62% 的准确率位列第一,成为该榜单首个准确率突破 90% 的参评方案。该方案内部代号为 Scout,构建在国产大模型 GLM-5.2 之上。榜单显示,其后依次为 Camber(Claude Opus 5,高推理强度)87.9%、Permute EQ(Claude Opus 5)87.1%、Sentinel 86.2%、Permute Core 84.1%、Alkera 84.1%、Sarvam Code v0.36(GLM-5.2)82.1%、SCRIBE 81.8%。换言之,登顶方案以国产数据库加国产模型的组合,超过了多项由海外前沿模型驱动的竞品。

DAB 由 UC Berkeley EPIC Data Lab 与 Hasura PromptQL 联合推出,评测覆盖互联网与本地生活、金融股票、生物医学、知识产权、企业运营、政务与公共管理、媒体文娱等领域,并横跨 PostgreSQL、MongoDB、SQLite、DuckDB 等多种数据库。与主要考察自然语言转 SQL 的传统测试不同,DAB 考查智能体进入真实数据环境后,能否从复杂、分散、形态各异的数据中找到正确答案。

技术路径

Scout 的关键并不在于更换更强的基础模型,而在于构建了一套「数据理解—任务执行—结果校验」的闭环体系。在数据理解环节,系统通过 DataLens 机制自动构建数据画像、识别字段语义与关联关系,并结合任务规划与结构化约束,把自然语言需求拆解为数据源与字段选择、筛选条件与关联键确定、跨源关联、聚合排序以及结果校验等可执行步骤。

  • 执行路径动态匹配:简单结构化查询直接调用工具以快速响应;多步计算任务走带约束检查的数据工作流,逐步验证;涉及文本理解的任务则结合语义抽取与分类工具协同处理。
  • 结果校验:底层由 DataKernel 与语义处理工具完成计算,上层通过证据追踪与答案校验,核查计算对象、统计粒度与执行过程是否符合任务要求,并把结果与数据来源显式关联。
  • 异常修复:一旦发现异常,系统依据结构化诊断定向修改执行计划,在限定预算内完成重新验证与执行,避免错误结果直接输出。
  • 产品化承接:本次评测中的能力将沉淀进 OceanBase DataPilot,定位为面向经营分析与业务决策的数据智能体,内置细粒度数据权限与审计能力。

为什么重要

对企业数据团队而言,这个结果的参考价值在于它把衡量标准从「模型会不会写 SQL」推进到「智能体能不能把数据用起来」。一次完整任务需要理解数据、选择数据、规划分析路径、执行查询计算并验证结果,任何一环缺失都会导致答案不可用。这也解释了为什么榜单上排名靠前的方案普遍不是单纯堆模型,而是模型、智能体编排与数据系统三者的协同。

另一层意义在于数据库角色的迁移。过去数据库提供存储、查询与处理能力;当 AI 智能体成为新的数据使用者后,数据库需要帮助 AI 理解数据、关联数据并验证分析结果。OceanBase 自今年 6 月 29 日发布湖库一体的 AI 数据库以来,正在沿这一方向把自身能力延伸到 AI 数据分析环节。

仍待确认

榜单成绩是技术能力的一项证据,但不等于生产可用性。真实环境中的可靠性、权限治理、运行成本、响应延迟与跨场景适用性,仍需结合产品测试与客户实践持续验证。此外,DAB 的评测集与评分口径由第三方机构维护,不同批次的任务构成可能变化,排名会随新方案提交和口径调整而变动,因此更适合作为横向参考而非绝对结论。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。