发生了什么
英伟达发布开源表格基础模型 Kumo Tabular,属 Kumo Structured 系列,权重托管在 Hugging Face,推理走开源的 structured-data-models 库(Apache 2.0 许可),首次运行自动下载权重。模型分 Small、Medium、Large 三档,参数规模约 2800 万至 2.15 亿。
- 输入一张含已标注行的表格作为上下文、若干待预测行作为查询,模型一次前向传播返回分类概率,或回归任务的 999 个分位数,同时给出点估计与不确定性。
- 架构仍是 Transformer,但按表格结构组织:列注意力判断某个值在本列分布中是否异常,行注意力学习同一行内的特征交互,最后的上下文 Transformer 让查询行只关注已标注行。
- 为应对推理表远长于训练表的情况,引入长度感知的注意力温度,按键数量对数放大查询缩放系数,避免注意力随行数增加而发散。
- 原生只支持数值列与类别列,文本、图片与时间戳需用官方预处理配方转换;单次前向最多覆盖约 10 个类别,更多类别通过纠错输出码扩展。
训练数据全部由合成生成
最值得注意的是预训练数据来源:Kumo Tabular 完全没有使用真实企业数据集,全部由结构因果模型生成。生成器先随机抽取表格配置,再用随机因果图连接隐变量,沿图从根到叶施加随机函数(线性映射、小型神经网络、树、高斯过程),其中部分节点成为数值或类别列、一个成为预测目标,其余保持隐藏。后处理阶段注入相关列组、离群值裁剪与缺失值,并用树模型剔除没有可学习信号的表。三档模型分别见过约 3500 万、7100 万与 1.37 亿张合成表,训练分三阶段把上下文从 1024 行扩展到 6 万行,列数上限为 100。
基准成绩与能力边界
英伟达自报在统一单卡 RTX 6000 Pro 设置下,Kumo Tabular 在 TabArena 总榜以 1950 ELO 排名第一,速度约为对照模型 LimiX-2 的 17 倍;BeyondArena 得分 1418、可提升空间 7.78%;在 TALENT 的分类准确率、分类对数损失与回归误差三项平均名次为 6.67、3.98 与 4.22;在概率预测榜 ScoringBench 上,Large 与 Medium 分列第一、第二。上述数字均为厂商在公开榜单上的自报结果,写作时未见独立复现。
为什么重要
对多数企业来说,真正产生价值的机器学习任务长在表格里——客户流失、信贷违约、需求与报价预测。过去二十年这套流程依赖梯度提升树,每换一个问题就要重新采标注、做特征工程、搜超参、验证与部署。Kumo Tabular 把这个循环压缩成一次前向调用,且许可允许商用、可不依赖托管端点自建,等于把「基础模型」这一模式正式搬进结构化数据领域。另一层意义在合规:训练数据全为合成表,规避了用真实企业记录训练带来的隐私争议与数据出境顾虑。
不确定之处
限制同样清晰。文本与时间戳不是原生输入,需要额外转换;单次前向的类别数上限约 10 个;当查询行分布明显偏离上下文、或表规模超出训练范围时精度会下降,官方明确要求上线前用留出集验证精度与校准。合成数据生成器与训练配方承诺后续开放,但目前没有时间表,研究者暂时拿不到最关键的构件。对企业而言,务实的做法是先在一个冷启动或标注昂贵的小任务上与现有树模型基线对打一轮。

