TabFM

TabFM – 谷歌开源的零样本表格基础模型

TabFM:谷歌研究的颠覆性表格数据处理新范式

在人工智能领域,处理结构化表格数据始终是一个充满挑战但至关重要的任务。近期,谷歌研究团队重磅推出了一款名为 TabFM 的基础模型,它以一种前所未有的“零样本”方式,彻底革新了我们对表格数据的分类与回归处理。这款模型在海量合成数据上精心训练,无需耗时微调或繁琐的超参数调优,仅需一次前向传播,便能凭借训练数据作为上下文,在复杂的表格任务上展现出超越顶级基线模型的卓越性能。

TabFM 的核心亮点

TabFM 的出现,为表格数据分析带来了诸多突破性的功能:

  • 真正的零样本分类:告别繁琐的训练过程,TabFM 能够直接对最多包含10个类别的表格数据进行精准分类预测,极大简化了模型部署的流程。
  • 零样本回归能力:对于数值型目标变量的回归任务,TabFM 同样无需进行模型微调,即可提供高效的预测结果。
  • 原生混合特征支持:TabFM 能够无缝处理数值型与类别型特征混合的表格数据,自动完成特征编码与缩放等预处理步骤,让数据科学家们从繁杂的数据准备工作中解放出来。
  • 上下文学习驱动的推理:模型巧妙地将训练数据作为“上下文”信息输入,通过单次前向计算即可完成预测,实现了高效且精准的零样本推断。
  • 双后端框架兼容:为了满足不同用户的技术栈偏好,TabFM 同时提供了 JAX 和 PyTorch 两种权重版本,极大地增强了其灵活性和易用性。

TabFM 的技术基石

TabFM 之所以能取得如此傲人的成绩,源于其背后强大的技术支撑:

  • 海量合成数据预训练:TabFM 的训练过程基于结构因果模型(SCM)生成的数百亿级别合成表格数据。通过随机生成有向无环图来模拟变量间的因果关系,并依据父节点条件分布生成特征值,这种方法不仅规避了真实数据可能存在的隐私与版权风险,还为模型注入了丰富的泛化能力。
  • Transformer 序列架构的运用:模型采用了先进的 Transformer 架构,将表格的每一行视为一个 token 序列。数值特征被巧妙地映射为连续向量,而类别特征则通过嵌入层转化为稠密向量。Transformer 的自注意力机制能够高效地捕捉列与列之间复杂的高阶交互关系。
  • 上下文学习的推理模式:在推理阶段,TabFM 将用户的训练集序列化并作为上下文输入模型。模型通过注意力机制从这些上下文信息中学习统计规律,从而在不改变模型权重的前提下,直接输出预测结果,实现了真正的零样本推断。
  • 自动化预处理流水线:TabFM 集成了一套兼容 scikit-learn API 的自动化预处理流程,能够自动完成类别特征的序数编码、数值特征的标准化以及缺失值的稳健处理,用户可以直接传入原始 DataFrame,无需进行额外的数据清洗和转换。

想要深入了解或参与 TabFM 的开源社区,请关注微信公众号并回复“开源”,加入 AI 开源项目交流群。

如何快速上手 TabFM

使用 TabFM 进行表格数据处理,流程简单高效:

  • 获取代码:首先,通过 git clone https://github.com/google-research/tabfm.git 命令克隆项目仓库。
  • 安装依赖:进入项目目录后,根据您选择的后端框架,执行相应的安装命令:pip install -e .[pytorch]pip install -e .[jax]
  • 加载模型权重:在您的代码中,导入对应后端模块(例如 tabfm_v1_0_0_pytorch),然后调用 .load() 方法即可自动下载并加载预训练权重。
  • 初始化分类器或回归器:使用 TabFMClassifierTabFMRegressor 包装模型实例,并通过 .fit(X_train, y_train) 方法准备好数据编码器。
  • 执行预测:调用 .predict(X_test).predict_proba() 方法,即可获得 TabFM 的零样本预测结果。

TabFM 的核心优势一览

  • 极致的零样本体验:无需微调,无需超参数搜索,开箱即用的设计极大地降低了使用门槛,让更多人能够轻松应用先进的表格模型。
  • 隐私与安全保障:模型完全基于合成数据进行训练,避免了对真实敏感数据的依赖,有效规避了隐私泄露和版权方面的风险。
  • 卓越的性能表现:在 TabArena 基准测试的51个真实数据集上,TabFM 的零样本预测能力已经超越了经过大量调优的梯度提升树等传统强基线模型。
  • 灵活的框架选择:同时支持 PyTorch 和 JAX 两种后端,用户可以根据自己的技术栈和部署需求选择,大大提升了模型的适用性。
  • 友好的用户接口:完全遵循 scikit-learn API 设计,数据科学家们可以无缝地将 TabFM 集成到现有的工作流中,无需学习新的接口。

TabFM 的项目资源

TabFM 与同类竞品对比

维度TabFMTabPFN
开发团队Google Research德国弗莱堡大学 / AutoML 团队
训练数据数百亿合成表格(SCM生成)数百万合成数据集(先验分布采样)
分类类别限制最多10类最多10类
回归支持原生支持早期版本不支持,后续扩展有限
后端支持PyTorch + JAX 双版本主要基于 PyTorch
数据规模适合中小规模表格(<10,000样本)同样针对中小规模优化
核心机制上下文学习(In-Context Learning)基于 Transformer 的近似贝叶斯推断

TabFM 的广泛应用场景

  • 金融风险控制:在评估贷款申请风险时,TabFM 能够快速进行预测,无需重新训练模型,同时有效保护客户的隐私信息。
  • 医疗辅助诊断:为患者的混合特征数据进行疾病分类,避免了敏感医疗数据的泄露风险,助力精准医疗。
  • 电商价格预测:对于新上架的商品,TabFM 能够快速进行零样本价格回归,并能有效结合商品的多样化特征。
  • 广告点击率预估:在广告投放的冷启动阶段,TabFM 可快速预测广告的点击率,无需等待大量训练数据的积累。
  • 科研数据探索:研究人员在处理人口普查、社会调查等敏感数据集时,TabFM 提供了快速建立基线模型的能力,且无需直接接触原始隐私数据。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...