【ICML 2025】TabICL:面向大数据量表格的上下文学习基础模型|从表格基础模型视角
2026/8/20 10:10:11 网站建设 项目流程

摘要

本文解读 ICML 2025 论文《TabICL: A Tabular Foundation Model for In-Context Learning on Large Data》。该论文提出TabICL,一个可扩展的表格分类基础模型,通过融合分布感知列嵌入上下文感知行交互数据集级上下文学习(ICL),把表格 ICL 的处理规模从 1 万样本推到50 万样本、500 特征,其特别之处在于"先嵌入、后 ICL"的两阶段架构,用列维度坍缩把复杂度从 $\mathcal{O}(m^2 n + n^2 m)$ 降到 $\mathcal{O}(m^2 n + n^2)$。实验表明在 TALENT 的200 个分类数据集上 TabICL 中位精度最佳、零超参调优,比 TabPFNv2 快至10 倍,并在 53 个大数据集上超越 TabPFNv2 与 CatBoost,为表格基础模型提供了重要借鉴。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机
  • 研究主线:从问题到结论
  • 基准/方法设计
  • 分类全景
  • 方法细节
  • 实验设计与结果
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • TabICL 与 TabPFNv2 的核心区别是什么?
    • TabICL 需要调参吗?
    • TabICL 如何处理超过 10 类的分类问题?
    • 为什么列嵌入能跨表迁移?
    • 表示坍缩是什么?RoPE 为什么能解决?
  • 参考链接

论文基本信息

项目内容
标题(英文)TabICL: A Tabular Foundation Model for In-Context Learning on Large Data
标题(中文)TabICL:面向大数据量表格的上下文学习基础模型
作者Jingang Qu, David Holzmüller, Gaël Varoquaux, Marine Le Morvan
机构SODA 团队 INRIA Saclay · Sierra 团队 INRIA Paris · ENS PSL
会议ICML 2025(Poster)
arXivhttps://arxiv.org/abs/2502.05564
项目网站https://github.com/Qu-Jingang/TabICL

背景与动机

表格数据在医疗、金融等工业场景中无处不在,但梯度提升决策树(GBDT)长期统治这一领域:CatBoost、XGBoost 精度高但需要超参调优,RealMLP、ModernNCA 等深度模型的差距在收窄但仍需验证集调参。TabPFN(ICLR 2023)开创了表格上下文学习范式——把训练数据作为上下文、单次前向完成预测,TabPFNv2(NeurIPS 2024)把它推到 1 万样本,但其交替列-行注意力在原始维度上计算,复杂度 $\mathcal{O}(m^2 n + n^2 m)$ 随样本量和特征数同时爆炸,30K 以上样本就容易显存溢出。

TabICL 的切入点是一个尖锐的问题:ICL 能否有效扩展到大数据量表格?作者给出的答案是架构性重设计而非堆算力——先把表格压缩成固定维度的行嵌入,再在嵌入上做 ICL,让 ICL 的成本不再随原始表格规模线性增长。

历史脉络上,表格 ICL 走过了清晰的三步:TabPFN(2022,上限 ~1K 样本)→ TabPFNv2(2024,交替注意力推到 10K 样本/500 特征)→ TabICL(2025,两阶段维度坍缩扩到 500K 样本,大表超越 GBDT)。后续的 TabDPT(真实数据预训练)、TabForestPFN(树型先验)、LoCalPFN/TuneTables(上下文蒸馏)都沿着"让 ICL 更可扩展"的主线演进。

研究主线:从问题到结论

图 13:TabICL 研究主线流程图(Mermaid)——问题→动机→设计→方法→实验→结论

基准/方法设计

TabICL 由三个 Transformer 组成,标签只在最后阶段参与计算(晚期融合):

  1. TF col(分布感知列嵌入):把特征嵌入重新表述为集合输入问题,用 Set Transformer 的诱导自注意力块(ISAB,$k=128$ 个诱导向量)把每列单元格映射为逐单元仿射参数 $W, B$,嵌入为 $e_j = W \odot c_j + B$(维度 $d=128$)。所有列共享参数,因此跨表可迁移,且能捕获列内分布统计。
  2. TF row(上下文感知行交互):3 层 8 头 Transformer 逐行处理特征交互,每行前置 4 个可学习 [CLS] token,拼接输出得到 512 维固定行嵌入;引入 RoPE(缩放因子 100,000)打破同分布特征的表示坍缩。
  3. TF icl(数据集级 ICL):12 层 4 头 Transformer 在行嵌入上做注意力,训练嵌入互相关注、测试嵌入只关注训练嵌入,2 层 MLP 输出类别概率,单次前向预测整个测试集。

图 1:TabICL 架构总览——列嵌入 TFcol → 行交互 TFrow(4 个 CLS token)→ 数据集级 ICL TFicl,单次前向输出测试集预测

图 2:分布感知列嵌入——Set Transformer(ISAB)把每列视为集合,输出逐单元仿射参数 W、B,嵌入 e_j = W⊙c_j + B

分类全景

表格学习的方法版图大致分四支:梯度提升树(XGBoost、CatBoost、LightGBM)、深度表格模型(RealMLP、ModernNCA、TabM)、跨表迁移方法(XTab、CARTE)、上下文学习基础模型(TabPFN、TabPFNv2、TabICL、TabDPT、TabForestPFN)。TabICL 处于第四支的最前沿。

图 14:表格学习方法分类全景(Mermaid)——TabICL 位于 ICL 基础模型最前沿

方法细节

预训练完全基于合成数据(约 8,200 万数据集,3×A100 共 20 天):用结构因果模型(SCM)按 $c = f(\mathrm{Pa}(c)) + \epsilon$ 生成依赖关系,新增树型 SCM(XGBoost 回归,70% SCM + 30% 树型)注入树模型归纳偏置;激活函数从 4 种扩到 15+ 种(含高斯过程采样的随机函数)。

课程学习三阶段:① 固定 1,024 样本跑 160K 步;② 1K–40K 样本对数均匀采样跑 2K 步(>10K 开启激活检查点);③ 40K–60K 均匀采样跑 50 步、只训练 TF icl。平均排名随课程推进从 11.4(第 9)→ 7.46(第 2)→ 6.95(第 1)。

>10 类问题的层次分类:递归切分成 ≤10 类子树(深度 $r = \lceil \log_{10} k \rceil$),所有子任务共享行嵌入与 TF icl,最终概率为根到叶路径概率乘积。

显存优化:FlashAttention + 动态 batch 调节(激活显存按多项式回归建模)+ CPU/磁盘激活卸载,使 100K 样本/500 特征仅需 5GB 显存 + 32GB 内存。

图 3:学习到的列嵌入编码分布属性——4 万特征 PCA 投影,相似偏度/峰度的特征聚集

图 4:balance scale 上的表示坍缩——无 RoPE 时行嵌入几乎塌成一点,RoPE 恢复三分类簇

实验设计与结果

评测协议:TALENT 基准 200 个分类数据集(120 二分类 + 80 多分类),排除 15 个 TabPFNv2 调参用过的数据集,聚焦 171 个 ≤10 类数据集;64%/16%/20% 划分;TabICL 与 TabPFNv2 仅用训练集、各做 32 次列/类置换集成,其余基线来自 TALENT 原基准(含调参)。

方法中位相对精度平均 Rank每 1K 样本耗时需调参
TabICL最佳6.95(第 1)1.1 s(A100)
TabPFNv2相当无显著差异慢 1.5–10×
CatBoost~3 min(CPU)
RealMLP / ModernNCA~7 min(GPU)
对比维度TabICLTabPFNv2
核心机制两阶段"嵌入后 ICL",列维度坍缩交替列-行注意力,无中间坍缩
复杂度$\mathcal{O}(m^2 n + n^2)$$\mathcal{O}(m^2 n + n^2 m)$
标签融合晚期(仅 ICL 阶段)早期(从头拼接)
预训练~82M 合成数据集,课程至 60K 样本~130M,上限 2,048 样本
推理上限500K 样本 / 任意类数10K 样本 / 10 类

图 5:TALENT 相对 MLP 精度与耗时——TabICL 中位精度最佳且快 1–2 个数量级

图 6:加速比——小表 1.5×,大表 3–10×;10K×100 特征时 20 s vs 1 min 40 s

图 7:按样本量排名的模型等级——TabICL 在 10K–100K 样本区间保持第一梯队

图 8:>10 类数据集归一化精度——TabICL 层次分类第二,TabPFNv2 无法原生处理

时间拟合(附录 D):以 $nm(n+m)$ 为横轴拟合 time $= \alpha + \beta (nm(n+m))^\gamma$($\gamma=0.8$),大表渐近加速比趋近 5×、小表 1.4×,与复杂度分析吻合。元特征分析:特征数增大时 TabICL 表现稳健;类别特征占比高时两者都略降,但 TabICL 仍优于先验生成更复杂的 TabPFNv2。

图 9:时间拟合——TabICL 曲线整体低于 TabPFNv2,差距随规模扩大

图 10:Rank 对特征数的依赖——TabICL 高维特征下依然稳健

消融(附录 E):加入 30% 树型 SCM 后 200 数据集相对精度全面提升;课程学习把平均 rank 从 11.4 提升到 6.95,代价是小数据集轻微回退。

图 11:树型 SCM 消融——绝大多数数据集提升为正

图 12:课程学习消融——大数据集显著获益,小数据集略有回退

结果对比总结

图 15:TabICL 结果对比总结(Mermaid)——效率与大数据量的双重优势

关键发现

  1. 规模跳变:TabICL 把表格 ICL 的处理上限从 1 万样本推到 50 万样本(500 特征,~20GB 显存),100K 样本/500 特征仅需 5GB 显存。
  2. 精度-效率兼得:200 个 TALENT 数据集上中位相对精度最佳、平均 Rank 6.95 第一,每 1K 样本仅 1.1 秒,全程零超参调优。
  3. 大表制胜:53 个 >10K 样本数据集上同时超越 TabPFNv2 与 CatBoost,证明 ICL 在大数据 regime 的竞争力。
  4. 系统性加速:小表比 TabPFNv2 快 1.5 倍、大表快 3–10 倍(10K×100 特征:20 s vs 1 min 40 s),与复杂度分析 $\mathcal{O}(m^2 n + n^2)$ vs $\mathcal{O}(m^2 n + n^2 m)$ 吻合。
  5. 概率可靠:不调参的 log loss 显著优于精度调参型竞争者,概率输出更适合决策场景。
  6. 多类扩展:层次分类让 TabICL 在 12 个 >10 类数据集上取得平均归一化精度第二,TabPFNv2 原生不支持。

局限性

  1. 推理速度:与其他基础模型一样偏慢(缓存可缓解);目前仅支持分类,回归需类似 TabPFNv2 的扩展。
  2. 列置换不变性:RoPE 使模型对列顺序敏感,只能靠多次列排列集成近似恢复——表格数据本应天然满足置换不变性。
  3. 评测方法学:继承自 TALENT(holdout 单模型 + 均值插补缺失值),交叉验证集成理论上更强但计算成本高。
  4. 基线未拉满:未给 TabPFNv2 提供类别信息、未让其内部处理缺失值,对手可能未达最佳状态;作者也坦诚调参时间按 ×100 近似估计。

常见问题(FAQ)

TabICL 与 TabPFNv2 的核心区别是什么?

架构上 TabICL 是两阶段"嵌入后 ICL"(列维度坍缩),TabPFNv2 是交替列-行注意力(无坍缩);标签融合上 TabICL 晚期、TabPFNv2 早期。结果是复杂度从 $\mathcal{O}(m^2 n + n^2 m)$ 降到 $\mathcal{O}(m^2 n + n^2)$,TabICL 能处理 500K 样本而 TabPFNv2 上限约 10K。

TabICL 需要调参吗?

不需要。它和 TabPFNv2 一样是零调参基础模型,预训练后直接单次前向预测;这也是它比 CatBoost(~3 min/1K 样本调参)快近两个数量级的原因之一。

TabICL 如何处理超过 10 类的分类问题?

用层次分类:递归把类别切分成 ≤10 类的子树,深度 $r = \lceil \log_{10} k \rceil$,所有子任务共享行嵌入和 ICL 模型,最终概率为根到叶路径乘积。12 个 >10 类数据集上平均归一化精度第二。

为什么列嵌入能跨表迁移?

因为 TF col 把特征嵌入建模为集合函数而非逐列专属模块:同一列集合经共享 Set Transformer 输出分布感知的仿射参数,PCA 可视化显示嵌入按偏度/峰度聚类,这种分布级语义不依赖具体表格。

表示坍缩是什么?RoPE 为什么能解决?

当所有特征服从同一分布时,置换不变自注意力无法区分不同样本,行嵌入塌缩成一点。RoPE 给特征位置编码相对信息打破对称性,代价是损失列置换不变性,靠集成近似恢复。

参考链接

  • arXiv 论文页:https://arxiv.org/abs/2502.05564
  • 项目网站(代码 + 预训练权重):https://github.com/Qu-Jingang/TabICL
  • TabPFN(ICLR 2023):https://arxiv.org/abs/2207.01848
  • TabPFNv2(NeurIPS 2024):https://arxiv.org/abs/2501.01439
  • TALENT 基准:https://github.com/zyphan/TALENT

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询