摘要
本文解读 ICML 2025 论文《TabICL: A Tabular Foundation Model for In-Context Learning on Large Data》。该论文提出TabICL,一个可扩展的表格分类基础模型,通过融合分布感知列嵌入、上下文感知行交互与数据集级上下文学习(ICL),把表格 ICL 的处理规模从 1 万样本推到50 万样本、500 特征,其特别之处在于"先嵌入、后 ICL"的两阶段架构,用列维度坍缩把复杂度从 $\mathcal{O}(m^2 n + n^2 m)$ 降到 $\mathcal{O}(m^2 n + n^2)$。实验表明在 TALENT 的200 个分类数据集上 TabICL 中位精度最佳、零超参调优,比 TabPFNv2 快至10 倍,并在 53 个大数据集上超越 TabPFNv2 与 CatBoost,为表格基础模型提供了重要借鉴。
视频讲解:点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机
- 研究主线:从问题到结论
- 基准/方法设计
- 分类全景
- 方法细节
- 实验设计与结果
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- TabICL 与 TabPFNv2 的核心区别是什么?
- TabICL 需要调参吗?
- TabICL 如何处理超过 10 类的分类问题?
- 为什么列嵌入能跨表迁移?
- 表示坍缩是什么?RoPE 为什么能解决?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | TabICL: A Tabular Foundation Model for In-Context Learning on Large Data |
| 标题(中文) | TabICL:面向大数据量表格的上下文学习基础模型 |
| 作者 | Jingang Qu, David Holzmüller, Gaël Varoquaux, Marine Le Morvan |
| 机构 | SODA 团队 INRIA Saclay · Sierra 团队 INRIA Paris · ENS PSL |
| 会议 | ICML 2025(Poster) |
| arXiv | https://arxiv.org/abs/2502.05564 |
| 项目网站 | https://github.com/Qu-Jingang/TabICL |
背景与动机
表格数据在医疗、金融等工业场景中无处不在,但梯度提升决策树(GBDT)长期统治这一领域:CatBoost、XGBoost 精度高但需要超参调优,RealMLP、ModernNCA 等深度模型的差距在收窄但仍需验证集调参。TabPFN(ICLR 2023)开创了表格上下文学习范式——把训练数据作为上下文、单次前向完成预测,TabPFNv2(NeurIPS 2024)把它推到 1 万样本,但其交替列-行注意力在原始维度上计算,复杂度 $\mathcal{O}(m^2 n + n^2 m)$ 随样本量和特征数同时爆炸,30K 以上样本就容易显存溢出。
TabICL 的切入点是一个尖锐的问题:ICL 能否有效扩展到大数据量表格?作者给出的答案是架构性重设计而非堆算力——先把表格压缩成固定维度的行嵌入,再在嵌入上做 ICL,让 ICL 的成本不再随原始表格规模线性增长。
历史脉络上,表格 ICL 走过了清晰的三步:TabPFN(2022,上限 ~1K 样本)→ TabPFNv2(2024,交替注意力推到 10K 样本/500 特征)→ TabICL(2025,两阶段维度坍缩扩到 500K 样本,大表超越 GBDT)。后续的 TabDPT(真实数据预训练)、TabForestPFN(树型先验)、LoCalPFN/TuneTables(上下文蒸馏)都沿着"让 ICL 更可扩展"的主线演进。
研究主线:从问题到结论
图 13:TabICL 研究主线流程图(Mermaid)——问题→动机→设计→方法→实验→结论
基准/方法设计
TabICL 由三个 Transformer 组成,标签只在最后阶段参与计算(晚期融合):
- TF col(分布感知列嵌入):把特征嵌入重新表述为集合输入问题,用 Set Transformer 的诱导自注意力块(ISAB,$k=128$ 个诱导向量)把每列单元格映射为逐单元仿射参数 $W, B$,嵌入为 $e_j = W \odot c_j + B$(维度 $d=128$)。所有列共享参数,因此跨表可迁移,且能捕获列内分布统计。
- TF row(上下文感知行交互):3 层 8 头 Transformer 逐行处理特征交互,每行前置 4 个可学习 [CLS] token,拼接输出得到 512 维固定行嵌入;引入 RoPE(缩放因子 100,000)打破同分布特征的表示坍缩。
- TF icl(数据集级 ICL):12 层 4 头 Transformer 在行嵌入上做注意力,训练嵌入互相关注、测试嵌入只关注训练嵌入,2 层 MLP 输出类别概率,单次前向预测整个测试集。
图 1:TabICL 架构总览——列嵌入 TFcol → 行交互 TFrow(4 个 CLS token)→ 数据集级 ICL TFicl,单次前向输出测试集预测
图 2:分布感知列嵌入——Set Transformer(ISAB)把每列视为集合,输出逐单元仿射参数 W、B,嵌入 e_j = W⊙c_j + B
分类全景
表格学习的方法版图大致分四支:梯度提升树(XGBoost、CatBoost、LightGBM)、深度表格模型(RealMLP、ModernNCA、TabM)、跨表迁移方法(XTab、CARTE)、上下文学习基础模型(TabPFN、TabPFNv2、TabICL、TabDPT、TabForestPFN)。TabICL 处于第四支的最前沿。
图 14:表格学习方法分类全景(Mermaid)——TabICL 位于 ICL 基础模型最前沿
方法细节
预训练完全基于合成数据(约 8,200 万数据集,3×A100 共 20 天):用结构因果模型(SCM)按 $c = f(\mathrm{Pa}(c)) + \epsilon$ 生成依赖关系,新增树型 SCM(XGBoost 回归,70% SCM + 30% 树型)注入树模型归纳偏置;激活函数从 4 种扩到 15+ 种(含高斯过程采样的随机函数)。
课程学习三阶段:① 固定 1,024 样本跑 160K 步;② 1K–40K 样本对数均匀采样跑 2K 步(>10K 开启激活检查点);③ 40K–60K 均匀采样跑 50 步、只训练 TF icl。平均排名随课程推进从 11.4(第 9)→ 7.46(第 2)→ 6.95(第 1)。
>10 类问题的层次分类:递归切分成 ≤10 类子树(深度 $r = \lceil \log_{10} k \rceil$),所有子任务共享行嵌入与 TF icl,最终概率为根到叶路径概率乘积。
显存优化:FlashAttention + 动态 batch 调节(激活显存按多项式回归建模)+ CPU/磁盘激活卸载,使 100K 样本/500 特征仅需 5GB 显存 + 32GB 内存。
图 3:学习到的列嵌入编码分布属性——4 万特征 PCA 投影,相似偏度/峰度的特征聚集
图 4:balance scale 上的表示坍缩——无 RoPE 时行嵌入几乎塌成一点,RoPE 恢复三分类簇
实验设计与结果
评测协议:TALENT 基准 200 个分类数据集(120 二分类 + 80 多分类),排除 15 个 TabPFNv2 调参用过的数据集,聚焦 171 个 ≤10 类数据集;64%/16%/20% 划分;TabICL 与 TabPFNv2 仅用训练集、各做 32 次列/类置换集成,其余基线来自 TALENT 原基准(含调参)。
| 方法 | 中位相对精度 | 平均 Rank | 每 1K 样本耗时 | 需调参 |
|---|---|---|---|---|
| TabICL | 最佳 | 6.95(第 1) | 1.1 s(A100) | 否 |
| TabPFNv2 | 相当 | 无显著差异 | 慢 1.5–10× | 否 |
| CatBoost | 高 | – | ~3 min(CPU) | 是 |
| RealMLP / ModernNCA | 中 | – | ~7 min(GPU) | 是 |
| 对比维度 | TabICL | TabPFNv2 |
|---|---|---|
| 核心机制 | 两阶段"嵌入后 ICL",列维度坍缩 | 交替列-行注意力,无中间坍缩 |
| 复杂度 | $\mathcal{O}(m^2 n + n^2)$ | $\mathcal{O}(m^2 n + n^2 m)$ |
| 标签融合 | 晚期(仅 ICL 阶段) | 早期(从头拼接) |
| 预训练 | ~82M 合成数据集,课程至 60K 样本 | ~130M,上限 2,048 样本 |
| 推理上限 | 500K 样本 / 任意类数 | 10K 样本 / 10 类 |
图 5:TALENT 相对 MLP 精度与耗时——TabICL 中位精度最佳且快 1–2 个数量级
图 6:加速比——小表 1.5×,大表 3–10×;10K×100 特征时 20 s vs 1 min 40 s
图 7:按样本量排名的模型等级——TabICL 在 10K–100K 样本区间保持第一梯队
图 8:>10 类数据集归一化精度——TabICL 层次分类第二,TabPFNv2 无法原生处理
时间拟合(附录 D):以 $nm(n+m)$ 为横轴拟合 time $= \alpha + \beta (nm(n+m))^\gamma$($\gamma=0.8$),大表渐近加速比趋近 5×、小表 1.4×,与复杂度分析吻合。元特征分析:特征数增大时 TabICL 表现稳健;类别特征占比高时两者都略降,但 TabICL 仍优于先验生成更复杂的 TabPFNv2。
图 9:时间拟合——TabICL 曲线整体低于 TabPFNv2,差距随规模扩大
图 10:Rank 对特征数的依赖——TabICL 高维特征下依然稳健
消融(附录 E):加入 30% 树型 SCM 后 200 数据集相对精度全面提升;课程学习把平均 rank 从 11.4 提升到 6.95,代价是小数据集轻微回退。
图 11:树型 SCM 消融——绝大多数数据集提升为正
图 12:课程学习消融——大数据集显著获益,小数据集略有回退
结果对比总结
图 15:TabICL 结果对比总结(Mermaid)——效率与大数据量的双重优势
关键发现
- 规模跳变:TabICL 把表格 ICL 的处理上限从 1 万样本推到 50 万样本(500 特征,~20GB 显存),100K 样本/500 特征仅需 5GB 显存。
- 精度-效率兼得:200 个 TALENT 数据集上中位相对精度最佳、平均 Rank 6.95 第一,每 1K 样本仅 1.1 秒,全程零超参调优。
- 大表制胜:53 个 >10K 样本数据集上同时超越 TabPFNv2 与 CatBoost,证明 ICL 在大数据 regime 的竞争力。
- 系统性加速:小表比 TabPFNv2 快 1.5 倍、大表快 3–10 倍(10K×100 特征:20 s vs 1 min 40 s),与复杂度分析 $\mathcal{O}(m^2 n + n^2)$ vs $\mathcal{O}(m^2 n + n^2 m)$ 吻合。
- 概率可靠:不调参的 log loss 显著优于精度调参型竞争者,概率输出更适合决策场景。
- 多类扩展:层次分类让 TabICL 在 12 个 >10 类数据集上取得平均归一化精度第二,TabPFNv2 原生不支持。
局限性
- 推理速度:与其他基础模型一样偏慢(缓存可缓解);目前仅支持分类,回归需类似 TabPFNv2 的扩展。
- 列置换不变性:RoPE 使模型对列顺序敏感,只能靠多次列排列集成近似恢复——表格数据本应天然满足置换不变性。
- 评测方法学:继承自 TALENT(holdout 单模型 + 均值插补缺失值),交叉验证集成理论上更强但计算成本高。
- 基线未拉满:未给 TabPFNv2 提供类别信息、未让其内部处理缺失值,对手可能未达最佳状态;作者也坦诚调参时间按 ×100 近似估计。
常见问题(FAQ)
TabICL 与 TabPFNv2 的核心区别是什么?
架构上 TabICL 是两阶段"嵌入后 ICL"(列维度坍缩),TabPFNv2 是交替列-行注意力(无坍缩);标签融合上 TabICL 晚期、TabPFNv2 早期。结果是复杂度从 $\mathcal{O}(m^2 n + n^2 m)$ 降到 $\mathcal{O}(m^2 n + n^2)$,TabICL 能处理 500K 样本而 TabPFNv2 上限约 10K。
TabICL 需要调参吗?
不需要。它和 TabPFNv2 一样是零调参基础模型,预训练后直接单次前向预测;这也是它比 CatBoost(~3 min/1K 样本调参)快近两个数量级的原因之一。
TabICL 如何处理超过 10 类的分类问题?
用层次分类:递归把类别切分成 ≤10 类的子树,深度 $r = \lceil \log_{10} k \rceil$,所有子任务共享行嵌入和 ICL 模型,最终概率为根到叶路径乘积。12 个 >10 类数据集上平均归一化精度第二。
为什么列嵌入能跨表迁移?
因为 TF col 把特征嵌入建模为集合函数而非逐列专属模块:同一列集合经共享 Set Transformer 输出分布感知的仿射参数,PCA 可视化显示嵌入按偏度/峰度聚类,这种分布级语义不依赖具体表格。
表示坍缩是什么?RoPE 为什么能解决?
当所有特征服从同一分布时,置换不变自注意力无法区分不同样本,行嵌入塌缩成一点。RoPE 给特征位置编码相对信息打破对称性,代价是损失列置换不变性,靠集成近似恢复。
参考链接
- arXiv 论文页:https://arxiv.org/abs/2502.05564
- 项目网站(代码 + 预训练权重):https://github.com/Qu-Jingang/TabICL
- TabPFN(ICLR 2023):https://arxiv.org/abs/2207.01848
- TabPFNv2(NeurIPS 2024):https://arxiv.org/abs/2501.01439
- TALENT 基准:https://github.com/zyphan/TALENT
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)