
TabFM集成BigQuery实现零样本表格预测

Google Research 发布了 TabFM,一个专为表格数据设计的预训练基础模型,现已原生集成到 BigQuery 中。传统上,企业做预测分析(如流失预测、欺诈评分)需要单独训练 XGBoost、随机森林或 DNN 模型,经历训练、调参、部署、再训练的循环,耗时且需要专业数据科学技能。TabFM 打破了这一流程:它采用上下文学习(ICL),类似大语言模型通过 prompt 中的 few-shot 示例学习任务,TabFM 直接将你的历史训练表格作为上下文示例,在单次前向传播中生成预测,无需任何模型训练或调优。
在 BigQuery 中使用 TabFM 极其简单:通过两个内置 SQL 函数 AI.PREDICT 和 AI.EVALUATE 即可完成。AI.PREDICT 接收训练数据和预测数据,自动判断分类或回归问题,输出包含预测标签和概率的结果表。AI.EVALUATE 则对测试集返回标准评估指标(如回归的 r2_score、MAE,分类的 precision、recall、f1)。整个过程无需手动特征工程(缺失值处理、类别编码等自动完成),也无需管理模型工件或运行时。
TabFM 在 TabArena 基准测试中表现突出,在分类和回归任务上均持续优于经典机器学习模型(如 XGBoost)和其他表格基础模型。其 ELO 评分排名靠前,但官方未给出具体数值。为了处理大规模推理,BigQuery 利用分布式并行推理架构,对训练数据进行智能采样,可在数分钟内处理百万行级别的推理表。
TabFM 特别适合以下场景:需要快速、高质量预测且缺乏 ML 专业知识;历史数据集小到中等规模;数据频繁变化需经常重新训练;以及对话或 Agent 工作流(通过 BigQuery MCP 服务器 为 Agent 添加预测能力)。对于非常大的历史数据集、需要完全控制超参数调优、特征数超过 TabFM 当前限制、或需要特征重要性可解释性的场景,传统模型如 XGBoost 仍是更合适的选择。
总的来说,TabFM 将预测 ML 的门槛降到“一条 SELECT 查询”的水平,让开发者、数据科学家和分析师能从原始数据秒级获得预测洞察。目前该功能处于预览阶段。


