
BigQuery 推出增强分析 TVF:把归因与因果推断做成 SQL 函数

BigQuery 推出了一套增强分析表值函数(TVFs),把 AI、ML 和统计方法直接放进 SQL 里,用于自动化洞察发现和模式解释。这套函数跑在数据所在的位置,不需要把数据导出到外部工具,输出是结构化 SQL 结果,因此也能作为 skills 集成给 AI agent,支撑自动化的对话式数据调查工作流。
这次一共发布六个函数,每个针对一类具体分析问题:AI.KEY_DRIVERS 找出两个时间段或两组数据之间指标涨跌的主要驱动因素;AI.CAUSAL_EFFECT 通过对比观测结果与预期基线,量化某个动作或事件的真实影响;ML.CORRELATION 评估成对数值指标之间关系的方向和强度;ML.DETECT_CHANGE_POINTS 识别指标发生结构性偏移的具体日期或区间;ML.TREND 把长期增长或下降趋势与短期波动、噪声分离开;ML.SEASONALITY 发现按小时、天、周、月或季度重复出现的可预测周期。这些函数可以链式调用,前一个函数的输出(比如检测到的时间窗口)可以直接作为下一步分析的参数。
官方用 Austin Bikeshare 公开数据集演示了完整的链式分析流程。第一步用 ML.DETECT_CHANGE_POINTS 在每日骑行数据中自动识别统计显著的结构性变化点,该函数可扩展到数百万条独立时间序列。第二步把检测到的 2018 年 2 月变化窗口直接传给 AI.KEY_DRIVERS,对比变化前后的时间段,找出驱动激增的维度组合。结果显示总骑行次数在参考期和兴趣期之间增加了 +374.7%(+40,159 次),增长高度集中在 UT 学生会员(+7,167.1%)和以 21st & Speedway @PCL 站为终点的行程(+20,739.1%)。这与 Austin Bikeshare 在 Dockless Mobility Pilot Program 通过后,与德州大学合作向所有 UT 学生提供免费年度会员的时间点吻合。第三步用 AI.CAUSAL_EFFECT 构建 ARIMA_PLUS 反事实基线,测算如果没有该项目,骑行量会是多少。结果显示该项目在有机基线之上造成了 +358% 的增量,估计带来 89,775 次增量行程,因果效应概率为 99.9%。
这些函数也已集成进 BigQuery 的 Conversational Analytics,用户可以用自然语言与 agent 对话,由 agent 编排多步骤调查工作流。官方给了两个例子:在芝加哥出租车数据集上,用 ML.CORRELATION 结合 AI.KEY_DRIVERS 分析什么指标与司机获得小费相关性最强,并做归因分析,发现信用卡支付是行程距离的主要正向驱动因素(+1.65M 英里),O’Hare 机场出发的行程贡献 +1.10M 英里,现金交易则是显著负向因素(-652.96K 英里);在爱荷华州酒类销售数据集上,用 ML.TREND 结合 ML.SEASONALITY 分析瓶装销量趋势和季节性,发现长期增长从 2012 年的 130-150 万瓶上升到近年约 260 万瓶,10 月、12 月以及 5 月、6 月存在强季节性周期,1 月和 2 月销量下降。
这些 TVF 的 skills 已发布在 Google Skills GitHub 仓库。整套设计的关键在于把复杂分析压缩成可组合的 SQL 函数,让分析逻辑可以被 agent 直接编排,而不是停留在单次查询层面。


