Google Cloud 推出无边界数据湖仓增强版

Google Cloud 在 Next Tokyo 上推出了其 borderless Lakehouse 的增强版,旨在解决传统数据架构高成本、碎片化和治理薄弱的问题,让 AI agent 直接对任意位置的数据进行实时推理与操作。

核心改动基于开放标准 Apache Iceberg。它通过 Iceberg REST 目录实现了多目录联邦(与 AWS Glue、Databricks Unity、Snowflake Horizon 双向集成),无需复制数据即可跨云查询。同时,零拷贝集成 SAP、Salesforce、Workday 等 SaaS 应用,BigQuery 可直接查询其活跃数据,并用自身 AI 引擎在原地处理,统一财务、HR 和客户数据。

为解决跨云数据移动的高昂成本(网络出口费、延迟等),Borderless Lakehouse 引入了 Cross-Cloud Interconnects(私有专用链路),提供固定费率订阅模式(1G-100G),并免除从 AWS 访问数据的可变出口费用。智能跨云缓存可暂存远程数据碎片,避免重复传输;结合 BigQuery 向量化处理、AI 函数和 Spark Lightning Engine,可处理 PB 级数据。

为防止 agent 幻觉,引入 Knowledge Catalog 作为持续运行的上下文引擎,自动同步上述目录,将原始 schema 转换为业务术语和列级血缘,并嵌入安全与治理规则。当 schema 变化时,上下文立即更新。

开发方面,开源 Data Agent Kit 与 Conversational Analytics API 搭配,可构建自定义数据 agent 并发布到 Gemini Enterprise。其中内置了 Model Context Protocol (MCP) 工具,直接连接 BigQuery、Spark 和 Cloud Storage,省去手动编写管道代码或复制 schema 的过程。

经济性层面,通过跨云互联和零拷贝共享避免不可预测的出口费用;Knowledge Catalog 只为每个 prompt 提供最小必要上下文,防止 token 膨胀;BigQuery AI 内置 token 控制(预估算、强制限制、自动选用小型蒸馏模型),据称客户使用 BigQuery 成本优化的内置 AI 函数后 token 消耗降低 230 倍。

Introducing the borderless Lakehouse

查看原文