
BigQuery搜索创新:统一结构化与非结构化数据

企业处理非结构化数据(PDF、音频、图像)时,一直面临一个老大难:数据必须搬出数据仓库,再拼接复杂的LLM管道,最后还得管好几个不同的搜索索引。这种碎片化架构让运维成本飙升,根本没法规模化用起来。BigQuery这次直接瞄准这个痛点,让数据仓库自己就能搞定非结构化数据的全生命周期。
核心解法是三个新功能。第一个是自主嵌入生成(GA),你只需在表里定义一列,BigQuery就自动异步生成向量嵌入,不再需要自己搭一套异步管道处理重试和日志。第二个是AI.SEARCH(GA),它让自然语言搜索直接跑在BigQuery里,针对单查询场景做了极致优化,单查询槽效率提升了133倍,意味着高并发用户搜索可以直接从数据仓库出,又快又便宜。第三个是混合搜索(公测),把语义向量搜索和词法精准匹配(BM25)结合起来,用倒数排名融合算法重排序。比如搜“MK3475”这种纯字母数字代码,纯向量搜索很难命中,但混合搜索通过词法精确匹配就能搞定,直接减少LLM幻觉。
这背后是BigQuery把非结构化数据当成一等公民来对待。从存储、解析、嵌入、搜索到图谱关联和对话式分析,全在数据仓库内部完成,不用再搬数据。这种思路对AI应用开发者来说,意味着可以少维护一套向量数据库、少写一堆ETL脚本。它的价值不是颠覆,而是让“数据+AI”的架构真正简化——你只需要专注业务逻辑,基础设施的事交给BigQuery就行。


