
Box用Gemini多模态嵌入解锁企业Agent能力

Box 与 Google Cloud 合作,将 Gemini Multimodal Embeddings 2 集成到 Box Agentic Platform,用于处理企业内容中大量被传统文本 RAG 忽略的多模态信息。Box 中存有数万亿 GB 的关键业务数据,包括财务模型、临床试验方案、并购尽调文档、工程图纸等。此前基于文本的检索和 RAG 已经建立了有效的基线,但表格、图表、图片等视觉元素难以被文本索引完整表达。
Gemini Multimodal Embeddings 2 的核心能力是建立统一的向量空间,让文本、栅格图像、文档页面、渲染后的电子表格、图表都映射到同一语义空间中。具体产品能力包括:跨模态检索,允许自然语言直接找到幻灯片中的特定图表,无需人工打标;布局感知的文档嵌入,直接嵌入页面渲染结果,保留层级结构和标注框;异构格式桥接,原生支持 .docx、.xlsx、.pdf、.pptx、.png、.csv 等格式的混合检索。
文章总结了基于该能力的三类企业多模态 Agent 设计模式。第一类是复杂财务与分析报告。财务团队需要分析嵌入在表格、图表和脚注中的数据,多模态嵌入能保持表头与行数据的结构对齐,让 Agent 交叉核对文字表述与图表趋势,并直接定位到支持某个指标的具体页面或表格。第二类是临床决策支持与辅助诊断。患者数据分散在临床照片、病理切片、分诊表格等异构格式中,多模态嵌入将视觉证据与专业知识映射到同一空间,可识别罕见病理特征,并结合分诊框架对过敏反应等即时风险给出预警。第三类是跨文档多模态综合与数据核对。企业信息分散在 PDF、Excel、图片、邮件中,多模态 Agent 可以同时连接这些格式,发现不同文件之间的冲突,例如图像中的过期定价与最新财务报表不一致,或者核对签署的 PDF 合同与法律审查邮件之间是否缺少条款。
Box 将这一集成视为企业内容管理从被动存储向主动智能协作转变的一步。其 Intelligent Content Management 平台希望成为一个受治理的语义索引层,让 AI Agent 在完整的安全与合规控制下对内容进行查询、交叉引用和操作。对金融服务、生命科学、法律等高复杂度行业,跨文本、表格、图表和图像的推理能力正在成为竞争要求。文章特别强调,企业数据本来就是多模态的,现在技术终于可以充分利用这一点。


