Trustpilot 如何用 Gemma 构建实时评论数据丰富化架构

Trustpilot 面临的核心问题是:如何在严格延迟和成本约束下,用 LLM 每天处理数百万条用户评论,同时不把命脉交给第三方 API。这家平台需要从每条评论中提取主题分类、命名实体识别、情感评分等元数据,传统的规则引擎早已不够用了。

他们的解法是放弃 GPT-4 这样的庞然大物,选用 **google/gemma-2-9b** 作为基座模型,通过教师模型(Gemini 2.0/2.5 Pro/Flash)生成共识标注数据,再微调出一套专门的轻量模型。架构上做了关键拆分:**FastAPI 端点**负责预处理和业务逻辑,**vLLM 端点**专职跑推理,两者通过 Vertex AI Model Handler 解耦,可以独立扩缩容。性能调优聚焦在 vLLM 的引擎参数、prefix caching,以及用 request count 指标做 auto-scaling。

这篇内容最有意思的地方在于**开源模型 + 垂直领域微调**这条路的可行性验证:用 9B 参数的 Gemma 加上领域数据微调,确实能在特定任务上逼近大模型效果,同时把成本压到可接受范围。不过要注意,文章没有给出具体 latency 数字或 cost reduction 比例,挑战部分也偏泛泛而谈,实用参考价值打了个折扣。对于想走这条路的企业来说,两个端点分离的架构设计值得借鉴,但 GPU 稀缺和私有网络限制这类坑,文中没有给出具体解法。

How Trustpilot built a real-time architecture for data enrichment using Gemma

查看原文