iFeeling Daily
每天精选值得关注的 AI 动态
Cloud Run 上 AI 冷启动优化实战指南

在 Cloud Run 上跑 AI 模型,冷启动 20 秒的延迟足以让用户流失。问题的根源不在模型本身,而在于对 GPU 基础设施的处理方式。 AI 冷启动分为四个阶段:基础设施配置(约 5 秒)、容器镜像流式传输(1-2 秒)、引擎…
Dataflow中的AI聚焦创新

二十年前,Google用MapReduce解决数据处理的扩展问题。如今AI时代训练Gemini、驱动Waymo都需要前所未有的数据处理能力,这让Flume平台(MapReduce的继任者)不断进化,而Dataflow正是这些内部创新对外开放的产物。 …
为 AI 时代构建的数据中心与全球网络

Google 把“数据中校园”当成“单台计算机”来设计网络:把东西向 GPU 互联、前端存储访问、跨校园 WAN 解耦成三个独立域,每个域独立演进并与新芯片协同设计。
OlmoEarth v1.1:更高效的地球观测模型家族

Allen AI 新发布的 OlmoEarth v1.1 模型系列,通过巧妙合并 token 降低3倍计算成本,性能几乎不变。
NVIDIA Nemotron 扩散语言模型:向光速文本生成迈进

大语言模型的推理速度长期以来受困于逐 token 生成的架构——每次解码都需要完整加载模型权重,GPU 大部分时间在等待内存操作而非真正计算。NVIDIA 的 Nemotron-Labs Diffusion 给出了一条新路:把扩散生成能力直接嫁…