iFeeling Daily
每天精选值得关注的 AI 动态
Google 把图算法原生集成进 Spanner 数据库

Google 把图算法直接做到了 Spanner 数据库里,解决了以前跑图分析必须建 ETL 管道、或者影响线上性能的难题。核心是把计算和存储解耦,用独立资源跑算法,数据不动、结果直接写回,号称十亿边规模分钟级跑完。
实测:GKE 多集群推理网关 + TPU + 托管 DRANET 跨区域容灾

Google Cloud 在 GKE 上做了一个跨区域 TPU 推理容灾的实测,用托管 DRANET + Inference Gateway 验证了主集群宕机后流量自动切换的效果。
Trustpilot 如何用 Gemma 构建实时评论数据丰富化架构

Trustpilot 用微调 Gemma 构建了一个日处理百万评论的实时流处理 pipeline。核心思路是把业务逻辑和 LLM 推理解耦成两个独立端点,用 Gemini 做教师模型生成高质量微调数据,最终用 9B 参数的轻量模型跑出了接近大模型的效果和成本可控的推理。
GKE standby buffers:用挂起节点让 autoscaling 更快更便宜

Google 给 GKE 增加了 standby buffers 功能,节点预热后进入挂起状态节省成本,流量来时快速恢复。实测延迟从分钟级降到秒级,成本降低 90%,解决了 autoscaling 性能和费用不可兼得的老大难问题。
AI 市场的做空情绪地图

这篇文章用做空比例这把手术刀,把当前市场对 AI 的真实情绪切了个明明白白。核心发现是:AI 云和 GPU 转售商的做空比例高达 16-17%,而超大规模厂商和 NVIDIA 只有 1% 左右——说明市场并非笼统看空 AI,而是在精准狙击那些"未来承诺还没兑现"的概念股。
NVIDIA发布Cosmos 3:首个物理AI全能世界基础模型

NVIDIA发布了Cosmos 3,这是一个将世界生成、物理推理和动作生成整合在单一模型中的omni-model。基于MoT架构,8B的Nano版和32B的Super版都已上线Hugging Face。
用 Connected Sheets 直接分析 BigQuery 数据

业务团队手里有数据需求,数据平台里锁着PB级数据,但两者之间隔着一道巨大的技术鸿沟。业务用户不懂 SQL,不愿意学数据库,却只能排队等数据团队写报表;数据团队陷在无尽的临时取数请求里,喘不过气。常见的解法…
PyTorch Profiling 入门:用最简单的例子学会读懂 profiler trace
PyTorch 训练和推理慢得像玄学,问题很可能出在你根本不知道时间花在了哪里。这篇文章直击这个痛点——profiler 的学习曲线太陡峭,trace 图看起来像一堵彩色的墙,大多数教程默认你已经是专家了。作者决定从最基础的…
Cloud Run 上 AI 冷启动优化实战指南

在 Cloud Run 上跑 AI 模型,冷启动 20 秒的延迟足以让用户流失。问题的根源不在模型本身,而在于对 GPU 基础设施的处理方式。 AI 冷启动分为四个阶段:基础设施配置(约 5 秒)、容器镜像流式传输(1-2 秒)、引擎…