iFeeling Daily
每天精选值得关注的 AI 动态
用SQL在Cloud Monitoring中创建智能告警

Google Cloud 在 Observability Analytics 里支持用 SQL 直接写告警规则,能 JOIN 日志和追踪、算百分比、检测高基数维度。对 AI Agent 这类复杂系统的延迟异常捕获尤其有用,告别死板阈值告警。
谷歌推出跨区域备份,数据保护更灵活

Google Cloud Backup and DR 终于支持跨 region 备份。核心亮点是把备份目标和数据源完全解耦,让你能为不同应用选择不同的备份 region,兼顾成本、灾备能力和难搞的数据驻留法规,而不是被多 region 架构的高账单绑死。
一行命令跑起vLLM服务器
一行命令,在 Hugging Face 上拉起一个私有、按秒计费的 vLLM 端点,兼容 OpenAI API,无需任何基础设施配置。从单卡小模型到多卡122B,再到 SSH 调试和挂载编码代理,每一步都有实操命令,适合快速测试和批量推理。
异步推理:Agent时代的基础设施新范式

当下所有AI推理都在等人,但真正的Agent不需要即时响应。Sail Research用异步队列+智能路由,把推理成本打到Haiku的六分之一,GPU闲置的算力也被重新填满。这不是未来的想象,是已经在跑的逻辑。
混合模型比Transformer强在哪?逐token对比揭晓答案

语言模型的评测只看平均loss会掩盖关键能力差异。研究者发现混合模型在实义词和追踪上下文上远超Transformer,但在抄写重复内容时优势消失。这篇用逐token对比揭示了架构的深层优劣。
NeMo AutoModel:一行代码让 MoE 微调提速 3.7 倍

微调 MoE 大模型最头疼的就是显存不够、通信太慢。NVIDIA NeMo AutoModel 只改一行 import,就在 Transformers v5 基础上叠加了 DeepEP 通信计算重叠和 Expert Parallelism 显存分片,把 550B 模型训练吞吐提升了 3.7 倍,还省了 32% 显存,存的 checkpoint 标准兼容 vLLM。这是一篇用工程手段解决核心瓶颈的硬核实战复盘。
Databricks 联合创始人谈 Agent 云、Omnigent 和数据库的未来

Databricks 两位联合创始人深入聊了他们为什么要开源 Omnigent 来统一 agent 框架,以及 LTAP 如何绕过 HTAP 的工程陷阱。对于做 agent 或数据工程的人来说,全是非共识的架构决策和内部经验。
FFASR基准测试:在真实世界中评估远场语音识别
首个开放远场ASR基准测试上线,量化了模型在真实房间声学环境下的性能骤降,揭示近场与远场WER的差距可达数倍。
Cisco SD-WAN Manager零日漏洞攻击实例分析

这是一份来自Mandiant的真实攻防战报,详细拆解了APT组织如何利用零日漏洞攻入Cisco SD-WAN集中控制器。从窃取证书建立非法对等连接,到上传CSV文件提权获得root权限,再到反取证清理所有日志,完整的攻击链和具体的payload代码都写得清清楚楚。