iFeeling Daily
每天精选值得关注的 AI 动态
IDEA Prune:将放大与剪枝整合进生成语言模型预训练

把预训练放大和剪枝合成一个整体,用统一学习率调度和迭代剪枝,在2T token下把2.8B模型压到1.3B,性能更优。
QueryStory 融资 600 万美元,用 LLM 让企业数据查询更可信

QueryStory 用 LLM 帮企业从大数据中提取可信洞察,自动生成 SQL 并展示置信度,融资 600 万美元,让分析从数周缩至几小时。
Google Cloud 为 Agent 推出灵活计费与成本控制

Google Cloud 为 Agent 新增按用付费和预付费折扣,开发者工具并入同一订阅,还加设月度硬上限与异常报警。
Granite 4.2 推理模型:从预训练到多阶段 RL 的完整构建

IBM 开源了 Granite 4.2 推理模型家族,从 15T token 预训练到多阶段 RL,8B/30B 还能在真实沙盒里学用工具,Apache 2.0 全开放。
OpenAI 自研芯片 Jalapeño 实测成绩公布

OpenAI 首颗自研推理芯片 Jalapeño 交出实测成绩:每瓦吞吐更高、延迟更低。GPT-5.6 Sol 还比对手少用 54% 输出 token——效率就是这么变成真金白银的。
Keenable获2600万美元融资,为AI重建搜索基础设施

Keenable 获 2600 万美元种子轮融资,要为 AI 时代重建搜索基础设施,让大模型直接检索网页而非返回链接列表。
Hugging Face 如何用三类云服务为 Papers with Code 构建混合搜索
Hugging Face 用 Jobs、Buckets、Inference Endpoints 搭了混合检索搜索架构,让 Papers with Code 能按语义找论文,还分享了冷启动降级、向量契约等实战经验。
量化感知修复:4 位模型性能反超全精度原版

一篇关于量化感知恢复(QAH)的论文:把模型压缩到 4 位后,通过蒸馏原始教师模型,让缩小版模型在多数基准上超过其全精度版本。
AI牛鞭效应

AI硬件瓶颈沿GPU、内存、CPU、存储依次传导,牛鞭效应正在推高数据中心成本,泡沫风险隐现。