iFeeling Daily
每天精选值得关注的 AI 动态
单层足矣:适配预训练视觉编码器用于图像生成

预训练视觉编码器跟生成模型latent空间不对付?FAE用单层注意力层就把这事搞定了,还在ImageNet上刷出FID 1.29的SOTA。核心思路是解耦特征提取和生成,用两个解码器各自干各自的事,简单又高效。
AlloyDB AI函数突破索引限制

当数据库遇到中文分词难题,传统方案又慢又复杂。AlloyDB直接把Gemini AI集成到SQL里,不用搬数据就能实现智能分词和混合搜索。这篇教程手把手教你用存储过程批量处理,比外部管道快得多。
GPT-Red:释放自我改进以提升鲁棒性

OpenAI训练了自动红队模型GPT-Red,通过self-play强化学习和对抗训练,让GPT-5.6的prompt injection失败率降低6倍。这种用今天模型让明天模型更安全的思路,或许能破解AI安全与规模化的矛盾。
Real World VoiceEQ:衡量语音AI的人类质量
Hume AI发布了Real World VoiceEQ,一个基于超过100万人类评分的语音AI基准。它揭示了现有模型在真实对话中表现不佳:更擅长说而不是听,传统基准严重高估性能。想要评估语音系统是否真正“听懂”人话?这是目前最接地气的参考。
Claude在机器人任务上的表现评测

语言模型能不能控制机器人?关键不在于模型本身,而在于你怎么把它连到机器人上。直接算扭矩基本全废,但用预训练策略当“监督者”,模型就能完成导航和抓取。新模型进步快,但视觉幻觉和空间记忆仍是致命短板,一个指南针工具比任何视觉增强都管用。
当遗忘免费:利用低影响力点降低计算成本

苹果研究发现,很多训练数据对模型影响近乎为零,强行遗忘它们纯属浪费算力。用影响力函数先筛出这些“低信息点”,就能把遗忘计算量砍掉一半。别盲目跑全流程,先搞清楚哪些数据真正重要。
空白画布AI策略

Slate Auto的廉价皮卡与Thinking Machines的开源模型Inkling,都采用'先卖基础版,再靠定制赚钱'的策略。这种'空白画布'模式让开源AI既能免费开放,又能通过服务实现商业化,或许是最可持续的AI普惠路径。
Google Vids更新:可创建个人AI数字头像,集成Gemini Omni
Google Vids更新后,你上传自拍和语音就能生成个人数字分身,再用文字加图片让Gemini Omni帮你生成视频,还能一步步局部修改。这可能是企业级AI视频工具最务实的落地方式——安全、可控、直接嵌入工作流。
Elorian以3亿美元估值完成5500万美元种子轮融资

前DeepMind研究员Andrew Dai以3亿美元估值融资5500万美元,讲述如何让投资者相信视觉AI是下一个前沿,以及为何优先选择战略投资者(如Nvidia)而非最高估值——对AI创业者来说,融资策略比估值数字更重要。