iFeeling Daily
每天精选值得关注的 AI 动态
异类心智:AI对齐、监控与谨慎推进的紧迫性

OpenAI 首席科学家指出,AI对齐与思维链监控的有效性正衰减,必须谨慎推进缩放,同时加速构建防御系统并协调放缓。
并非所有LLM负载等价:TPU在分类与生成任务上的基准测试

实测数据揭示:Gemma 3 27B在生成任务高并发时性能饱和仅4倍,而分类任务与12B几乎持平。
形式化费马大定理

Claude在11天内自动形式化了费马大定理,产生1300万行Lean代码和29500个定理,实现了首次全自动计算机验证。
Playco 借 GPT-6 Astra 让人工修复减半

Playco 用 GPT-6 Astra 在 Unity 里跑通了 AI 游戏原型流程:三个主题原型一次生成,大多首版即用,人工修复量直接减少一半。
Thinking Machines拟融资10亿美元估值400亿

前OpenAI CTO创立的Thinking Machines拟以400亿估值融资10亿美元,由Accel领投,收入刚超1亿。此前寻求500亿未果,且核心成员已离职。
OpenAI 发布 Astra:最强模型引发争议

OpenAI 发布新模型 Astra,号称最强、对齐最好,但争议性不透明推理技术可能削弱可审计性。
Google 发布 WeatherNext 3 AI 天气模型

Google DeepMind 新模型 WeatherNext 3 将预报分辨率提升至 5 公里,降雨预测比前代改进 60%,并首次直接融入卫星实时观测数据。
NeoMME:高效多模态原生多语言编码器

NeoMME用单个双向Transformer处理图像和文本,文档检索nDCG@10达0.523,吞吐量51页/秒,存储压缩255倍。
用100步GRPO微调350M模型提升结构化输出
用500样本+100步GRPO微调350M小模型,IFStruct基准从22.6%升至29.7%,代码全公开。