iFeeling Daily
每天精选值得关注的 AI 动态
如何靠卖推理赚到钱

推理API的利润正被疯狂挤压,想保住30%毛利率?答案是用价值定价替代成本加成,把定价权从算力成本中解耦。文章用Sierra按消单收费、Devin卖计算单元等案例,讲透了从卖Token升级为卖工作成果的生存逻辑。
PP-OCRv6:一套1.5M到34.5M参数的50语言OCR模型上线

PP-OCRv6带来三个规模(1.5M ~ 34.5M参数)的轻量OCR模型,支持50种语言,用PPLCNetV4统一骨干和RepLKFPN模块提升了检测准度。
未来产品都是活系统:Ronak Malde 谈企业 AI 持续学习
Ronak Malde 之前在 Windsurf 做 AI coding agent,公司被 Google DeepMind 收购后,他创立了 Trajectory.ai,目标是让企业 AI 系统在生产中持续学习,而不是一次训练就放着不管。
Google加速器十年成绩单:93%存活率的秘密

Google的加速器93%存活率靠的不仅是钱,而是把工程师直接派到创始人身边改架构、模型管线。更有意思的是,他们正在帮初创公司把技术栈嵌入国家AI战略,从做产品变成定标准。
ChatGPT企业版推出信用额度分析与支出控制更新

企业用AI最怕钱花得不明不白。OpenAI给ChatGPT Enterprise加了信用额度分析,把消耗拆到用户、产品和模型三个维度,还升级了分层限额控制。以前是盲人摸象,现在是实时仪表盘。AI从实验工具走向可管理的基础设施,这才算真正开始。
AI 前沿:从 FLOPs 到 Megawatts 的算力调度

Anjney Midha 直指 AI 计算其实被浪费到荒唐——Google 的 95% 利用率竟是事故。他主张建独立计算市场,像电网调度电力一样调度 FLOPs。还透露 DeepMind 内部囤研究是负外部性、Anthropic 从第一天就以编码为 P0。
提升 Ray Serve LLM 在 GKE 上的吞吐与延迟

Google Cloud 和 Anyscale 联手优化 Ray Serve LLM,通过 HAProxy 集成、直接 token 流和 v2 Ray executer 三招,实现最高 5 倍吞吐、8 倍延迟改善,性能逼近原生 vLLM 且无需改代码。
超越 LoRA:最流行的微调方法不一定最好
LoRA 并非微调最优解,Hugging Face 用统一基准证明 OFT 等新方法在准确率和内存两项指标上均能同时超越它。
选择、合规与协作:欧洲走向开放数字主权的现实路径

如何用技术手段解决主权合规,而不是靠物理围墙?Google Cloud在欧盟新规面前摆明了态度:用加密密钥、开源和本地化联盟来证明“数据可控”不等于“数据必须关在境内”。这种现实主义的工程视角,比单纯喊口号有用得多。