iFeeling Daily
每天精选值得关注的 AI 动态
开源模型+行业数据:AT&T与GSMA用Gemma给电信AI趟路

电信行业有张自己的“考卷”,通用大模型几乎得零分。GSMA和AT&T用谷歌的Gemma开源模型做了一次教科书式的示范:用行业私域数据微调出的小模型,准确率碾压通用巨无霸,还把幻觉控制住了。这条路径对所有垂直行业都有直接参考价值。
用本地模型免费实时分类开源仓库的Issue和PR
作者手拿128GB内存的NVIDIA GB10,硬是用gemma和qwen跑出了一套能实时过滤开源项目几百个Issue/PR的本地分类系统。核心思路是半智能体架构:分类走LLM推理,告警走确定性规则,再用vLLM的NVFP4量化把吞吐拉到每秒400+ token。一条7.
如何靠卖推理赚到钱

推理API的利润正被疯狂挤压,想保住30%毛利率?答案是用价值定价替代成本加成,把定价权从算力成本中解耦。文章用Sierra按消单收费、Devin卖计算单元等案例,讲透了从卖Token升级为卖工作成果的生存逻辑。
PP-OCRv6:一套1.5M到34.5M参数的50语言OCR模型上线

PP-OCRv6带来三个规模(1.5M ~ 34.5M参数)的轻量OCR模型,支持50种语言,用PPLCNetV4统一骨干和RepLKFPN模块提升了检测准度。
未来产品都是活系统:Ronak Malde 谈企业 AI 持续学习
Ronak Malde 之前在 Windsurf 做 AI coding agent,公司被 Google DeepMind 收购后,他创立了 Trajectory.ai,目标是让企业 AI 系统在生产中持续学习,而不是一次训练就放着不管。
Claude Code 正式支持实时分享的 Artifacts 功能

终于有人解决了AI Agent产出的协作难题。Claude Code新功能能让Agent调试、重构的完整发现自动变成一个实时更新的网页,分享链接给团队就能同步所有上下文。从事故分析到架构复盘,省去一遍遍“带我过一遍”的沟通成本。直接可用的团队协作升级。
ChatGPT企业版推出信用额度分析与支出控制更新

企业用AI最怕钱花得不明不白。OpenAI给ChatGPT Enterprise加了信用额度分析,把消耗拆到用户、产品和模型三个维度,还升级了分层限额控制。以前是盲人摸象,现在是实时仪表盘。AI从实验工具走向可管理的基础设施,这才算真正开始。
AI 前沿:从 FLOPs 到 Megawatts 的算力调度

Anjney Midha 直指 AI 计算其实被浪费到荒唐——Google 的 95% 利用率竟是事故。他主张建独立计算市场,像电网调度电力一样调度 FLOPs。还透露 DeepMind 内部囤研究是负外部性、Anthropic 从第一天就以编码为 P0。
提升 Ray Serve LLM 在 GKE 上的吞吐与延迟

Google Cloud 和 Anyscale 联手优化 Ray Serve LLM,通过 HAProxy 集成、直接 token 流和 v2 Ray executer 三招,实现最高 5 倍吞吐、8 倍延迟改善,性能逼近原生 vLLM 且无需改代码。