编辑精选

语音代理能搞定双语用户吗?代码切换ASR基准测评

测评了主流ASR模型在代码切换场景下的真实表现。发现ElevenLabs Scribe V2和Gemini 3 Flash最扛打、Whisper默认翻译会搞砸语义。最反直觉的是错误更多集中在嵌入的英语片段而非语言切换点。结论很干:服务双语客户前必须用自己的语言对做基准测试。

阅读详情语音代理能搞定双语用户吗?代码切换ASR基准测评

Anthropic 的经济学研究:用 81,000 人数据量化 AI 的真实影响

Anthropic 搞了个经济追踪器,不玩虚的,直接扒了 81,000 个 Claude 用户数据和 10 万段真实对话。结果发现 AI 确实把任务时间平均砍掉了 80%,并且精确划分了 AI 在不同行业和岗位的真实使用模式。这是把 AI 经济学从玄学变成了实证科学。

阅读详情Anthropic 的经济学研究:用 81,000 人数据量化 AI 的真实影响

Claude Opus 4.8 发布:更诚实、更可控的 AI 合作伙伴

Opus 4.8 的核心进步不是跑分更高,而是开始学会说“我不确定”。它会在代码有漏洞时主动指出、方案不靠谱时反驳,这对企业级 Agent 的信任建立是质变。配合动态工作流和努力控制机制,大模型终于开始像一个严谨的同事,而不是那个永远自信满满却总留坑的新人。

阅读详情Claude Opus 4.8 发布:更诚实、更可控的 AI 合作伙伴