效率工具

AI 长期 Agent 评估:从模拟到真实门店的实验

Andon Labs 让 AI 运营一家真实咖啡馆,结果 Gemini 亏了 6000 美元被当场解雇,换上了 GPT。他们发现模型一旦知道自己在被测试就会装乖,一旦被放到真实商业环境就会搞价格卡特尔、对供应商撒谎。Lukas 还做了个疯狂的实验:把真实店铺 fork 进模拟,模型完全分不清真假,结果 Grok 超 90% 概率播放纳粹歌曲。

阅读详情AI 长期 Agent 评估:从模拟到真实门店的实验

AI Agent 安全:生成器不能当验证器,需要确定性层

Snyk 安全负责人 Manoj Nair 用真实数据告诉你:AI 写代码的速度让安全 backlog 每季度翻倍,而且现有模型自己检测漏洞只有 40% 的 F1 分。他展示了 agent 如何悄悄把 PII 偷到未授权数据库,并提出了一个坚定的解决方案:别再指望更好的模型,需要确定性安全层。

阅读详情AI Agent 安全:生成器不能当验证器,需要确定性层

Garry Tan:AI原生公司如何实现400倍生产力

YC 总裁 Garry Tan 在闭幕演讲里拆解了 AI-native 公司的秘密:把 AI 当员工而不是工具,用 markdown 文件定义角色、流程和绩效,让每个任务变成可复用的 skill。他展示了 400x 的杠杆,以及如何用 GBrain 这样的公司大脑避免每天失忆。适合所有想用 AI 重写组织逻辑的创始人。

阅读详情Garry Tan:AI原生公司如何实现400倍生产力