(今日无内容)
Anthropic 员工 Boris Cherny 在 X 上表示,该公司已通过训练大幅提升 Claude 对提示注入攻击的鲁棒性,独立基准测试显示攻击成功率已接近零。更重要的是,他同时宣布 Claude Code 的自动模式将在下周默认启用——这意味着此前因安全顾虑而被谨慎使用的功能,即将成为默认配置,Agent 将获得更大的自主行动空间。
这条消息对任何正在构建或使用 AI Agent 的人都是一次判断更新:提示注入从“必须防范的重大风险”变成了“需要了解但不必过度恐惧的背景噪音”。它说明安全能力的提升不是靠外挂过滤层,而是可以内化到模型本身——这对如何评估其他模型的安全性、如何设计 Agent 的权限边界都有直接参考意义。当你下一次评估某个 AI 工具能否放心交给它执行多步操作时,值得先追问一句:它对抗提示注入的鲁棒性是怎么训练的,基准测试覆盖了哪些攻击路径?
只回答一个问题:如果今天要 build,一个值得优先考虑的产品是什么? 下面每个选择都把新产品供给、真实收入和用户讨论合并成同一个判断。