今日判断
- Agent 替代完整岗位的幻想正在被现实打破。 Klarna 2022-2024 年裁掉约 700 名客服后用 AI 助手替代,2026 年开始悄悄重新招聘远程客服。85% 单步可靠率连乘 10 步后只剩 20%,这是当前 agent 端到端无法替代完整岗位的数学瓶颈——前九步它比人快,第十步(没见过的情况)它敢硬编。MIT 2025 年统计,95% 的企业 AI 项目对财报利润影响为零。
- Codex 正在成为第一个具备“自循环”能力的 agent 工具。 内置 cron jobs 已可让 Codex 按计划自动检查依赖更新、发现安全漏洞自动开 PR、无任务自动归档——不再是“被动响应”的工具,而是有自己的时间表和日程表的数字员工。
- Claude Code 和 Codex 进入正面对决,结论是分工而非二选一。 实战社区共识:长链路深度推理(架构/审查/重构)用 Claude Code,标准化批量任务(测试/文档/依赖更新)用 Codex,两者通过 Git Worktree 并行跑。Codex 也开始入局专业软件操控(CAD/Photoshop/PPT)的 Computer Use。
- 旧 prompt 在新的强模型上反而有害。 Fable 5 上,“复述你的推理”会触发 reasoning_extraction refusal 导致 fallback 到 Opus 4.8,“安全为先”碎碎念引发过度审议。值得测试的是旧模型做不下来的难任务,而不是旧任务的翻版。
- 内容平台冷启动方法论和 AI 工具执行力正在融合。 全球内容平台冷启动方法论、飞书多维表格 AI 化、PPT 技能公开发布,三者共同指向一个趋势:AI-native 的内容生产与工具链建设已从“单点突破”进入“系统工程”阶段。
30 秒短讯
底层变化
- OpenAI Codex 连续发布 Rust 版本 alpha (GitHub):发生了什么:Codex 两个小时内连续发布 0.140.0-alpha.4、0.140.0-alpha.7 以及 rust-v0.140.0-alpha.2/3/4。判断价值:Rust 原生支持的推进意味着 Codex 正在从 Python 生态向外扩展,可能进入系统编程和嵌入式开发领域,agent 开发工具链的底层架构正在被重写。
- OpenAI 与 Oracle Cloud 达成合作,Codex 可通过云承诺额度使用 (OpenAI Blog):发生了什么:企业可将 OpenAI 和 Codex 的使用纳入 Oracle Cloud 的现有合同承诺。判断价值:企业 AI 采购的“合规门槛”被拉平——不需要新预算、不需要新审批,现有云合同就能用 Codex。这对 AWS/Azure 版图构成直接挑战,未来企业级 agent 部署的第一选择不看模型,看云合同里剩多少钱。
- ChatGPT 模型选择器改版,对齐 Codex 的 Speed/Effort 命名体系 (ChatGPT):发生了什么:模型列表被重新组织,移除 thinking-light 模型(少于 1% 付费用户使用)。判断价值:命名体系从“技术代号”转向“用户意图”——这是 AI 产品经理的经典战役:当模型多到用户不知道怎么选,就按使用场景重写界面。Copilot 和 Claude 必然跟进。
- OpenAI 用 Codex 模拟黑洞的研究案例发布 (OpenAI Blog):发生了什么:天体物理学家 Chi-kwan Chan 用 Codex 构建黑洞模拟,用于测试爱因斯坦的广义相对论。判断价值:这不是 PR 文章——它证明了 Codex 在科学计算和高性能仿真中的实用价值。对于做内容的人来说,“AI 做科研”是最好的叙事素材。
- Crownlands 开源 Gateway 4M 数据集 (Kevin Weil):发生了什么:Crownlands 开源了有史以来最大的来自活人的单细胞组织数据集 Gateway 4M。判断价值:AI for Science 不再停留在“用 AI 看数据”,而是“开放数据给 AI 看”。这对生物计算和 AI 健康领域的 agent 训练意味着可用的训练数据量级跃迁。
- LSEG 用 OpenAI 赋能 4000 名员工 (OpenAI Blog):发生了什么:伦敦证券交易所集团(LSEG)在全球业务中规模化使用 OpenAI,加速洞察、缩短发布周期。判断价值:金融领域是 AI 商业化的“高压容器”——如果连监管最严格的金融机构都能找到合规且可量化的 AI 应用路径,其他行业没有理由说“我们行业特殊”。
工具工作流
- Claude Code 内置 Git Worktree 支持:发生了什么:一行命令
claude --worktree feature-auth 即可创建互不干扰的独立分支工作目录。四个 Claude 实例可并行跑不同任务,最后合并 PR。判断价值:这是把 agent 从“单线程”推向“多线程”的关键基础设施——解决了一直以来“等 A 合并完再开始 B”的串行损耗,内存占用比开多个 IDE 实例降低 80%。
- Claude Code 的 Hook 系统是比 CLAUDE.md 更硬的约束:发生了什么:13 个生命周期事件可挂钩子,pre-edit 可拦截白名单外目录,post-edit 自动跑 formatter+lint 不通过回滚,on-tool-use 在 rm/drop database 前弹窗。判断价值:真正理解 agent 生产化的人都知道——软规则(写文档)不如硬约束(写 hook)。这是从“AI 帮我写代码”到“AI 在安全牢笼里写代码”的进化。
- Claude Code 截图粘贴直接生成 UI / 修复视觉 Bug:发生了什么:将竞品页面截图粘贴到 Claude Code,一句话“还原这个页面,用 React + Tailwind”,20 分钟可产出可运行版本。判断价值:截图代替文字描述场景——省掉的是“描述设计”这一层无效翻译。对于内容创作者,这意味着“看到什么就能做出什么”的实操门槛正在消失。
- Codex 内置 cron jobs 首次实现“AI 自循环”:发生了什么:Codex 能按计划自动开启/重命名/编辑/归档/删除任务,例如每天早上 8 点自动检查依赖更新、发现安全漏洞自动开 PR。判断价值:这是第一个真正实现“AI 员工”的工具——它有自己的时间表,自己排日程,自己跑流程,自己交付。晚上下命令,早上看交付,不再需要实时盯盘。
- Claude Code + Codex 的分工策略:深度用 Claude,广度用 Codex:发生了什么:架构设计/代码审查用 Claude Code(Fable 5 推理能力),标准化批量测试/文档用 Codex(成本更低),Computer Use 接管 Photoshop/PPT 用 Codex,团队协作用 Claude Code。判断价值:工具战争结束了?不,战争变成了协奏曲。正确的提问不再是“哪个更好”,而是“哪个环节更好”。
- Fable 5 Subagent 官方确认显著升级:发生了什么:异步通信替代阻塞等待,串行 60 分钟任务压缩到 20 分钟;长寿命 subagent 跨越多个子任务复用上下文。判断价值:关键指令是“Delegate independent subtasks to subagents and keep working while they run”——添加这句话后,Fable 5 可以像项目经理一样自主分发任务。这是 agent 从“执行者”到“管理者”的质变。
- Fable 5 到 6 月 22 日后开始烧按量积分,现在白嫖审计定稿:发生了什么:当前 Fable 5 使用在订阅额度内,22 号开始按量计费。有人放出了全套“仓库审计与改进计划”提示词。判断价值:这是典型的“蜜月期套利”——在模型成为计费资源之前,让它干最贵的活(代码审计),把一次性高价值工作包月化。未来会有更多这样的“限时窗口”套利机会。
- 旧模型 prompt 在 Fable 5 上反而降低质量,迁移需策略:发生了什么:“复述你的推理”触发 reasoning_extraction refusal,fallback 到 Opus 4.8;“安全为先/检查再检查”导致过度审议。最佳迁移策略:用一个旧模型做不下来的难任务让 Fable 5 scope + ask clarifying questions。判断价值:这是 AI 产品经理和 prompt 工程师的分水岭——懂得什么时候“删指令比加指令更重要”的人,将显著领先对手。
- Codex + ComfyUI 做视频二创的完整项目实操:发生了什么:从环境搭建到模型管理、从授权检查到失败记录,完整链路被拆成可复用的项目资产。判断价值:视频二创不是“按一下按钮”,而是“做成一个项目”——Codex 真正有用的地方不是替你点工具,而是把这件事拆成流程、文件和检查清单。这是 AI 视频领域的 SOP 思维。
- 飞书多维表格 AI 化小白教程发布:发生了什么:详细教程教用户如何用飞书多维表格建立 AI 驱动的轻量业务系统,替代 Excel 的混乱。判断价值:这是“AI 时代的 Excel 科普”——普通表格是纸,多维表格是数据库。对于内容创作者来说,这是把 AI 工具落地到运营场景的实操手册。
- 开源 PPT Skill 迎来大更新:瑞士国际主义风格 + Codex 配图:发生了什么:guizang-ppt-skill GitHub Star 达到 6000+,新增瑞士国际主义风格、Codex 接入 GPT-Image 2.0 生成配图、多平台封面自动生成。判断价值:设计经验被封装成 AI Skill,这是“知识资产化”的典型案例——可以像安装插件一样安装十年的设计经验。Skill 经济的冰山一角。
内容 / 分发 / 变现
- 内容的“三圈交集法”:你喜欢 × 平台推荐 × 粉丝认可:发生了什么:做自媒体的核心是在自己喜欢的、平台推荐的、粉丝认可的三者中找到交集。判断价值:这是内容运营的“不可能三角”——只追平台推荐会丢失人格,只做自己喜欢会无人问津,只迎合粉丝会陷入僵化。找到三者的交集点是一切持久内容的基础。
- 全球内容平台冷启动方法论:必过万粉:发生了什么:分享了一套“全球任何一个内容平台,冷启动必过万粉”的方法论。判断价值:跨平台冷启动是 AI-native 内容操盘手必须掌握的技能——不依赖单一平台的幸运,而是可复制的系统打法。
今日深读
核心论点: 基础设施是区分 agent 原型和生产级 agent 的分水岭。Anthropic 提出了从“tokens in, tokens out”的简单 API 到“基础设施即 product”的演进路线。Claude Managed Agents 提供了一套可组合的 API,让团队能在几天内从原型走到生产,而非数月。
为什么值得读: 这是 Anthropic 对 agent 生产化最系统的一次阐述。它揭示了 agent 开发中一个长期被忽视的事实:prompt 写得好不等于 agent 能上线——需要运行代码的环境、访问数据的凭据、可观测的会话、随用量扩展的基础设施。很多团队把大部分时间花在了安全、状态管理、权限配置和 harness 调优上。
它改变了什么判断: 之前“agent 生产化的关键是更好的模型”的判断被修正为“agent 生产化的关键是更好的基础设施”。通用判断变更: 在竞争格局中,胜利的不会是“模型最好的公司”,而是“让 agent 最容易从原型走到生产的公司”。这解释了为什么 Anthropic 和 OpenAI 都在快速推出管理 agent 的 API 而不是单纯提升模型能力。
可迁移启发: 即使在小团队里,也可以做“基础设施分离”——把 agent 的“业务逻辑”(prompt/工具链)和“运行基础设施”(安全/状态/权限/观测)拆成两层。这样当模型升级或者工具库更换时,不需要重写全部。
核心论点: 85% 单步可靠率 × 10 步 = 20% 端到端成功率,数学上 agent 替代完整岗位就是不可行的。Klarna CEO 2025 年公开承认“太追求效率和成本,结果质量掉下来”,2026 年开始重新招聘人类客服。Gartner 统计真正认真做 agentic AI 的公司约 130 家,其余几千家在“agent washing”(空壳包装)。
为什么值得读: 这是少有的“agent 泡沫拆穿”级的深度分析,不是推理而是引用真实数据——Klarna 翻车案例、FTC 的反虚假宣传起诉、MIT 的 95% 企业 AI 项目利润为零的统计。它把“agent 替代人”和“卖课卖铲子”做了类比,揭开了行业的一个巨大共识泡沫。
它改变了什么判断: “AI agent 正在取代人类岗位”的主流叙事被修正为“AI agent 能接走前九步,但接不住第十步——而人真正创造的恰好是那第十步”。通用判断变更: agent 现阶段的价值不是替代人,而是把人的带宽释放到“只有人能做的事情”上。卖铲子(工具/培训)比淘金(部署 agent 替代人)更赚钱。
可迁移启发: 不管是做内容还是做产品,都要区分“agent 能完成”和“agent 能交付”——能完成 90% 的步骤不等于能交付 100% 的结果。设计产品时,永远给“那第十步”留下人类介入的接口。
核心论点: 官方确认 Fable 5 的 Subagent 机制有三大升级:主动委托、异步通信、长寿命上下文复用。关键指令是 “Delegate independent subtasks to subagents and keep working while they run”——添加这句话后,主 agent 可以在 subagent 执行子任务时继续工作,串行 60 分钟的任务可以压到 20 分钟。
为什么值得读: 这不是泛泛的功能介绍,而是给出了具体可操作的关键指令和性能数据(60 分钟 → 20 分钟)。它展示了 agent 开发的下一个范式——从“一个人一个 agent”到“一个 agent 管理多个 agent”。
它改变了什么判断: agent 的进化方向不是“单 agent 更强”,而是“多 agent 协作更智能”。之前你认为 agent 的天花板是模型能力,现在是 agent 编排能力。通用判断变更: 未来 agent 竞争力的核心不是模型有多聪明,而是主 agent 有多擅长委派和监督 subagent。项目经理的技能变得比程序员技能更值钱。
可迁移启发: 在任何 agent 设计中,加上这句关键指令:把独立子任务委派给 subagent 并在它们运行时继续工作。这会立即改变 agent 的工作模式——从串行到并行,从执行者到管理者。
核心论点: Codex 内置的 cron 功能允许 AI 按计划自动执行任务——自动检查依赖、发现安全漏洞自动开 PR、无任务自动归档。它不只是被动响应,而是有自己的时间表、自己排日程、自己跑流程、自己交付。
为什么值得读: 这是 agent 能力的范式级突破。所有的 agent 之前都是“你想让它做什么,它就做什么”——本质是高级版的脚本。Codex cron 把它变成了“你告诉它什么时候该做什么,它自己去安排”——这是从“工具”到“员工”的质变。
它改变了什么判断: agent 的效率边界不再被“人的注意力”所限制——它可以在人睡觉时独立运行循环任务。通用判断变更: 下一波 agent 杠杆不是“用 AI 写代码更快”,而是“让 AI 按 cron 自己干活,晚上下命令,早上起来看交付”。这对自动化工作流的设计方向产生根本性影响——从设计“人类触发的工具”转为设计“自动循环的流程”。
可迁移启发: 想一想你的工作中哪些环节是“每天/每周都做一次,且步骤可枚举但需要判断的”——这些就是 cron agent 的天然应用场景。先把它们列出来,然后评估 Codex cron 能否覆盖其中 80%。
核心论点: 视频换脸不是按一个按钮就完事的工具活,而是一个需要完整项目管理的系统工程。Codex 真正有用的地方不是替你点工具,而是把这件事拆成流程、文件、检查清单和交付包。作者提供了从授权检查、环境搭建、模型管理到失败记录和资产复用的完整方案。
为什么值得读: 这是目前公开渠道最完整的“AI 视频项目操作指南”。它解决了 AI 应用中最核心的痛点不是“工具不会用”,而是“链路没搭好”。当所有人都问“用什么工具/哪个模型/怎么让脸不漂”时,它是少数强调“素材有没有授权、环境稳不稳、失败原因有没有记录”的内容。
它改变了什么判断: “视频二创 = 找一个好工具”的认知被修正为“视频二创 = 一套可复用的项目资产”。通用判断变更: 任何 AI 应用的长期竞争力不是用最好的模型/工具,而是建立最稳定的交付链路。一个能稳定交付 80 分结果的项目资产,比一个时好时坏的 95 分工具更有价值。
可迁移启发: 不管你要用 AI 做什么(写文章/做视频/建网站),先问自己三个问题:素材从哪里来?失败怎么处理?能复用到下一个项目吗?回答不了这三个问题,就不要开始做。
可行动机会
- 在 Fable 5 切换到按量计费(6 月 22 日)之前,利用全套仓库审计提示词做一次完整的代码审计。 原文中包含了可直接复制使用的审计提示词,包含 4 个阶段和 7 个审计维度。这是用月费换取价值五位数的代码审计服务的时间窗口。
- 立即把 Codex cron 应用到“依赖检查+安全漏洞自动 PR”场景。 每天早上 8 点的依赖检查是风险最低、收益最确定的 cron agent 场景。先把这个跑通,再扩展到 CI/CD 监控、数据清洗、内容自动化发布。
- 在 Claude Code 中配置 Hook 系统的“硬约束”三大件: pre-edit(白名单拦截)、post-edit(自动 format+lint+回滚)、on-tool-use(危险操作弹窗)。三个 Hook 配置好,相当于为 agent 加上了安全气囊——它可以在你不在旁边盯着的时候安全运行。
- 尝试给你的主 agent prompt 加上那句关键指令: “Delegate independent subtasks to subagents and keep working while they run”。观察串行任务到并行任务的性能提升——如果效果明显,可以把它作为所有 agent 设计的默认指令。
- 评估你当前的工作流程,找到一个“每天重复、可枚举、需要判断但不需要创造”的系统,将其迁移到 Codex cron。 不是找一个完美的大项目,而是找一个最小可用流程(比如每天整理邮箱/更新日报/检查日志),用 cron agent 跑三天,观察效果再放大。