Claude Devs | Claude Code桌面版新增内置浏览器
Claude Devs官方宣布,Claude Code桌面版现已集成浏览器功能,用户可直接在IDE内完成网页交互和调试。同步提醒用户更新至最新版本以获取该功能。
ai_xiaomu / 黄小木 | GPT-5.6评估应转向任务成本
黄小木提出,评估AI模型不应只关注token单价,而应计算完成特定任务的总成本,包括工具调用和返工等隐性支出。这一框架有助于团队在实际部署中做出更经济的决策。
Greg Brockman / OpenAI X / Ethan Knight | GPT-5.6 Sol Ultra证明50年数学猜想
OpenAI官方确认,GPT-5.6 Sol Ultra使用64个子智能体在不到一小时内成功证明了存在50年的Cycle Double Cover猜想,并公开了完整提示词与证明过程。这是多智能体协作在科学推理领域的标志性成果。
Greg Brockman | GPT-5.6 Sol Ultra真实性能展示
Greg Brockman发布未加速视频,展示了GPT-5.6 Sol模型在真实环境下约750 TPS的推理性能,为开发者提供了模型实际运行效率的参考基准。
Claude Blog | Cognition如何信任Claude Fable 5实现自主编程
Anthropic官方博客发布案例研究:Cognition利用Claude Fable 5构建的自主编程智能体可连续工作8小时以上无需人工干预。文章详细拆解了信任机制、任务规划、错误恢复等关键工程实践,展示从个人效率到组织流程的落地路径。
ai_xiaomu / 黄小木 / Greg Brockman | Codex合并入ChatGPT并更名为Work
OpenAI正式将Codex合并至ChatGPT并更名为“Work”,AI Agent能力被推向消费者级。黄小木分析了产品转型的战略意图与实操案例;Greg Brockman宣布该功能将重新定义工作流程的自动化边界。
Greg Brockman | 开源项目Tend:基于GPT-5.6的自动化循环工作流
Greg Brockman发布开源项目Tend,利用GPT-5.6构建邮件、招聘和客服的自动化循环流程。用户角色从每个任务的执行者转变为系统维护者,只需定期检查状态和调整规则,代表了AI工作流设计的范式转变。
Thariq / Lance Martin | 混合模型策略:成本降至34%-46%,性能保持90%-96%
Lance Martin通过量化实验证明,在AI Agent中混合使用Fable 5与Sonnet 5模型,可将成本降至纯前沿模型的34%-46%,同时保持90%-96%的接近前沿性能。该策略为生产级Agent部署提供了现实可行的成本优化方案。
Anthropic官方博客以Cognition为案例,详细展示了Claude Fable 5如何实现自主编程智能体连续8小时以上不间断工作。文章深入到信任机制的建立:团队不再逐行审查代码,而是通过定义清晰的目标边界、设计自动化的正确性验证循环,以及对智能体“犯错—恢复”路径的容错设计,使系统能够在无人值守状态下完成复杂工程任务。核心论点是,智能体的信任不是通过一次完美表现建立的,而是通过可预测的失败模式和可靠的恢复机制累积的。
这篇博客是当前极少数官方完整披露生产级AI智能体工程实践的素材。它将抽象的能力突破还原为具体的架构选择——任务拆分粒度、失败重试策略、以及人与系统之间的反馈闭环。对于任何正在设计或计划部署自主工作流的团队,这些经验可以直接迁移:你可以停止追求让智能体“永不犯错”,转而设计一个“犯了错也能自己爬回来”的系统。这一判断转变——从追求完美到设计恢复——将直接影响你在Agent架构中投入精力的方向。
OpenAI和Greg Brockman联合宣布,GPT-5.6 Sol Ultra在不到一小时内证明了存在50年历史的Cycle Double Cover猜想,且公开了完整提示词和证明过程。关键在于“64个子智能体”和“多智能体协作”的具体实现:每个子智能体负责一个子问题的探索,通过系统化的信息交换和结果合并机制,最终形成了人类数学家长期未能找到的证明路径。这不是一次简单的“模型更聪明了”的展示,而是验证了一种可复现的多智能体推理协议。
这一成果改变了“AI解决数学问题”这一叙事的技术含量——从“模型参数大到能记住答案”转向“系统架构设计得当就能解决未知问题”。可迁移的启发在于:复杂推理任务的核心瓶颈或许不再是模型本身的能力天花板,而是智能体之间协作协议的设计质量。团队在设计Agent系统时,可以借鉴“子任务分解—独立探索—结果合成”这一模式,而非期待单一模型调用就能解决一切。需要留意的是,当前计算成本仍然极高,但协议本身是开源的,存在被效率优化的空间。
Greg Brockman发布开源项目Tend,基于GPT-5.6构建了邮件处理、简历筛选和客服响应的自动化循环工作流。项目的核心理念是一次角色定位的翻转:用户不再是任务的执行者,而是系统的维护者。你不需要每天处理每封邮件,而是定期检查系统状态、调整筛选规则、处理异常边界案例。Tend的代码和架构完全开源,覆盖了从“读取输入—生成决策—执行操作—记录日志”的完整闭环。
这篇文章值得精读的原因在于,它给出了一个具体到手把手可复制的“AI工作流”模板,而不是抽象的方法论。它改变的判断是:自动化不是要替代人的判断,而是把人从高频低判断任务的重复劳动中解放出来,升级为对系统进行规则治理的角色。这一模式可以无缝迁移到内容运营、客户管理和项目管理等场景——任何需要持续处理半结构化信息流的岗位,都可以尝试构建一个“我来定规则,AI去执行,我来处理例外”的工作闭环。
Claude YouTube | Building the future of agentic infrastructure
Building the future of agentic infrastructure
时长:16:33
Dwarkesh Podcast | Einstein's happiest thought: General Relativity from scratch – Adam Brown
Einstein's happiest thought: General Relativity from scratch – Adam Brown
时长:1:38:24
Latent Space | Podcast Crossover: AIE, AGI, frontier lab strategy with @matthew_berman and @swyxtv
Podcast Crossover: AIE, AGI, frontier lab strategy with @matthew_berman and @swyxtv
时长:28:03
只回答一个问题:如果今天要 build,一个值得优先考虑的产品是什么? 下面每个选择都把新产品供给、真实收入和用户讨论合并成同一个判断。 今天只有 1 个足够新的方向,不为了凑满 5 个而重复昨天的判断。