PARK
每日 AI 情报 · Daily Newsletter

把噪声炼成信号

01
快讯 Briefs

底层工具

  • Claude Devs | Claude Code桌面版新增内置浏览器
    Claude Devs官方宣布,Claude Code桌面版现已集成浏览器功能,用户可直接在IDE内完成网页交互和调试。同步提醒用户更新至最新版本以获取该功能。

  • ai_xiaomu / 黄小木 | GPT-5.6评估应转向任务成本
    黄小木提出,评估AI模型不应只关注token单价,而应计算完成特定任务的总成本,包括工具调用和返工等隐性支出。这一框架有助于团队在实际部署中做出更经济的决策。

  • Greg Brockman / OpenAI X / Ethan Knight | GPT-5.6 Sol Ultra证明50年数学猜想
    OpenAI官方确认,GPT-5.6 Sol Ultra使用64个子智能体在不到一小时内成功证明了存在50年的Cycle Double Cover猜想,并公开了完整提示词与证明过程。这是多智能体协作在科学推理领域的标志性成果。

  • Greg Brockman | GPT-5.6 Sol Ultra真实性能展示
    Greg Brockman发布未加速视频,展示了GPT-5.6 Sol模型在真实环境下约750 TPS的推理性能,为开发者提供了模型实际运行效率的参考基准。

工作流

  • Claude Blog | Cognition如何信任Claude Fable 5实现自主编程
    Anthropic官方博客发布案例研究:Cognition利用Claude Fable 5构建的自主编程智能体可连续工作8小时以上无需人工干预。文章详细拆解了信任机制、任务规划、错误恢复等关键工程实践,展示从个人效率到组织流程的落地路径。

  • ai_xiaomu / 黄小木 / Greg Brockman | Codex合并入ChatGPT并更名为Work
    OpenAI正式将Codex合并至ChatGPT并更名为“Work”,AI Agent能力被推向消费者级。黄小木分析了产品转型的战略意图与实操案例;Greg Brockman宣布该功能将重新定义工作流程的自动化边界。

  • Greg Brockman | 开源项目Tend:基于GPT-5.6的自动化循环工作流
    Greg Brockman发布开源项目Tend,利用GPT-5.6构建邮件、招聘和客服的自动化循环流程。用户角色从每个任务的执行者转变为系统维护者,只需定期检查状态和调整规则,代表了AI工作流设计的范式转变。

  • Thariq / Lance Martin | 混合模型策略:成本降至34%-46%,性能保持90%-96%
    Lance Martin通过量化实验证明,在AI Agent中混合使用Fable 5与Sonnet 5模型,可将成本降至纯前沿模型的34%-46%,同时保持90%-96%的接近前沿性能。该策略为生产级Agent部署提供了现实可行的成本优化方案。

内容

  • rwayne / Roland.W | 创作者策略:分享价值观与来时路
    Roland.W分享内容创作心法:创作者不应只做提供工具性内容的人,更应分享自身的价值观和成长经历,以此建立信任与权威,从“工具人”晋升为“意见领袖”。
02
深读 Deep Read

Working at the frontier: How Cognition trusts Claude Fable 5 to work through the night

Anthropic官方博客以Cognition为案例,详细展示了Claude Fable 5如何实现自主编程智能体连续8小时以上不间断工作。文章深入到信任机制的建立:团队不再逐行审查代码,而是通过定义清晰的目标边界、设计自动化的正确性验证循环,以及对智能体“犯错—恢复”路径的容错设计,使系统能够在无人值守状态下完成复杂工程任务。核心论点是,智能体的信任不是通过一次完美表现建立的,而是通过可预测的失败模式和可靠的恢复机制累积的。

这篇博客是当前极少数官方完整披露生产级AI智能体工程实践的素材。它将抽象的能力突破还原为具体的架构选择——任务拆分粒度、失败重试策略、以及人与系统之间的反馈闭环。对于任何正在设计或计划部署自主工作流的团队,这些经验可以直接迁移:你可以停止追求让智能体“永不犯错”,转而设计一个“犯了错也能自己爬回来”的系统。这一判断转变——从追求完美到设计恢复——将直接影响你在Agent架构中投入精力的方向。

50-year old math conjecture solved with Sol Ultra

OpenAI和Greg Brockman联合宣布,GPT-5.6 Sol Ultra在不到一小时内证明了存在50年历史的Cycle Double Cover猜想,且公开了完整提示词和证明过程。关键在于“64个子智能体”和“多智能体协作”的具体实现:每个子智能体负责一个子问题的探索,通过系统化的信息交换和结果合并机制,最终形成了人类数学家长期未能找到的证明路径。这不是一次简单的“模型更聪明了”的展示,而是验证了一种可复现的多智能体推理协议。

这一成果改变了“AI解决数学问题”这一叙事的技术含量——从“模型参数大到能记住答案”转向“系统架构设计得当就能解决未知问题”。可迁移的启发在于:复杂推理任务的核心瓶颈或许不再是模型本身的能力天花板,而是智能体之间协作协议的设计质量。团队在设计Agent系统时,可以借鉴“子任务分解—独立探索—结果合成”这一模式,而非期待单一模型调用就能解决一切。需要留意的是,当前计算成本仍然极高,但协议本身是开源的,存在被效率优化的空间。

GPT-5.6 has changed how we think about knowledge work — Tend

Greg Brockman发布开源项目Tend,基于GPT-5.6构建了邮件处理、简历筛选和客服响应的自动化循环工作流。项目的核心理念是一次角色定位的翻转:用户不再是任务的执行者,而是系统的维护者。你不需要每天处理每封邮件,而是定期检查系统状态、调整筛选规则、处理异常边界案例。Tend的代码和架构完全开源,覆盖了从“读取输入—生成决策—执行操作—记录日志”的完整闭环。

这篇文章值得精读的原因在于,它给出了一个具体到手把手可复制的“AI工作流”模板,而不是抽象的方法论。它改变的判断是:自动化不是要替代人的判断,而是把人从高频低判断任务的重复劳动中解放出来,升级为对系统进行规则治理的角色。这一模式可以无缝迁移到内容运营、客户管理和项目管理等场景——任何需要持续处理半结构化信息流的岗位,都可以尝试构建一个“我来定规则,AI去执行,我来处理例外”的工作闭环。

视频更新

YouTube

03
产品雷达 Product Radar

Top 1 Products To Build Today

只回答一个问题:如果今天要 build,一个值得优先考虑的产品是什么? 下面每个选择都把新产品供给、真实收入和用户讨论合并成同一个判断。 今天只有 1 个足够新的方向,不为了凑满 5 个而重复昨天的判断。

1. 把数据监控、搜索和变化发现做成决策前置雷达

  • 可以 build 什么:一个把公开数据变化变成产品/市场决策的监控雷达。
  • 为什么是今天:产品机会越来越分散,能持续监控新供给、讨论热度和收入信号本身就是工作流入口。
  • 证据
  • Hacker NewsWhy We Don't Trust the Database with Authentication — blog.sturdystatistics.com;29 points · 11 comments · topstories;HN 29 points / 11 comments
  • Hacker NewsOne Wikipedia page costs your AI agent 68,000 tokens — i use claude code daily and measured what pages cost it while doing research. an average wiki...;5 points · 1 comments · newstories;HN 5 points / 1 comments
  • Hacker NewsEinstein's relativity rules chemical bonds in heavy elements, new research shows — www.brown.edu;45 points · 19 comments · topstories;HN 45 points / 19 comments
  • MVP 切入:做面向产品经理/创始人的监控面板:从新产品、讨论热度和收入信号中自动产出 build brief。
获取 → 内化 → 产出 · 每天把噪声炼成信号 往期回顾 →