Claude Devs X | Model and effort in Claude Code: knowing more vs. trying harder
Claude Code 团队详解模型与努力程度的独立控制:模型决定知识容量,努力程度决定执行投入,给出实际决策框架——知识不够换大模型,努力不够增加努力程度。
claude-code-releases | v2.1.205
Claude Code v2.1.205 发布:增强自动模式安全性(防篡改日志)、修复多项 bug,/doctor 命令升级为完整设置检查工具。
Claude Blog | Working at the frontier: How Thomson Reuters builds AI for high-stakes professional work
Thomson Reuters 结合 Anthropic 前沿模型与权威内容,为法律等高风险专业构建可验证、可辩护的信义级 AI,CoCounsel 平台基于 Claude Agent SDK 重建,生产问题根因分析时间从 3 小时缩短至 4 分钟。
Anthropic X | GRAM 模块化可移除能力研究
Anthropic 提出 GRAM 新训练方法,可将 AI 的双重用途能力(如病毒学知识)放入可移除模块,以平衡有用性与风险。
bcherny | Claude Code /checkup 命令
Claude Code 新增 /checkup 命令,可自动清理未使用的技能/插件、去重 CLAUDE.md、拆分嵌套文件,执行前请求用户确认。
Boris Cherny / Thariq / Jarred Sumner | Rewriting Bun in Rust
Bun 运行时从 Zig 重写为 Rust 引发业内讨论,观点认为重写可以快速且成本可控,AI 模型能降低重写风险,改变了对软件重写的传统认知。
OpenAI X | 编码评估需升级
OpenAI 官方发文:随着编码模型进步,评估标准需要变得更难、更公平、更可信。
OpenAI X / Greg Brockman / Sam Altman / OpenAI YouTube | GPT-Live 发布
OpenAI 正式发布 GPT-Live 新一代全双工语音模型,支持自然对话打断、实时翻译、搜索与推理,可将复杂问题委托给 GPT-5.5,即日起在 ChatGPT 全平台推送,API 即将支持。Sam Altman 和 Greg Brockman 均亲自推介,称其为下一代语音交互。
OpenAI X | SWE-Bench Pro 审计发现基准不可靠
OpenAI 审计 SWE-Bench Pro 发现 30% 的任务存在缺陷,基准已饱和在约 70% 的噪声上限,不再可靠衡量前沿编码能力,因此撤回推荐。审计中使用了模型驱动的调查 agent 与人工专家相结合的方法。
Greg Brockman | GPT-5.6-Sol Next.js 开发测试
Greg Brockman 透露 GPT-5.6-Sol 已在内部测试超两个月,在 Next.js 日常开发中表现极佳,能自主完成大型重构并考虑代码库整体影响。
Orange AI | 大模型传闻汇总
传闻汇总:GPT-6 预计一个月内发布、Anthropic Fable 5.1 即将发布、DeepSeek V4 GA 即将发布、MiniMax 开发 2.7T 参数模型。
Latent Space | Modal:代理体验与10万沙盒问题
Modal CTO 阐述从开发者体验转向代理体验的范式转变,指出 AI 代理需要动态自配置的运行时,揭示大规模 AI 工作负载催生的 100,000 沙盒问题。
Latent Space | Amazon AGI Lab:AI 智能体缺乏真正理解
Amazon AGI Lab 研究者指出当前 AI 智能体缺乏对用户的真正理解,限制了有效协作,为 AI 代理产品设计提供反思。
zkSecurity / Roland.W | AI 审计代理发现 Cloudflare CIRCL 库7个漏洞
zkSecurity 的 AI 审计代理 zkao 在 Cloudflare CIRCL 密码学库中发现 7 个真实漏洞,包括 float64 精度丢失和访问控制失效,已全部修复并获得奖励,是 AI 代码安全审计的里程碑式成功。
Roland.W | GitHub Agentic Workflows prompt injection 漏洞
Noma Labs 发现 GitHub Agentic Workflows 中存在 prompt injection 漏洞,攻击者可通过公开仓库 issue 触发 agent 泄露私有仓库内容。
openai-codex-releases | OpenAI Codex Rust 0.144.0-alpha.1
OpenAI Codex 发布 Rust 语言支持的 v0.144.0-alpha.1 预发布版本。
openai-codex-releases | OpenAI Codex Rust 0.144.0-alpha.2
OpenAI Codex Rust 版本发布 0.144.0-alpha.2 预发布版。
Claude Blog | Using Claude Cowork in marketing operations to automate reporting and campaign building
Anthropic 营销运营团队通过 Claude Cowork 将周报生成和活动搭建时间从数天压缩至数小时,并引入审计代理进行端到端验证,展示了 AI 代理在营销技术栈中的全链路自动化能力。
cat | Claude Tag 多用户协作直播预告
作者预告直播展示从单用户 Claude Code 到多用户 Claude Tag 的演进,Claude Tag 可监控频道、主动执行任务并支持团队协作。
Nate Herk - AI Automation | Fable 5 单提示词构建公司
Fable 5 通过单个提示词自主完成从市场调研到产品开发的全流程,数小时内构建出完整 SaaS 产品。
Roland.W | 企业 AI KPI Token 考核现象
有阿里员工发帖称 Token 消耗被纳入绩效考核,低于平均值会扣分,导致员工为证明使用 AI 而被迫消耗更多 Token,揭示了企业 AI 管理的新型异化问题。
苍何 | 失业宝妈 AI 自媒体转型经验
一位女性因失业回家生孩子,通过使用 AI(GPT/Lovart)和自媒体在小红书获得 4 万粉丝并成功变现,总结出破除恐惧、不幻想捷径、学 AI 必须做自媒体等经验。
黄小木 | AI 副业风险评估三问
作者提出评估 AI 副业可持续性的三个核心问题:平台风险、工具依赖程度、是否可积累资产,内容生产者和副业者可直接使用的评估工具。
Roland.W | 蚂蚁集团战略投资薄荷健康
蚂蚁集团战略投资薄荷健康,持股超 28%,成为最大外部股东,旨在获取健康数据入口并已集成到蚂蚁阿福 App。
Orange AI | Vibe Coding 审美设计网站推荐
推荐一个设计巧妙的网站,强调 Vibe Coding 与审美结合的价值,指向 AI 时代产品设计的审美趋势。
OpenAI 今日正式推出 GPT-Live,这是一款新一代全双工语音模型,彻底改变了人机语音交互的质感。与传统的轮询式语音助手不同,GPT-Live 支持自然的对话打断、实时翻译和多轮推理,当遇到复杂问题时,可以自动将任务委托给 GPT-5.5 模型进行处理。该产品即日起在 ChatGPT 全平台逐步推送,API 支持也即将开放,Sam Altman 和 Greg Brockman 均称这仅仅是「刚刚开始探索」的交互范式。
这可能是 2026 年最重要的 AI 产品发布之一。它标志着语音 AI 从「工具」向「对话伙伴」的关键跃迁,直接影响所有依赖语音交互的产品设计和内容分发策略。对开发者和创作者而言,GPT-Live 的委托机制意味着需要重新思考应用架构——哪些任务应该由轻量级语音模型处理,哪些需要委托给更强模型。对内容生产者来说,拟人化语音交互将催生新的内容消费场景(音频内容、实时互动节目等),而现有的语音助手产品可能需要重新定义自己的价值定位。
OpenAI 公布了对 SWE-Bench Pro(最广泛使用的 AI 编码基准之一)的完整审计结果,发现约 30% 的任务存在缺陷——包括测试用例错误、问题描述模糊和评估逻辑漏洞。更关键的是,该基准已趋近饱和:前沿模型的表现停滞在约 70% 的准确率,且这 70% 可能已达噪声上限,意味着分数提升不再反映真实能力进步。OpenAI 因此正式撤回对该基准的推荐,并呼吁行业升级评估标准。审计过程中,OpenAI 使用了自己开发的模型驱动调查 agent,结合五位独立人工专家进行交叉验证。
这篇审计报告将动摇整个 AI 编码评估体系的信任基础。如果你依赖 SWE-Bench 分数来选择模型或评估团队能力,现在需要重新思考你的判断框架。核心启示是:基准饱和不等于能力天花板,而可能意味着基准本身失效。更可迁移的教训是,所有 AI 评估标准都需要定期审计——当模型越来越强时,评估题也需要随之「变难、变公平、变可信」。对于构建 AI 产品的团队,这个方法论(用 AI agent 辅助审计基准)本身就是一种可复用的质量保障实践。
Claude Code 团队成员首次公开解析了「模型」和「努力程度」作为两个独立的控制维度。模型决定了知识容量和处理能力上限,而努力程度则决定了在给定模型条件下投入的计算资源(Token 预算、搜索深度等)。团队给出了清晰的决策框架:如果模型知识不够,应该换更大的模型;如果模型够好但执行不够深,则增加努力程度。这一框架直接回答了实际开发中「是该升级模型还是调整参数」的经典两难问题。
这篇技术文档虽然简短,却提供了一个可以立即应用到工作中的决策逻辑。很多团队在遇到 AI 输出质量不足时,第一反应是换更强或更贵的模型,但实际上问题可能出在「努力不够」——提示词设计、上下文提供、搜索迭代等投入不足。反之,如果模型本身就不具备相关知识(如需要特定领域专业知识),增加努力也无济于事。这一框架可以迁移到任何 AI 工具的使用决策中,帮助你更理性地分配计算资源预算。
Thomson Reuters 详细披露了其如何为法律等高风险专业领域构建可信赖的 AI 系统。其 CoCounsel 平台基于 Claude Agent SDK 重新构建,核心思路是将 Anthropic 的前沿模型与 Thomson Reuters 自身拥有版权的权威法律内容深度集成,确保 AI 输出的每条结论都可溯源、可验证、可辩护。实际效果惊人:生产问题的根因分析时间从平均 3 小时缩短至 4 分钟,提升了 45 倍效率。
这是目前最完整的、信义级 AI 在 B2B 行业落地的系统工程研究。它改变了「AI 不适合高风险决策」的判断——只要有正确的数据来源、验证机制和审计追踪,AI 完全可以胜任专业领域的核心工作。对任何想在垂直行业(医疗、金融、法律、合规)落地 AI 产品的团队,这篇文章提供了可复用的架构模式:权威内容数据层 + 前沿模型推理层 + agent 执行层 + 人工审计闭环。特别是「模型要推理,但不要记忆事实」这个设计原则——AI 的创作能力应基于模型,而事实依据必须来自可信源。
zkSecurity 的 AI 审计代理 zkao 对 Cloudflare CIRCL 密码学库进行了全量审查,成功发现 7 个真实的安全漏洞,涵盖 float64 精度丢失、访问控制失效等关键类型。这些漏洞被 Cloudflare 官方确认并全部修复,团队也获得了相应奖励。这是目前公开报道中 AI 审计工具在真实生产代码库中发现漏洞数量最多、质量最高的案例之一。
这一事件验证了 AI agent 在代码安全审计中的真实能力边界。它改变了「AI 审计只能做表面检查」的认知——zkao 发现的问题涉及密码学库的核心实现细节,精度丢失和访问控制问题通常是人工审计也容易遗漏的。对任何有安全需求的团队,这个案例提供了明确信号:应该将 AI 审计工具纳入 CI/CD 流程的安全卡点。更重要的是,它展示了 AI 审计的最佳实践:不是替代人类专家,而是作为「第一道防线」覆盖大量代码,让人工审计聚焦于高危区域。
Modal 的 CTO Akshat Bubna 在访谈中阐述了一个核心论断:AI 时代的基础设施正在从「开发者体验」转向「代理体验」。传统的云基础设施面向人类开发者设计,需要静态配置和预定义环境,而 AI 代理需要动态自配置的运行时,能够根据任务需求自动搭建和拆卸计算环境。他揭示了一个新问题——「100,000 沙盒问题」:大规模 AI 工作负载可能需要同时管理数十万个独立沙盒环境,这对基础设施的编排、成本和安全性提出了前所未有的要求。
这个视角对构建 AI 应用的团队具有深刻的战略意义。它改变了对基础设施投资的判断——如果你还在围绕人类开发者的体验设计基础设施(如优化部署流程、提升控制台体验),可能需要反思是否正在服务于错误的用户。真正的用户——AI 代理——需要的是无状态、弹性、可自毁的计算环境。这个认知可以迁移到任何与 AI 应用部署相关的决策中:选择平台时优先考察其「代理友好度」而非「开发者友好度」,关注动态自配置能力而非静态配置功能。
Joe Rogan / PowerfulJRE | Joe Rogan Experience #2524 - Rupert Lowe
Joe Rogan Experience #2524 - Rupert Lowe
时长:2:04:07
Latent Space | The 100,000 Sandbox Problem — Akshat Bubna, Modal CTO
The 100,000 Sandbox Problem — Akshat Bubna, Modal CTO
时长:59:10
Latent Space | Why AI Agents Don't Actually Understand You — Danielle Perszyk, Amazon AGI Lab
Why AI Agents Don't Actually Understand You — Danielle Perszyk, Amazon AGI Lab
时长:未知
Nate Herk - AI Automation | Fable 5 Just Built Me a Business With One Prompt
Fable 5 Just Built Me a Business With One Prompt
时长:12:28
OpenAI YouTube | The next generation of ChatGPT Voice
The next generation of ChatGPT Voice
时长:未知
只回答一个问题:如果今天要 build,有没有新的产品方向值得优先考虑?
今天没有足够新的产品/需求/收入信号形成新的 Top 5 build choices。
最近几天已经反复出现过的方向已隐藏;没有必要把同样的 5 个方向换顺序再推一次。