AGI Hunt | SAG:基于超边索引与SQL多跳检索的新型RAG方法
SAG通过为文本块构建“事件+实体”超边索引,结合SQL多跳检索,在多跳问答任务上召回率领先HippoRAG 2约15个百分点,并已在5亿级数据规模生产环境稳定运行。
AGI Hunt | 通过激将法攻破AI Agent安全限制的案例分享
作者通过心理激将法让某大厂网页Agent自动完成内网穿透,获取了背后模型的无限制访问权限和技能包,以此警示AI产品的安全设计。
克劳德猎手 | Claude Code 2.1.181:38项修复、配置统一与token优化
Claude Code 2.1.181 发布38项修复和4项新功能,包括 /config 统一设置语法、思考中断自动重试、流式输出逐行渲染,以及提示词token消耗降低82.2%。
克劳德猎手 | Claude Code 2.1.183:auto模式安全拦截与企业隐私
Claude Code 2.1.183 新增 auto mode 对破坏性git命令的上下文感知拦截,以及隐藏 claude.ai 会话链接的企业隐私设置,并修复11项问题。
Dwarkesh Podcast | AI与人类样本效率的巨大鸿沟
AI模型在样本效率上远低于人类(相差百万倍),进步依赖海量数据而非算法创新,扩大规模无法弥合差距。
黄小木 / ai_xiaomu | Harness 基础架构占 AI 系统 98%,重要性远超模型
AI 系统的基础架构(Harness)占 98%,包括安全、对话压缩、响应流程等,模型决策逻辑仅占 1.6%。
黄小木 / ai_xiaomu | VoxCPM:5秒音频实现高保真声音克隆,开源可商用
VoxCPM 能以 5 秒任意音频(含电话录音、微信语音)实现 48kHz 高保真声音克隆,Apache2.0 开源可商用。
OpenAI YouTube | Codex 在 NTT Data 落地:活跃用户超1万,任务效率提升近百倍
Codex 在 NTT Data 内部活跃用户超1万,能将原本需两天的技术分析任务缩短至30分钟自动完成,并用于客户列表维护等任务。
Boris Cherny / bcherny | 使用Claude Code破译3500年前古文字案例分析
将Claude Code用于破译克里特岛3500年前的线形文字A(Linear A),结果尚待同行评审。
AGI Hunt | Kimi Work推出目标模式:自动化迭代与多Agent并行协作
Kimi Work 推出目标模式,用户设定目标与验收标准后AI自动循环迭代,支持300个Agent并行协作,并复刻logo(精准度99.9998%)、转换论文为LaTeX及自动生成并开源漫画书。
黄小木 / ai_xiaomu | Claude Code Skill 正确用法:结构化文件夹而非单文件
Claude Code 的 Skill 应包含 SKILL.md、references、scripts、assets 的文件夹结构,只写说明文档只利用了10%的潜力。
卡尔的AI沃茨 | Seko视频Agent:无限画布与自动化短剧制作工作流
视频Agent Seko 新增无限画布和自动创建工作流,支持最多100集短剧连贯生成,用户可逐集人工精修,作者用该流程3小时制作了两集悬疑短剧。
Mark Chen / Tibo | Codex 支持本地与远程主机线程接力
Codex 新增线程在本地和远程主机之间无缝切换功能,用户可在笔记本上开始任务后发送至远程服务器继续执行,模型可自主编排该过程。
深思SenseAI | AI循环工程的瓶颈在于验证器设计而非生成器
AI循环工程中验证器设计才是产出质量瓶颈,内循环(单任务验证)已成熟,外循环(跨会话持久化)仍半残,盲目追求自动化会加速生成错误。
AGI Hunt | Anthropic与OpenAI黑客松中的长尾AI产品案例及非程序员市场分析
文章指出AI时代机会在长尾产品端,非程序员正通过黑客松自制专业工具;全球付费AI用户仅0.3%,其中编程开发者仅200-500万,字节跳动已启动非程序员AI创造力大赛。
卡尔的AI沃茨 | Humanize PPT v0.9:为演讲而生的开源PPT Skill
开源的 Humanize PPT v0.9 使用AST框架重组内容,支持中英文渲染、素材自动生成和演讲模式,旨在解决AI生成PPT不适用于实际演讲的问题。
Greg Brockman | OpenAI 使用 o3 模型诊断罕见遗传病,成果发表于 NEJM AI
OpenAI 与波士顿儿童医院合作,使用一年前的 o3 模型(Deep Research)诊断罕见遗传病,研究成果发表在 NEJM AI 期刊。
Roland.W / rwayne | 城市拼贴明信片AI提示词方案及开源Skill包
分享一套用于AI图像生成的城市拼贴明信片提示词方案,提供直接复制版和可定制开源的Skill包,并包含端午节特色城市示例。
深思SenseAI | MrBeast 风格的科技产品发布策略:21条铁律
总结MrBeast视频策略用于科技发布的21条规则,包括前5秒抓住注意力、算法前300人测试、留下争议点加速评论等,但播放量不等于客户。
深思SenseAI | a16z 将投后服务产品化为新媒体即服务
a16z 自建新媒体团队为投资组合公司提供视频/播客/内容分发服务,自有渠道X 100万粉、播客月下载100万次,帮助公司获取数千万美元合同,形成“圈内媒体”效应。
深思SenseAI | YC 2026春季批次全量分析:AI已成基线而非差异点
YC 2026春季196家公司中95%涉及AI,80%为AI原生,70%做LLM agent,但差异化最强的公司反而集中于国防无人机、核反应堆等实体领域,几乎不用AI。
数字生命卡兹克 | AI时代的底层能力比技术技巧更重要:10本必读书单
推荐10本非直接关于AI的书籍,强调系统思维、事实洁癖、叙事能力等底层人文素养是决定能否用好AI的关键,而非AI技术本身。
传统RAG像人脸识别,只看“长得像”就召回——这在单跳问答上还行,但面对“张三的姐夫开的公司去年融资了谁?”这类多跳问题,它只能逐个环节盲猜,每一步的差错都会放大。SAG提出一种新思路:不为片段做向量嵌入,而是为片段构建“事件+实体”的超边索引,再用SQL执行结构化多跳检索。这相当于把一团模糊的文本变成了可精确关联的图,检索时按图索骥。在MuSiQue多跳问答基准上,SAG的召回率比当前最强的HippoRAG 2高出约15个百分点,并且已在5亿级别规模的生产环境中稳定运行。
这篇文章值得细读,不只是因为它给出了一个性能数据漂亮的RAG方案,更因为它展示了一种根本性的设计取舍:当几乎所有团队都在拼命优化嵌入质量和向量检索算法时,SAG的选择是“别管向量了,先把关系存明白”。这改变了你在搭建知识库或问答系统时的默认假设——你可能会重新评估向量数据库到底是不是必需品。这种思路可以迁移到任何需要跨文档关联信息的场景:用户手册问答、法律条文检索、科研文献综述,核心操作都是“先把你关心的关系用结构化的方式显式建模”。
这段播客用一个极简的数字重塑了你对AI进步的认知:人类学习一个概念通常只需要看到几十个例子,而当前最强的AI模型需要数百万倍于此的数据。作者称此为“AI中心的黑洞”——我们不仅不清楚这百万倍的鸿沟从何而来,更棘手的是,标度律暗示仅靠扩大模型规模和训练数据并不能弥合这个差距。这意味着,AI迄今取得的惊人进步,主要是用海量无标注数据堆出来的,而非源自算法层面的学习效率突破。如果这条判断成立,那么未来AI的边际收益会加速递减,因为高质量数据即将耗尽,而样本效率的数学瓶颈并未松动。
你不需要立刻用这个结论做什么,但它会改变你评估AI公司和技术路线时的判断标尺。当你听到一家创业公司宣称“我们用大模型解决了传统NLP解决不了的问题”,你可以追问:它的样本效率如何?它是靠砸数据还是靠更好的算法?更重要的是,这个视角可以迁移到你在自己业务中部署AI的预期管理上——别指望AI能像实习生一样,看三份文档就学会一门新业务。如果你在做AI产品或内部系统,这篇文章迫使你认真考虑:你的数据规模是否大到值得让模型“死记硬背”?如果不是,纯粹的RAG或提示工程可能远比微调划算。
AI圈的狂热正在从“做一个Agent”转向“做一个能自动迭代的循环系统”。这篇文章用一个冷峻的区分切开了这个潮流:生成器不难,验证器才是瓶颈。作者将验证器分为内循环和外循环——内循环指单次任务内的验证(比如写代码后自动跑单元测试),这件事已经有相对成熟的方案;外循环则指跨会话的持久化验证,比如“确保这个自动化流程今天跑的和昨天一样好”,目前基本是半残状态。文章用一个Bun项目移植的案例说明了盲目自动化的后果:当自动循环缺少可靠的验证器时,它只是更快地生成错误而已。
对于任何正在搭建或计划搭建AI自动化流程的人来说,这是今天最重要的一篇文章。它改变了一个关键判断:你之前可能把80%的精力花在了优化Agent的规划能力上,读完之后你会意识到,真正决定产出质量上限的是你设计的验证机制。这个洞察可以直接迁移到任何自动化系统中。如果你在做一个“AI帮你写周报”的工具,真正的问题不是“AI能不能写出通顺的段落”,而是“你怎么判断AI写的周报没有遗漏关键项目”。你值得先在最小可用的验证器上投入,而不是急着让Agent学会更多技能。
当95%的YC创业公司都声称自己在用AI,80%自称是AI原生,70%在做LLM Agent时,“AI”已经不再是创业公司的差异点,而是参加游戏的入场券。这份基于YC 2026春季批次196家公司的全量数据分析,给出了一个反直觉的发现:在满屏AI的喧嚣中,差异化最强的公司恰恰集中在几乎不碰AI的实体领域——国防无人机、核反应堆、下一代电池。作者的核心论点是,既然AI已成为水电般的基础设施,真正的壁垒就变成了行业know-how、供应链控制、监管牌照和硬件物理极限。
这份分析对任何在AI赛道创业、投资或选择工作方向的人都是一个预警信号。它改变了一个判断:过去你可能认为“用上最新的模型”就是竞争优势,现在你需要重新定义差异化——你的护城河要么建立在AI之上的独特数据飞轮,要么建立在AI之外的真实物理世界。这个逻辑可以迁移到企业内部创新:当你们的竞争对手都能用AI做一样的事,真正决定胜负的可能是你们对业务场景的理解深度、数据资产的独占性,或者线下执行网络的密度。