< 返回文章列表
ARTICLE.SYS
AI DAILY

AI 动态日报 · 2026-09-04(周五)

> 这份日报写给一个人(下文的「你」指他):一位在做 agent 基础设施和 skill 家族的工程师。

《AI 动态日报》是 Sway Lab 每天早上做的简报:抓取当天的 GitHub、Hacker News、arXiv、Hugging Face 等一手来源,筛出十条最值得读的,原样公开。它首先是写给 Sway 本人看的,所以文中的「你」指的是他。

这份日报写给一个人(下文的「你」指他):一位在做 agent 基础设施和 skill 家族的工程师。 选条的标准不是「这条新闻大不大」,是「他会不会拿去改自己的 agent、会不会拿去写一篇」。

今天最该知道的一件事:同一个 GPT-6 Astra 跑同一个基准,只换外面那层壳,62.7% 变 99.9%。

Top 10

1. OpenAI 发 GPT-6 Astra,当天 HN 全站第一 · 产品 / 官方发布 · HN 1,326 pts / 1,052 条评论id=49554643,今日全站第一),2026-09-03 发布,GPT-5.6 Sol 的继任者 官方发布页 openai.com/index/gpt-6-astra/ 对 curl 返回 HTTP 403,所以下面的数字分两类看:一手可核的是 ARC Prize 基金会同日发布的独立评测(见第 2 条)——ARC-AGI-3 半私有集最高 99.9%只有二手来源的是定价与安全评级:多家报道与 HN 讨论口径一致地写成每百万 token 输入 $10 / 输出 $50(Sol 为 $4 / $20),缓存输入 $1;以及 OpenAI 首次把一个模型的网络安全风险评为 Critical——意思是它能在没有人一步步指挥的情况下,在加固过的系统里找到并利用未知漏洞。这两组数字本次没有拿到一手页面,按二手记。 为什么值得注意:真正会改变你日程的不是分数,是那条 Critical 评级和它背后的含义——「能自主找漏洞」和「能自主写代码」是同一种能力的两面。你给 agent 开的每一个沙箱、每一条文件系统白名单,面对的对手强度在今天变了一档。另外记一下输出比输入贵 5 倍这个结构:让 agent 少说话的收益,正在变得比让它少读东西更大(这条在第 7 条会有一个现成的数字)。 🔗 https://openai.com/index/gpt-6-astra/ | HN 讨论 https://news.ycombinator.com/item?id=49554643

2. 同一个模型、同一个基准,只换 harness:62.7% → 99.9%,而且贵的那个反而分低 · 理念 / 方法论 · HN 164 pts / 99 条评论id=49555691),ARC Prize 基金会官方评测,作者 Greg Kamradt,2026-09-03 发布 ARC Prize 用两种 harness 跑同一个 Astra。Standard harness(模型自己挑要带走的笔记)最高分 62.7%,花掉 $26,098Provider Adapter harness(在请求之间保留模型不透明的推理状态,长对话用压缩)最高到 99.9%,只花 $18,817。也就是说更好的壳同时买到了 +37 个百分点更低的账单。另外两个数字同样值得记:Astra 在 96.0% 的关卡里用的动作数少于人类基线(基线来自开跑前测的约 500 名普通人的中位数),平均每关少 51.7% 的动作;以及它会自己临时造一套代数速记来记状态,比如 L8: hub q2 (8↓)extend8 to3; retract10 to2Turn 5: P=(24,20), empty, facing west为什么值得注意:这是今天最能直接改你代码的一条,而且它把一个模糊直觉变成了可引用的数字——壳带来的差距(37 个点)比调 reasoning effort 带来的差距大得多(同一张表里 max 到 low 在 Provider Adapter 下只差 0.6 个点)。两个 harness 的区别只有一句话:一个让模型自己写笔记再带走,一个保留模型原始的推理状态。前者是你现在多数 skill 的做法。第二件可抄的是那套代数速记:模型在没人教的时候,自发选择把状态压成符号而不是散文——你手写的状态字段格式,可以直接换成让模型自己发明的那种密度。 🔗 https://arcprize.org/blog/astra | HN 讨论 https://news.ycombinator.com/item?id=49555691

3. 16,893 次真实会话测出来:LangChain 被提到 194 次,只被选中 4 次 · 理念 / 研究 · HN 99 pts / 31 条评论id=49557206),armature.tech,2026-09-03 发布 先说利益相关:Armature 自己卖的就是「帮开发者工具被 agent 选中」的增长服务,这一点写在文章第一行,读数字时要带着看。方法:16,893 次会话,1,163 种 prompt 变体、75 个仓库、3 个编码 agent(Claude Code / Codex / Cursor),并且是真的把方案实现出来而不是只给建议;用 Gemini 3.7 Flash 扮演「循环里的人类」,另一个实例当裁判;筛完发布 5,292 次有效会话,覆盖 51 个代码库、18 个行业。结论里最硬的几条:三个 agent 只在 42% 的格子里选同一个工具;Claude Code 只有约 30% 的会话会搜网(主要靠自己的先验;在先验薄弱的沙箱类目里升到约 80%),而 Codex 有 94% 会搜,且十次里九次带 site: 这类限定符;Claude Code 自己造轮子的比例是另外两家的近两倍(19% vs 10%)。最刺眼的是「被提到 ≠ 被选中」:LangChain 被提 194 次、只被选 4 次;PayPal 被提 139 次、一次都没被选;Adyen 175 次里选中 3 次;Netlify 152 次里 6 次。还有一条很实在——仓库语言决定选谁:同一个需求在四种语言的仓库里跑出四个不同的邮件服务赢家(TypeScript → Resend 55/89,Python → Sendgrid 22/24,Go → Postmark 20/24,Java → Azure ACS 22/23)。 为什么值得注意:这份数据的价值不在排行榜,在它暴露了三个 agent 的信息获取姿势根本不同——一个靠记忆、一个靠搜索、一个靠网页,而这决定了它们的知识新鲜度差多久。你要是在多个 harness 之间切换,同一份 skill 在「靠先验的那个」和「必搜网的那个」上表现会不一样,这是可以预期的,不是玄学。第二个能直接用的观察:agent 会因为供应商页面上一句「免费版保留 1 天」这种细节就把它淘汰掉——说明写给 agent 看的文档,减一句多余的捆绑功能介绍比加一段介绍更有用。 🔗 https://armature.tech/blog/which-tools-coding-agents-install | HN 讨论 https://news.ycombinator.com/item?id=49557206

4. OpenAI、Claude、Grok 在同一个下午一起挂了 · 事故 / 安全 · HN 汇总帖 330 pts / 263 条评论id=49551096,2026-09-03 15:07 UTC 发起),另外三个独立故障帖分别是 ChatGPT 315 条评论id=49550614)、Claude 146 条id=49549676)、Grok 142 条id=49551589) 一个 Ask HN 直接把三家的状态页并排贴出来问「为什么同时挂」。讨论里被反复提到的一点是当时 status 页面还没反映故障,用户比状态页先知道;也有人指出这天正好是 Astra 发布日。本次没有拿到任何一家的官方事后复盘,所以下面只讲能确认的部分:三家主流推理服务在同一时段同时不可用,且社区先于状态页发现。 为什么值得注意:这条的价值不在原因,在它给了一个具体的日期去做一次演练。你的长时任务在三家全挂的那两个小时里会变成什么样? 大多数 agent 编排的失败模式不是「报错退出」,是在重试循环里安静地烧掉额度,或者更糟——把一次 API 失败当成「工具返回了空结果」继续往下推理。今天可以确认的三件事:① 你的重试有没有上限和退避;② 失败和「返回为空」在你的工具层是不是同一种东西(应该不是);③ 有没有一条「所有供应商都不可用就落盘当前状态并停下」的路径。顺带一提,三家同时挂说明多供应商冗余不等于不相关的冗余。 🔗 https://news.ycombinator.com/item?id=49551096

5. K2 Horizon:一次开六个模型,而且把整条训练流水线也一起开了 · 产品 / 官方发布 · HN 256 pts / 84 条评论id=49551760),Institute of Foundation Models 发布,2026-09-03 六个尺寸一次给全:375B-A23B、36B-A4B、32B、7B、3.7B、0.9B,模型与代码 Apache-2.0,数据按各自许可(如 ODC-BY)发布、不能再分发的就公开构造与混合方法。真正少见的是开放的范围:从预训练到推理与 agentic 后训练的完整生命周期——中间检查点、训练数据或数据构造配方、架构、混合配比、训练代码、配置、细粒度日志、评测结果、最终权重,全部放出。官方的说法是这是第一个把 agentic 后训练全过程暴露出来的开放模型家族。0.9B 面向手表眼镜这类极受限环境,3.7B / 7B 面向手机端;36B-A4B 用了他们新的 Mixture-of-Value-Attention(MoVA)。 为什么值得注意:对你有用的不是权重,是中间检查点加训练日志这一组。它第一次让「工具调用、规划、agentic 能力是在训练的哪一步长出来的」这个问题变成可以实测的,而不是只能读论文猜。如果你想知道一个模型对 skill 描述的服从性到底是预训练来的还是后训练来的,这是目前唯一能自己动手验证的材料。另一面也要说清楚:六个尺寸横跨眼镜到企业服务器,意味着同一套 skill 要在 0.9B 和 375B 上都能跑这件事,从设想变成了具体的兼容性问题。 🔗 https://ifm.ai/blog/k2 | HN 讨论 https://news.ycombinator.com/item?id=49551760

6. Repo-To-Skill:从 1,000 个 ML 仓库里蒸出 5,000 多个经过验证的 skill · 论文 · arXiv 2609.02749,2026-09-02 提交,cs.AI / cs.CL,11 位作者(Jianlyu Chen、Yuyang Hu、Hongjin Qian、Jiawei Liu、Wenqing Wei、Xiaolong Chen 等) 论文提出的概念叫 operational knowledge(操作性知识)——「知道一个方法」和「能把它跑通」之间差的那层东西。它的论点是:这层知识不是不存在,它就写在仓库和论文里,只是写成了给人读的形式,而且大到没法在任务执行时装进上下文。系统叫 DisCo,蒸馏分两种走法:任务无关的(把领域里常用的仓库预先压成可复用的 skill)和任务导向的(临场为一个具体任务产出它要的 skill)。前者跑完整个开放生态,产出 AREX-Skill Library:1,000 个常用 ML 仓库 → 5,000+ 条经过验证的 skill,组织成 20 个领域、178 个能力族。评测时把模型底座(GPT-5.5)、研究 harness、下游执行预算全部固定,只比有没有 skill。 为什么值得注意:两件事。第一,「组织成 20 个领域、178 个能力族」这个结构本身就值得看——skill 一多,检索就是真问题,而这是目前公开的、规模最大的一次分类实践。第二,也是更该动手的:「把一个仓库蒸成 skill」是一条可以自动化的流水线,不是只能手写。你现在的 skill 大概率是一条条手工攒出来的;这篇给的是「拿一个你依赖的仓库,自动产出它的操作性知识并验证」的做法。注意它强调的是 verified——蒸出来要能跑通才算数,这一条是它和满地的 awesome-list 的分界线。 🔗 https://arxiv.org/abs/2609.02749

7. caveman:让 agent 说话像穴居人,输出 token 砍掉 65%——以及一份罕见的「别拿这个数字去跟老板汇报」 · 开源仓库 · 103,132 stars / 5,995 forks,今日 +543(GitHub Trending 日榜),2026-04-04 建仓,2026-09-04 推送(今天还在改),Go,95 个 open issue 自述是 "why use many token when few token do trick"。做法很轻:一个 skill,让 agent 别写小作文。README 里的对照表是真跑出来的——同模型同问题,十条普通编码 prompt,输出 token 从平均 1,214 降到 294,省 65%;最好一条「实现 React error boundary」3,454 → 456(87%),最差一条「回调改 async/await」387 → 301(22%)。作者把最好和最差同时放在摘要表里,理由写在旁边:agent 本来要写小作文时它赢很多,答案本来就基本是代码时它几乎不赢。 为什么值得注意:真正值得学的是它的诚实度工程。README 里有一段加粗警告:这个 skill 只压缩输出,输入和推理 token 不变,而且 skill 自己的规则每轮要吃掉约 1–1.5k 输入 token,所以整场会话的实际节省远低于表格;在本来就简洁的活儿上你会亏钱。作者还专门写了一份 HONEST-NUMBERS 文档,起因是一个用户的 A/B 结果反着来而他复现不出来。你自己写 skill 时最该抄的就是这个形状:把「什么时候它不起作用」和「它自己的开销是多少」写进 README 的主干,而不是藏在 FAQ 里。顺带回到第 1 条——输出比输入贵 5 倍的定价结构下,压输出这件事的性价比刚刚变高了。 🔗 https://github.com/JuliusBrussee/caveman

8. hermes-agent:24 万星,4.9 万 fork,以及 39,169 个没关的 issue · 开源仓库 · 240,873 stars / 49,356 forks,今日 +774(GitHub Trending 日榜),2025-07-22 建仓,2026-09-04 推送,Python,MIT,39,169 个 open issue NousResearch 的个人 agent,自述一句话:"The agent that grows with you"。星数和 fork 数都在头部区间,今天还在推代码。 为什么值得注意:把它放进来不是因为它星多,是因为 39,169 这个数字本身是今天最有信息量的一条。四万个未关闭 issue 配四点九万 fork,意味着这个项目的真实形态是一个巨大的分叉集合,而不是一个被维护的上游——大部分人拿走的是代码,不是发行版。你选依赖的时候,star 数几乎不携带信息,open_issues / forks 这个比值携带的信息多得多(这里约 0.79,即每 1.3 个 fork 就对应一个开着的 issue)。这条可以直接做成你自己的选型检查项:gh api repos/O/N --jq '.open_issues_count / .forks_count',一秒钟就能算,比读 README 快。 🔗 https://github.com/NousResearch/hermes-agent

9. Zed:Xanadu 一直在等 agent 出现 · 理念 / 方法论 · HN 87 pts / 34 条评论id=49526298),zed.dev,作者 Nathan Sobo,2026-09-01 发表 文章从 Ted Nelson 1965 年提出 hypertext 的那个项目 Project Xanadu 讲起。Nelson 想要的东西叫 docuverse,规矩只有两条:永不复制,永远引用(他自己造的词是 transclusion);永不覆写,永远留版本。链接同时知道自己的源和目的地,引文按引用保存所以永远带着出处——精确到跨度级别的溯源。这套东西需要无限存储和一个永不过时的命名方案,两样在他工作的那几十年里都不存在,于是九十年代 web 用「链接就是一个字符串,目标一移动就断」的简化版赢了,维护成本从系统身上转嫁给了用户。作者的论点是:人类其实不需要能追溯每一条链接、比对每一个版本,所以扁平化「够用了」——直到 agent 出现。agent 能同时追踪比人脑装得下更多层的潜台词:一段引文背后的原始出处、围绕它的讨论、以及挂在那段确切代码上的调用栈。 为什么值得注意:这是今天唯一一条不给你东西装、只给你一个坐标系的条目,但它解释了一件你可能已经在实践中撞到的事——agent 的上下文问题,本质上是六十年前那个超文本问题。「永不复制,永远引用」翻译成今天的话就是:别把文件内容抄进上下文,给它一个能自己去取、并且带着出处的引用。「永不覆写,永远留版本」翻译过来就是:agent 改过的东西要保留改之前的样子。这两条你多半已经在做了一半(版本那半 git 帮你做了),另一半——跨度级别的出处——基本没人做。文章还有一个具体判断:这套东西正在版本控制里长出来,不是在浏览器里。 🔗 https://zed.dev/blog/agentic-xanadu | HN 讨论 https://news.ycombinator.com/item?id=49526298

10. 三个中文插件仓库在同一天建仓,22 天攒了 4,722 星——一个围绕 DeepSeek Harness 长出来的生态 · 开源仓库 · 中文圈 · dsh-TUI 2,813★ / 153 forks;dsh-vision-router 1,059★ / 43 forks;dsh-vision-toolkit 850★ / 42 forks,合计 4,722★,三个仓库全部建于 2026-08-13,全部 MIT,其中两个 2026-09-03 推送、一个 2026-09-04 推送 三个仓库解决的是同一类问题的两个方向。dsh-TUI 是终端界面补位:实时状态栏、流式思考展示、双击 Esc 回滚、上下文进度条 + TPS,npm 一键装,README 写明被 DSH 官方公众号收录。另外两个都在给纯文本模型补眼睛——dsh-vision-router 提供免密钥的视觉链路加像素级工具(问答、grounding、裁剪、像素 diff、取色、OCR、SVG 描摹、抠图、截图),并强调「图像轮次表现得和普通工具调用轮次一样」;dsh-vision-toolkit 走同一路线,主打粘贴图片直接识别、多图问答、截图还原前端 UI。 为什么值得注意同一天建三个仓库、三周后都还在推、加起来快五千星——这不是三个孤立项目,是一个 harness 的插件层在自组织,而且是在中文社区里。两个可操作的点:第一,dsh-vision-router 那句「让图像轮次表现得和普通工具调用轮次一样」是一个具体的接口设计主张,比「支持多模态」这种描述有用得多,值得对着读一遍它怎么把视觉封装成工具;第二,当一个 harness 的周边同时冒出「界面补位」和「能力补位」两类插件,说明它的扩展点位置定对了——你自己设计扩展接口时,可以拿「别人会不会自发来补这两类东西」当验收标准。 🔗 https://github.com/ccch1mneyyy/dsh-TUIhttps://github.com/ysr666/dsh-vision-routerhttps://github.com/Anionex/dsh-vision-toolkit

快讯(5 条)

今天可以亲手试的

1. 用第 2 条那张表,量一次你自己的 harness 值多少分(对应第 2 条)· 挑一个你手上跑得最久的 skill,做一次严格的 A/B:A 组照现状,让模型自己写笔记再带进下一轮;B 组改成把上一轮的原始推理状态整段带过去、只在超长时压缩。同任务同模型各跑三次,记通过率和 token 花费。ARC 的数字说这两种做法之间是 37 个百分点——你的活儿上不一定这么夸张,但只要差值大于你调 prompt 调出来的收益,你的优化重心就该换地方了 · 约 20 分钟

2. 装 caveman,但先读它的 HONEST-NUMBERS(对应第 7 条)· gh api repos/JuliusBrussee/caveman/readme -H "Accept: application/vnd.github.raw" | head -120 先看那张 87%/22% 的对照表和下面加粗的警告段,再决定装不装。装完做一次真实会话的 A/B,注意只有输出 token 会降,skill 自己每轮还要吃 1–1.5k 输入 token——在本来就简洁的活儿上是负收益。顺便把这个「写清楚什么时候我不起作用」的段落抄进你自己 skill 的 README · 约 15 分钟

3. 给你的仓库依赖算一个 issue/fork 比值(对应第 8 条)· gh api repos/<owner>/<name> --jq '{stars:.stargazers_count, forks:.forks_count, issues:.open_issues_count, ratio:(.open_issues_count/.forks_count), pushed:.pushed_at}' 挨个跑一遍你 agent 栈里在用的仓库。比值接近 1 的(今天第 8 条约 0.79)说明它更像一个被分叉的代码堆而不是被维护的上游,把这类依赖单独标出来,别指望上游修 bug · 约 8 分钟

本次未取到的源:

  • openai.com/index/gpt-6-astra/ 正文 HTTP 403(按手册 openai.com 直连预期即为 403)。第 1 条因此拆成两半写:ARC-AGI-3 的 99.9% 来自 ARC Prize 官方评测页的一手抓取;定价($10/$50 每百万 token)与「Critical」安全评级仅有二手来源(WebSearch 返回的多家报道与 HN 讨论口径一致),已在正文标注为二手,未按一手事实陈述。
  • Hugging Face Papers 页面本次为 JS 渲染,/papers/papers/date/2026-09-04/papers/date/2026-09-03 解析后均只剩两个 arXiv id、无 upvote 数据,因此本期没有任何一条使用 HF Papers 的热度数字,论文条目改从 arXiv cs.MA / cs.AI 当日提交列表中直接选取并逐篇取回摘要。
  • 三家推理服务同时故障(第 4 条)本次未取到任何一家的官方事后复盘,正文只写了 HN 上可核的部分(三个独立故障帖的评论数、状态页滞后于社区),未推测原因。
  • inference-docs.cerebras.ai 的 Qwen 3.8 27B 单页解析后未含速度数字,快讯里的 1500 tokens/s 标注为「提交标题标称」,未作为一手事实。
  • Google Antigravity 条款那条的原始载体是一条推文,本次未取到条款原文,因此只进快讯区且只给 HN 的分数与评论数。
  • Brave News「AI agent」查询返回 10 条,多为企业营销稿与二手转载;其中关于「AI agent 十小时内攻破企业网络」的多家报道,与本报 2026-09-03 第 3 条为同一事件,按跨天去重规则不再上榜。
  • anthropic.com/news 按要求不抓。Reddit / Product Hunt 直连按手册未尝试(403)。国内中文资讯源(几家科技媒体 RSS、一个问答站搜索接口、Brave 的 search_lang=zh)按手册全部跳过,此前实测均已失效;中文圈今日由第 10 条的三个仓库覆盖,均为一手链接与本次实际抓取的仓库元数据。