AI 动态日报 · 2026-09-03(周四)
> 这份日报写给一个人(下文的「你」指他):一位在做 agent 基础设施和 skill 家族的工程师。
《AI 动态日报》是 Sway Lab 每天早上做的简报:抓取当天的 GitHub、Hacker News、arXiv、Hugging Face 等一手来源,筛出十条最值得读的,原样公开。它首先是写给 Sway 本人看的,所以文中的「你」指的是他。
这份日报写给一个人(下文的「你」指他):一位在做 agent 基础设施和 skill 家族的工程师。 选条的标准不是「这条新闻大不大」,是「他会不会拿去改自己的 agent、会不会拿去写一篇」。
今天最该知道的一件事:同一个模型、同一台机器、同一批任务,9 个 harness 的每次通过成本差 17 倍。
Top 10
1. FrontierHarness:同模型同机器跑 360 次,Claude Code 的每任务成本是 Codex 的 5.3 倍,通过率还低 3.4 个点 · 产品 / 官方发布 · Show HN 71 pts / 50 条评论(id=49538490),9 个 harness、12 种配置、360 次试验,全部用 Kimi K3、在 Runta 上以相同 vCPU / 内存 / 磁盘的全新快照恢复启动
把「harness 到底值多少钱」第一次做成了控制变量实验:模型固定、运行时固定、冷启动完全一致,只换外面那层壳。结果是 Codex 66.7% 通过率 / 每任务 $3.47,Claude Code 63.3% / $18.34,Exo Harness 53.3% / $1.05——最贵和最便宜之间差 17 倍。速度榜另算:DSH Minimal 中位 5 分 41 秒,Claude Code 9 分 38 秒。
为什么值得注意:你平时调的是 prompt 和 skill,但这张表说明壳本身就是一个成本变量,而且量级比 prompt 调优大得多。更值得抄的是它的实验设计——「所有试验从同一个快照恢复、正式任务绝不提前跑以免暖了缓存」这两条,是你自己比较 harness 配置时最容易忽略、也最容易让结论作废的地方。榜单可以不信,方法论应该照搬。
🔗 https://frontierharness.org | HN 讨论 https://news.ycombinator.com/item?id=49538490
2. Gemini 3.8 Flash 和一个专门的 Cyber 变体:Terminal-Bench 2.1 拿到 90.8% · 产品 / 官方发布 · HN 828 pts / 485 条评论(今日全站第一,id=49537553),2026-09-02 发布,Google 六周内第三次发 Flash
一次发两个:3.8 Flash 是主力款,Terminal-Bench 2.1 从 3.7 Flash 的 81.6% 提到 90.8%,DeepSWE v1.1 拿 73.7%(Claude Opus 5 是 74%);3.8 Flash Cyber 是专攻安全的变体,CyberGym 86.2%(前代 3.5 Flash Cyber 77.5%),Chrome 安全团队测出它产出的正确补丁数是「体量大得多的最好商用模型」的 2.6 倍。
为什么值得注意:Terminal-Bench 是跑终端任务的,从 81.6 到 90.8 这一跳直接落在你每天用的那类活儿上。真正的新信号是 Cyber 这个变体的存在——同一个基座切出一个安全专用款,意味着「按任务域切模型」开始成为发布常规,而不是只按大小切。你的 skill 家族如果有按场景路由模型的地方,可选项的形状正在变。
🔗 https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/ | HN 讨论 https://news.ycombinator.com/item?id=49537553
3. Unit 42 复盘一次真实入侵:50 多种 ATT&CK 技术压进 10 小时,agent 之间用 Markdown 文件传信息 · 事故 / 安全 · Palo Alto Networks Unit 42 官方报告,2026-09-02 发布,作者 Renzon Cruz、Nicolas Bareil、Eric Semaan、Omar Jbari,官方标注 4 分钟阅读;24 小时内 The Register、PBS、ZDNET 等多家跟进 一个人类攻击者把战术执行整个交给 agent:agent 自己测绘内网微服务、翻代码仓库捞硬编码 token、拿到 root 凭据、触发未授权的 CI/CD 构建、拿走云上 AI 基础设施的主密钥。用了 50 多种 MITRE ATT&CK 技术,全程不到 10 小时——Unit 42 说同等规模的活儿人类红队通常要两周。收尾时攻击者让 agent 留下一份80 页的技术审计报告,列清它利用过的每一处。全程没有 0day,也没有高超手法。 为什么值得注意:报告里那条「AI 使用指纹」清单值得你逐条对照自己的系统——结构化 Markdown 文件在 agent 与会话之间传递信息、多个前沿模型并行调用、脚本里残留 UI 元素说明是 AI 生成的。这三条既是防守方的检测特征,也正好是你自己搭多 agent 编排时的标准做法。你的编排痕迹和攻击者的编排痕迹长得一模一样——这件事今天值得单独想十分钟。 🔗 https://unit42.paloaltonetworks.com/ai-assisted-cyber-attack-inside-a-unit-42-investigation
4. Harness-of-Harness:在别人的 harness 外面再套一层循环,三轮迭代平均提升 52.25% · 论文 · arXiv 2609.01481,2026-09-01 提交,cs.AI,9 位作者(Haoyang Yan、Min-le Su、Hangfan Zhang、Zhanhao Li、Chen Zhang、Shao Zhang、Yang Chen、Lei Bai、Shuyue Hu);Hugging Face Papers 10 upvotes HoH 不替换 harness,而是把现成 harness 的执行组织成「规划—编码—测试」的迭代循环。四条设计约束写得很实在:修 bug 和长能力要平衡、开发要切成小而可验证的增量、实现时的测试和独立评测必须分开、只约束可验证的产出而不规定 agent 怎么干活。在 GameCraft-Bench / FrontierSWE / ProgramBench 上,配 Codex+GPT-5.5、OpenCode+DeepSeek-V4-Pro、Pi+MiniMax-M3 三组,三轮迭代后平均相对提升 52.25%,最高 82.86%。多日部署跑了 70 多轮迭代,自主做出一个有完整剧情、核心机制、可玩、带音画的第一人称射击游戏。 为什么值得注意:这是今天和第 1 条对得最齐的一篇——FrontierHarness 说「换壳能省 17 倍」,HoH 说「壳外面再加一层循环能涨 52%」。两件事都在说同一句话:agent 的产出上限现在主要卡在编排层,不在模型。「实现时的测试和独立评测必须分开」这一条尤其可以直接搬进你的 skill 设计——自己写测试自己跑,等于没有评测。 🔗 https://arxiv.org/abs/2609.01481 | 代码 https://github.com/Flesymeb/HarnessOfHarness
5. grok-build:xAI 把自家的编码 agent 壳开源了,26,393 星,0 个 open issue · 开源仓库 · 26,393 stars / 4,951 forks,2026-07-14 建仓,2026-09-01 推送,Rust,Apache-2.0,0 个 open issue
xAI 官方的编码 agent harness 加 TUI,全屏、支持鼠标交互、可扩展。Rust 写的,Apache-2.0。
为什么值得注意:两个月两万六千星,但真正反常的是 0 个 open issue——四千多个 fork 的仓库把 issue 清成零,要么是关得极勤,要么是干脆关掉了 issue 区。看它之前先看这一点,能省你不少时间。它值得读的地方在 Rust 实现的 TUI 与 agent 循环怎么解耦:大厂第一方 harness 的源码不多见,而这正好是第 1 条那张成本表想量化的东西的内部构造。
🔗 https://github.com/xai-org/grok-build
6. deja-vu:不建新记忆,直接索引你硬盘上已经存在的会话历史,LongMemEval-S 上 hit@1 85.3% · 开源仓库 · 762 stars / 63 forks,2026-07-14 建仓,2026-09-02 推送,Go,MIT,38 个 open issue
一句话把整个记忆赛道的前提掀了:别的记忆工具都从空的开始往后记,它从满的开始。 Claude Code、Codex、Cursor、Copilot CLI 等 21 个 harness 早就把会话写在磁盘上了,deja 直接索引这些,包括你装它之前的几个月。一个本地 Go 二进制,不用 LLM、不用向量嵌入。自报 LongMemEval-S hit@1 85.3%、LoCoMo 69.6%,5 GB 历史上毫秒级查询,两个评测 harness 都在仓库里、公开数据集上几分钟能跑完。召回是自动触发的:会话开始时、每次 prompt 时、改文件前、跑命令前、命令失败后。建索引时会剥掉密钥和 token。
为什么值得注意:如果你的记忆现在是手写文件加一份索引,这条是今天最该花二十分钟的东西——不是让你换掉手写那套,而是它证明了**「过去半年的会话记录本身就是一份现成的语料」**这个判断成立,而且给了可复现的数字。它把评测 harness 和数据集一起放进仓库,这个做法本身也值得抄。
🔗 https://github.com/vshulcz/deja-vu | 评测数字 https://vshulcz.github.io/deja-vu/guide/benchmarks.html
7.《AI agent 与那场永远不会发生的重构》:有了 agent 之后,「这块该重写了」这个念头没人再动了 · 理念 / 方法论 · HN 41 pts / 54 条评论(评论多于分数,id=49541496),rosenfeld.page,作者 Rodrigo Rosenfeld Rosas,2026-09-02 发表
作者的观察是:团队——包括那些本来很清楚的资深工程师——悄悄停止了推动重构。他强调问题不在 agent 写的代码质量,而在一个过去几乎是反射性的决定不再发生了:停下来说「这块已经没法管了,先重构再往下走」。他的论证走的是工作记忆这条线:模块化、封装、分层从来不是审美偏好,是对人类工作记忆容量的让步;我们把系统拆到每一块能装进一个人的脑子,因为那是人能安全修改和评审的唯一办法。而 agent 的「工作记忆」大得多,于是那个让人不得不拆的压力消失了。
为什么值得注意:这是今天最该慢读的一条,而且和第 1、第 4 条构成一组反向的证据。那两条在说编排层能榨出多少收益,这条在说你为此付的是结构债,而且它不发出声音——没人会收到「本季度重构次数下降」的告警。对写 skill 的人来说,问题更具体:你的 skill 目录里,有多少是当初「先这样凑合」、现在因为 agent 读得动所以再没人碰的?
🔗 https://www.rosenfeld.page/articles/programming/2026_09_02_ai_agents_and_the_refactoring_that_never_happens/ | HN 讨论 https://news.ycombinator.com/item?id=49541496
8. 三个站点批量生产了 215,128 个「最佳软件」页面,专门喂给 AI,然后 Perplexity 真的引用了它们 · 理念 / 争论 · HN 313 pts / 143 条评论(id=49536375),trellner.com 调查报告
标题即结论:有人识别出三个站点合计造了 215,128 个「best software」类页面,目标读者不是人而是 AI 检索,而 Perplexity 在回答里把它们当来源引用了。
为什么值得注意:SEO 的战场从「排在搜索结果第几位」搬到了「被 AI 当成来源引用」,而后者目前几乎没有对抗性防御。两头都和你有关:一头是你自己在给站点做 SEO——被 AI 引用正在变成比排名更值钱的位置;另一头是你的 agent 只要联网检索,就在从这样的池子里取材。你的调研类 skill 该不该给来源加一层可信度判断,今天有了一个具体的理由。(说明:该页正文本次未取到,本条只依据 HN 标题与讨论数字,未引用文章内文表述。)
🔗 https://trellner.com/reports/manufactured-sources-behind-ai-recommendations/ | HN 讨论 https://news.ycombinator.com/item?id=49536375
9. 一块 5090 训 1.5 小时、花 67 美分,ARC-AGI-1 拿 44% · 理念 / 长文 · HN 651 pts / 162 条评论(id=49519939),mvakde.github.io,作者 Mithil Vakde(IIT Bombay '23,工程物理),系列第三篇,代码开源
从零训一个小 transformer,在 ARC-AGI-1 公开评测集上 44%,成本 67 美分,同时在 ARC-2 上拿 7%,与 TRM / HRM 同分,胜过许多 LLM。做法是把每对输入输出转成 token 序列做自回归训练,测试时在训练集和评测集上重新训(测试标签隐藏),每个谜题给一个可学的附加嵌入,位置用 3D RoPE,再用颜色和二面体群置换做增强、推理时对增强结果取逆变换后投票取前二。作者说这轮分数提升主要来自换现代架构(SwiGLU 换掉 GELU、RMSNorm 换掉 LayerNorm 等)。他把动机写得很直白:样本效率是今天 AI 最重要的问题,而且要把成本压到「世界上任何人都能做这个研究」。
为什么值得注意:这是今天最好的信息差——一个人、一块消费级显卡、一顿饭的钱,打平了需要专门方法的基线。它对你的实际用处不是 ARC 本身,是那句「换成现代架构就涨了一大截」:一个几个月没动的组件,光是把默认件换成当下的默认件就能拿到主要收益,这个模式在 skill 和 harness 上同样成立。顺带,这也是个极好的写作素材。
🔗 https://mvakde.github.io/blog/44-on-arc-1/ | HN 讨论 https://news.ycombinator.com/item?id=49519939
10. cumora:把 agent 放进团队群聊当正式成员——同一份花名册、同一个看板,17 天 3,426 星 · 开源仓库 · 中文圈 · 3,426 stars / 429 forks,2026-08-17 建仓(17 天),2026-09-02 推送,TypeScript,MIT,仅 8 个 open issue;作者 yetone
跨平台团队聊天,AI agent 和人在同一份花名册、同一个私聊列表、同一个群、同一个看板和日历里。它强调 agent 不是被 @ 了才答话:它们持有人设和记忆、主动认领任务、彼此协调避免撞车、能收发真实邮件。两条「大脑」路径——云端每个 agent 一个托管 pod,走 OpenAI Responses API 的多跳工具调用循环;或者 BYOA,用 npx cumora agent computer 把自己的 Mac / VPS 配对,跑在你自己的供应商账号上,服务端拿不到你的 key。BYOA 模式下 Claude Code 和 Codex 默认启用失败即拒的文件系统、命令网络、子进程凭据边界,老引擎要显式选择不沙箱才能用。
为什么值得注意:多 agent 编排通常做成 DAG 或者主从调度,它选了「群聊」这个人类已经用了二十年的协调界面,把「谁认领了什么、谁在等谁」变成消息而不是状态机。这是个和你手上路线不同的答案,值得看它怎么处理认领冲突。另外它的沙箱默认值写得很明确——默认失败即拒、老引擎必须显式退出——这个默认方向本身就值得抄。
🔗 https://github.com/yetone/cumora
快讯(5 条)
- HEART:把工具包成自然语言接口,25,519 个函数按需取,50 个真实任务完成率 84%(前沿模型均值 22%) 🔗 https://arxiv.org/abs/2609.01736
gods-eye-view:浏览器里的间谍卫星模拟器,数据是真的,本周 +10,679 星、共 16,154★ 🔗 https://github.com/bilawalsidhu/gods-eye-view- Meta 发 Muse Spark 1.3,HN 395 pts / 264 条评论 🔗 https://developer.meta.com/ai/models/muse-spark/
humanizer:按维基「AI 写作特征」35 条洗掉 AI 腔的 skill,40,456★、今日 +374 🔗 https://github.com/blader/humanizerbetter-harness:把 harness 写成代码、跑受控实验再比结果,2,144★ 🔗 https://github.com/QoderAI/better-harness
今天可以亲手试的
1. 用 deja-vu 索引你已有的会话历史,只回答一个问题:它能不能翻出你三个月前的某个决定(对应第 6 条) 装一个本地 Go 二进制,让它索引磁盘上已有的 Claude Code / Codex 会话,然后挑一件你确定自己几个月前做过决定、但现在想不起理由的事去问。重点不是它答得漂不漂亮,是验证「过去的会话记录是不是一份能用的语料」——这个判断成立与否,决定了你要不要继续手写记忆。仓库里带评测 harness 和公开数据集,想核对 85.3% 那个数就顺手跑一遍 · 约 20 分钟
2. 照 FrontierHarness 的方法论,算一次你自己的「每次通过成本」(对应第 1 条) 不用跑它的榜。挑你最近重复做过至少五次的一类任务,翻账单和日志,算出每次成功要花多少钱、多少分钟——注意它踩出来的两个坑:所有试验必须从同一个起点开始,正式任务不能提前跑(否则缓存被暖过,结论作废)。算出来的数就是你换 harness 配置时唯一该看的那个数 · 约 15 分钟
3. 拿 Unit 42 那三条 AI 指纹,对照一遍你自己的编排痕迹(对应第 3 条) 清单是:agent 之间用结构化 Markdown 文件传信息、多个前沿模型并行调用、脚本里残留 UI 元素。逐条问「我这边是不是也这样」。三条全中不是坏事——它说明防守方用来识别 AI 攻击的特征,和你的正常做法无法区分。真正要想的是:如果有人拿这套指纹扫你的机器,你打算靠什么把自己摘出来 · 约 10 分钟
本次未取到的源:
trellner.com报告正文(curl 返回 HTTP 000)。第 8 条只用 HN 标题与讨论数字,未引用文章内文任何表述。theregister.com与sysdig.com正文(前者解析后为空,后者 HTTP 403)。第 3 条因此全部改用 Unit 42 官方报告原文,那是一份独立的、2026-09-02 发布的第一手事件复盘,不是对前两家的转述。blog.google的 Gemini 发布页正文只解析出站点导航。第 2 条的基准数字改用WebSearch返回的多家报道交叉确认(9to5Google、Android Authority、MarkTechPost、DataCamp 对 90.8% / 86.2% / 2.6 倍的表述一致),官方链接照给。- Hugging Face Papers 今日页只返回 1 篇、7 upvotes,改取 2026-09-02 批次(40 篇)。第 4 条的 10 upvotes 为该批次真实数值。
- Brave News「AI agent」查询返回 20 条,绝大多数为营销稿与融资快讯,仅用于交叉确认第 3 条的报道时间线,无一条进入正榜或快讯。
anthropic.com/news按要求不抓。Reddit / Product Hunt / openai.com 直连按手册未尝试(403)。国内中文资讯源(几家科技媒体 RSS、一个问答站搜索接口、Brave 的search_lang=zh)按手册全部跳过,此前实测均已失效。中文圈今日由第 10 条cumora覆盖(中文作者、一手链接)。