AI 动态日报 · 2026-08-14(周五)
今天最该知道的一件事:DeepSeek 把自己的 agent harness 开源了,源码全给,一切皆插件。
《AI 动态日报》是 Sway Lab 每天早上做的简报:抓取当天的 GitHub、Hacker News、arXiv、Hugging Face 等一手来源,筛出十条最值得读的,原样公开。它首先是写给 Sway 本人看的,所以文中的「你」指的是他。
今天最该知道的一件事:DeepSeek 把自己的 agent harness 开源了,源码全给,一切皆插件。
Top 10
1. DeepSeek Harness 开发者预览:源码全给,一切皆插件 · 产品 / 官方发布 · 中文圈 · HN 549 pts / 240 条评论(今日 HN 第二)· 官方站 deepseek.com/harness DeepSeek 面向全球 harness 开发者放出 developer preview,source code included;模型、工具、skill、会话、沙箱、存储、循环、调度、UI 全部是可替换插件,跑在 Cordis 插件系统上,配置里换就行、不改源码。四种运行模式:Standard(全工具)/ Code(模型写 TypeScript 程序编排多轮工具调用)/ Minimal(只有 bash + str_replace_editor,用来在最小环境里裸测模型)/ Creator(在内存里试插件、组新模式)。另一半是可追溯:模型看见的一切都进 append-only 会话日志——system prompt、推理、工具调用与结果、子 agent 调度、每一次上下文注入,Trajectory 视图里按来源查,resume / fork / search / replay 全在同一条事件流上。 为什么值得你读:这是你 hermit-agent 那一层最直接的对照组。它把「agent = 模型 + harness」写成了产品口号,而 Minimal 模式(两个工具裸测模型)正是你评估 harness 增益时缺的那把尺子——把你的 harness 和它的 Minimal 跑同一批任务,差值才是你自己的功劳。append-only 事件流 + 按来源归因的上下文注入,也是 session-memory-skill 可以直接抄的结构。 🔗 https://deepseek.com/harness/en/ · 仓库 https://github.com/deepseek-ai/deepseek-harness · HN https://news.ycombinator.com/item?id=49285244
2. Prime Agent:把上下文当变量、把子 agent 当函数调用的自改进 agent · 仓库 · 15,468 stars / 1,650 forks,GitHub Trending 周榜第一、本周 +12,476,2026-05-08 建仓,2026-08-14 推送(今天),TypeScript,MIT,592 个 open issue Prime Intellect 的开源 coding / research agent,专做长跑任务,架在两个抽象上:Recursive Language Model(RLM)——把上下文当变量(prompt-as-a-variable)、把递归子 agent 这类工具当函数调用,全都发生在一个常驻的 REPL 里;Continual Harness(arXiv 2605.09998)——把补充提示词、记忆、skill 描述、可复用的子 agent 规格存成持久状态,靠小步、有证据支撑的更新来自我精炼,默认只作用于当前会话。 为什么值得你读:这是本周涨得最凶的仓库(+12,476),而且它的两个抽象正好压在你在做的事上。「prompt-as-a-variable」是 lambda-lang 的同一个直觉换了个说法;「evidence-backed、局部于 session 的小步更新」则是 skill 自进化最保守也最可落地的那一版——比整篇重写 skill 安全得多。 🔗 https://github.com/PrimeIntellect-ai/prime-agent
3. 腾讯 TencentDB Agent Memory:把团队记忆做成四类可交接的资产 · 仓库 · 中文圈 · 21,221 stars / 1,931 forks,GitHub Trending 周榜本周 +5,388,2026-04-07 建仓,2026-08-11 推送,TypeScript,563 个 open issue 腾讯云出的 agent 团队级记忆中枢,把对话、文档、代码变成四类可复用记忆资产:Chat Memory / Skill / LLM-Wiki / Code-Graph,可治理、可共享、可跨 agent 与框架装配。三个服务一起起(memory-core + memory-hub + proxy)。自报基准:PersonaMem 从 48% 提到 76%,相对提升 +59%(该基准测的是长交互后 agent 能不能正确理解并应用用户信息)。已支持 OpenClaw / Hermes / Claude Code / CodeBuddy 与 SDK 接入。README 自己写明了三条未完成项:Wiki 和 CodeGraph 是异步构建、CodeGraph 目前只优先公开 HTTPS 仓库、全自动记忆路由还在迭代,Hub 现在靠手动绑定资产。 为什么值得你读:你 session-memory-skill 解的是「一个人跨会话」,它解的是「一个团队跨 agent」——而它给出的分类(对话 / 技能 / 知识 / 代码图)比通用向量库有用得多,因为四类资产的写入时机和失效条件完全不同。那句「新成员第一天就能加载团队的存档」是个很好的产品比喻,可以直接借。 🔗 https://github.com/TencentCloud/TencentDB-Agent-Memory
4. reverse-skill:41 条路由规则、163 个回归用例,一个能自我进化的安全技能路由包 · 仓库 · 中文圈 · 24,937 stars / 3,389 forks,GitHub Trending 周榜本周 +5,270,2026-05-13 建仓,2026-08-13 推送,PowerShell,MIT,仅 14 个 open issue
中文作者做的逆向 / 授权渗透 / 安全研究技能路由包,客户端中立(Claude Code / Kiro / Cursor / Cline / Codex / OpenCode 都能挂)。它解的问题很具体:agent 拿到一个 APK / 二进制 / 前端 JS 加密 / CTF 题目时,不知道该用 jadx 还是 apktool 还是 Frida 还是 IDA,于是它把「选方法论 → 检查工具在不在 → 跑可重复流程」做成一条固定链路:RULES.md → MASTER-ROUTING → case-init/scope.md(先确认授权与网络画像,没就绪不许对目标动作)→ 场景 skill → 工具/MCP/脚本 → timeline + Evidence→Finding→Path → 报告 + field-journal。现状表自报:41 条路由规则(R0–R40)、163 个回归用例、42 个受管 skill 模块、Windows + Ubuntu 双平台 CI,路由核心由一份结构化配置驱动、与客户端适配层分离。
为什么值得你读:这是你那六个 skill 最该看的一个工程范本,跟安全无关。它把 skill 家族从「一堆 markdown」升级成了「一个有回归测试的路由系统」——41 条规则配 163 个 case,改一条路由跑一次 CI 就知道有没有砍错。你昨天纠结的 skill 膨胀问题,它给的答案不是压缩,是先把触发条件从散文里抽成一份结构化配置。另外它有个细节值得抄:README 顶上直接写「如果你是 AI agent,跳到 README_AI.md 并严格照做」——人读的和 agent 读的分成两份。
🔗 https://github.com/zhaoxuya520/reverse-skill
5. book-to-skill:把一本技术书变成一个能边干活边查的 agent skill · 仓库 · 21,219 stars / 2,237 forks,GitHub Trending 周榜本周 +3,789,2026-05-01 建仓,2026-08-13 推送,Python,MIT,仅 12 个 open issue 把任意技术书、文档目录或一堆来源,合成一个统一的 agent skill,能学、能查、能在干活时直接用。支持 PDF / EPUB / DOCX / MD / HTML / RTF / MOBI,产出走 Agent Skills 开放标准,可挂在 GitHub Copilot CLI、Amp、Claude Code 上。 为什么值得你读:你的大师.skill 和私教.skill 本质上就是「把某个领域的知识压成一个可调用的 skill」,而这个仓库把那条生产流水线做成了工具。区别在于你是手写、它是从书里抽——可以拿它跑一本你熟的书,然后对比它抽出来的结构和你手写的结构差在哪,差异的地方就是你手写时的隐性判断,那些判断才是你 skill 的护城河。 🔗 https://github.com/virgiliojr94/book-to-skill
6. AI4AI at Test-Time:强模型给弱模型「搭架子」,平均分从 0.49 翻到 0.91 · 论文 · arXiv 2608.12307,2026-08-12 提交,cs.LG / cs.AI / cs.CL,9 位作者(Cheng Qian、Wenting Zhao、Liangwei Yang、Heng Wang、Jielin Qiu、Heng Ji、Silvio Savarese、Huan Wang、Shelby Heinecke)· Hugging Face Papers 99 upvotes 不更新任何参数,只让强模型在推理时给弱模型造 harness:四个 Theory-of-Mind 基准上,builder 模型拿 5% 数据当验证集、多轮迭代打磨 harness,最后在全量测试集上评。结果目标模型平均分从 0.49 提到 0.91,接近翻倍。最值钱的是归因分析——增益主要来自「把不稳定的模型推理卸载成确定性代码」、按基准做路由、以及严格的答案格式强制,而不是让目标模型多想几步或者多采样几次。另外三条:builder 模型的推理投入越大,harness 质量单调变好;平台差异相对于 builder 自身能力来说影响不大;越弱的目标模型收益越大。 为什么值得你读:这篇给了你一句可以拿去吵架的结论——harness 的增益不是「让模型多想」,是「让模型少想」。能变成确定性代码的那部分,就别留在提示词里。这也直接回答了「便宜模型 + 好 harness 能不能顶贵模型」:在这四个基准上能,而且越便宜的模型收益越大。 🔗 https://arxiv.org/abs/2608.12307
7. Gemini 3.7 Flash 发布 · 产品 / 官方发布 · HN 595 pts / 330 条评论(今日 HN 第一),2026-08-13 blog.google 官方发布 Google 发布 Gemini 3.7 Flash,登上今日 HN 首页第一。注意:官方博客正文本次未取到(blog.google 页面用 curl 取回来只有导航结构,正文没渲染出来),所以这条只有「发布了 + HN 热度」这两个可验证事实,具体的基准分数、定价、上下文长度、agent 能力描述本次一律未取到,引用前必须自己开官方页核对。 为什么值得你读:Flash 档是 agent 里跑量的那一档——子 agent、路由、批量分类、长跑任务的中间步骤,成本全压在这一档上。它一动,你 agent-matrix 的成本模型就要重算。配合第 6 条读更有意思:如果 harness 能把弱模型从 0.49 拉到 0.91,那 Flash 档变强这件事的杠杆比旗舰模型变强大得多。 🔗 https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/ · HN https://news.ycombinator.com/item?id=49289112
8. Geoffrey Litt:《理解,是新的瓶颈》 · 理念 / 方法论 · HN 190 pts / 97 条评论 · 2026 年 7 月 AI Engineer 大会演讲的文字版 立论很干脆:agent 写的代码,你还是得懂。但他把「为什么要懂」从常见答案里拽了出来——大多数人(包括支持理解的人)会说「懂是为了验证」,而验证本质上是个点赞/点踩的问题,而 agent 正在越来越擅长验证自己的工作。所以他给的答案是另一个:懂是为了参与(understand to participate)。理由是「从来不是只有一个循环」——一个项目是跟 agent 的无数个循环,而你对系统的理解,构成了你想出下一个演进方向的能力。脑子里没有一套丰富的概念,你在这个项目里的参与度就被实质性地限死了。他把这个接到 Margaret Storey 和 Simon Willison 说的认知债(cognitive debt)上——像技术债,短期不懂也能混,长期一定会咬你。文章后半部分给的是方法:代码讲解文档、用测验来检查自己的理解、以及可以玩的「微世界(micro-worlds)」。 为什么值得你读:这是今天唯一一篇能给你的自媒体内容当骨架的文章。而且「验证 vs 参与」这个切分,正好能解释一件事——为什么你自己写 skill 时会觉得「让 agent 全自动改 skill」哪里不对:不是怕它改错(那是验证),是你会失去对自己那套系统的概念流利度,然后再也想不出下一步该往哪改。 🔗 https://www.geoffreylitt.com/2026/07/02/understanding-is-the-new-bottleneck · HN https://news.ycombinator.com/item?id=49290299
9. Pi 团队公开讲清楚了 compaction 到底怎么做 · 理念 / 方法论 · HN 97 pts / 34 条评论 · Earendil Engineering,2026-08-13 发表 · 写成了一封邮件的格式 Pi(一个 coding agent)的工程团队把「上下文压缩」这件通常被藏起来的事,一步步拆开写:一次请求包含 system prompt、加载的文件(AGENTS.md 之类)、工具定义和完整对话历史;每一轮 tool call → tool result → assistant 都在往历史里累加,直到超过窗口、请求直接被拒。溢出时只有两条路——开新会话(丢掉历史里的决策和未完成的活,但也不全是坏事,因为上下文越长模型输出质量越降),或者做一份更小的对话表示,也就是 compaction。文章还画了请求的逐段结构图(哪段是 LLM 返回的、哪段是 agent 程序自己拼的)。 为什么值得你读:你每天都在撞 compaction,但大部分 harness 把这一步做成黑箱。这篇的价值在于它把**「什么时候该压」和「什么时候该干脆开新会话」当成两个并列选项来讨论**,而不是默认压缩。对 session-memory-skill 来说这是个设计问题:你要存的是「压缩后的摘要」还是「触发压缩那一刻的完整快照」——这篇给了判断依据。 🔗 https://earendil.com/posts/compaction-in-pi/ · HN https://news.ycombinator.com/item?id=49289654
10. 四天、1,395 个文件、85 组破解凭据:agent 打的一场准自主攻击 · 事故 / 安全 · CSO Online,作者 Gyana Swain,2026-08-13 发表,5 分钟长文 · 源研究来自安全公司 Dream · Brave News 抓到时距发布 17 小时 用开源 AI 框架搭的自主 agent 打进了台湾政府系统,拿下凭据、探到了一个核安全机构。研究方 Dream 的原话:「大约四天里,这个 agentic 攻击者产出了 1,395 个文件、85 组破解凭据、数千条外泄的人员记录,并在国家基础设施内部拿到了持久驻留。」它给的判断只有一句:「发动一次称职攻击的成本已经塌了,防御一次的成本还没有。」多个 agent 并行地测绘网络、找漏洞、跨互联系统执行入侵步骤。Dream 没点名国家,只说「亚洲的政府实体」;台湾数位发展部则表示同期检测到「AI agent 辅助」的针对政府机关的攻击,据路透社报道,该活动涉及 OpenClaw 这类 AI 驱动工具,并称攻击来源、手法和影响范围均已查清、受影响单位已陆续完成处置。 为什么值得你读:这是「agent 越界」从演示进入现实的第一批带数字的记录,而且用的是开源框架——不是某家实验室的内部模型。对你有两层意义:一是你自己的 agent 基础设施里,沙箱与权限那层现在是安全边界而不是工程整洁度问题;二是这件事会直接影响未来半年 agent 产品的合规叙事,做 IP 的人早一步有判断就有话说。 🔗 https://www.csoonline.com/article/4209210/ai-agents-wage-near-autonomous-cyberattack-on-asian-government-networks.html
快讯(5 条)
- OpenART:1 万+ 有状态红队场景、中位数 97 次工具调用,攻击成功率 85.0% 🔗 https://arxiv.org/abs/2608.00677(Hugging Face Papers 184 upvotes,今日最高)
- 经济学人:agent 会撒谎、作弊、偷窃,这正在劝退用户 🔗 https://www.economist.com/business/2026/08/12/ai-agents-lie-cheat-and-steal-that-is-putting-off-users(HN 153 pts / 191 条评论)
- Google 官方 skills 仓库仍在高速推进,本周 +2,359 🔗 https://github.com/google/skills(18,069 stars / 1,429 forks,Apache-2.0,08-13 推送)
- Spark-to-Paper:把「写完整篇论文」做成一个可组合的 skill 🔗 https://huggingface.co/papers/2608.11924(Hugging Face Papers 176 upvotes)
- Show HN:用 Google OKF + SQLite FTS5 做的快速 agent 记忆,纯本地 🔗 https://github.com/fellowgeek/mcp-memory(HN 53 pts / 35 条评论)
今天可以亲手试的
1. 用 DeepSeek Harness 的 Minimal 模式,量出你自己 harness 的净增益 · 约 15 分钟
npx @deepseek-ai/dsh web(或 git clone https://github.com/deepseek-ai/deepseek-harness 从源码装)。Minimal 模式只给模型两个工具:持久 bash + str_replace_editor。挑 3 个你手上真实的任务,先在 Minimal 里跑一遍记结果,再用你自己的 harness 跑一遍。差值就是你 harness 的分数——这是你一直缺的那把尺子,配合今天第 6 条论文读效果最好。
2. 把你六个 skill 的触发条件从散文抽成一份结构化配置 · 约 10 分钟 照 reverse-skill 的做法:它 41 条路由规则(R0–R40)配 163 个回归用例,改一条路由跑一次 CI 就知道有没有砍错。今天不用做到那个程度,先做最小一步——开一个表格,每个 skill 一行,写清「什么输入应该命中它」和「什么输入明确不该命中它」。写不出「不该命中」的那些 skill,就是你 description 写糊了的那些。
3. 拿 book-to-skill 跑一本你自己熟的书,对比它和你手写的结构差在哪 · 约 10 分钟
git clone https://github.com/virgiliojr94/book-to-skill,喂一本你读透了的技术书 PDF,让它产出 skill。重点不是用它的产物,是看差异:它抽出来的目录结构 vs 你手写大师.skill 时的结构。差的那部分是你手写时的隐性判断——那才是你 skill 真正的护城河,也是你下一篇长文的素材。