< 返回文章列表
ARTICLE.SYS
AI DAILY

AI 动态日报 · 2026-08-25(周二)

今天最该知道的一件事:DeepSeek Harness 开源 12 天 19.2 万星,插件仓库已经长出 122 个。

《AI 动态日报》是 Sway Lab 每天早上做的简报:抓取当天的 GitHub、Hacker News、arXiv、Hugging Face 等一手来源,筛出十条最值得读的,原样公开。它首先是写给 Sway 本人看的,所以文中的「你」指的是他。

今天最该知道的一件事:DeepSeek Harness 开源 12 天 19.2 万星,插件仓库已经长出 122 个。

Top 10

1. DeepSeek Harness 开源 12 天 19.2 万星,周边插件仓库 122 个——一个中文 agent 插件生态凭空长出来了 · 开源仓库 · 中文圈 · deepseek-ai/deepseek-harness 192,031 stars / 21,518 forks,2026-08-13 建仓(12 天),2026-08-21 推送,TypeScript,MIT,0 个 open issue;GitHub 搜索 dsh- 前缀且超过 100 星的仓库共 122 个,超过 500 星的 35 个,超过 1,000 星的 17 个(含少量同名误匹配,如 2014 年的网络取证工具 Dshell) 它的口号只有一句「万物皆插件」——核心只留一个跑循环的壳,界面、路由、记忆、侧边栏全部由第三方插件补。头部插件本身就是大项目:anywhere-labs/dsh-desktop 19,675★(桌面端,08-13 建仓)、awesome-dsh-plugin 12,268★、yjh051108/dsh-routing-suite 6,760★(注入器加模型路由)、zhu1090093659/dsh-web 5,917★、xiaobright/dsh-anchored-standard 3,746★、omdsh-dev/DSH-better-sidebar 2,816★、ccch1mneyyy/dsh-TUI 2,476★。 你正在做的 hermit 系列面对的正是同一个选择题:核心留多少、外面留多少接口。DSH 把「留得极少」这条路径推到了极端,而且它把生态涨速当成了验证——12 天 122 个插件仓库,这是「接口设计对不对」最直接的一次公开实验。中文圈的 agent 基础设施第一次出现这种量级的自发生态,值得你逐个翻头部插件的目录结构。 🔗 https://github.com/deepseek-ai/deepseek-harness

2. Fabien Sanglard 公开了他的 agent.md:22 条写死的代码风味,全是「我不想再说第二遍」的话 · 理念 / 方法论 · HN 394 pts / 171 条评论,fabiensanglard.net,2026-08-21 发表 《毁灭战士》代码解析的作者写了一年 LLM 辅助编程,结论是:模型写的代码能跑,但质量烂到「省下的时间全赔在清理上」。他的解法不是换模型,是把每次重复说的意见沉淀成一个 agent.md——不许用魔法数字、函数名不超过 30 个字符、用枚举别用布尔参数、早返回别嵌套、给逻辑块之间留空行、别说「你完全正确」给我冷冰冰的实话。他建议把 claude.md / gemini.md 软链到同一个 agent.md,一份配置吃遍所有 harness。 这条对你的价值不在那 22 条本身,在方法:他的每一条都来自「我第 N 次重复同一句话」这个触发器,而不是从最佳实践清单上抄的。你的 skill 家族可以直接拿这个当筛选器——凡是你在会话里说过三遍以上的,就该进文件;没说过三遍的,多半是你想象出来的规矩。 🔗 https://fabiensanglard.net/agent.md/index.html

3. 《AI 编程会阻止专家的诞生》:用 agent 需要的技能,恰好是 agent 会让你退化掉的那些 · 理念 / 争论 · HN 447 pts / 452 条评论(今日全站第四),Lars Faye,larsfaye.com 作者管这叫「熟练指挥官悖论」:今天从 AI 编程里获益最大的那批人,本事全是在 LLM 出现之前的十几年里练出来的;而刚入行的人被要求(有时是被强制)用同一套工具提速,却没有那段积累。结果是行业在向新人发出互相矛盾的信号——不用 AI 会被淘汰,用了 AI 又长不出判断力。他把这种人称作「专家型新手」:需要专家级技能才能负责任地用工具,但工具本身在阻断成为专家的那条路。 你写的私教 skill 正好卡在这个矛盾的正中间。这篇给了一个可以直接反驳或者直接采纳的立论:如果「摩擦」是技能形成的必要条件,那一个好的教学型 agent 就不该把摩擦全消掉,而该在正确的地方留住它。这是设计题,不是伦理题。 🔗 https://larsfaye.com/articles/ai-coding-will-prevent-expertise

4. Apache Maka 进孵化器:把模型消息、工具调用、工具结果、授权决策、终止事件全部写成只能追加的日志 · 开源仓库 · 2,907 stars / 305 forks,今日 +411(GitHub Trending 日榜)、本周 +1,313,2026-05-27 建仓,2026-08-24 推送,TypeScript,Apache-2.0,251 个 open issue 它自称「本地优先的 AI agent 工作台」,但真正的设计核心是那条只能追加不能改写的日志(append-only log,写进去就不再修改的记录方式):模型说了什么、调了哪个工具、工具回了什么、你批准还是拒绝了哪次授权、这一轮为什么结束——五类事件全部落成一条时间线。这是极少数把「事后能查」当第一目标而不是当日志功能来做的 agent 运行时。 你的 hermit 面临的最难受的问题之一就是「昨天那次它到底为什么这么干」。Maka 的事件模型可以直接抄——尤其是「授权决策」也当成一等事件记下来这一点,大多数 harness 只记工具调用,不记人在哪一步点了同意。 🔗 https://github.com/apache/maka

5. Vercel Labs 的 fx:用 Zig 写的编码 agent,二进制 7.8 MB,形态照着 Unix shell 而不是终端里的 IDE · 产品 / 官方发布 · 2,363 stars / 248 forks,2026-08-11 建仓,2026-08-25 仍在推送,Zig,Apache-2.0,148 个 open issue Vercel Labs 官方项目,定位写得很直白:为研究和「嵌进更大的系统里」而优化。从系统提示词到工具集全部走极简,输出风格刻意做成命令行管道那一挂,而不是满屏 TUI(终端图形界面)。模型无关,本地推理和云推理都能接,登录可以走 Vercel AI Gateway 或者已有的 ChatGPT 订阅(fx login codex)。README 顶部自己标着「实验性质,风险自负」。 7.8 MB 的静态二进制加上「可嵌入」这个明确目标,意味着它可以当成 hermit 的子进程直接塞进去——你不需要一个会抢终端的 agent,你需要一个能被别的程序调用的 agent。这类东西目前很少。 🔗 https://github.com/vercel-labs/fx

6. OpenAI 把 GPT-5.6 Sol 降价,并承诺至少撑到 11 月 21 日 · 产品 / 官方发布 · HN 289 pts / 262 条评论(讨论页 2026-08-24 15:22 UTC 发布);同一话题 08-22 另有一帖 94 pts / 78 条评论,标题写明降幅 20% 官方定价页面的更新,HN 首页讨论里争的主要是「降到什么时候」——标题里那句「至少到 11 月 21 日」是这次的关键信息,它把降价从一次促销变成了一个可以拿来做预算的时间窗。 你现在有多个 cron agent 每天在跑,token 成本是按天累加的固定支出。一个有明确到期日的降价窗口,值得你今天就去核一次自己那几条链路的实际单价——尤其是日报这种每天固定跑一次的任务。 🔗 https://developers.openai.com/api/docs/pricing 讨论:https://news.ycombinator.com/item?id=49421074

7. 《政务服务的 agent 洪水》:11 个辖区收集到 84 个疑似案例,公共服务正在被 agent 生成的申请淹没 · 论文 · HN 62 pts / 74 条评论,arXiv 2608.16603,2026-08-17 提交,3 位作者(Chris Schmitz、Lewis Hammond、Alan Chan) 论文提出一个新词并给了三样东西:一是基于 11 个辖区、84 个疑似案例的数据集,论证这种「洪水」今天已经在广泛发生,主要靠 LLM 极廉价地批量生成文本;二是一张风险矩阵,结论是「钱多且流程复杂」的服务最先被冲垮;三是把政府可选的应对手段逐条列了出来。 这是「agent 副作用」这个议题里少见的有数据的一篇,而不是又一次伦理表态。对你有用的是那张风险矩阵的思路:判断一个系统会不会被 agent 冲垮,看的是「单次交互的收益 ÷ 单次交互的成本」这个比值突然变了多少——这个判据能直接搬到你自己做的任何对外接口上。 🔗 https://arxiv.org/abs/2608.16603

8. 一篇被 LessWrong 转载的攻击面分析:模型可以吐一串「语义无意义但能打穿推理引擎」的 token,反向控制自己所在的那台机器 · 事故 / 安全 · HN 88 pts / 49 条评论,Boyd Kane(boydkane.com),2026-08-24 发表,6 分钟读完 思路很干净:agent 的动作跑在你的机器上(Claude Code、Codex 这类壳),但模型本身的推理跑在另一台带 GPU 的机器上。作者问的是——一个有恶意的模型能不能拿下那台跑权重的机器?那台机器是高价值目标:算力足够跑前沿模型、权重就在本地、而且在数据中心里享有比普通机器高得多的内网权限。主攻击路径不是提示词注入,是让模型输出一段专门去踩「加载权重、跑推理、解析输出 token」这套软件(比如 vLLM)漏洞的字节序列。 这跟你熟悉的越权方向是反的:你一直在防「agent 在我的机器上乱来」,这篇防的是「模型在推理服务商的机器上乱来」。它值得你读的地方是那条边界——推理服务本身也是攻击面,而你完全看不见它。 🔗 https://boydkane.com/essays/llms-could-control-their-host-machines-by-exploiting-inference-engines

9. shuohao-skills:五个 skill 串成一条流水线,把一本小说变成能直接喂给生成管线的短剧素材包 · 开源仓库 · 中文圈 · 1,976 stars / 243 forks,2026-08-06 建仓(19 天),2026-08-22 推送,JavaScript,Apache-2.0,仅 2 个 open issue 五段依次是:novel-outline 把小说拆成改编说明、人物表、爽点表、分集梗概、资产清单;novel-characters 出人物画像、形象提示词、音色提示词和角色设定图;novel-art 出场景与道具的美术设定(带一致性锚点、光照变体、尺度参照);novel-script 写剧本,逐集时长按语速换算,台词按角色聚合并带音色提示词直接对接语音合成;novel-storyboard 切分镜,硬性要求每个分镜 2–5 秒、每段生成不超过 15 秒,还会跟 MiniMax H3 的提示词逐字对账。Claude Code 和 codex 都能跑。 真正值得抄的不是短剧本身,是它的质量门设计——五个 skill 分别写了 14、11、10、17 道用脚本检查的质量门,不是让模型自己说「我完成了」。这跟你之前看的 SemaPLC 那篇论文是同一个思路,但这是一份跑得起来的中文实现,而且作者把「不做新决定」写进了分镜那一段的职责边界里。 🔗 https://github.com/eternityspring/shuohao-skills

10. 《你的 agent 不是模型》:一篇把模型 / 推理服务 / harness / agent 系统四层掰开的术语贴 · 理念 · HN 63 pts / 34 条评论,Joe Wright(code.joejag.com),2026-08-23 发表 作者受不了大家把「Claude」这个词同时用来指模型和 agent,写了一份短参考:最底下是模型(一堆浮点数);模型太大跑不动,所以有推理服务(Bedrock、Anthropic API,负责喂进去和算钱);服务外面包一层交互界面叫 harness(Claude Desktop、命令行工具都是);harness 加上工具和处理逻辑,才叫 agent 系统。他强调的那句是重点——MCP 和 skill 主要活在 harness 这一层,模型本身并不知道有 MCP 服务器或 skill 这回事,是 harness 决定把什么上下文和工具递给它。 你写中文内容时最缺的就是这套能站得住的术语分层。这篇可以直接当引用源,尤其是「模型不知道 skill 存在」这一句——中文圈把这两层混着说已经很久了,谁先把它讲清楚谁就占住这个词。 🔗 https://code.joejag.com/2026/your-agent-is-not-the-model.html

快讯(5 条)

今天可以亲手试的

1. 用「重复三遍」这个筛选器过一遍你自己的 skill 家族 · 约 10 分钟 翻最近 5 次会话记录,找出你对 agent 说过三遍以上的同一句要求;再打开你现有的 skill 文件,标出哪些条款你从来没在会话里说过。前者补进去,后者是你想象出来的规矩,删掉。命令:grep -ric "别\|不要\|不许" .claude/skills/*/SKILL.md 先看条款密度,再人工比对。对照读 Fabien 那 22 条:https://fabiensanglard.net/agent.md/index.html

2. 翻三个头部 DSH 插件的目录结构,看「万物皆插件」到底怎么切的 · 约 10 分钟

for r in anywhere-labs/dsh-desktop omdsh-dev/DSH-better-sidebar yjh051108/dsh-routing-suite; do
  echo "=== $r ==="
  gh api repos/$r/contents --jq '.[].name' | head -20
done

重点看三个仓库对「插件要向宿主注册什么」的约定是不是一致——这决定了 hermit 该不该学这套切法。

3. 把 shuohao-skills 装上,扔一段你喜欢的小说进去出人物表 · 约 10 分钟

git clone --depth 1 https://github.com/eternityspring/shuohao-skills /tmp/shuohao
ls /tmp/shuohao/skills

然后在 Claude Code 里跑 novel-outline,喂三章原文。真正要看的是它那 14 道脚本检查的质量门是怎么写的——这是当前唯一一份跑得起来的中文「不许模型自己宣布完成」实现。