AI 动态日报 · 2026-08-13(周四)
今天最该知道的一件事:DeepSeek V4 Pro 正式 GA,100 万上下文、输入每百万 0.435 美元。
《AI 动态日报》是 Sway Lab 每天早上做的简报:抓取当天的 GitHub、Hacker News、arXiv、Hugging Face 等一手来源,筛出十条最值得读的,原样公开。它首先是写给 Sway 本人看的,所以文中的「你」指的是他。
今天最该知道的一件事:DeepSeek V4 Pro 正式 GA,100 万上下文、输入每百万 0.435 美元。
Top 10
1. DeepSeek V4 Pro 0813 正式版发布:1M 上下文,输入 $0.435 / 百万 · 产品 / 官方发布 · 中文圈 · HN 720 pts / 270 条评论(今日 HN 第二)· OpenRouter 页面标注 2026-08-12 发布 大规模 MoE,这是 DeepSeek V4 Pro 的 GA(正式可用)版本,不再是预览。OpenRouter 上的硬参数:上下文 1,000,000,价格 输入 $0.435 / 输出 $0.87 每百万 token,目前只有一家 provider 托管、请求直接转发不做路由。 对你最直接的一条是价格和窗口的组合:1M 窗口配这个单价,意味着"把整个 session 历史原样喂回去"从奢侈变成了可选项。你在 hermit-agent 和 session-memory-skill 里为了省 token 做的那些压缩取舍,值得拿这个价位重新算一次账——有些压缩可能已经不值得做了。 🔗 https://openrouter.ai/deepseek/deepseek-v4-pro-0813 · HN 讨论 https://news.ycombinator.com/item?id=49274600
2. 「AI 正在消灭软件工程的中产阶级」 · 理念 / 争论 · Florian Herrengt,2026-08-11 发表 · HN 698 pts / 630 条评论(今日 HN 第三,评论数全站第一) 作者用两个场景对照:2020 年你休假回来发现代码库乱了,还能修;2026 年一个普通的周一早上,你打开电脑面对 7 个 PR,第一个就是 +24,506 / -3,938 行,配一段 AI 写的说明——团队从周五到周一的改动量,比过去你休假几周的还多。他的核心判断是 "AI 移除了速度限制":工程文化弱的项目现在失败得更快,而最要命的地方在于"对外行来说它看起来是work 的"——拉下分支跑一跑确实有东西,于是团队继续加码,直到没人知道任何东西是怎么运转的。文中那段对话是全篇的钩子:"数据是从哪来的?""我不知道,我问一下 Claude。" 这条对你有两层用:一是它给"agent 产出的代码谁来负责理解"这个问题提供了目前传播最广的表述(630 条评论),二是它反过来定义了 agent 基础设施该解的问题——不是让 agent 写得更多,而是让人验证得更快。你做 hermit-ui 时,"这段改动的意图链在哪"比"改了多少行"重要得多。 🔗 https://blog.florianherrengt.com/ai-removing-middle-class-software-engineering.html · HN 讨论 https://news.ycombinator.com/item?id=49271994
3. Zed 发布 Delta:把「对话」和「工作树」一起实时复制给整个团队 · 产品 / 官方发布 · Zed 官方博客,作者 Nathan Sobo,2026-08-12 · HN 373 pts / 122 条评论 Zed 团队新做了一个独立应用(不是往 Zed 里加功能):Delta,定位是"和 agent 一起写代码、并 review 它产出的多人环境"。底座叫 DeltaDB——把对话和 worktree 一起实时复制给同一个 thread 里的所有人,而且是跟你已有的 git 仓库配合:每次 commit 之间的所有编辑和对话都被捕获,你照常 commit/push,没装 Delta 的同事看到的仍然是一个普通 git 仓库。要解的问题说得很明确:commit-based 平台上评论挂在快照上,代码一变就过期;Delta 里评论可以挂在对话上、也可以挂在 worktree 的任意一行上(不管是 agent 昨天碰的还是人三年前写的),并随代码演化锚定。agent 就在 thread 里,跟你读同一份原始对话和决策——"东西看着不对时,你不用从 diff 反推意图,直接问 agent"。目前私有 beta。 这是第 2 条那个问题的一个具体答案,而且答案的形状值得你抄:意图不该丢在 commit 之间。你手上多个会话并行跑 agent(今天开工的 worktree 提示就是),"这段代码是哪次对话产出的"这件事你迟早要在 hermit 里解一遍。DeltaDB 选择"复制对话+工作树、但对外仍是普通 git"这个兼容路线,比另起一套版本控制现实得多。 🔗 https://zed.dev/blog/introducing-delta · HN 讨论 https://news.ycombinator.com/item?id=49276574
4. better-harness:不改你的 agent,改你 agent 周围那个循环 · 仓库 · 中文圈 · 1,815 stars / 150 forks,2026-07-21 建仓,2026-08-13 推送(今天),JavaScript,MIT,10 个 open issue Qoder(阿里)出的开源工具,一句话定位是 "Delegate coding to agents. Improve the loop around them."——它跑在你已经在用的那个 coding agent 里面,把项目证据和 session 证据变成排好优先级的改进项和可验证的下一步。三个设计取舍值得注意:① 没有统一入口,每个 host 有自己的安装/验证/调用/出报告步骤,README 里直接给了 Claude Code / Codex Desktop / Codex CLI / Qoder / Cursor / GitHub Copilot CLI 的分别写法,另外还支持 Qwen Code / Pi / Kimi Code / WorkBuddy / Grok(在 Host Adapter Matrix 里);② 行为断言限定在相关的 Task Episode 和周边项目机制上,不做全局结论;③ "证据缺失"是显式输出的,不是默默略过。报告形态按 host 分:Qoder / Cursor 出 host 原生 Canvas 报告,Claude Code / Codex / Qwen Code / Copilot / Kimi Code 出自包含 HTML + 配对的 Markdown。README 有简体中文版。 这是今天最贴你活儿的仓库。昨天 Evo-Bench 讲的是"怎么评价 harness 改动",这个讲的是"怎么从你自己的 session 里提出 harness 改动"——而且它已经支持 Claude Code,你六个 skill 跑出来的 session 就是它的输入。"missing evidence stays explicit" 这条尤其值得抄进你自己的 eval:不敢下结论的地方明写不敢,比编一个结论有用。 🔗 https://github.com/QoderAI/better-harness
5. 有人在冒充 ClaudeBot 之类的 AI 爬虫,跑全网漏洞扫描 · 事故 / 安全 · Known Agents「The Agentic Web Index」· HN 226 pts / 164 条评论 数据基于 5,000+ 个网站的实测流量。几个能引用的数字:机器人流量占全部访问的 35%(较前 90 天 ↓1%);其中 "agentrification"(机器人流量里属于 AI 的比例)29%,较前 90 天 ↑11%——这是全表涨得最猛的一项;robots.txt 遵守率 98.5%;AI chat 带来的人类访问引荐量只有 0.1%(↓9%)。Top Agents 榜上 ClaudeBot 以 27.0% 排第一(被归类为 AI Data Scraper),后面是 meta-externalagent 19.3%、Amazonbot 19.1%、GPTBot 9.5%、Bytespider 7.3%。而 HN 上被顶起来的是它的 Spoofing & Security 一节:有人伪装成 ClaudeBot 这类知名 AI 爬虫的 User-Agent,在跑大规模漏洞扫描——被冒充的正是流量份额第一的那个,这不是巧合:冒充份额最大的爬虫,最容易混进白名单。 两个用处。一是防守面:UA 自称是 AI agent 不构成任何身份证明,你要是在 hermit 里做过"放行 AI 爬虫"这类白名单,那条规则现在是个洞。二是进攻面的镜像——昨天那条 Claude Code 把用户真实邮箱写进 curl UA 的 issue,和今天这条是同一枚硬币的两面:出站请求头既会泄漏你的身份,也会被别人冒用。agent 的网络身份需要真的可验证(签名 / 反查 IP),不能靠字符串。 🔗 https://knownagents.com/insights · HN 讨论 https://news.ycombinator.com/item?id=49272569
6. SkillZip:不用跑评测,把一个膨胀的 skill 压回它最短的那个结构 · 论文 · arXiv 2608.11079,2026-08-11 提交,cs.AI,7 位作者(Xiaofan Bai、Hongqiang Lin、Chao Liu、Yantao Zhang、Xuan Jin、Xipeng Cao、Yuhong Li)· Hugging Face Papers 11 upvotes 问题描述得非常准:自进化 agent 靠"追加成功流程 + 追加失败修复"积累 skill,时间一长,同一条要求会在多个分支、示例和警告里被重述,公共动作序列被复制而不是被复用——skill 变得又贵(注入成本)又难维护。作者指出通用的 prompt 压缩在这儿不管用,因为 skill 不是一段平铺的文字:它的 name 和 description 决定何时适用,workflow 控制执行,tool / output contract 约束有效性,而罕见异常即使在采样任务里从没被触发过也可能是必要的。评测引导的压缩能测这些行为,但要跑 rollout、要花钱、还依赖压缩时用的那套评测集。SkillZip 的做法是免评测:把压缩定义成"找到这个 skill 最短的忠实结构解释",形式化为带类型的最小描述长度目标(skill contract + 残差),并对每一个抽取出的 trigger、workflow 边、tool 要求、obligation 和 output 字段施加硬覆盖约束。口号是 explain once, reference many——重复规则在它适用的作用域上只说一次,重复动作序列抽成共享过程,只把差异留成显式异常。两种模式:一次性的 one-shot(一次结构化抽取 + 确定性优化),和持续的 Zip-on-Write(每来一个自进化补丁就并进去,不重放任务、不重新解析全部历史)。 你有六个 skill,而且它们是长出来的不是设计出来的——这篇讲的就是你正在经历的那个膨胀。"罕见规则按构造保留"这条是它跟粗暴压缩的分水岭,也正是你不敢删 skill 里那些边角条款的原因。Zip-on-Write 这个增量模式尤其值得照着做一遍。 🔗 https://arxiv.org/abs/2608.11079
7. diagram-design:29 种编辑级图表,一个 skill,读一遍你的网站就配好色 · 仓库 · 10,433 stars / 674 forks,GitHub Trending 日榜第一、今日 +2,855,2026-04-16 建仓,2026-08-13 推送(今天),HTML,MIT 一个给 Claude Code / Codex / Pi 用的 agent skill,副标题是"你的设计师不会嫌弃的编辑级图表"。README 自陈的动机很朴素:每次要画架构图 / 流程图,问 Claude 得到的都是"通用圆角框",跟站点其余部分完全不搭,只能去 Figma 磨 30 分钟或者干脆不画。它给的答案是 27 种视觉类型 × 三种静态变体(minimal light / minimal dark / full-editorial),纯 HTML + SVG 自包含,没有构建步骤、没有 JavaScript、没有外部图片依赖,浏览器直接打开。宣称读一遍你的网站、60 秒对上你的品牌色。2.0 加了 Loop(带共享记忆中枢的飞轮图,虚线是写回),2.3 加了语义系统模式和可选的无障碍动效、静态输出仍是默认。还能把已有的 draw.io 或 Mermaid 源按指定格式/尺寸/详略重画。设计准则写得挺狠:"最高质量的动作通常是删除"、"强调色只留给读者最先该看的那 1–2 个东西"、目标密度 4/10。 两个用处叠在一起:一是你在做自媒体,知乎长文和推特 thread 的配图是硬需求,这个能直接产出;二是它本身是一个做得很好的 skill 样本——27 个类型不靠堆 prompt,靠"语义模式与布局分离"来控制类型数不膨胀,这个切法可以直接搬进你自己的 skill 设计。 🔗 https://github.com/cathrynlavery/diagram-design
8. Co-Evolution in Agentic Systems:一篇把「自进化」拆成三级阶梯的综述 · 论文 · arXiv 2608.10299,2026-08-10 提交,cs.CL,12+ 位作者(Qing Zong、Jiayu Liu、Junhao Shen、Zecong Tang、Linsi Wu、Yuxuan Liu、Rui Wang、Zhaowei Wang 等)· Hugging Face Papers 116 upvotes(今日第二高) 立论的起点是一个具体的局限:单实体自进化被静态学习语境卡住——任务固定、反馈固定,agent 再怎么自我改进也有天花板。这篇综述转向 co-evolution:多个 agent 和它们的环境互相施加适应压力。分类法是一个逐级褪去人工约束的三阶段阶梯:① Agent–Agent 共进化——通过动态的同伴适应,含对抗、协作、组织三种;② Agent–Environment 共进化——把这个循环扩展到会随 agent 变化的任务、反馈和交互空间;③ Meta 共进化——让进化机制本身变成可进化的。文末的开放问题正好是三个工程难题:怎么评测这类系统、怎么跨多组件扩展、以及怎么让越来越自主的进化过程保持安全可控。 这是理念占位的那一条,也是你 agent-matrix 和 emotion-system 的地图。它给了你一把尺子:你现在的 skill 自进化多半停在第①级(agent 之间互相改),而第②级"环境/任务本身也跟着变"是你还没动的地方。综述类论文的价值在参考文献网络——116 个 upvote 说明这份 taxonomy 正在被当共识用。 🔗 https://arxiv.org/abs/2608.10299
9. 一个人怎么用六个 agent 当员工:一份不吹牛的实录 · 理念 / 方法论 · Chad Arimura,2026-08-11 发表 · HN 95 pts / 45 条评论 开篇的免责声明就定了调:"这是人写的。我让 gtm-agent 审了一遍,然后把它的修改基本全撤回了,花的时间是直接发出去的 10 倍。"他明说不跟那些"上千个 agent、自改进循环"的说法凑热闹,先从六个开始:ea-agent(日程 + Linear 里当 PM)、ops-agent(盯性能和 Sentry,自己修 / 派给 dev-agent / 上报给人)、dev-agent(有几个仓库的 GitHub 权限)、gtm-agent(漏斗、流量、社媒,带写作和社媒管理 skill)、research-agent(长时异步研究出报告)、vps-agent(agent 机器的 root 权限,能新建 agent、加 MCP server 和 skill、做服务器维护,只对本人响应)。运行时和记忆这段最有信息量:每个 agent 由 SOUL.md + AGENTS.md + skills + tools + MCP servers + 每个 profile 一个 Mnemosyne memory bank + 一个同步到本机的共享 Obsidian wiki 定义。Obsidian 那段是他说的最实在的一句——它成了"业务操作手册",把流程沉淀下来,新 agent 起来就知道这儿的规矩。模型选择也很坦率:本来用 Anthropic 的 Fable,"被 API 账单拍了一下"、发现这种用法不能走订阅,就换成了 GPT-5.6 Sol(子 agent 用 Terra),并认为前沿模型在这类活儿上大体可互换。 你的 IDENTITY.md / AGENTS.md / evolution/ 这套跟他的 SOUL.md / AGENTS.md / memory bank 是收敛到同一个形状的——这是个独立验证。最值得抄的是"共享 wiki 当组织记忆":你现在每个 agent 的记忆是各自的,跨 agent 的"这儿的规矩"没有单一落点。另外那句"订阅不能用于这种编排、只能走 API 计费"是一条硬约束,你排 agent-matrix 的成本时用得上。 🔗 https://chad.cm/posts/2026-8-11-my-agent-setup · HN 讨论 https://news.ycombinator.com/item?id=49272484
10. semantica:把上下文做成图,而不是做成一段文本 · 仓库 · 5,718 stars / 624 forks,GitHub Trending 周榜本周 +3,585、日榜今日 +845,2025-06-25 建仓,2026-08-12 推送,Python,MIT,67 个 open issue 定位一句话:"Graph-Native Infrastructure for Context and Accountable AI Systems"——图原生的上下文与可问责 AI 系统基础设施。它同时上了今天的日榜和本周的周榜,是本周榜上除 Cloudflare Computer 之外增速最靠前的一个,而且是本榜里少数建仓超过一年(2025-06-25)还在加速的项目——不是一周窜起来的热度。 "accountable"(可问责)这个词是它跟一堆记忆库的区别:图结构天然带来源和路径,能回答"这个结论是从哪几条证据来的"。这正好接上今天第 2、第 3 条的同一个主题——agent 时代真正稀缺的是可追溯,不是产出量。你的 session-memory-skill 现在大概率是扁平检索,图原生是另一条路;67 个 open issue 说明它还在长,当参考实现读比当依赖装合适。 🔗 https://github.com/semantica-agi/semantica
快讯(5 条)
- Grok 4.6 发布,主打长时 agent,AA 智能指数 61 分、与 GPT-5.6 Sol 持平 🔗 https://x.ai/news/grok-4-6(HN 391 pts / 389 条评论)
- Qwen3.8-2.4T-A95B 上 Hugging Face,2.4 万亿参数 MoE 🔗 https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B(HN 481 pts / 102 条评论)
- Hax:用 C 写的极简终端 coding agent 🔗 https://usehax.dev/(HN 85 pts / 28 条评论)
- xerj:给 agent 用的索引式搜索,自称比 grep 省 40 倍 token,兼容 Elasticsearch 🔗 https://github.com/xerj-org/xerj(1,316 stars / 289 forks,Rust,今日仍在推)
- llm-space:桌面应用,逐步查看 harness 每一步、重放失败、跑评测 🔗 https://github.com/deer-flow/llm-space(1,586 stars / 161 forks,MIT)
今天可以亲手试的
1. 用 better-harness 让 agent 审一遍你自己的 session · 约 15 分钟
npx @qoder-ai/better-harness(npm 包名 @qoder-ai/better-harness,MIT)。注意它没有统一入口——按 README 里 Claude Code 那一节的专属步骤走,别照抄别的 host 的命令。Claude Code 走的是"自包含 HTML + 配对 Markdown"那条输出路径。挑一个你最近折腾得最久的 skill 目录跑,重点看它把哪些地方标成了 "missing evidence"——那些就是你 harness 里没有可观测性的位置,比它给的改进建议更有价值。
2. 装 diagram-design,给知乎那篇长文出一张架构图 · 约 10 分钟 仓库 https://github.com/cathrynlavery/diagram-design ,MIT,作为 Claude Code skill 装。先让它读 swaylab.ai 取品牌色(README 声称 60 秒对色),然后拿今天第 8 条那个"共进化三阶梯"画一张 Layer stack 或 Loop 图。产出是自包含 HTML + SVG,浏览器直接开、直接截图。
3. 拿 SkillZip 的"explain once, reference many"给自己的 skill 做一次人工体检 · 约 10 分钟 不用等代码。挑你六个 skill 里最长的那个,只做三件事:① 找出在多个分支里被重述的同一条要求,提到它真正适用的那个作用域上,只留一份;② 找出被复制粘贴的动作序列,抽成一个共享过程;③ 剩下的差异写成显式异常。做完对比一下字数。论文强调的那条边界要守住:罕见规则不能因为"没触发过"就删——那正是评测引导的压缩会误伤的地方。