AI 动态日报 · 2026-08-15(周六)
今天最该知道的一件事:Anthropic 官方第一次把 Claude Code 的 token 账单拆开讲了,缓存键、/rewind、@-mention 全是可抄的。
《AI 动态日报》是 Sway Lab 每天早上做的简报:抓取当天的 GitHub、Hacker News、arXiv、Hugging Face 等一手来源,筛出十条最值得读的,原样公开。它首先是写给 Sway 本人看的,所以文中的「你」指的是他。
今天最该知道的一件事:Anthropic 官方第一次把 Claude Code 的 token 账单拆开讲了,缓存键、/rewind、@-mention 全是可抄的。
Top 10
1. GLM-5.3 发布:Terminal-Bench 3.0 从 4.6 冲到 28.3,而且没重训基座 · 产品 / 官方发布 · 中文圈 · HN 1,025 pts / 514 条评论(今日 HN 第一),z.ai 官方博客 2026-08-14 智谱 Z.ai 的新一代编码模型。官方数据:Z.ai Code Bench 比 GLM-5.2 提升 50%,Max effort 下 34.5% vs 5.2 的 23.4%,且每题输出 token 从 96,000 降到 75,000;Terminal-Bench 3.0 从 4.6 → 28.3;官方称在同等 effort 下超过 Claude Opus 4.8 的 token 经济性。另一条被标题拎出来的是「emergent cyber capabilities」——CyberGym 上的安全研究能力超出了训练预期。 为什么值得注意:长时任务(long-horizon)是你 hermit-agent 的主战场,而 GLM-5.3 的增益全部集中在最长的那类 benchmark 上,且是不重训基座、只改后训练拿到的——这等于在说「harness 层和后训练层还有大量没榨干的空间」,正是你 skill 家族在做的事。开源权重因安全审查还未放出,暂时只能走 API。 🔗 https://z.ai/blog/glm-5.3 · 官方文档 https://docs.z.ai/guides/llm/glm-5.3
2. 《为什么 Opus 5 用起来感觉更差?》——不是模型退步,是 benchmark 在选择「不问就干」的模型 · 理念 / 争论 · HN 768 pts / 704 条评论(评论数今日全站第一),Mun logadan,2026-08-14 发表 作者的论点很干净:他不认为 Opus 5 能力退步(benchmark 上它比 4.7/4.8 强、逼近 Fable),但 4.7、4.8、Fable「用起来更舒服」,因为那些模型会在意图不清时停下来问、不擅自假设、不偷偷改你的计划。他归因于两股力量:一是各家追求「递归自举的自改进 AI」,二是刷榜压力——好的 benchmark 任务天然是自包含、可解、不需要问人的,于是训练过程系统性地奖励「在歧义面前大胆猜、且通常猜对」的模型,惩罚「停下来要澄清」的模型。而现实不是 benchmark。 为什么值得注意:这是今天最值得你写一篇的争论。你做 harness 和 skill 家族,正好站在「模型不问,那就让 harness 逼它问」的位置上——这是纯观察者给不出的判断。 🔗 https://mun-logadan.github.io/why-does-opus-5-feel-worse/ · HN https://news.ycombinator.com/item?id=49296740
3. Anthropic 官方拆解 Claude Code 的 token 账单:缓存键、/rewind、@-mention · 理念 / 方法论 · HN 130 pts / 86 条评论,claude.com/blog,作者 Lydia Hallie,2026-08-14 发表,5 分钟长文
第一次把机制讲透而不是给几条 tips。核心事实(全部来自原文):输出 token 约为输入的 5 倍价;缓存读 0.1x 输入价、缓存写最高 2x;/model、/effort、fast mode 都在缓存键上,中途切会把整段对话按全价重新 prefill(opusplan 进出 plan 模式就切一次模型);缓存 TTL 订阅是 1 小时、API key 是 5 分钟(ENABLE_PROMPT_CACHING_1H=1 可拉到 1 小时);/rewind 只砍掉尾部几轮、前面还在缓存里所以几乎免费,/compact 要重写整段对话所以永远有成本;@ 引用文件会在发送前直接附上,省掉一次 Read;MAX_THINKING_TOKENS=0 claude 是比 /effort low 更低一档。
为什么值得注意:你六个 skill 加 hermit 一堆 MCP,/context 里的开局占用大概率已经很吓人。这篇给了两条直接可执行的结构性建议:CLAUDE.md 只留具体指令、工作流类的挪进 skill(按需加载),本 session 用不到的 MCP 用 /mcp 关掉。
🔗 https://claude.com/blog/maximizing-the-value-of-your-claude-code-sessions
4. Graft:给 coding agent 加一层代码图,token 省 42%、SWE-bench 正确率 54%→66% · 仓库 · Show HN 38 pts / 40 条评论(08-14)· 2,687 stars / 230 forks,2026-07-03 建仓,08-13 推送,TypeScript,MIT,61 个 open issue
NanoNets 出的上下文层。README 给的是 162 次受控对照实验(同一个 agent、同一套文件工具、只换上下文):工具调用减少 46%、token 省 42%、耗时省 60%;正确率那一栏走的是 SWE-bench Verified 官方 harness,Cold Claude Code 54%、加 graft 66%(+12 分)。装法就两条命令:npm install -g @nanonets/graft 然后 graft init——它会建 graft/ 图并把 statusline + hooks 写进你的 .claude/,之后每轮自动把匹配节点塞进 prompt、后台重建图。无 daemon、无常驻索引,图就是文件。
为什么值得注意:今天最能直接上手的一条,而且它动的正是你熟的那层(hooks + .claude/)。graft init --dry-run 能先看它要碰哪些文件,风险可控。
🔗 https://github.com/NanoNets/Graft · HN https://news.ycombinator.com/item?id=49299985(Show HN 标题原文:“Claude Code hooks that cut grep tokens by 42%”)
5. qm:YC 自己做的「多人 agent harness」,17 天 13,558 星 · 仓库 · 13,558 stars / 1,595 forks,2026-07-29 建仓、2026-08-15 推送(今天),TypeScript,MIT,229 个 open issue yc-software 出品,定位是「给创业公司用的 agent,不是个人助理」。每个员工一个隔离工作区,各自有独立作用域的记忆、文件、keychain 视图、权限、cron、web app 和持久沙箱;同时能在 Slack 频道 / 群聊 / 项目里协作。最值得注意的一句在 README 里:「Pick your own harness and model」——Pi、OpenCode、Codex、Claude Code 驱动同一个核心,部署不绑任何厂商。skill 是作用域所有、按授权共享,管理员可提升到全组织,还能从 git 仓库导入 skill pack。 为什么值得注意:这是 agent-matrix / session-memory-skill 那条线上目前最完整的一个公开参照系。「scope 化的记忆 + 权限 + skill 授权提升」这套模型,比你自己从零推要快得多。 🔗 https://github.com/yc-software/qm
6. DarwinX:把 harness 自进化做成种群选择,模型冻结不动,Terminal-Bench 2.1 到 84.7% · 论文 · arXiv 2608.07545,2026-07-31 提交,cs.NE / cs.AI / cs.LG / cs.SE,12 位作者(Yifan Zhang、Yutong Dai、Juntao Tan、Luyu Yang、Rishi Mullur、Thai Hoang、Zhiyuan Hu、James Zhu 等)· Hugging Face Papers 59 upvotes 立论:agent 的能力不只在权重,也在 harness(prompt、工具、skill、控制流)。现有自改进循环是单谱系搜索,路径依赖、局部收益常常拖垮别的任务。DarwinX 改成对一个 harness 种群做选择、模型冻结:一份 preserve-and-extend 契约只接纳「扩展覆盖且不回归」的变体,archive 保留备选谱系供重组,失败证据 / 教师证据 / 自产证据共用同一个编辑接口,适应度直接来自每个 benchmark 自己的 verifier(无标准答案、无人工挑选优胜者)。一轮循环平均 +17 分:Terminal-Bench 2.1 在匹配基座上 +7.7 到 83.2%、在更强基座上到 84.7%;TerminalWorld held-out 68.3%;WebArena-Infinity 真实任务 pass@1 从 43.5% → 93.0%(audit-clean);一个 Terminal-Bench 2.1 上进化出的 harness 原样迁到 SWE-bench Verified 仍有效。 为什么值得注意:「不回归」那条契约是你 skill 家族最缺的东西——你现在改一个 skill 靠人眼判断有没有搞坏别的。这篇给的是可直接抄的工程约束,不是一个新框架。 🔗 https://arxiv.org/abs/2608.07545
7. Qwen 3.8 27B 上线 Hugging Face · 产品 / 官方发布 · 中文圈 · HN 871 pts / 571 条评论(今日 HN 第二)
阿里 Qwen 家族这一代的中量级开源权重,仓库是 FP8 量化版。从模型卡的 chat template 可以确认两件事:它是多模态原生(image / video 的 vision token 都在模板里);并且把 reasoning effort 做成了三档 xhigh / medium / low,默认 xhigh,可在请求级切换。
为什么值得注意:27B + FP8 意味着单卡可跑,是本地跑 agent 循环里少见的「多模态 + 可调思考预算」组合。你要做本地兜底或成本敏感的批量任务,这是目前最合适的一档;reasoning_effort 做进模板这个设计本身也值得抄进 lambda-lang。(注:08-13 快讯里的 Qwen3.8-2.4T-A95B 是同代旗舰 MoE,这条是能落地的小尺寸版,不是同一件事。)
🔗 https://huggingface.co/Qwen/Qwen3.8-27B-FP8
8. ego-lite:把你已登录的浏览器状态借给 agent,而不打扰你自己用 · 仓库 · 10,368 stars / 528 forks,GitHub Trending 日榜今日 +165,2026-04-16 建仓,08-14 推送,JavaScript,MIT,106 个 open issue
citrolabs 做的「给 AI agent 用的最快浏览器」,卖点写得很直白:把你的登录态共享给 Codex / Claude Code 这类 agent,而不干扰你本人的浏览器,零成本零配置。
为什么值得注意:这条直接打在你的痛点上。你的 browser-lock.sh 跑完会把自己起的 Chrome 停掉(ephemeral),所以「留着页面等扫码」这个模式一直不成立;小红书 / 知乎 / 飞书那几个需要登录态的抓取每次都要重来。ego-lite 的模型正好绕开这一层——值得拿一个非关键账号先试。
🔗 https://github.com/citrolabs/ego-lite
9. 《别做分类,让它幻觉》——用小模型做大规模分类的一个反直觉技巧 · 理念 / 方法论 · HN 216 pts / 85 条评论,Doug Turnbull(softwaredoug.com),2026-08-10 发表
问题是老问题:让 LLM 把「wood coffee table」归到几百个类目里的一个,标准做法是 structured output——在 Pydantic 里写一个 500 项的巨型 Literal,靠 provider 约束输出。作者指出这条路在小模型 / 大规模下又贵又有上限(能塞进去的枚举值有限),提出反过来做:先让模型自由「幻觉」出一个假想分类,再把这个自由文本映射回合法词表。
为什么值得注意:你的 skill 触发路由本质上就是分类问题(41 条路由规则那种)。把「约束输出」换成「自由生成 + 事后归一」,能让你用便宜得多的模型跑同样的路由,而且规则表变大时不会撑爆 schema。
🔗 https://softwaredoug.com/blog/2026/08/10/hypothetical-classifications
10. Google:用同态加密把「私密 AI」做成能落地的东西 · 产品 / 官方发布 · HN 270 pts / 129 条评论,blog.google 安全博客,2026-08-14 Google 官方讲他们怎么把同态加密(在密文上直接算,不解密)从学术玩具推到可用工程。 为什么值得注意:优先级不如上面几条,但方向上跟你有关——agent 要碰用户的邮件、文件、凭据,「数据不出域就能算」是这类权限问题唯一的结构性解法,而不是又一层 sandbox。存着,别急着用。 🔗 https://blog.google/security/how-google-is-making-private-ai-practical-with-homomorphic-encryption/
快讯(5 条)
- AutoDesign:元 harness 优化器递归改 harness,PosterBench 78.32 分、超商用 Claude Design 7.45 分 🔗 https://arxiv.org/abs/2608.13560(arXiv 2608.13560,08-13 提交,14 位作者,HF Papers 32 upvotes)
- deja-vu:索引你 coding agent 早就写到磁盘的历史 session,翻出「你早解过这题」 🔗 https://github.com/vshulcz/deja-vu(633 stars / 45 forks,Go,MIT,08-14 推送)
- holaOS:开源全能 agent 工作区,100+ 集成 + MCP,今日 GitHub 日榜 +769 🔗 https://github.com/holaboss-ai/holaOS(7,295 stars / 638 forks)
- Launch HN:Bullet(YC S26)主打「更快的 coding agent」 🔗 https://www.codewithbullet.com(HN 107 pts / 86 条评论,08-13)
- MCP-stama:Rust 写的零依赖极速 MCP server 🔗 https://github.com/StamManif/mcp-stama(Show HN 73 pts,08-13)
今天可以亲手试的
-
量一遍你自己的开局上下文,然后砍掉不用的 MCP 开一个全新 session(不是 resume),依次跑
/context、/model、/effort。看 CLAUDE.md + tool definitions + MCP 定义在你还没打字之前吃掉多少 token,用/mcp关掉本次用不到的 server。 · 约 10 分钟 · 依据:Top 10 第 3 条 -
在一个非关键仓库上试 Graft,先 dry-run
npm install -g @nanonets/graft cd <你的某个仓库> graft init --dry-run # 先看它要碰哪些文件,什么都不写 graft init --agents claude # 确认后再真装然后拿同一个任务在装前装后各跑一次,自己量 token,不要信 README 的 42%。 · 约 15 分钟 · 依据:Top 10 第 4 条
-
把 DarwinX 的「preserve-and-extend」契约手工套在你一个 skill 上 挑一个你最近改过的 skill,列出它原来覆盖的场景清单,改完之后逐条对一遍:新版本有没有扩展了覆盖但没让任何一条回归。不用写代码,就是把那份契约当 checklist 用一次,看你上次的改动能不能通过。 · 约 10 分钟 · 依据:Top 10 第 6 条