< 返回文章列表
ARTICLE.SYS
AI DAILY

AI 动态日报 · 2026-08-15(周六)

今天最该知道的一件事:Anthropic 官方第一次把 Claude Code 的 token 账单拆开讲了,缓存键、/rewind、@-mention 全是可抄的。

《AI 动态日报》是 Sway Lab 每天早上做的简报:抓取当天的 GitHub、Hacker News、arXiv、Hugging Face 等一手来源,筛出十条最值得读的,原样公开。它首先是写给 Sway 本人看的,所以文中的「你」指的是他。

今天最该知道的一件事:Anthropic 官方第一次把 Claude Code 的 token 账单拆开讲了,缓存键、/rewind、@-mention 全是可抄的。

Top 10

1. GLM-5.3 发布:Terminal-Bench 3.0 从 4.6 冲到 28.3,而且没重训基座 · 产品 / 官方发布 · 中文圈 · HN 1,025 pts / 514 条评论(今日 HN 第一),z.ai 官方博客 2026-08-14 智谱 Z.ai 的新一代编码模型。官方数据:Z.ai Code Bench 比 GLM-5.2 提升 50%,Max effort 下 34.5% vs 5.2 的 23.4%,且每题输出 token 从 96,000 降到 75,000;Terminal-Bench 3.0 从 4.6 → 28.3;官方称在同等 effort 下超过 Claude Opus 4.8 的 token 经济性。另一条被标题拎出来的是「emergent cyber capabilities」——CyberGym 上的安全研究能力超出了训练预期。 为什么值得注意:长时任务(long-horizon)是你 hermit-agent 的主战场,而 GLM-5.3 的增益全部集中在最长的那类 benchmark 上,且是不重训基座、只改后训练拿到的——这等于在说「harness 层和后训练层还有大量没榨干的空间」,正是你 skill 家族在做的事。开源权重因安全审查还未放出,暂时只能走 API。 🔗 https://z.ai/blog/glm-5.3 · 官方文档 https://docs.z.ai/guides/llm/glm-5.3

2. 《为什么 Opus 5 用起来感觉更差?》——不是模型退步,是 benchmark 在选择「不问就干」的模型 · 理念 / 争论 · HN 768 pts / 704 条评论(评论数今日全站第一),Mun logadan,2026-08-14 发表 作者的论点很干净:他不认为 Opus 5 能力退步(benchmark 上它比 4.7/4.8 强、逼近 Fable),但 4.7、4.8、Fable「用起来更舒服」,因为那些模型会在意图不清时停下来问、不擅自假设、不偷偷改你的计划。他归因于两股力量:一是各家追求「递归自举的自改进 AI」,二是刷榜压力——好的 benchmark 任务天然是自包含、可解、不需要问人的,于是训练过程系统性地奖励「在歧义面前大胆猜、且通常猜对」的模型,惩罚「停下来要澄清」的模型。而现实不是 benchmark。 为什么值得注意:这是今天最值得你写一篇的争论。你做 harness 和 skill 家族,正好站在「模型不问,那就让 harness 逼它问」的位置上——这是纯观察者给不出的判断。 🔗 https://mun-logadan.github.io/why-does-opus-5-feel-worse/ · HN https://news.ycombinator.com/item?id=49296740

3. Anthropic 官方拆解 Claude Code 的 token 账单:缓存键、/rewind、@-mention · 理念 / 方法论 · HN 130 pts / 86 条评论,claude.com/blog,作者 Lydia Hallie,2026-08-14 发表,5 分钟长文 第一次把机制讲透而不是给几条 tips。核心事实(全部来自原文):输出 token 约为输入的 5 倍价;缓存读 0.1x 输入价、缓存写最高 2x;/model/effort、fast mode 都在缓存键上,中途切会把整段对话按全价重新 prefill(opusplan 进出 plan 模式就切一次模型);缓存 TTL 订阅是 1 小时、API key 是 5 分钟(ENABLE_PROMPT_CACHING_1H=1 可拉到 1 小时);/rewind 只砍掉尾部几轮、前面还在缓存里所以几乎免费,/compact 要重写整段对话所以永远有成本;@ 引用文件会在发送前直接附上,省掉一次 Read;MAX_THINKING_TOKENS=0 claude 是比 /effort low 更低一档。 为什么值得注意:你六个 skill 加 hermit 一堆 MCP,/context 里的开局占用大概率已经很吓人。这篇给了两条直接可执行的结构性建议:CLAUDE.md 只留具体指令、工作流类的挪进 skill(按需加载),本 session 用不到的 MCP 用 /mcp 关掉。 🔗 https://claude.com/blog/maximizing-the-value-of-your-claude-code-sessions

4. Graft:给 coding agent 加一层代码图,token 省 42%、SWE-bench 正确率 54%→66% · 仓库 · Show HN 38 pts / 40 条评论(08-14)· 2,687 stars / 230 forks,2026-07-03 建仓,08-13 推送,TypeScript,MIT,61 个 open issue NanoNets 出的上下文层。README 给的是 162 次受控对照实验(同一个 agent、同一套文件工具、只换上下文):工具调用减少 46%、token 省 42%、耗时省 60%;正确率那一栏走的是 SWE-bench Verified 官方 harness,Cold Claude Code 54%、加 graft 66%(+12 分)。装法就两条命令:npm install -g @nanonets/graft 然后 graft init——它会建 graft/ 图并把 statusline + hooks 写进你的 .claude/,之后每轮自动把匹配节点塞进 prompt、后台重建图。无 daemon、无常驻索引,图就是文件。 为什么值得注意:今天最能直接上手的一条,而且它动的正是你熟的那层(hooks + .claude/)。graft init --dry-run 能先看它要碰哪些文件,风险可控。 🔗 https://github.com/NanoNets/Graft · HN https://news.ycombinator.com/item?id=49299985(Show HN 标题原文:“Claude Code hooks that cut grep tokens by 42%”)

5. qm:YC 自己做的「多人 agent harness」,17 天 13,558 星 · 仓库 · 13,558 stars / 1,595 forks,2026-07-29 建仓、2026-08-15 推送(今天),TypeScript,MIT,229 个 open issue yc-software 出品,定位是「给创业公司用的 agent,不是个人助理」。每个员工一个隔离工作区,各自有独立作用域的记忆、文件、keychain 视图、权限、cron、web app 和持久沙箱;同时能在 Slack 频道 / 群聊 / 项目里协作。最值得注意的一句在 README 里:「Pick your own harness and model」——Pi、OpenCode、Codex、Claude Code 驱动同一个核心,部署不绑任何厂商。skill 是作用域所有、按授权共享,管理员可提升到全组织,还能从 git 仓库导入 skill pack。 为什么值得注意:这是 agent-matrix / session-memory-skill 那条线上目前最完整的一个公开参照系。「scope 化的记忆 + 权限 + skill 授权提升」这套模型,比你自己从零推要快得多。 🔗 https://github.com/yc-software/qm

6. DarwinX:把 harness 自进化做成种群选择,模型冻结不动,Terminal-Bench 2.1 到 84.7% · 论文 · arXiv 2608.07545,2026-07-31 提交,cs.NE / cs.AI / cs.LG / cs.SE,12 位作者(Yifan Zhang、Yutong Dai、Juntao Tan、Luyu Yang、Rishi Mullur、Thai Hoang、Zhiyuan Hu、James Zhu 等)· Hugging Face Papers 59 upvotes 立论:agent 的能力不只在权重,也在 harness(prompt、工具、skill、控制流)。现有自改进循环是单谱系搜索,路径依赖、局部收益常常拖垮别的任务。DarwinX 改成对一个 harness 种群做选择、模型冻结:一份 preserve-and-extend 契约只接纳「扩展覆盖且不回归」的变体,archive 保留备选谱系供重组,失败证据 / 教师证据 / 自产证据共用同一个编辑接口,适应度直接来自每个 benchmark 自己的 verifier(无标准答案、无人工挑选优胜者)。一轮循环平均 +17 分:Terminal-Bench 2.1 在匹配基座上 +7.7 到 83.2%、在更强基座上到 84.7%;TerminalWorld held-out 68.3%;WebArena-Infinity 真实任务 pass@1 从 43.5% → 93.0%(audit-clean);一个 Terminal-Bench 2.1 上进化出的 harness 原样迁到 SWE-bench Verified 仍有效。 为什么值得注意:「不回归」那条契约是你 skill 家族最缺的东西——你现在改一个 skill 靠人眼判断有没有搞坏别的。这篇给的是可直接抄的工程约束,不是一个新框架。 🔗 https://arxiv.org/abs/2608.07545

7. Qwen 3.8 27B 上线 Hugging Face · 产品 / 官方发布 · 中文圈 · HN 871 pts / 571 条评论(今日 HN 第二) 阿里 Qwen 家族这一代的中量级开源权重,仓库是 FP8 量化版。从模型卡的 chat template 可以确认两件事:它是多模态原生(image / video 的 vision token 都在模板里);并且把 reasoning effort 做成了三档 xhigh / medium / low,默认 xhigh,可在请求级切换。 为什么值得注意:27B + FP8 意味着单卡可跑,是本地跑 agent 循环里少见的「多模态 + 可调思考预算」组合。你要做本地兜底或成本敏感的批量任务,这是目前最合适的一档;reasoning_effort 做进模板这个设计本身也值得抄进 lambda-lang。(注:08-13 快讯里的 Qwen3.8-2.4T-A95B 是同代旗舰 MoE,这条是能落地的小尺寸版,不是同一件事。) 🔗 https://huggingface.co/Qwen/Qwen3.8-27B-FP8

8. ego-lite:把你已登录的浏览器状态借给 agent,而不打扰你自己用 · 仓库 · 10,368 stars / 528 forks,GitHub Trending 日榜今日 +165,2026-04-16 建仓,08-14 推送,JavaScript,MIT,106 个 open issue citrolabs 做的「给 AI agent 用的最快浏览器」,卖点写得很直白:把你的登录态共享给 Codex / Claude Code 这类 agent,而不干扰你本人的浏览器,零成本零配置。 为什么值得注意:这条直接打在你的痛点上。你的 browser-lock.sh 跑完会把自己起的 Chrome 停掉(ephemeral),所以「留着页面等扫码」这个模式一直不成立;小红书 / 知乎 / 飞书那几个需要登录态的抓取每次都要重来。ego-lite 的模型正好绕开这一层——值得拿一个非关键账号先试。 🔗 https://github.com/citrolabs/ego-lite

9. 《别做分类,让它幻觉》——用小模型做大规模分类的一个反直觉技巧 · 理念 / 方法论 · HN 216 pts / 85 条评论,Doug Turnbull(softwaredoug.com),2026-08-10 发表 问题是老问题:让 LLM 把「wood coffee table」归到几百个类目里的一个,标准做法是 structured output——在 Pydantic 里写一个 500 项的巨型 Literal,靠 provider 约束输出。作者指出这条路在小模型 / 大规模下又贵又有上限(能塞进去的枚举值有限),提出反过来做:先让模型自由「幻觉」出一个假想分类,再把这个自由文本映射回合法词表。 为什么值得注意:你的 skill 触发路由本质上就是分类问题(41 条路由规则那种)。把「约束输出」换成「自由生成 + 事后归一」,能让你用便宜得多的模型跑同样的路由,而且规则表变大时不会撑爆 schema。 🔗 https://softwaredoug.com/blog/2026/08/10/hypothetical-classifications

10. Google:用同态加密把「私密 AI」做成能落地的东西 · 产品 / 官方发布 · HN 270 pts / 129 条评论,blog.google 安全博客,2026-08-14 Google 官方讲他们怎么把同态加密(在密文上直接算,不解密)从学术玩具推到可用工程。 为什么值得注意:优先级不如上面几条,但方向上跟你有关——agent 要碰用户的邮件、文件、凭据,「数据不出域就能算」是这类权限问题唯一的结构性解法,而不是又一层 sandbox。存着,别急着用。 🔗 https://blog.google/security/how-google-is-making-private-ai-practical-with-homomorphic-encryption/

快讯(5 条)

今天可以亲手试的

  1. 量一遍你自己的开局上下文,然后砍掉不用的 MCP 开一个全新 session(不是 resume),依次跑 /context/model/effort。看 CLAUDE.md + tool definitions + MCP 定义在你还没打字之前吃掉多少 token,用 /mcp 关掉本次用不到的 server。 · 约 10 分钟 · 依据:Top 10 第 3 条

  2. 在一个非关键仓库上试 Graft,先 dry-run

    npm install -g @nanonets/graft
    cd <你的某个仓库>
    graft init --dry-run          # 先看它要碰哪些文件,什么都不写
    graft init --agents claude    # 确认后再真装
    

    然后拿同一个任务在装前装后各跑一次,自己量 token,不要信 README 的 42%。 · 约 15 分钟 · 依据:Top 10 第 4 条

  3. 把 DarwinX 的「preserve-and-extend」契约手工套在你一个 skill 上 挑一个你最近改过的 skill,列出它原来覆盖的场景清单,改完之后逐条对一遍:新版本有没有扩展了覆盖但没让任何一条回归。不用写代码,就是把那份契约当 checklist 用一次,看你上次的改动能不能通过。 · 约 10 分钟 · 依据:Top 10 第 6 条