AI 动态日报 · 2026-08-17(周一)
今天最该知道的一件事:Stripe 超 70 亿美元收购 OpenRouter——agent 的模型路由层,被支付公司买走了。
《AI 动态日报》是 Sway Lab 每天早上做的简报:抓取当天的 GitHub、Hacker News、arXiv、Hugging Face 等一手来源,筛出十条最值得读的,原样公开。它首先是写给 Sway 本人看的,所以文中的「你」指的是他。
今天最该知道的一件事:Stripe 超 70 亿美元收购 OpenRouter——agent 的模型路由层,被支付公司买走了。
Top 10
1. Stripe 敲定超 70 亿美元收购 OpenRouter · 产品 / 官方发布 · HN 171 pts / 115 条评论,Bloomberg 首发(约 6 小时前),TechCrunch / Fortune / Seeking Alpha 均已跟进 彭博报道 Stripe 已敲定协议,以超过 70 亿美元收购模型路由网关 OpenRouter;Stripe 对 TechCrunch 表示「不评论传闻」。可对照的硬数字(TechCrunch):OpenRouter 今年 5 月刚完成 1.13 亿美元 B 轮、当时报道估值 13 亿美元(投资方含红杉、a16z、Menlo、CapitalG)——三个月后成交价放大了 5 倍多;它自报 800 万全球用户、接入 400+ 模型,CEO Alex Atallah 一直自称「AI 界的 Stripe」,现在字面成真。 为什么值得你读:OpenRouter 是大量 agent 项目默认的模型接入层,你自己在 OpenSquilla 实测时就撞过它的 403(账号级模型可用性)。支付公司买下路由层,说明「模型调用」正在被当成清算业务来做——供应策略、模型准入、折扣结构都可能重排,依赖它的下游要重测。配合第 5 条 token 灰市一起读,是同一件事的正规军与游击队两面。 🔗 https://techcrunch.com/2026/08/16/stripe-will-reportedly-acquire-ai-gateway-startup-openrouter-for-7b/ · HN https://news.ycombinator.com/item?id=49323381 · Bloomberg(付费墙,未直接抓取)https://www.bloomberg.com/news/articles/2026-08-16/stripe-nears-deal-to-buy-ai-firm-openrouter-for-over-7-billion
2. Claude 各代系统提示词全文页被顶上 HN 第二:从 300 词涨到 3000+,Opus 5 里写着「安全路由」 · 产品 / 官方发布 · HN 526 pts / 222 条评论,platform.claude.com 官方文档 Anthropic 文档站的 System Prompts 页收录了 claude.ai 及移动端各代模型系统提示词全文(自 4.6 代起每个模型 ID 一个固定快照;不适用于 API)。HN 讨论翻出来的干货:早期系统提示词 300 来词,最新的 3000+ 词;Opus 5 的提示词里明写了一段「安全路由」——用户选的可能是 Fable 5,但请求会因 safeguards 路由机制被转到 Opus 5 处理;simonw 把历代提示词重建成了 git 提交历史,逐版 diff 一眼可读。 为什么值得你读:这是最大规模生产环境的上下文工程一手教材——什么行为约束值得花 token 写进每一轮,Anthropic 用四年迭代替你试过了。simonw 的「把 prompt 版本化成 git 历史」这招今天就能抄到你自己的 agent 上;「你以为固定的模型可能被静默路由」对 harness 作者也是个要记的变量。 🔗 https://platform.claude.com/docs/en/release-notes/system-prompts · HN https://news.ycombinator.com/item?id=49319556 · diff 历史 https://github.com/simonw/research
3. Anthropic:《新兴多智能体系统的模式与问题》——45 个 agent 组蜂群挖漏洞的一手实验 · 论文 / 研究 · HN 179 pts / 130 条评论,anthropic.com/research,2026-08-13 发表(经 HN 浮上来) Frontier Red Team 的研究文:给 45 个 agent 各配一台虚拟机 + 一个共享论坛 + 同一段提示词,让它们在 15 个开源项目里挖漏洞、互相同行评审,另设一个仲裁 agent 终审「新且有效」;对照组是各自为战的并行 agent(测了 Claude Mythos Preview 和 Opus 4.8 两个模型)。结论的骨架:agent 把彼此当「工具调用」(输入输出清晰)时协作良好,把彼此当「有自己目标的长寿对等体」时就不行;个体层面无害的行为怪癖,会在系统层面复合成意外的全局失败。协调蜂群以大致恒定的速率持续挖出新漏洞。 为什么值得你读:这就是 agent-matrix 的主战场。「工具式协作 vs 对等体协作」这条边界可以直接当你的设计准则用——能压成工具调用的协作就别做成自由对话;「仲裁 agent 终审」的三层结构(干活 / 互审 / 仲裁)也值得抄进你的 workflow 编排。 🔗 https://www.anthropic.com/research/multiagent-systems · HN https://news.ycombinator.com/item?id=49316271
4. 《模型在故意变笨》:厂商正在用世界知识换推理能力 · 理念 / 方法论 · HN 254 pts / 146 条评论,Walter van der Giessen(w4g1.dev),2026-08-17 发表(今天) 数字链很硬:GLM-5.2 以约 400 亿激活参数拿下 AIME 2026 的 99.2%,Qwen3.5 以 170 亿拿 91.3%,而 2023 年传闻 2800 亿激活参数的 GPT-4 几乎解不了 AIME;但同一批模型在 SimpleQA(无工具事实问答)上,最好成绩也只有 53%(Gemini 2.5 Pro),Qwen3.5 4B/9B 的知识幻觉率被 Artificial Analysis 测到 80–82%。作者的解释:事实要占参数(「物理学」系列论文测到约每参数 2 比特知识),推理是一小套反复复用的程序、压缩得多——事实会过时,程序不会,所以厂商刻意把深度知识扔出权重,只留「广度」用来判断该查什么。 为什么值得你读:这是「模型默认知识在外部」的宣言——工具、检索、记忆从加分项变成模型设计的前提。你的 skill 家族和 session-memory 正是那个「外置知识层」;反过来选型时也要记住:小模型跑 agent 循环,harness 不补知识层就是裸奔。 🔗 https://w4g1.dev/blog/models-are-getting-dumber-on-purpose · HN https://news.ycombinator.com/item?id=49322695
5. 《谁在倒卖 token?》——一手暗访 AI 额度灰市:单个卖家日供 10 万美元 · 理念 / 长文 · HN 221 pts / 88 条评论,Matt Lenhard(vectoral.com),2026-08-10 发表 作者直接给经纪人发邮件暗访:有卖家开价每天 10 万美元规模的推理额度,不给原始 key、而是做代理转发(从一池 key 里挑一个转你的请求);创业者收到的直销报价是 40–50% off;挂牌市场(AI Credits / AICreditMart)标价 30–80% off;自称「批量采购价」的 CheapCredits 全模型一律 60 折——作者的判断是行价根本给不出这个折扣,供给来路存疑(他明说这是猜测)。Telegram 和 Reddit 上还有零售层。 为什么值得你读:两层。一是安全:折扣额度 = 你的请求过别人的代理池,prompt 和数据顺手被看光,这类「省钱方案」在你评估任何三方网关时都该按此模型审。 🔗 https://vectoral.com/blog/who-are-the-token-brokers · HN https://news.ycombinator.com/item?id=49320611
6. Anthropic 文本水印争议:Gruber 发文骂「这是对写作的败坏」 · 事故 / 争议 · HN 136 pts / 136 条评论,Daring Fireball,2026-08-16 发表 按 Gruber 的转述:Anthropic 宣布为合规(欧盟法规)将对所有 Claude 模型的全部生成内容加水印、包括纯文本;最初的支持文档《How Claude Marks AI-Generated Content》声称水印「不可感知、不改变意义/质量/可读性」但没讲原理;随后另一篇《How Claude's Text Watermark Works》承认做法是推理时的选词隐写——用词元选择留下指纹,事后可概率性检测。Gruber 的立场:语义层面的选词水印就是在改动文本本身,「imperceptible」的说法站不住;评论区 136 条、赞评比 1:1,争议度拉满。 为什么值得你读:你的产出流水线就是 Claude 写中文然后上平台——文本可被概率检测这件事如果落地,「AI 检测」生态、平台判定、你的改稿流程全都要重估。注意:本条事实全部来自 Gruber 的转述,Anthropic 两篇原文档本次未抓取,动笔引用前必须先读原文。 🔗 https://daringfireball.net/2026/08/anthropics_watermark_text_adulteration_in_claude_is_a_perversion_of_writing · HN https://news.ycombinator.com/item?id=49324087
7. microsoft/skill-recorder:把「你亲手干一遍」录下来,直接生成 agent skill · 仓库 · 3,176 stars / 320 forks,2026-07-29 建仓(两周半),2026-08-12 推送,TypeScript,MIT,30 个 open issue 微软官方出品:录一次真实工作过程(屏幕、点击、应用切换、可选口述),用 Copilot CLI 把它重建成「一个意图 + 有序步骤」,人工确认后一键生成可复用的 SKILL.md 或定时 Automation。两个设计点很讲究:优先翻译成 agent 原生工具(gh CLI、web_fetch)而不是回放 UI 点击;从单次示范泛化——「录你提交一张表单,agent 学会提交所有表单」。源码发布制安装,需要 Copilot 访问权,macOS 为主平台。 为什么值得你读:你手写 skill 的成本曲线要被这条路线改变——「示范一遍→生成 skill」对不写代码的人是从零到一。而「探索一次→固化成原生工具脚本」正是你 browser-automation skill 里已经在用的理念,微软把它做成了产品;对比它生成的 SKILL.md 和你手写的结构,差异就是你的隐性判断。 🔗 https://github.com/microsoft/skill-recorder
8. human-writing:「活人感写作」skill,12 天 2,771 星 · 仓库 · 中文圈 · 2,771 stars / 229 forks,2026-08-05 建仓,v1.1.0,Python,MIT,仅 7 个 open issue 中文作者的通用创作与改稿 skill,口号是「让 AI 写的中文读起来像一个具体的人在说话」。结构分四层:前置关先问「你手上有没有东西可写」(材料不够就去查、查不到就追问或缩短篇幅,不凑字数);然后管三件事——材料(核事实数字引语)、推进(每段必须带来新东西)、中文(白话打底、清报告腔);终检一道关:逐段查原地转圈、砍重复解释、调长短句节奏,用检查脚本拦冒号滥用、破折号、「不是……而是……」翻案腔和 AI 黑话——脚本只管写明的硬规则,风格判断留给人。安装方式就是把仓库链接发给你的 agent。 为什么值得你读:这跟你的 renwei-writing skill 是同一个问题域,12 天 2,771 星说明需求有多硬。最值得对表的是它的分层:把「可判定的硬规则」下沉进脚本、把风格留在提示词层——你的去 AI 味清单如果也这么拆,就能加回归测试了。 🔗 https://github.com/KKKKhazix/human-writing
9. cordis:DeepSeek Harness 的插件底座,四年老仓库冲上趋势日榜涨幅第一 · 仓库 · 中文圈 · 今日 +720 星、总 4,728 stars / 253 forks,2022-05-17 建仓,2026-08-13 推送,TypeScript,MIT 自称「时空可组合性元框架」(Meta-Framework of Spatiotemporal Composability),配一篇同名论文仓库。08-14 头条 DeepSeek Harness 的「一切皆插件」跑的就是它;它的入门文档(cordis-primer)现在直接挂在 DSH 官方文档站下。DSH 发布三天,把一个 2022 年的基础设施仓库送上了趋势榜——今天 GitHub 日榜涨幅第一。 为什么值得你读:hermit-agent 的插件化如果要参考一个经受过「被大厂产品选中」检验的模型,读它比读 DSH 本体更快——DSH 的模型、工具、skill、沙箱全是 cordis 插件协议上的应用。注意 README 明写 API 未稳定、随时可能变,抄结构别抄接口。 🔗 https://github.com/cordiverse/cordis · 文档 https://deepseek-harness.github.io/deepseek-harness/reference/cordis-primer
10. Spatial Memory Agent:冻结模型、不调参,把「验证过的经验」写成可复用教训 · 论文 · arXiv 2608.12743,2026-08-13 提交,8 位作者(Haokai Zhang 等)· Hugging Face Papers 40 upvotes
问题设定:不做后训练、推理时也不依赖外部空间工具(深度估计 / 3D 重建),一个冻结的视觉语言模型能不能靠免参数更新的自进化提高空间推理?做法:在可验证环境里让模型作答并拿到奖励,把验证过的经验蒸馏成可复用、可迁移的教训(lessons),运行时挂载。
为什么值得你读:这就是你 evolution/lessons.md 的机制被写成了论文——「跑过、验证过的失败与成功 → 结构化教训 → 下次运行时注入」。它给出的增量是「教训何时够格入库」的判据来自环境验证信号而不是模型自评,这一条正好补你现在「人眼判断要不要写进 lessons」的缺口。
🔗 https://arxiv.org/abs/2608.12743
快讯(5 条)
- 路透:Nvidia 大幅缩减可能为 OpenAI 数据中心提供的融资担保(HN 90 pts) 🔗 https://www.reuters.com/business/nvidia-scales-back-250-billion-openai-data-center-guarantee-wsj-reports-2026-08-14/
- MathCode:数学专用编码 agent,仓库 624 星,HN 54 pts 🔗 https://math-ai-org.github.io/mathcode/
- Show HN:wildstatic——所有用户共享同一份记忆的公共 AI,69 pts / 62 条评论 🔗 https://news.ycombinator.com/item?id=49319814
- jit:把笔记本上的明文密钥收进统一凭据层,Go,Show HN 51 pts / 74 条评论 🔗 https://github.com/jitpass/jit
- macro:Rust 团队工作台,邮件/文档/任务/agent 共享记忆互链,周 +2,588 星(总 3,407) 🔗 https://github.com/macro-inc/macro
今天可以亲手试的
1. 装 human-writing,拿你自己的一段稿子跟 renwei-writing 对打 · 约 10 分钟
给任一 agent 会话发一句:帮我安装这个skill:https://github.com/KKKKhazix/human-writing(或手动 clone 到 .claude/skills/)。挑一段你最近写的小红书笔记草稿,让它按「活人感写作」改一遍,再用你自己的 renwei-writing 改同一段,并排对比砍了什么、留了什么。差异清单就是两边 skill 的判断分歧——最值钱的部分。
2. 用 simonw 的 git 历史 diff 一遍 Opus 4.8 → Opus 5 的系统提示词 · 约 5 分钟 打开 https://github.com/simonw/research 里 extract-system-prompts 的提交历史,看 Opus 4.8 → Opus 5 那次 diff,重点找「safeguards 路由」和行为约束的新增段。顺手可以抄这个做法本身:把你 hermit agent 的 system prompt / CLAUDE.md 也版本化成专门的 git 历史,每次改动一个 commit,回看演化一目了然。
3. 跑一次 skill-recorder:录一个你每周都重复的活 · 约 15 分钟(macOS,需 GitHub Copilot 访问权) 从 https://github.com/microsoft/skill-recorder/releases/latest 拷贝 macOS 安装命令(源码发布制,本机构建,不装全局)。录一次你真实重复的操作(比如整理某个后台数据),看它重建的「意图 + 步骤」和生成的 SKILL.md,跟你手写的 skill 结构差在哪。