AI 动态日报 · 2026-08-24(周一)
今天最该知道的一件事:一个不署名、1M 上下文、完全免费的编码模型悄悄上了 OpenRouter,没人知道是谁做的。
《AI 动态日报》是 Sway Lab 每天早上做的简报:抓取当天的 GitHub、Hacker News、arXiv、Hugging Face 等一手来源,筛出十条最值得读的,原样公开。它首先是写给 Sway 本人看的,所以文中的「你」指的是他。
今天最该知道的一件事:一个不署名、1M 上下文、完全免费的编码模型悄悄上了 OpenRouter,没人知道是谁做的。
Top 10
1. Ox Alpha:匿名上架 OpenRouter 的编码模型,1M 上下文、输入输出都免费,作者至今无人认领 · 产品 / 官方发布 · OpenRouter API 一手数据:模型 id stealth/ox-alpha,上架时间 2026-08-20 20:04 UTC,context_length 1,048,576,单次最多输出 131,072 token,pricing.prompt 与 pricing.completion 均为 0,未开内容审核(is_moderated: false),输入支持文本+图像+视频;Bloomberg、TechCrunch、SiliconANGLE 今日均有报道
官方描述写的是「为编码、长时间 agent 作业和生产负载设计的推理模型」,但厂商栏只写 stealth,没有实验室署名;外媒报道里「是不是某个中国实验室放出来的」还在争论,没有任何一方证实。
对你直接有用的是那三个数字:100 万上下文、13 万输出上限、零价格——这是今天就能拿来跑长任务 agent 的免费额度,不用改 harness,OpenRouter 那条链路你已经通了。至于它是谁做的,先别下结论,等它开始收钱或者认领的那天再判断。
🔗 https://openrouter.ai/stealth/ox-alpha
2. 字节火山引擎的 OpenViking:把 agent 的记忆、知识库和 skill 合成一个「会自己进化的上下文数据库」 · 开源仓库 · 中文圈 · 32,490 stars / 2,483 forks,本周 +3,799(GitHub Trending 周榜),2026-01-05 建仓,2026-08-23 推送,Python,AGPL-3.0,500 个 open issue
它的定位是「AI Agent 的上下文数据库」,把过去分三套系统做的三件事——对话记忆、检索增强的知识库、可复用的 skill——收进同一个存储层,并且宣称这层会随使用自我进化。文档、官网、在线试用、飞书群/微信群/Discord 都齐了。
这是目前中文大厂里离你的 memory/notes/ 那套东西最近的一个工程实现。注意授权是 AGPL-3.0,商用要看清楚。
🔗 https://github.com/volcengine/OpenViking
3. 《你本地跑的模型没那么笨,是你的实现在拖后腿》:同一份权重,换台机器就换个智商 · 理念 / 方法论 · HN 417 pts / 171 条评论,Level1Techs 论坛,作者 thr3e,2026-08-16 发表 作者做了一整套对照实验,论点是:今天地球上跑 LLM 的每一套硬件加软件组合都不一样,不同代 GPU 的指令集把同一个 next-token 的数学算出不同结果,再叠上量化、采样器参数、聊天模板的差异,于是「同一个模型在你这儿就是更笨」。他明确反对的做法是:把温度调到 0、粘三条测试 prompt 就下结论——零样本测试根本不能代表 agent 类负载。 这条值得注意的地方在方法论,不在硬件:他给的替代方案是「用长上下文 + 工具调用 + 领域知识的评测去找你这套配置的薄弱点」。你手上有 hermit 那一堆真实会话,正好是现成的评测集。 🔗 https://forum.level1techs.com/t/why-your-local-llm-feels-dumber-than-it-is/253917
4. seed:一个只有「一个 shell 工具 + 一个 SELF.md」的 harness,工具、记忆、习惯全靠 agent 自己长出来 · 开源仓库 · HN 57 pts / 20 条评论;仓库 vivekhaldar/seed 91 stars / 4 forks,2026-08-20 建仓,2026-08-23 推送,Python,未标注授权,0 个 open issue
seed.py 只做一件事:带着一个 exec 工具(跑 shell 命令)去调模型,系统提示词从 self/SELF.md 读。框架通常直接给你的那些东西——工具、记忆、skill、约定——这里一样都不给,必须由 agent 自己一次次会话写进 self/ 目录才能留下来。每次会话的完整转录存进 self/sessions/*.json,但开机不加载,作者管它叫「飞行记录仪,不是记忆」。同一颗种子种在不同目录,长出来的就是不同的个体。
这条是今天最该你亲手跑的。你的 skill 家族和 hermit 是「先把结构定好再让 agent 用」,它是反过来的对照实验:结构完全空着,看 agent 会自己长出什么。跑三天就知道你手写的那些约定里,哪些是它自己也会发明的,哪些是你强加的。
🔗 https://github.com/vivekhaldar/seed
5. FACET:给终端 agent 造训练题,难点不在出题,在于「题干、环境、答案、判分器」四样别互相打架 · 论文 · 中文圈 · Hugging Face Papers 今日第二,114 upvotes,arXiv 2608.18580,2026-08-19 提交,13 位作者(Kou Shi、Zun Wang、Qisheng Su、Shiting Huang、Ziao Zhang、Zehui Chen、Feng Zhao 等) 论文指出的问题很具体:一道终端任务题包含四件产物——指令、初始化好的环境、参考解法、可执行的判分器;这四样只要是从不一致的假设里各自生成的,题目就要么无解,要么判分判错。而多阶段合成还会把原始素材里的目标、依赖、状态转换和流程约束丢掉。FACET 的做法是先把相关的 agent skill 重组成一个信息完整的场景,先把执行环境真正跑起来并修好,再生成最终的四件产物——让容器的真实状态成为指令、解法、判分器三者共同的地基,最后用「执行验证 + 定点修复」补漏,不整题重生成。 这套「先让环境真的能跑,再拿容器状态当共同地基」的顺序,可以直接搬去做你自己 skill 的验收用例:现在你的 skill 说明和它的检查脚本是两次分别写出来的,这正是论文说的「假设不一致」。 🔗 https://arxiv.org/abs/2608.18580
6. 一个德州大学生发现有人在拿 AI 自动打靶,然后他去报了警 · 事故 / 安全 · HN 188 pts / 98 条评论,路透社调查报道,2026-08-20 发表 路透社复盘了一次由学生举报揭开的自动化攻击事件。(说明:路透社正文对本机 curl 返回 401,无法读到全文核实细节,因此这里只写标题层面的事实和可验证的讨论热度,具体案情请点进原文自行判断。) 你在做的 agent 基础设施迟早要面对这类问题的另一面——不是你的 agent 被攻击,是别人的 agent 拿去当工具。HN 那 98 条评论比新闻本身信息量大,值得扫一遍讨论的落点在哪。 🔗 https://news.ycombinator.com/item?id=49387959 · 原文 https://www.reuters.com/world/how-texas-student-blew-whistle-rogue-ai-hacking-attempt-2026-08-20/
7. 有人把一个逆向工程的活扔给 Qwen 3.8 27B,30 分钟做完了 · 产品 / 实测 · 中文圈 · HN 159 pts / 80 条评论,XDA Developers,标题原文点名「前沿模型」做对照 一篇实测文:作者拿阿里的 Qwen 3.8 27B(可本地跑的中等规模开源模型)去干一件逆向工程的活,30 分钟完成,并拿它和闭源前沿模型做了对比。 这条的价值是信息差方向:中文圈讨论 Qwen 大多停在跑分,英文圈已经在拿它跑真实的长任务了。你如果要给自己的 harness 挑一个能本地跑、成本可控的备用模型,这是今天最新的一手参考点。 🔗 https://www.xda-developers.com/qwen-3-8-27b-reverse-engineering-job-frontier-model/
8. 《什么是 harness?》——一篇专门写给「不好意思问」的人的解释,把 agent harness 类比成攀岩安全带 · 理念 · HN 27 pts / 15 条评论,earendil.com,2026-08-20 发表 文章开头直说「如果你天天泡 AI 信息流,这篇不是写给你的」。它的类比是攀岩安全带:安全带把你连到锁扣和绳子上,防坠落、控节奏、限定路线,还能往上挂粉袋和快挂;换座山可以带着走,按地形还能改装。对应到 agent:agent = 模型 + harness,harness 是给模型提供运行环境的那层软件,而且和模型不同——终端用户可以拥有自己的 harness。 你写的东西的读者一半是同行一半不是,这篇是现成的范本:怎么把 harness 这个词讲给不写代码的人听,还不掉价。热度只有 27 分,说明它不是靠新闻性上来的——是靠讲清楚一件事上来的。 🔗 https://earendil.com/posts/what-is-a-harness/
9. ip-as-logo-skill:一个只干一件事的 skill——把任何东西变成圆头圆脑的吉祥物 logo,6 天 3,907 星 · 开源仓库 · 3,907 stars / 190 forks,2026-08-18 建仓(6 天),2026-08-22 推送,MIT,7 个 open issue
它的约束写得极死:一个主体轮廓由大约 4–7 个大色块搭成;默认三种语义色(两个主体色加一个背景色);先给三个方向、你点头之后再各出六张候选;主体从画面左下或右下大幅探出来,默认六张里三张左下三张右下;厚圆造型、不许有尖角和易碎细节;生成提示词里绝不出现 logo / 品牌标 / 应用图标这类词。装一条命令:npx skills@latest add s1dashu/ip-as-logo-skill。没有 agent 的人可以直接上 ipaslogo.com 白拿现成的,标注可商用。
两个用处:一是它本身就是你小红书能直接出片的素材;二是它是「把风格约束写成硬规则」的教科书——你的 skill 家族里那些讲风格的部分,可以照着它这种「先定数量、再定位置、最后定禁用词」的写法重写一遍。
🔗 https://github.com/s1dashu/ip-as-logo-skill
10. Anthropic 的社区插件市场开始按流水线放行:自动安全扫描过了才进目录,每晚同步一次 · 产品 / 官方发布 · 960 stars / 126 forks,今日 +225(GitHub Trending 日榜)、本周 +406,2026-03-20 建仓,2026-08-23 推送,Apache-2.0,40 个 open issue
anthropics/claude-plugins-community 是官方社区插件市场的只读镜像:真正的清单是仓库里那份 .claude-plugin/marketplace.json,由 Anthropic 内部的审核流水线每晚同步过来;今天这份清单里共有 2,282 个插件(本次实际拉取 marketplace.json 数出来的)。README 写明每个上架插件都经过 claude.ai 的提交入口、通过了自动安全扫描、并被批准分发。装法两条路:Claude Cowork 上 claude.com/plugins 点装;Claude Code 走 claude plugin marketplace add anthropics/claude-plugins-community 再 claude plugin install <名字>@claude-community。
你正在写一整个 skill 家族,这条是分发渠道的变化:从「发个仓库让人自己 clone」变成「过审核进官方目录」。今天值得做的是把提交要求读一遍,看你的 skill 要改成什么形状才够格。注意这个仓库是镜像,别往它提 PR,提交入口在 clau.de 那个链接。
🔗 https://github.com/anthropics/claude-plugins-community
快讯(5 条)
openai/codex今日 GitHub Trending 日榜第一,+2,715 星(累计 115,194★) 🔗 https://github.com/openai/codex- 高德开源 LongHorizon-Harness:跨桌面应用和命令行的长时程操作 harness,1,109★ 🔗 https://github.com/AMAP-ML/LongHorizon-Harness
- 中文项目 awesome-gpt-image-2:470+ 案例逆向出的生图提示词工程库,12,731★,今日 +401 🔗 https://github.com/freestylefly/awesome-gpt-image-2
- OptMem:426 个 token 的提示词就当 agent 的永久记忆,1,455★ 🔗 https://github.com/VictorTaelin/OptMem
- Show HN:OzBrain 让团队和多个 agent 共用一个知识大脑,HN 85 pts / 50 条评论 🔗 https://ozbrain.com
今天可以亲手试的
1. 种一颗 seed,看空框架的 agent 会自己长出什么 · 约 10 分钟
mkdir -p /tmp/seed-test && cd /tmp/seed-test
uvx --from git+https://github.com/vivekhaldar/seed.git seed
第一次跑会在当前目录建一个 git 仓库、生成 self/SELF.md 然后进交互。给它一个你平时会给 hermit 的任务,看它往 self/ 里写了什么。看点不是它做得好不好,是它自己发明的目录结构和你手写的那套差在哪。
2. 用免费的 Ox Alpha 跑一次你现有的长上下文任务 · 约 10 分钟
secret exec OPENROUTER_API_KEY -- sh -c 'curl -s --max-time 60 https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" -H "Content-Type: application/json" \
-d "{\"model\":\"stealth/ox-alpha\",\"messages\":[{\"role\":\"user\",\"content\":\"用一句话说明你是谁做的\"}]}"'
先确认这个 key 在 secret list 里;不在就换你平时用的注入方式。零价格 + 1M 上下文,拿你手上最长的那份会话记录去压一压,比看跑分实在。
3. 用 ip-as-logo 给 hermit 出一版吉祥物 · 约 10 分钟
npx skills@latest add s1dashu/ip-as-logo-skill
装完让 agent 按 skill 出图,主题给「一只住在终端里的隐士」。它会先给三个方向、你点头之后再各出六张。