json-render 拆解:17k star 的 Generative UI,赌的是「别让模型写代码」
把 Vercel Labs 这个 17k star 的项目从 0 到 1 读了一遍:它用一棵扁平元素树加 RFC 6902 流式 patch,把「AI 生成界面」这件不可控的事变成可校验、可剪枝、可导出代码的工程问题。真正的取舍不在生图不在模型,而在数据结构。
Long-form essays on engineering, AI, and craft.
把 Vercel Labs 这个 17k star 的项目从 0 到 1 读了一遍:它用一棵扁平元素树加 RFC 6902 流式 patch,把「AI 生成界面」这件不可控的事变成可校验、可剪枝、可导出代码的工程问题。真正的取舍不在生图不在模型,而在数据结构。
Google 的 cwebp 是个 单文件转化器:cwebp input.png -o output.webp。它没有 --glob 也没有文件夹模式 —— 这不是设计缺陷,而是 Unix 哲学:保持一个目标单一,让 find/for/xargs 去编排。本文整理 5 个真实场景下的批量写法,以及 quality/preset/lossless 怎么选。
这是我拆的第六个技能仓库,也是唯一一个「私人工作流」型——微信解密、剪映无头生成、火山 ASR、X 切片、公众号批量导出,19 个技能。但最让我意外的是它的 fork 率:41.5%,是前五个仓库的 4 到 6 倍。原因不复杂——这些技能必须被改才能用(你自己的微信、你的 Obsidian 路径、你的账号),而每个 fork 出去的人第一件事就是改路径和配置。它的许可证也因此不是开源的,是「源可用 + 商用需授权」。另外有一个细节我觉得前五个仓库都该学:它的 CI 里装着一个隐私扫描器,会拦截私人路径、私钥和六种凭据形态——把「别提交敏感信息」从 README 里的一句请求,变成了会挂红的门禁。
这是我拆的第四个 Skill 仓库,也是 star 最多的一个(95,125)。前三个都在解决「怎么让 agent 做对一件事」,它解决的是另一个问题:「当你有 25 条规则,你怎么知道它们还在生效」。答案是一套三层评测框架——其中第二层用词法近似把「路由」变成了可确定、免费、能进 CI 的检查。另外两个我觉得该抄的是:每个技能都附一张「agent 的借口 vs 现实」反合理化表,以及一句关于训练与架构腐坏的洞察——「架构腐坏要几个月才显现,永远进不了权重,棘轮就是那个缺失的惩罚项」。
这是我拆的第五个仓库,也是第一个「会动手打东西」的——AI 自主渗透测试工具,6.3 万 star。但真正让我停下来的是一个不到 300 行的技能文件:反证与结案纪律。它规定每个候选漏洞只能以三种状态之一结束,没有第四种,「我往下看了」不算其中一种。而要判一个候选「安全」,你必须能说完一句话:因为某个具体位置的某个具体控制,在攻击者可达的每一条路径上、在危险动作之前生效。说不出这句话,你就不能标 ruled_out——那是把「我没证明出来」伪装成「我证明了没有」,而真实漏洞就是这样被漏掉的。
上一篇拆的封面 Skill 只有 300 行提示词。这一篇拆的 diagram-design 有 554 个文件、11 份 ADR、58 条本地关卡命令,4 万 star。读完我最强的感受是:Skill 的工程质量不取决于提示词写得多好,取决于有多少条规则被写成了 checker。它的每一句审美判断背后都有一道几何验证;更狠的是,每个 checker 还配了反向对抗测试——因为作者发现,一条只活在散文里的规则,真的会发出一堆坏例子。
前两篇拆的是 Skill 本身。这一篇拆的仓库,是给 AI agent 配了一门语言、一个编译器和一套运行时来做视频——112 个包、2026 个文件、一个半月做到 2315 star。它最关键的设计决策只有一句:把时间轴锚定在「词」上,而不是「秒」上。作者源码里根本没有秒和帧,时间是从语音证据里长出来的。这一句决定了它后面所有的能力:改一句台词时间轴自己重排、第二条视频几乎不花钱、以及一条完全零模型调用、成本精确为 0 的渲染路径。
我用了一段时间的封面生成 Skill,一直以为它的核心是「攒了九种好看风格」。直到认真拆了 peggykangkang02 的 xialingguo-ip 才发现,九种风格只是素材库——真正决定它能不能稳定出活的是另外四件事:一句「风格固定、主次灵活」的原则、一套不把人问烦的信息收集方式、一条「不写死真人 IP」的公共边界,以及一个「不把缩略图当交付」的自我约束。这篇逐层拆开。
我给自己门店的销售助理接上了一个 1188 篇《车型适配产品目录》的知识库。整个过程让我意识到:把知识库接进 AI,难的不是「接上」——接口通不通是半小时的事。真正的难点是「匹配」:资料形态是否匹配调用链、能力接入是否匹配行为约束、库里的内容是否匹配能说和不能说的边界。这篇完整拆解这四个匹配点,以及我用什么证据证明它真的接上了。
我把自己和 AI 一起『一页页读书』的机制拆成一个可复用 Skill:PDF 拆页、按物理页让 AI 讲解精华、追问互动、累积笔记,并靠 progress.json 精确管理阅读进度。这篇把它设计成系统的关键决策写清楚——为什么是『互动共读』而不是批量总结、为什么原文框是刚需、为什么进度要按物理页记。