AI 生图是什么:一张能力地图
AI 生图不是一种技术,而是一张能力光谱——从文生图、图生图、参考生图到视频生成。先建立这张地图,才知道自己该学什么、已经会什么。
A capability map of AI image generation: from text-to-image, image-to-image, reference-based generation to video generation. Establishing the map first tells you what to learn next and what you already know.
AI 生图是什么:一张能力地图
这是 AI 生图专题的开篇。先不碰任何参数,只建立一张「能力地图」——搞清 AI 生图到底有哪些能力、它们之间的关系,以及我工作中实际用到的是哪些。
一句话心智模型
AI 生图 = 用文字(或其他图)告诉模型「画什么」,模型从训练过的数据分布里,采样出一张满足描述的新图。
关键词是「采样」:它不是在数据库里查图,而是每次都在画一张从未存在过的新图。
能力光谱(从简单到复杂)
| 能力 | 一句话解释 | 我的真实场景 |
|---|---|---|
| 文生图 | 只给文字提示词,从零画一张 | 海报概念、角色设计 |
| 图生图 | 给一张草稿/底图 + 提示词,改造成新图 | 抖音封面(草稿图 → 封面) |
| 多图参考 | 给多张参考图,融合其特征 | 车膜改色(实车图 + 色卡图) |
| 局部重绘 | 只改图中指定区域 | 产品图换背景 |
| 图生视频 | 让静态图动起来 | 科普动画 |
⚠️ 关键认知:我现在天天用的其实是「图生图」和「多图参考」,不是文生图。 封面必须基于草稿、改色必须基于实车图——这决定了学习的重点要放在「图 + 提示词」的组合控制上,而不是纯靠文字憋图。
底层原理预告:Diffusion 是什么
先埋一个概念,后面单独展开:现在的生图模型大多是 Diffusion(扩散)模型。
它的工作方式可以想象成:
- 训练时:把大量真实图片一步步加噪声,直到变成纯噪声,让模型学会「怎么把噪声还原成图」
- 生成时:从一个纯噪声出发,让模型一步步「去噪」,每步根据提示词修正方向,最终得到一张清晰的图
所以生图模型的本质是一个极度擅长「去噪」的网络,提示词是它去噪时的方向指引。
配套阅读练习 ⭐
- 打开你的 Hermes 生图链路(
~/hermes-scripts/gen.py或封面 SKILL),看看每个调用走的是哪个能力:image_generate(文生图)还是image_edit/image_multi_reference(图生图/多参考)? - 思考:为什么抖音封面的执行电路强制要求先有草稿图?(提示:和「可控性」有关,下一章展开)
- 给自己现在的工作列一张表:哪些场景用的是文生图、哪些是图生图?你会发现 80% 都在「图 + 文」。
一句话总结
AI 生图的能力光谱里,我真正值钱的是「图生图」——而所有能力的底层,都是 Diffusion 的去噪网络。 下一篇就讲 Diffusion 到底怎么把噪声变成画。