
AI入门补充第一课——生图(持续更新中)
最近经常有朋友问我几个问题:这么多 Agent 选哪个?还有就是生成图片怎么这么麻烦?我相信不久又有朋友会问我:这生图怎么这么模糊?生成的字怎么乱码?我让他生成这个角色,怎么他生成的别的角色?
这些都很值得说一下,我一个一个来。
首先,选哪个 Agent?
我认为:用 GPT 就去用 Codex(ChatGPT),用 GLM 就去用 ZCode,其他的都可以通融一下。
我这么推荐 ZCode 他竟然不给我广告费😠。不过前段时间 ZCode 爆出了偷用户数据的出生行为,而且现在其他几个大厂或多或少都在偷数据,可信的就只有开源的几个 Agent 了(不过 ZCode 目前爆这么大的雷而且开源了,短期应该不会那么明目张胆了)。

- DeepSeek、GLM、Kimi、Qwen 甚至 Grok 都可以使用 ZCode,做事更稳一些,也更通用一些(可能是因为 ZCode 以 opencode 为底子,所以挺通用的)
- GPT 就去用 Codex
- 至于什么 DSH、Kimi Code、Grok Build 都可以到后面觉得需要了再用
并没有说某个模型一定在某个客户端就好用,到另一个客户端就完全没法用。比如 DeepSeek 在 DSH 可能表现最好,但到 ZCode 可能更稳一些(做出来的东西“石山”的概率更小一点这个样子)。
不过如果你不怕麻烦,也可以试试给每个 Agent 配自己的专武,可能效果会更好一些。
市面上主要的生图模型
补充:不包括国模,虽然诸如 Qwen 生图和 Seedance 生图都非常不错,但是在市面上渠道最多的还是 gpt image 系列、谷歌 nanobanana 系列和老马的 grok 系列。

1. gpt-image 系列
这个系列在大多榜单眼里可以说是世界第一生图模型,原因很简单:
- 生图质量稳定,不需要你手动大量调试提示词,他都能生成质量还可以的效果,可以说是最适合小白了;
- 生图更加华丽,所以看起来更好看(不过也因此导致他 AI 感会浓一些)。
缺点也很明显:
- 噪点太强,有很强的噪点鱼鳞感;
- 太华丽导致 AI 味有点强。


gpt-image-2.5-sunbrust
新一代世界第一生图模型,相比 flare 生成更细致,相比 image2 质量更高、细节更多,支持 max 生图质量挡位。
gpt-image-2.5-flare
sunbrust 的加速版本,生成速度更快,不过质量稍微低一点。
gpt-image-2
老一派世界第一生图模型,清晰度高、质量高,还便宜,不过在逻辑和细节上不如 2.5,还是用 2.5 吧。
2. 谷歌 Gemini 系列
nanobanana pro
老牌世界顶尖生图模型,但是现在有点老了,不介绍了。
nanobanana 2
比 pro 新一点,便宜一点,但貌似质量还不如 pro。
总之等 2.5pro 出来我再介绍吧。
3. 老马 Grok 系列
grok-imagine-image-2
最高貌似只有 2k,然后生图质量整体不如 gpt-image 系列。但是尺度可能大一点:GPT 很多不能生成的(比如泳装)Grok 可能可以生成(当然只是大一点,想做不太好的东西这个模型也不行)。
依旧没太大值得看的,跳过。

4. NovelAI 系列
22 年那阵开始爆火的二次元人物 AI 绘图,大家可能还有印象,而那个就是 NovelAI 公司系列模型,如今已经进阶到了 V5 系列。
- 这个系列完全为二次元而制作,并不适合二次元画风以外的任何生图
- 生图没有限制(就是那个没有限制)
- 所以这个系列主要也还是用在酒馆或者二次元美图或者表情包上



诸如此类的。
而且很特殊的是:生图时可以直接指定某些画师风格、某些特定角色、调整某些参数等等,最后生图会根据参数弄出非常非常符合你期待的图。
不过这个生图需要专门的工具,比较复杂我也不太懂,需要的话我后面学了再介绍吧。
链接:https://nai.rinko.ai/sign-up?aff=IiMu
这个是一个公益站(没办法充值,只能靠签到领积分),可以免费生图试试。具体参数怎么调、怎么配置,大家自己摸索看看吧(生成小图应该是免费的,大家可以配置一下看看怎么样是不花积分)。
补充:上面的几个生图模型,等我后面用得多了再给大家介绍特点(主要还是用 gpt-image 系列,因为便宜加上上手容易)。
常见问题
我让 gpt-image-2 生成真寻这个角色的图,他怎么给我生成了个不知道是哪个的角色?
然后大家可能就会说这个模型怎么这么笨。其实这个问题很清楚:gpt-image-2 模型他作为生图模型,并不知道真寻是谁(主要是生图模型训练的时候可能并没有详细告诉他真寻是谁,只是说给你这个角色的这些数据,学习怎么画之类的)。
那该怎么解决这个问题呢?最简单的方法就是给他参考图,让他了解这个角色大概长什么样子就行了。
其次还有几个问题:每次都要我手动找图告诉他吗?不能自动找吗?生图不能批量生图吗?生图能更高分辨率吗?能更高质量吗?
这些问题我们都可以通过 Agent 解决
首先明确什么是分辨率——可以理解成清晰度,4K、2K、1K 和你看视频的 1080p、720p 是一样的,1K 你就当成是 1080p 就好理解了。
其次什么是质量——生图的时候可以选择 low、medium、high 甚至 xhigh、max 挡位的 quality(质量),其实就是细节度的问题。质量越高,花的越多、想的越多,生成的细节都更高(比如文字会更清晰,乱码情况会少一点)。
另外还有一个问题——为什么我让 ChatGPT 生图,他不给我生成?——因为生图需要生图模型,但是你给 Agent 选择了用某个模型(比如 gpt-5.6-sol),这就导致虽然你的 Key 里有生图模型,但是他没办法调用,因为你设置了用 gpt-5.6-sol 模型。(订阅账号可以是因为订阅账号内部用 imagegen 技能做了调整)
所以想让 Agent 生图,实际上只需要让 Agent 知道你的 Key 和 URL,然后通过你电脑向算力中心发起请求就行了。
教程:用 Cherry Studio 的 Agent 功能生图
补充:Cherry Studio 的聊天,在你和他说了非常非常多东西以后可能出现一直报错的问题,这个情况很正常,大概是因为你聊天太多以后他上下文超支了,然后超出上下文就会报错了(而且聊天竟然还没有上下文压缩,只有清除上下文,这个不太好,要注意一下)。
但是 Cherry Studio 不止有聊天,也有自己的 Agent 功能的!现在开始介绍一下这个 Agent 功能。
1. 进入工作栏目

2. 添加智能体并选择模型与权限

提示:Claude 适合工程,推荐 Claude 这个,其他俩不适合新人。权限如果给了完全访问,就不用再每次点同意执行了。
3. 设置工作场所
可以专门新开一个文件夹。

4. 进入文件夹,新建文本,按图写入自己的 Key 和 URL


补充:这里为什么要这样呢?因为你的 Agent 想要调用 API Key 和 URL,肯定需要连接到 API Key 和 URL;但我们之前提到过了,你给他设置模型以后他没办法连接到你之前设置的模型,所以我们这里直接新开一个地方告诉他应该用哪个 Key 和 URL 来进行生图(按理来说你直接把 Key 和 URL 发给他也行,但是模型大概率会告诉你自己不能这么干、太危险了、可能泄露 Key,所以还是这样更省心)。
5. 进行生图
跟他说你的 Key 和 URL 在哪里,然后你要选择什么模型、参数调多少(比如分辨率、质量、张数),生成的图片是什么样的。如果有特定的参考图,可以告诉他让他去找参考图,然后依据参考图生成图片。


MESSAGE BOARD
评论区
不用登录,填昵称就能评论;图片会作为附件保存,邮箱和网站不会公开展示。