SHSH_ZMDの分享站
首页归档音乐说说留言墙杂谈推荐表中转站友链关于
星图计划表灵境
封面

AI入门补充第一课——生图(持续更新中)

2026-09-25 13:41:52

最近经常有朋友问我几个问题:这么多 Agent 选哪个?还有就是生成图片怎么这么麻烦?我相信不久又有朋友会问我:这生图怎么这么模糊?生成的字怎么乱码?我让他生成这个角色,怎么他生成的别的角色?

这些都很值得说一下,我一个一个来。

首先,选哪个 Agent?

我认为:用 GPT 就去用 Codex(ChatGPT),用 GLM 就去用 ZCode,其他的都可以通融一下。

我这么推荐 ZCode 他竟然不给我广告费😠。不过前段时间 ZCode 爆出了偷用户数据的出生行为,而且现在其他几个大厂或多或少都在偷数据,可信的就只有开源的几个 Agent 了(不过 ZCode 目前爆这么大的雷而且开源了,短期应该不会那么明目张胆了)。

  • DeepSeek、GLM、Kimi、Qwen 甚至 Grok 都可以使用 ZCode,做事更稳一些,也更通用一些(可能是因为 ZCode 以 opencode 为底子,所以挺通用的)
  • GPT 就去用 Codex
  • 至于什么 DSH、Kimi Code、Grok Build 都可以到后面觉得需要了再用

并没有说某个模型一定在某个客户端就好用,到另一个客户端就完全没法用。比如 DeepSeek 在 DSH 可能表现最好,但到 ZCode 可能更稳一些(做出来的东西“石山”的概率更小一点这个样子)。

不过如果你不怕麻烦,也可以试试给每个 Agent 配自己的专武,可能效果会更好一些。

市面上主要的生图模型

补充:不包括国模,虽然诸如 Qwen 生图和 Seedance 生图都非常不错,但是在市面上渠道最多的还是 gpt image 系列、谷歌 nanobanana 系列和老马的 grok 系列。

1. gpt-image 系列

这个系列在大多榜单眼里可以说是世界第一生图模型,原因很简单:

  1. 生图质量稳定,不需要你手动大量调试提示词,他都能生成质量还可以的效果,可以说是最适合小白了;
  2. 生图更加华丽,所以看起来更好看(不过也因此导致他 AI 感会浓一些)。

缺点也很明显:

  1. 噪点太强,有很强的噪点鱼鳞感;
  2. 太华丽导致 AI 味有点强。

gpt-image-2.5-sunbrust

新一代世界第一生图模型,相比 flare 生成更细致,相比 image2 质量更高、细节更多,支持 max 生图质量挡位。

gpt-image-2.5-flare

sunbrust 的加速版本,生成速度更快,不过质量稍微低一点。

gpt-image-2

老一派世界第一生图模型,清晰度高、质量高,还便宜,不过在逻辑和细节上不如 2.5,还是用 2.5 吧。

2. 谷歌 Gemini 系列

nanobanana pro

老牌世界顶尖生图模型,但是现在有点老了,不介绍了。

nanobanana 2

比 pro 新一点,便宜一点,但貌似质量还不如 pro。

总之等 2.5pro 出来我再介绍吧。

3. 老马 Grok 系列

grok-imagine-image-2

最高貌似只有 2k,然后生图质量整体不如 gpt-image 系列。但是尺度可能大一点:GPT 很多不能生成的(比如泳装)Grok 可能可以生成(当然只是大一点,想做不太好的东西这个模型也不行)。

依旧没太大值得看的,跳过。

4. NovelAI 系列

22 年那阵开始爆火的二次元人物 AI 绘图,大家可能还有印象,而那个就是 NovelAI 公司系列模型,如今已经进阶到了 V5 系列。

  • 这个系列完全为二次元而制作,并不适合二次元画风以外的任何生图
  • 生图没有限制(就是那个没有限制)
  • 所以这个系列主要也还是用在酒馆或者二次元美图或者表情包上

诸如此类的。

而且很特殊的是:生图时可以直接指定某些画师风格、某些特定角色、调整某些参数等等,最后生图会根据参数弄出非常非常符合你期待的图。

不过这个生图需要专门的工具,比较复杂我也不太懂,需要的话我后面学了再介绍吧。

链接:https://nai.rinko.ai/sign-up?aff=IiMu

这个是一个公益站(没办法充值,只能靠签到领积分),可以免费生图试试。具体参数怎么调、怎么配置,大家自己摸索看看吧(生成小图应该是免费的,大家可以配置一下看看怎么样是不花积分)。

补充:上面的几个生图模型,等我后面用得多了再给大家介绍特点(主要还是用 gpt-image 系列,因为便宜加上上手容易)。

常见问题

我让 gpt-image-2 生成真寻这个角色的图,他怎么给我生成了个不知道是哪个的角色?

然后大家可能就会说这个模型怎么这么笨。其实这个问题很清楚:gpt-image-2 模型他作为生图模型,并不知道真寻是谁(主要是生图模型训练的时候可能并没有详细告诉他真寻是谁,只是说给你这个角色的这些数据,学习怎么画之类的)。

那该怎么解决这个问题呢?最简单的方法就是给他参考图,让他了解这个角色大概长什么样子就行了。

其次还有几个问题:每次都要我手动找图告诉他吗?不能自动找吗?生图不能批量生图吗?生图能更高分辨率吗?能更高质量吗?

这些问题我们都可以通过 Agent 解决

首先明确什么是分辨率——可以理解成清晰度,4K、2K、1K 和你看视频的 1080p、720p 是一样的,1K 你就当成是 1080p 就好理解了。

其次什么是质量——生图的时候可以选择 low、medium、high 甚至 xhigh、max 挡位的 quality(质量),其实就是细节度的问题。质量越高,花的越多、想的越多,生成的细节都更高(比如文字会更清晰,乱码情况会少一点)。

另外还有一个问题——为什么我让 ChatGPT 生图,他不给我生成?——因为生图需要生图模型,但是你给 Agent 选择了用某个模型(比如 gpt-5.6-sol),这就导致虽然你的 Key 里有生图模型,但是他没办法调用,因为你设置了用 gpt-5.6-sol 模型。(订阅账号可以是因为订阅账号内部用 imagegen 技能做了调整)

所以想让 Agent 生图,实际上只需要让 Agent 知道你的 Key 和 URL,然后通过你电脑向算力中心发起请求就行了。

教程:用 Cherry Studio 的 Agent 功能生图

补充:Cherry Studio 的聊天,在你和他说了非常非常多东西以后可能出现一直报错的问题,这个情况很正常,大概是因为你聊天太多以后他上下文超支了,然后超出上下文就会报错了(而且聊天竟然还没有上下文压缩,只有清除上下文,这个不太好,要注意一下)。

但是 Cherry Studio 不止有聊天,也有自己的 Agent 功能的!现在开始介绍一下这个 Agent 功能。

1. 进入工作栏目

2. 添加智能体并选择模型与权限

提示:Claude 适合工程,推荐 Claude 这个,其他俩不适合新人。权限如果给了完全访问,就不用再每次点同意执行了。

3. 设置工作场所

可以专门新开一个文件夹。

4. 进入文件夹,新建文本,按图写入自己的 Key 和 URL

补充:这里为什么要这样呢?因为你的 Agent 想要调用 API Key 和 URL,肯定需要连接到 API Key 和 URL;但我们之前提到过了,你给他设置模型以后他没办法连接到你之前设置的模型,所以我们这里直接新开一个地方告诉他应该用哪个 Key 和 URL 来进行生图(按理来说你直接把 Key 和 URL 发给他也行,但是模型大概率会告诉你自己不能这么干、太危险了、可能泄露 Key,所以还是这样更省心)。

5. 进行生图

跟他说你的 Key 和 URL 在哪里,然后你要选择什么模型、参数调多少(比如分辨率、质量、张数),生成的图片是什么样的。如果有特定的参考图,可以告诉他让他去找参考图,然后依据参考图生成图片。

MESSAGE BOARD

评论区

不用登录,填昵称就能评论;图片会作为附件保存,邮箱和网站不会公开展示。

0 条评论
0 / 2000图片 0 / 3Ctrl + Enter 发送
正在读取评论...
avatar

SH_ZMD

正在学习AI agent的化工小白,分享从零开始的经验

2026年9月

一
二
三
四
五
六
日
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30

Recent Records

AI入门第五课——大模型认识(持续更新中)

2026-09-12 23:20:14

AI入门第四课——CC Switch 接入 Codex

2026-09-09 23:26:13

AI入门第三课——接入 Agent

2026-09-08 22:51:59