SHSH_ZMDの分享站
首页归档音乐说说留言墙杂谈推荐表中转站友链关于
星图计划表灵境
封面

AI入门第五课——大模型认识(持续更新中)

2026-09-12 23:20:14

接下来带大家了解一下国内外比较知名的 AI 公司和大模型,以便大家后续选择。接下来的测评一方面是我个人体验,一方面是看跑分,还有一方面是看风评。

国外

Anthropic——Claude 系列模型

1. Claude-Fable-5.1

  • 价格超级贵(常见的大模型里世界第三贵,第一贵是 claude-fable-5 和 gpt-6-astra)
  • 最聪明,最智能,写代码强,记忆力强,人工理解强,审美能力强(可以看看他做的体素山水)

至于 Claude-Fable-5,价格更贵,而且能力可能不如 5.1,因此要用也用 5.1,故跳过。但是两者都贵,我也没用过,下一个。

2. Claude-Opus-5

  • 价格贵但没有 Fable 那么离谱,可以看作 Fable 的低级版本(实际上是 Opus 先出现的)
  • 能力强,智力强,突出是写东西更有人味,前端审美好,后端开发好,逻辑理解好,科学研究好……
  • Fable 5.1、Fable 5 和 gpt-6-astra 后的第一大模型,各方面都很强很强
  • 不过我依旧没用过满血 Opus,跳过

3. Claude-Sonnet

这个系列是 Opus 的低级版,都用 Claude 了,很少有人用这个,跳过。

补充:不过这个公司太出生,和军方合作,抵制中国用户,泄密,到处指控,是世界上名声最差的 AI 公司。

OpenAI——GPT 系列模型

注意:GPT 系列大多都有一个问题,就是没有人味。你让他干什么他就干什么。举个例子:我让他做个网站,他可能会想怎么做这个网站、怎么优化更好,然后做出来;但他不会想我的网站别人看的时候觉得怎么样。GPT 就是太死板的 AI 了,不如别的 AI 会做一些小巧思。所以实际上你最好明确你真的要干什么,然后做好规划以后让他做,这样会好很多。

1. gpt-6-astra

  • 如果说 Astra 之前 OpenAI 被 Anthropic 压了一头,那 Astra 之后 OpenAI 稳稳拿下首位
  • Astra 也是全能型选手,在每个方面(我是说每个,或者可以把中文写作去掉以后的每个),都是世界第一或者第二(总体上强于 claude-fable-5.1)
  • 但是贵,和 Claude-Fable-5 一个价格,随便跑一下就是几十块,一个项目跑完可能要大几百了
  • 因为他的价格太贵,暂时跳过

2. gpt-5.6

  1. 6 系列一共三个模型:sol(太阳)> terra(地球)> luna(月亮)。
  • sol:最强,确实强,确实慢,容易有雷霆大思考,但是前后端和思维能力以及智能体上都很不错,写文章也还不错,也可以说是 Opus 5 以下最适合大工程的大模型之一
  • terra:便宜很多,做小任务够了,不过大一点的任务就没什么优势了,比他思维能力强还快还便宜的模型有很多。优点就是能用在 Codex 里,但总体不是很推荐——有比他好的为什么用它,因为它能在 Codex 里用吗?
  • luna:好处——便宜,然后,没了。做任务甚至不如 deepseek-V4-flash,又笨又慢(真的慢)

3. gpt-5.5

当初时代的真神。真正能搞工程的模型代表,从 5.5 开始,AI 真的能独立开发大项目工程,非常强。不过现在被 gpt-5.6-sol 取代了(价格相同),因此现在也没人用了。

谷歌——Gemini 系列模型

到这里我们先明确一个东西:pro 和 flash 的区别。pro 就是旗舰款,特点是参数大,所以智力高、做事稳重,缺点是慢和容易过度思考;flash 是轻量款,优点是更快、干活儿更轻量,缺点是不够稳重、智力没那么高(按常理来说是这样,不过最近很多公司训练出问题,容易甚至导致两者反过来)。

1. gemini-3.8-flash

  • 除了快还是快,足够用来干小的重复性任务,也足够便宜
  • 优点是写文字挺好的,长文本推理、科学推理(单纯的语言文字,比如写小说等)也还不错,还有审美也不错(当然是审美,比如让他画个 2d 小插图还可以,但是让他做一个飞机模型就不行了,编程能力不够)
  • 平时用来写写文章、问点学科小问题就行了,当个超级豆包就行
  • 同时工具调用也很不错,简洁清晰,适合日常小任务
  • 因为短板太多——还是不适合接入任何编程等项目
  • 总的来说可以作为日常用的模型,因为快和智力够用

2. gemini-3.1-pro

超级早的模型了,落后几个时代了,跳过。

X(马斯克的那个)——Grok 系列模型

1. grok-4.6

  • 强!可能比较少人用这个模型,但是这个模型又快又稳,智力综合来说很高,日常够用,体感速度很不错
  • 而且编程很强,是的,真的很强,排名甚至紧接 gpt-5.6-sol
  • 但不能只看专项能力,实际体验的时候他总会出现一些问题,比如这块中文理解不到位,那块思维链僵化等等问题,所以依旧不适合大工程,所以国内也没那么出名,期待后面几代模型改善(据说 grok-4.7 也堆参数,马上可能有超越 gpt-5.6-sol 的水平)

Moonlight——Kimi 系列模型

1. kimi-k3

  • 神之大模型,国内力大砖飞的代表,模型参数很高,所以做事非常稳,智力很高,做事很完备(你给一个命令,他会处理好别的任务防止你觉得不满意)
  • 尤其在审美方面很强(举个例子,做 PPT,这是我一句话生成出来的,然后告诉他可以去哪里找图片使用,然后他自己下载好看的图片,自己做渲染,最后自己做出来的 PPT)

  • 同样的了,力大砖飞的好处——全方位的突出
  • 他的审美强,可以看到
  • 他的逻辑思维能力同样强——比如我最近使用他来进行数模比赛,他从头到尾找问题,竟然只是略逊于 gpt-6-astra(要知道换 DeepSeek 的话,gpt-6-astra 已经挑出更多更多的错误了)
  • 他的中文能力也很强——也就是听得懂人话,也说得出人话
  • 编程能力同样强,略逊于 gpt-5.6-sol
  • 缺点也很明显——慢,贵(比国内其他顶级大模型贵三到四倍)

深度求索——DeepSeek 系列模型

1. deepseek-v4.1-flash

  • 还没实际体验工程效果,不过据说已经到了能接入项目的程度
  • 不过真的很快很快,速度比肩 Gemini,质量又比 Gemini 快,国内做小任务可以使用这个了
  • 甚至还有多模态能力(能看得懂图片,不过目前还是有点落后于其他大模型)
  • 而且便宜

2. deepseek-v4-pro-0813

最乌龙、最寒心、最让人失望的大模型,甚至比不上自家 flash 模型,没得说,官方都不喜欢,跳过。

通义——Qwen(千问)系列模型

1. qwen-3.8-flash

  • Qwen 家名声最好的模型,低参数(参数量在同等级模型下都是最低的,比 deepseek-v4.1-flash、glm-5.3-flash 都低很多),但是后训练超级强
  • 文字能力不错
  • 前端能力很强(在 flash 模型里审美应该是第一或者第二了),运镜不错
  • 速度很快,尽管 token 输出速度低于 deepseek-v4.1-flash,但阿里云的服务器实在强悍,导致实际体感下来他的速度可能比 deepseek-v4.1-flash 还要快个几倍
  • 后端能力同样强悍,修理 bug 的能力在所有 flash 模型里是最稳妥的,甚至接近几家顶尖的旗舰模型
  • 中文理解能力同样强悍,意味着无论是让他写文章还是分析论文,都是非常非常适合的
  • 综合来说,如果你有日常工作需求,完全可以试试这个模型代替豆包和 DeepSeek

这速度快吗?很快,比 DeepSeek 快了将近 10 秒,工具调用很合理,没有多余动作。

智谱——GLM 系列模型

1. glm-5.3

  • GLM 系列一代存在感比较低的模型,也是比较尴尬的一代模型
  • 文字处理?不如很多 flash 模型(如 qwen-3.8-flash 或者 deepseek)
  • 前端审美?更是太过平平无奇,被大多主流大模型甩开
  • 理解论文、知识处理?仍然不出彩,不如更快更便宜的 qwen-3.8-flash 或者 deepseek
  • 速度呢?作为旗舰款,速度肯定比众多 flash 慢很多
  • 那他到底为什么是 5.3?因为他单纯强化的是后端能力,在后端做代码工程上,他确实比大部分模型都更稳,同时在找漏洞(网关)上,有特别的突出能力
  • 所以这个模型不适合日常,甚至不适合设计,只适合你专门做项目的时候让他搞后端和找 bug

2. glm-5.3-flash

很割裂的一个模型,之前叫牛来大模型,刚出的时候宣传得很厉害,远超过 DeepSeek;但目前实际体验下来,除了便宜以外没有什么比 DeepSeek 新模型和 qwen-3.8-flash 更好的地方,甚至调用还容易出错。我不喜欢这个模型,跳过。

3. glm-5.2

老模型,质量还可以,但是过时了,现在也没人用了,后端也不如 glm-5.3,跳过。

字节跳动——豆包系列模型

1. doubao-seed-2.1-pro

没人用,跳过。

模型推荐

寝室没电了,我这里就推荐几个模型:

用途推荐模型
编程任务(比如做项目)gpt-6-astra > gpt-5.6-sol > kimi-k3 > glm-5.3(qwen-3.8-max 我还不确定,后面再加)
做 PPTkimi-k3
读论文qwen-3.8-flash > deepseek-v4.1-flash(不写 gpt-6-astra 是觉得太贵了,读论文有点浪费)
日常任务(比如整理 D 盘、批量改文件名、定时任务)qwen-3.8-flash ≈ deepseek-v4.1-flash > grok-4.6 > gemini-3.8-flash

MESSAGE BOARD

评论区

不用登录,填昵称就能评论;图片会作为附件保存,邮箱和网站不会公开展示。

0 条评论
0 / 2000图片 0 / 3Ctrl + Enter 发送
正在读取评论...
avatar

SH_ZMD

正在学习AI agent的化工小白,分享从零开始的经验

2026年9月

一
二
三
四
五
六
日
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30

Recent Records

AI入门补充第一课——生图(持续更新中)

2026-09-25 13:41:52

AI入门第四课——CC Switch 接入 Codex

2026-09-09 23:26:13

AI入门第三课——接入 Agent

2026-09-08 22:51:59