
AI入门第五课——大模型认识(持续更新中)
接下来带大家了解一下国内外比较知名的 AI 公司和大模型,以便大家后续选择。接下来的测评一方面是我个人体验,一方面是看跑分,还有一方面是看风评。
国外
Anthropic——Claude 系列模型
1. Claude-Fable-5.1
- 价格超级贵(常见的大模型里世界第三贵,第一贵是 claude-fable-5 和 gpt-6-astra)
- 最聪明,最智能,写代码强,记忆力强,人工理解强,审美能力强(可以看看他做的体素山水)

至于 Claude-Fable-5,价格更贵,而且能力可能不如 5.1,因此要用也用 5.1,故跳过。但是两者都贵,我也没用过,下一个。
2. Claude-Opus-5
- 价格贵但没有 Fable 那么离谱,可以看作 Fable 的低级版本(实际上是 Opus 先出现的)
- 能力强,智力强,突出是写东西更有人味,前端审美好,后端开发好,逻辑理解好,科学研究好……
- Fable 5.1、Fable 5 和 gpt-6-astra 后的第一大模型,各方面都很强很强
- 不过我依旧没用过满血 Opus,跳过

3. Claude-Sonnet
这个系列是 Opus 的低级版,都用 Claude 了,很少有人用这个,跳过。
补充:不过这个公司太出生,和军方合作,抵制中国用户,泄密,到处指控,是世界上名声最差的 AI 公司。
OpenAI——GPT 系列模型
注意:GPT 系列大多都有一个问题,就是没有人味。你让他干什么他就干什么。举个例子:我让他做个网站,他可能会想怎么做这个网站、怎么优化更好,然后做出来;但他不会想我的网站别人看的时候觉得怎么样。GPT 就是太死板的 AI 了,不如别的 AI 会做一些小巧思。所以实际上你最好明确你真的要干什么,然后做好规划以后让他做,这样会好很多。
1. gpt-6-astra
- 如果说 Astra 之前 OpenAI 被 Anthropic 压了一头,那 Astra 之后 OpenAI 稳稳拿下首位
- Astra 也是全能型选手,在每个方面(我是说每个,或者可以把中文写作去掉以后的每个),都是世界第一或者第二(总体上强于 claude-fable-5.1)
- 但是贵,和 Claude-Fable-5 一个价格,随便跑一下就是几十块,一个项目跑完可能要大几百了
- 因为他的价格太贵,暂时跳过
2. gpt-5.6
- 6 系列一共三个模型:sol(太阳)> terra(地球)> luna(月亮)。
- sol:最强,确实强,确实慢,容易有雷霆大思考,但是前后端和思维能力以及智能体上都很不错,写文章也还不错,也可以说是 Opus 5 以下最适合大工程的大模型之一
- terra:便宜很多,做小任务够了,不过大一点的任务就没什么优势了,比他思维能力强还快还便宜的模型有很多。优点就是能用在 Codex 里,但总体不是很推荐——有比他好的为什么用它,因为它能在 Codex 里用吗?
- luna:好处——便宜,然后,没了。做任务甚至不如 deepseek-V4-flash,又笨又慢(真的慢)
3. gpt-5.5
当初时代的真神。真正能搞工程的模型代表,从 5.5 开始,AI 真的能独立开发大项目工程,非常强。不过现在被 gpt-5.6-sol 取代了(价格相同),因此现在也没人用了。
谷歌——Gemini 系列模型
到这里我们先明确一个东西:pro 和 flash 的区别。pro 就是旗舰款,特点是参数大,所以智力高、做事稳重,缺点是慢和容易过度思考;flash 是轻量款,优点是更快、干活儿更轻量,缺点是不够稳重、智力没那么高(按常理来说是这样,不过最近很多公司训练出问题,容易甚至导致两者反过来)。
1. gemini-3.8-flash
- 除了快还是快,足够用来干小的重复性任务,也足够便宜
- 优点是写文字挺好的,长文本推理、科学推理(单纯的语言文字,比如写小说等)也还不错,还有审美也不错(当然是审美,比如让他画个 2d 小插图还可以,但是让他做一个飞机模型就不行了,编程能力不够)
- 平时用来写写文章、问点学科小问题就行了,当个超级豆包就行
- 同时工具调用也很不错,简洁清晰,适合日常小任务
- 因为短板太多——还是不适合接入任何编程等项目
- 总的来说可以作为日常用的模型,因为快和智力够用
2. gemini-3.1-pro
超级早的模型了,落后几个时代了,跳过。
X(马斯克的那个)——Grok 系列模型
1. grok-4.6
- 强!可能比较少人用这个模型,但是这个模型又快又稳,智力综合来说很高,日常够用,体感速度很不错
- 而且编程很强,是的,真的很强,排名甚至紧接 gpt-5.6-sol
- 但不能只看专项能力,实际体验的时候他总会出现一些问题,比如这块中文理解不到位,那块思维链僵化等等问题,所以依旧不适合大工程,所以国内也没那么出名,期待后面几代模型改善(据说 grok-4.7 也堆参数,马上可能有超越 gpt-5.6-sol 的水平)
Moonlight——Kimi 系列模型
1. kimi-k3
- 神之大模型,国内力大砖飞的代表,模型参数很高,所以做事非常稳,智力很高,做事很完备(你给一个命令,他会处理好别的任务防止你觉得不满意)
- 尤其在审美方面很强(举个例子,做 PPT,这是我一句话生成出来的,然后告诉他可以去哪里找图片使用,然后他自己下载好看的图片,自己做渲染,最后自己做出来的 PPT)

- 同样的了,力大砖飞的好处——全方位的突出
- 他的审美强,可以看到
- 他的逻辑思维能力同样强——比如我最近使用他来进行数模比赛,他从头到尾找问题,竟然只是略逊于 gpt-6-astra(要知道换 DeepSeek 的话,gpt-6-astra 已经挑出更多更多的错误了)
- 他的中文能力也很强——也就是听得懂人话,也说得出人话
- 编程能力同样强,略逊于 gpt-5.6-sol
- 缺点也很明显——慢,贵(比国内其他顶级大模型贵三到四倍)
深度求索——DeepSeek 系列模型
1. deepseek-v4.1-flash
- 还没实际体验工程效果,不过据说已经到了能接入项目的程度
- 不过真的很快很快,速度比肩 Gemini,质量又比 Gemini 快,国内做小任务可以使用这个了
- 甚至还有多模态能力(能看得懂图片,不过目前还是有点落后于其他大模型)
- 而且便宜
2. deepseek-v4-pro-0813
最乌龙、最寒心、最让人失望的大模型,甚至比不上自家 flash 模型,没得说,官方都不喜欢,跳过。
通义——Qwen(千问)系列模型
1. qwen-3.8-flash
- Qwen 家名声最好的模型,低参数(参数量在同等级模型下都是最低的,比 deepseek-v4.1-flash、glm-5.3-flash 都低很多),但是后训练超级强
- 文字能力不错
- 前端能力很强(在 flash 模型里审美应该是第一或者第二了),运镜不错
- 速度很快,尽管 token 输出速度低于 deepseek-v4.1-flash,但阿里云的服务器实在强悍,导致实际体感下来他的速度可能比 deepseek-v4.1-flash 还要快个几倍
- 后端能力同样强悍,修理 bug 的能力在所有 flash 模型里是最稳妥的,甚至接近几家顶尖的旗舰模型
- 中文理解能力同样强悍,意味着无论是让他写文章还是分析论文,都是非常非常适合的
- 综合来说,如果你有日常工作需求,完全可以试试这个模型代替豆包和 DeepSeek

这速度快吗?很快,比 DeepSeek 快了将近 10 秒,工具调用很合理,没有多余动作。
智谱——GLM 系列模型
1. glm-5.3
- GLM 系列一代存在感比较低的模型,也是比较尴尬的一代模型
- 文字处理?不如很多 flash 模型(如 qwen-3.8-flash 或者 deepseek)
- 前端审美?更是太过平平无奇,被大多主流大模型甩开
- 理解论文、知识处理?仍然不出彩,不如更快更便宜的 qwen-3.8-flash 或者 deepseek
- 速度呢?作为旗舰款,速度肯定比众多 flash 慢很多
- 那他到底为什么是 5.3?因为他单纯强化的是后端能力,在后端做代码工程上,他确实比大部分模型都更稳,同时在找漏洞(网关)上,有特别的突出能力
- 所以这个模型不适合日常,甚至不适合设计,只适合你专门做项目的时候让他搞后端和找 bug
2. glm-5.3-flash
很割裂的一个模型,之前叫牛来大模型,刚出的时候宣传得很厉害,远超过 DeepSeek;但目前实际体验下来,除了便宜以外没有什么比 DeepSeek 新模型和 qwen-3.8-flash 更好的地方,甚至调用还容易出错。我不喜欢这个模型,跳过。
3. glm-5.2
老模型,质量还可以,但是过时了,现在也没人用了,后端也不如 glm-5.3,跳过。
字节跳动——豆包系列模型
1. doubao-seed-2.1-pro
没人用,跳过。
模型推荐
寝室没电了,我这里就推荐几个模型:
| 用途 | 推荐模型 |
|---|---|
| 编程任务(比如做项目) | gpt-6-astra > gpt-5.6-sol > kimi-k3 > glm-5.3(qwen-3.8-max 我还不确定,后面再加) |
| 做 PPT | kimi-k3 |
| 读论文 | qwen-3.8-flash > deepseek-v4.1-flash(不写 gpt-6-astra 是觉得太贵了,读论文有点浪费) |
| 日常任务(比如整理 D 盘、批量改文件名、定时任务) | qwen-3.8-flash ≈ deepseek-v4.1-flash > grok-4.6 > gemini-3.8-flash |
MESSAGE BOARD
评论区
不用登录,填昵称就能评论;图片会作为附件保存,邮箱和网站不会公开展示。