WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
今日情报播客来源我的
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
Market Intelligence/爱范儿

实测GLM-5.3: 在神仙打架的一周杀回国模顶流,还按下了重置键

7000 亿 VS 2.8 万亿 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

张子豪·2026.08.14·8 min 阅读
事件背景基于真实抓取数据整理

本条来自 爱范儿(Business / 消费科技),聚焦 technology。 神仙打架,这周的大模型圈,已经卷到了几乎一天一个新旗舰。

Original Intelligence基于真实抓取数据整理

7000 亿 VS 2

  • ▲ 教你如何用 128xH100 训练 DeepSeek R1,以及如何蒸馏
  • 当所有 AI 都开始卷编程
  • 同尺寸里的最强模型
  • 神仙打架,这周的大模型圈,已经卷到了几乎一天一个新旗舰

7000 亿 VS 2

8 万亿 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上

神仙打架,这周的大模型圈,已经卷到了几乎一天一个新旗舰。

有 Cursor 数据加持的 Grok 4.6 突飞猛进,马斯克还说 4.7 马上就要来;DeepSeek V4 Pro 正式版虚晃一枪后正式发布,多项 benchmark 直指 Fable 5;还有一个不能算旗舰的 Gemini Flash。

然后今天,智谱也把 GLM-5.3 端了上来。

这个在 5.2 期间,一直被调侃「我知道很好用,但不给我开会员用」的顶尖国产编程模型,终于迎来了更新。

新的模型继续在编程方面发力,评测榜单的结果显示, GLM-5.3 在编程能力上比肩 Fable 5 和 GPT-5.6 Sol 。在社交媒体上参与内测用户的反馈则提到, 使用体感比 Kimi K3、DeepSeek V4-Pro-0813 要更好 。

能跟 GLM-5.3 上桌对比的模型,在可视化图表中只剩下了 Kimi K3、Fable 5 和 GPT-5.6 Sol。以前是开源自己一堆模型对比,不找闭源自讨苦吃,现在是「对标 Fable 5」成了开源的基本配置。

六个 benchmark,GLM-5.3 的表现都不赖,尤其是由 OpenAI 提出的 GDPVal 评估测试,智谱拿到了第一名。

AutomationBench、Agents’ Last Exam,一个是用来测试跨应用工作流编排能力,一个是测试智能体能力,GLM-5.3 的成绩也是数一数二。

和 Kimi K3、Qwen3.8-Max 迈向万亿大参数不同,GLM-5.3 这次参数量和上一版本差不多,同样是 7000 亿参数级别。官方技术博客中提到, 此次升级带来的提升主要原因是后训练 Scaling 。

就是靠着 743B 的基模,智谱训练出来了 Kimi K3 2.8T 级别的大模型。

我们在与 GLM-5.2 完全相同基座上高效推进强化学习,可能我们还远未开发出这个基座(即 GLM-5.2 模型)的智能上界。

▲ 更完整的 benchmark 对比,经过后训练的 GLM-5.3 对比 GLM-5.2 提升相当明显,Coding、网络安全和 Agentic 成绩进步都不像是一个基座模型。

不得不说,现在大模型做好后训练在某些程度上比预训练都更好使。就拿四月份发布的 DeepSeek V4 Flash 预览版和 7 月底发布的正式版相比,两个模型的能力几乎是断层的。

智谱这次还开源了名为史莱姆 Slime 的一个后训练框架,直接能覆盖发布级模型后训练所需要的完整工作流。他们说 从 GLM 4.5 开始,就一直在用这套框架进行后训练 。

目前 Slime 支持对 GLM 系列、Qwen 系列以及 DeepSeek 系列的部分模型和 Llama 3 进行后训练。

▲ 教你如何用 128xH100 训练 DeepSeek R1,以及如何蒸馏

除了主打编程,GLM-5.3 的另一个重点方向是网络安全。从 Hugging Face 事件开始,现在哪个模型不能谈谈网络安全,都算不上是一个好模型。

无论是模型的攻击能力强,能逃出设置的沙箱,还是防守能力强,能监控、抵御和分析复杂的 AI Zero Day 漏洞;这些以前听着离我们普通用户很远的东西,也成了大模型角力的新赛场。

GLM-5.3 在网络安全相关的任务中,表现与 Claude Mythos 5 持平。其中 ExploitGym 网络安全测试,就是 OpenAI 在评估自己的待发布模型时,为了解决更多问题去攻击了 Hugging Face,GLM-5.3 的表现也非常不错,898 到题,限时 6 小时内完成的情况下,达到了 130 道。

针对模型的网络安全能力,智谱还公开了一项网络安全披露账本,记录模型在不同的项目中找到的各种漏洞。 GLM 找到的最古老漏洞,甚至可以追溯到大约 40 年前 。

40 年都没找到,GLM-5.3 一出手就找到了,放 OpenAI 或者 A 社手里,这不比证明了一个数学难题强吗。

▲ 网络安全披露账本 https://cvd.z.ai/

虽然我们普通用户不会拿它去找各种攻防漏洞,但模型的能力提升是实打实的,具体到日常的办公和编程任务上,GLM-5.3 的表现又如何。

APPSO 提前拿到了 GLM-5.3 的测试资格,继续用一些 3D 网页生成、网页应用开发、macOS 小工具开发等任务,来看看 GLM-5.3 的表现是否能快速实现我们的想法。

目前 GLM-5.3 已经上线智谱官方 Agent 应用 Zcode 和效率工具 AutoClaw,同时面向 GLM Coding Plan 用户全量开放并开放订阅。

▲ 在 Zcode 应用内可以直接选择 GLM-5.3 进行体验

第三方平台像是 WorkBuddy,QwenWork,TraeWork 等应用也已经开放抢先体验。而 API 调用预计在下周二开放,模型的完整权重则会在两周内开源。

当所有 AI 都开始卷编程

相较于写作或者文科领域,那些见仁见智,审美无法统一的任务,编程大概是大模型最适合发力的场景。

简单粗暴的一句提示词丢进去,就等着看它用代码能写出什么好看好玩有意思的画面。

我们先是让它做了一个人体血液循环的 3D 交互仿真系统,原以为它会做一个写实的人体透视,至少像是这种细节满满的 3D 仿真,有真实的身体轮廓,合理排放的血管,真实的肌肉线条。

但不知道是不是提示词不够详细,GLM-5.3 给的交付是看起来比较粗糙的版本。整个人更像是一个火柴人,内部器官也全部堆在了一起。

比较难得的是,整个的演示有较多的自定义,例如视图图层可以选择不同的场景,生理参数也有心率、压力等内容。我们甚至可以选择失血性休克的场景,直接看到血液循环的流向。

▲ 提示词:做一个高精度的人体血压循环 3D 可交互仿真系统,使用 GLM-5.3 + Claude Code

总的来说,这个交互网页能够用在教学场景,但就是没有那么好看。

继续我们在 DeepSeek Harness 中的金字塔滑板游戏测试,同样的提示词,GLM-5.3 + Claude Code 最高推理深度给出的结果也不赖——游戏体验好,场景渲染也准确。

▲ 如果你不好好操作,可能真的会输,只是这个滑板的残影,过于「亮眼」。

当我们想要它生成一些惊艳的 3D 场景时,像是一个满是水母的湖,数百万只写实的水母在一片翡翠湖泊里飘动。

这个效果确实还挺漂亮的,渲染水母就不会像渲染人体一样,只用一些简单的圆圈,不过这个 3D 水母的提示词也相当长。

在 Claude Code 中使用 GLM-5.3 时,如果你开启了自动审批命令,会经常遇到一个错误,显示「auto mode cannot determine thesafety of Bash right now.」即「自动模式目前无法判断 Bash 命令的安全性。」

这大概是 Claude Code 应用自身的机制来处理自动模式下,如何识别不同的命令是否需要弹窗通知交给我选择,但第三方的模型,暂时还没有适配 Claude Code。

于是我们切换到 ZCode 进行体验,它能像 Codex 一样使用不同的工具,不断对已经生成的网页截图识屏,分析存在的问题,然后持续优化,整个运行时间也比单纯在 Claude Code 中使用会更久。

就像这个行星撞地球的模拟,两个行星碰撞,我们在 Claude Code 中的任务最长没有超过 1h,但这个 3D 网页过了一个小时,ZCode 还在反复地测试检查。

好在最后的效果没有让人失望,我们第一眼就能看到地壳开裂、熔岩喷出、碎片形成行星环等壮观画面。就这些复杂的粒子运动,要面面俱到的编程好,肯定是需要一点模型底子的。

同尺寸里的最强模型

GLM-5.3 的意义,我们测试下来就觉得它还是回到了原本属于它的位置,即同尺寸最强模型,编程开发者的首选。

K3 用了 2.8T,DeepSeek V4 用了 1.6T,而 GLM 5.2 用了不到一半的参数,就实现了同样程度的智能。

所以如果你本来就在用智谱,已经购买了 Coding Plan(今天下午他们也重置了一次),从六月中旬发布的 GLM-5.2 切换到 5.3,是能感受到比较明显的差异。

虽然 API 版本预计要等到下周二更新,目前官网显示的 API 价格也还是 GLM-5.2 版本,但同样的模型尺寸,估计 GLM-5.3 的 API 定价不会有太大的变化。

Kimi K3、Qwen3.8-Max、DeepSeek V4 正式版、Grok 4.6、Gemini 3.7 Flash、GLM-5.3,最近的模型发布节奏几乎是前所未有,每天都有新的模型,新的工具可以测试。

模型之间的区别也随着密集的发布逐渐在缩小。拿我们自己来说,曾经 Claude 被认为是写作上最好用的模型,优化一些句子的结构,把脑子里乱成一团的想法让它有逻辑的串联起来,Claude 给的文章有时比人类写得还要好。

但频繁封号的 Claude,让我们转到了用 GPT 以及其他的模型,于是发现好像所谓的 Fable 5 和 Opus 5 并不是那么的非它不可。

写作如此,编程、生图、整理文档、做报告、构建知识库也越来越接近这个状态。

GLM-5.3 和最近这一连串新模型一起,把大模型的「最强保质期」压得越来越短。

新发布的 GLM 用了 20 天,就有更强更好的 Kimi,Kimi 用了 20 天,又能换到新发布的 DeepSeek,等 DeepSeek 不好用了,那个时候又可以轮到 GLM 了。

所以当别人问你,现在最好的国产编程模型是什么,你会说 Kimi K3、DeepSeek V4 还是 GLM 5.3?

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

❧
Industry Analysis规则派生 · 可核对

本条目归入「Brand Marketing」垂直,涉及真实话题:technology。

· 市场:关注 technology 对相关品类与竞争格局的潜在影响。

· 消费者:受众行为与偏好变化值得追踪。

· 品牌:本动向对品牌资产建设的启示。

· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。

Marketing Insight规则派生 · 可核对

· 核心话题:technology。

· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?

Career Usage规则派生 · 可核对

面试中可引用「实测GLM-5.3: 在神仙打架的一周杀回国模顶流,还按下了重置键」:围绕 technology,说明你对行业动向的判断与可落地动作。

本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。

关联公司由品牌 / 正文匹配真实 dossier
Tencent
China Internet & Platforms · 中国社交与游戏龙头,2025 年营收人民币 7,517.66 亿元(+14%),归母净利润人民币…
关联播客真实 RSS 单集
8点1氪 8月14日|超越腾讯,长鑫科技成中国市值最高上市公司
36氪·8点1氪 · 2026.08.14
咖啡豆|两次遭遇苹果冲击,运动手表佳明为何还能增长?
声动早咖啡 · 2026.08.14
Vol.270 大食代留在了它的时代
商业就是这样 · 2026.08.13
延伸信源A / B 级权威来源 · 供深挖
Marketing BrewACampaignAThe DrumAWARCAAdweekADigidayA
Business English提取正文真实商业词汇
ai
ai

六个 benchmark,GLM-5.3 的表现都不赖,尤其是由 OpenAI 提出的 GDPVal 评估测试,智谱拿到了第一名。…

系统商务英语 →
关联 English Brief
早报|曝iPhone全线涨价100美元/ChatGPT开始拥有你的电脑历史/长鑫科技市值超过腾讯
爱范儿
早报|曝iPhone全线涨价100美元/ChatGPT开始拥有你的电脑历史/长鑫科技市值超过腾讯
爱范儿
来源
阅读原文 · 爱范儿 ↗
发布:2026.08.14
类型:Business / 消费科技
话题:technology
相关阅读
爱范儿/2026.08.14
首发 | 澎湃OS 4 体验:小米第一个 AIOS,用起来怎么样?
爱范儿/2026.08.14
爱范儿独家|谷歌不再追逐前沿, DeepMind 或大幅裁员
爱范儿/2026.08.14
DeepSeek V4 Flash 之后,大模型开始卷「智效比」了
爱范儿/2026.08.13
首发体验 | DeepSeek Harness 来了,它不想做下一个Codex
爱范儿/2026.08.13
打工人的办公三件套,被 WorkBuddy 用 AI 重做了
个人笔记
自动同步到云端