WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
今日情报播客来源我的
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
Market Intelligence/钛媒体

GLM-5.3发布,基座没变,能力却涨了

GLM-5.3的发布证明了后训练Scaling的潜力。

Leo张ToB杂谈·2026.08.14·8 min 阅读
事件背景基于真实抓取数据整理

本条来自 钛媒体(Business / 科技商业),聚焦 technology、ai。 (本文作者为 Leo张ToB杂谈,钛媒体经授权发布) 过去的几个月,国内外大模型厂商都迎来了新一轮的版本更新,4月,OpenAI发布GPT-5.5版本,并于近日将免费用户默认模型升级为GPT-5.6 Luna;7月中旬,月之暗面发布Kimi K3;8月初,DeepSeek V4 Pro正式上线;阿里Qwen3.8-Max以2.4万亿参数规模开放API访问...... 8月3日,ZCode官网短暂上线了“ZCode for GLM-5.3”页面,官方说明文档也对外开放了大约一个小时。那次“意外泄露”让 智谱 股价当天涨超8%。一周后, 高盛 上调智谱收入预期35%。直到 8月14日,智谱AI也正式发布了新一代基座模型GLM-5.3。该模型总参数规模7430亿,在编程能力和复杂工程执行等核心人物上取得突破。 让人意外的是,GLM-5.3的技术路径——基座模型没变,但能力却提升了不少。智谱在官方公告中明确写道:“与GLM-5.2相比,基座模型没变,但通过极致的后训练Scaling大大提高了模型的智能上界。” 此外,GLM-5.3在白盒代码审查与漏洞推理等安全任务中的表现接近Mythos 5,在网络安全防御场景中的表现让人眼前一亮。 GLM-5.3到底要“升”什么? 要理解GLM-5.3的分量,得先看看GLM-5.2走到了哪一步。 6月13日,智谱开源了旗舰模型GLM-5.2。这款模型交出了一份相当漂亮的成绩单:混合专家(MoE)架构,总参数量约7530亿,上下文窗口达100万token。在国际人工智能独立评测机构Artificial Analysis的综合能力评测榜单上,GLM-5.2拿下51分,位列开源模型最佳水平。富瑞发布研报称,GLM-5.2在Artificial Analysis模型智能指数中排名全球第三,为中国模型首次打入前三位,在编程及智能体能力上分别排名全球第四及第二。 换句话说,GLM-5.2已经是国产开源模型里跑得最快的那一个。但大模型这行,没有“守成”一说,直白点说,你不跑,别人就会超过你。 与GLM-5.2相比,GLM-5.3基座模型并没有改变,但通过极致的后训练Scaling大幅提升了模型的智能上界,主要体现在了数十倍的长程任务环境、更丰富的环境类型,以及超长的后训练时间。 具体到能力层面,在编程能力方面,相比GLM-5.2,GLM-5.3体感评测提升50%,据智谱AI方面透露,GLM-5.3在包括Terminal Bench 3.0在内的公开基准测试中,在开源模型方面排名第一。其中,在Terminal Bench 3.0上,GLM-5.3的得分从4.6提升到28.3;在DeepSWE v1.1上,得分从46.2提升至66.9;在Agents' Last Exam 上,得分也从23.8提升至28.5。在GDPval-AA v2中,GLM-5.3得分1769,展现基于编程能力涌现的专业任务执行能力。 这些结果表明,GLM-5.3不只擅长做出一个好看的Demo,更能接住复杂的大目标,在数万行代码、上百个文件和多个相互依赖的系统之间持续推进。在极少人工干预的情况下,它也能长时自主开发、反复验证,最终把项目推进到可交付状态。 从GLM-5.2开始,智谱引入了effort level(思考档位)控制。在相近Token预算下,GLM-5.3在任务完成质量、执行速度和使用成本之间取得了更好的平衡。 安全能力值得期待 如果说编程能力的提升是GLM-5.3的基本操作,那么网络安全能力的涌现就是一条更值得关注的惊喜。 在网络安全能力方面,GLM-5.3在白盒代码审查与漏洞推理等安全任务中的表现接近Mythos 5,相信后续再网络安全防御实战场景中能发挥比较大的价值。 智谱在官方公告中坦承:“安全能力的出现并不偶然,安全工作本质上是约束严格的编程能力。”从2025年9月开始,智谱就在这个方向投入研究,与国内多家头部安全实验室一同推进更多长程任务环境,构建更专业化的评测与执行框架。 在CyberGym测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞。GLM-5.3得分为83.5%,高于GLM-5.2的77.2%,与Mythos 5的83.8%和GPT-5.6 Sol的83.6%基本相当。 在更考验深度推理能力的ExploitBench中,模型需要进一步理解真实漏洞的成因并完成相应的利用。GLM-5.3得分为54.4%,是GLM-5.2(24.4%)的两倍多,但仍低于Mythos 5的78.0%和GPT-5.6 Sol的73.5%。 在ExploitGym中,模型在限定时间内完成漏洞利用任务的数量。GLM-5.3在两小时内完成105项任务,六小时内完成130项,而GLM-5.2分别只完成29项和39项。Mythos 5仍然领先,两个时间段分别完成181项和247项。 这三个基准呈现出一个清晰的趋势:越接近漏洞利用链的前端,GLM-5.3的提升越明显;越深入完整的漏洞利用,模型与Mythos 5等闭源前沿模型之间的差距也越大。 换句话说,GLM-5.3在发现漏洞这个环节已经追上了全球顶尖水平,但在利用漏洞这个更深的环节还有不小的距离。这既是差距,也是方向。

Original Intelligence基于真实抓取数据整理

GLM-5

  • (本文作者为 Leo张ToB杂谈,钛媒体经授权发布) 过去的几个月,国内外大模型厂商都迎来了新一轮的版本更新,4月,OpenAI发布GPT-5

GLM-5

3的发布证明了后训练Scaling的潜力

(本文作者为 Leo张ToB杂谈,钛媒体经授权发布) 过去的几个月,国内外大模型厂商都迎来了新一轮的版本更新,4月,OpenAI发布GPT-5.5版本,并于近日将免费用户默认模型升级为GPT-5.6 Luna;7月中旬,月之暗面发布Kimi K3;8月初,DeepSeek V4 Pro正式上线;阿里Qwen3.8-Max以2.4万亿参数规模开放API访问...... 8月3日,ZCode官网短暂上线了“ZCode for GLM-5.3”页面,官方说明文档也对外开放了大约一个小时。那次“意外泄露”让 智谱 股价当天涨超8%。一周后, 高盛 上调智谱收入预期35%。直到 8月14日,智谱AI也正式发布了新一代基座模型GLM-5.3。该模型总参数规模7430亿,在编程能力和复杂工程执行等核心人物上取得突破。 让人意外的是,GLM-5.3的技术路径——基座模型没变,但能力却提升了不少。智谱在官方公告中明确写道:“与GLM-5.2相比,基座模型没变,但通过极致的后训练Scaling大大提高了模型的智能上界。” 此外,GLM-5.3在白盒代码审查与漏洞推理等安全任务中的表现接近Mythos 5,在网络安全防御场景中的表现让人眼前一亮。 GLM-5.3到底要“升”什么? 要理解GLM-5.3的分量,得先看看GLM-5.2走到了哪一步。 6月13日,智谱开源了旗舰模型GLM-5.2。这款模型交出了一份相当漂亮的成绩单:混合专家(MoE)架构,总参数量约7530亿,上下文窗口达100万token。在国际人工智能独立评测机构Artificial Analysis的综合能力评测榜单上,GLM-5.2拿下51分,位列开源模型最佳水平。富瑞发布研报称,GLM-5.2在Artificial Analysis模型智能指数中排名全球第三,为中国模型首次打入前三位,在编程及智能体能力上分别排名全球第四及第二。 换句话说,GLM-5.2已经是国产开源模型里跑得最快的那一个。但大模型这行,没有“守成”一说,直白点说,你不跑,别人就会超过你。 与GLM-5.2相比,GLM-5.3基座模型并没有改变,但通过极致的后训练Scaling大幅提升了模型的智能上界,主要体现在了数十倍的长程任务环境、更丰富的环境类型,以及超长的后训练时间。 具体到能力层面,在编程能力方面,相比GLM-5.2,GLM-5.3体感评测提升50%,据智谱AI方面透露,GLM-5.3在包括Terminal Bench 3.0在内的公开基准测试中,在开源模型方面排名第一。其中,在Terminal Bench 3.0上,GLM-5.3的得分从4.6提升到28.3;在DeepSWE v1.1上,得分从46.2提升至66.9;在Agents' Last Exam 上,得分也从23.8提升至28.5。在GDPval-AA v2中,GLM-5.3得分1769,展现基于编程能力涌现的专业任务执行能力。 这些结果表明,GLM-5.3不只擅长做出一个好看的Demo,更能接住复杂的大目标,在数万行代码、上百个文件和多个相互依赖的系统之间持续推进。在极少人工干预的情况下,它也能长时自主开发、反复验证,最终把项目推进到可交付状态。 从GLM-5.2开始,智谱引入了effort level(思考档位)控制。在相近Token预算下,GLM-5.3在任务完成质量、执行速度和使用成本之间取得了更好的平衡。 安全能力值得期待 如果说编程能力的提升是GLM-5.3的基本操作,那么网络安全能力的涌现就是一条更值得关注的惊喜。 在网络安全能力方面,GLM-5.3在白盒代码审查与漏洞推理等安全任务中的表现接近Mythos 5,相信后续再网络安全防御实战场景中能发挥比较大的价值。 智谱在官方公告中坦承:“安全能力的出现并不偶然,安全工作本质上是约束严格的编程能力。”从2025年9月开始,智谱就在这个方向投入研究,与国内多家头部安全实验室一同推进更多长程任务环境,构建更专业化的评测与执行框架。 在CyberGym测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞。GLM-5.3得分为83.5%,高于GLM-5.2的77.2%,与Mythos 5的83.8%和GPT-5.6 Sol的83.6%基本相当。 在更考验深度推理能力的ExploitBench中,模型需要进一步理解真实漏洞的成因并完成相应的利用。GLM-5.3得分为54.4%,是GLM-5.2(24.4%)的两倍多,但仍低于Mythos 5的78.0%和GPT-5.6 Sol的73.5%。 在ExploitGym中,模型在限定时间内完成漏洞利用任务的数量。GLM-5.3在两小时内完成105项任务,六小时内完成130项,而GLM-5.2分别只完成29项和39项。Mythos 5仍然领先,两个时间段分别完成181项和247项。 这三个基准呈现出一个清晰的趋势:越接近漏洞利用链的前端,GLM-5.3的提升越明显;越深入完整的漏洞利用,模型与Mythos 5等闭源前沿模型之间的差距也越大。 换句话说,GLM-5.3在发现漏洞这个环节已经追上了全球顶尖水平,但在利用漏洞这个更深的环节还有不小的距离。这既是差距,也是方向。

之所以让笔者对GLM-5.3在网络安全的能力有所期待的是,智谱AI官方发布的真实案例。GLM-5.3联合国内安全团队发现2404个漏洞,其中1088个为中高危,最早可追溯至约40年前,部分漏洞存在于Android、Windows、macOS、APP等人们每天使用的软件中。 GLM未来猜想 GLM-5.3交出了一份漂亮的成绩单,但它面前仍然摆着三个必须回答的问题。 首当其冲的就是视觉。GLM-5.3的升级有一个容易被忽略的细节:它依然是一个纯文本模型。 此前,智谱首席科学家唐杰在社交平台上发起全球意见征集,为GLM-5.3收集功能建议,浏览量超过40万。评论区被一个词刷屏了:视觉。 开发者想要的,是能看懂截图、能解析表格、能从UI设计图直接生成代码的模型。而GLM-5.2虽然性能强劲,但偏偏没搭载视觉编码器,看不了图,也造不出图。 智谱并非没有视觉技术。这家公司此前发布过CogVLM视觉编码器和GLM-5V-Turbo原生多模态模型。但唐杰此前认为多模态对提升AGI智能帮助有限,主张分开发展。这一策略如今看来需要调整了—开发者的呼声和市场的竞争态势都在迫使智谱做出改变。 其次是深度漏洞利用的差距怎么追?ExploitBench上54.4%对Mythos 5的78.0%,ExploitGym上130项对247项,这两组数字清晰地划出了GLM-5.3与全球顶尖水平之间的距离。 GLM-5.3在漏洞发现(CyberGym)上已经追平了Mythos 5,但在漏洞利用(ExploitBench、ExploitGym)上仍有显著差距。智谱自己也承认:“越深入完整利用,模型与Mythos 5等闭源前沿模型之间的差距也越大。” 这个差距意味着什么?在真实的网络安全攻防中,“发现漏洞”只是第一步,“验证漏洞”和“修复漏洞”同样关键。如果模型只能发现而不能验证,安全团队的工作量依然巨大。智谱需要在这条路上继续追赶。 最后,也是很多大模型公司都需要面对的,商业价值如何体现?智谱2025年全年总营收达7.24亿元。这个数字放在大模型赛道里不算小,但对比其市值(即便是经历了大幅回撤之后)依然显得不成比例。资本市场对大模型公司的估值,本质上是在为未来的可能性买单。但这种可能性需要被不断验证。 国内排名前十的互联网公司中有9家深度集成了GLM系列模型。这是一个不错的起点,但远非终点。在政企市场之外,智谱需要在更广阔的商业化场景中证明自己。 不过,外部环境正在向有利于智谱的方向变化。8月6日,DeepSeek发布公告计划近期整体上调API服务定价。业内人士认为,这一动作打破了此前大模型行业以低价竞争为主的格局。智谱年内已多次上调API价格,如果行业整体涨价成为趋势,智谱的定价策略将不再显得“突兀”。 高盛已经上调了智谱今年的收入预期35%。但高盛同时将智谱的目标价下调,评级维持“中性”。上调收入预期、下调目标价——这组看似矛盾的操作传递了一个清晰的信号:市场看好行业的增长空间,但对具体公司的竞争位置仍持观望态度。 两个月的迭代周期放在大模型时代是一个不算慢的节奏,GLM-5.3的发布证明了后训练Scaling的潜力(在不更换基座的前提下,靠极致的长程任务训练和更丰富的环境交互,照样能榨出大模型更多的智能空间)。这对行业来说是一个值得留意的信号:参数竞赛或许不是唯一的路,把现有模型的能力“挖透”同样能带来可观的回报。 (文|Leo张ToB杂谈,作者|张申宇,编辑丨杨林) 更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App

❧
Industry Analysis规则派生 · 可核对

本条目归入「Technology AI」垂直,涉及真实话题:technology、ai。

· 市场:关注 technology、ai 对相关品类与竞争格局的潜在影响。

· 消费者:受众行为与偏好变化值得追踪。

· 品牌:本动向对品牌资产建设的启示。

· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。

Marketing Insight规则派生 · 可核对

· 核心话题:technology、ai。

· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?

Career Usage规则派生 · 可核对

面试中可引用「GLM-5.3发布,基座没变,能力却涨了」:围绕 technology、ai,说明你对行业动向的判断与可落地动作。

本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。

关联播客真实 RSS 单集
Pump and circumstance: is China the new OPEC?
The Intelligence · 2026.08.12
The Innovation Strategy Most Companies Miss
HBR IdeaCast · 2026.08.11
Spring, then fall: a weakened Muslim Brotherhood
The Intelligence · 2026.08.11
延伸信源A / B 级权威来源 · 供深挖
Marketing BrewACampaignAThe DrumAWARCAAdweekADigidayA
Business English提取正文真实商业词汇
airoi
ai

(本文作者为 Leo张ToB杂谈,钛媒体经授权发布) 过去的几个月,国内外大模型厂商都迎来了新一轮的版本更新,4月,OpenAI发布GPT-5.5版本,并于近日将免费用户默认模型升级为GPT-5.6 Luna;7月中旬,月之暗面发布Kimi K3;8月初,DeepSeek V4 Pro正式上线;阿里Qwen3.8-Max以2.4万亿参数规模开放API访问..…

roi

之所以让笔者对GLM-5.3在网络安全的能力有所期待的是,智谱AI官方发布的真实案例。GLM-5.3联合国内安全团队发现2404个漏洞,其中1088个为中高危,最早可追溯至约40年前,部分漏洞存在于Android、Windows、macOS、APP等人们每天使用的软件中。 GLM未来猜想 GLM-5.3交出了一份漂亮的成绩单,但它面前仍然摆着三个必须回答的…

系统商务英语 →
关联 English Brief
面向多模态推理的高效长上下文建模|AICon深圳
InfoQ 中文
“AI版金融创新”:博通大跌背后的AI芯片“卖方担保”模式
华尔街见闻
来源
阅读原文 · 钛媒体 ↗
发布:2026.08.14
类型:Business / 科技商业
话题:technology、ai
相关阅读
钛媒体/2026.08.15
兴锋作浪,大模型和机器人抢着“联姻”
钛媒体/2026.08.15
Pixel 11来了,AI真的能接管你的手机吗?
钛媒体/2026.08.15
张一鸣的10万亿参数大模型:还能跑赢时间吗?
钛媒体/2026.08.14
Robotruck重新升温,无人货运开始算经济账
钛媒体/2026.08.14
李开复老师又卖书了
个人笔记
自动同步到云端