中美开源模型大会师:Kimi、Qwen、DeepSeek、Meta和英伟达五模大横评
开源模型最近密集到有点不讲道理。七月底到八月中,Kimi K3、Qwen3.8-Max先后放出权重、DeepSeek V4 Pro正式版也刚刚上线。与此同时,沉寂了一年多的美国开源也回来了,Meta拿出Muse Glimmer,英伟达跟上Nemotron 3.5 Lightning。如此盛况,那可就必须把五个...... 本文来自微信公众号: 硅星GenAI ,作者:周一笑 开源模型最近密集到有点不讲道理。七月底到八月中,Kimi K3、Qwen3.8-Max先后放出权重、DeepSeek V4 Pro正式版也刚刚上线。与此同时,沉寂了一年多的美国开源
本条来自 虎嗅(Business / 中文商业),聚焦 technology、ai。 开源模型最近密集到有点不讲道理。七月底到八月中,Kimi K3、Qwen3.8-Max先后放出权重、DeepSeek V4 Pro正式版也刚刚上线。与此同时,沉寂了一年多的美国开源也回来了,Meta拿出Muse Glimmer,英伟达跟上Nemotron 3.5 Lightning。如此盛况,那可就必须把五个...... 本文来自微信公众号: 硅星GenAI ,作者:周一笑 开源模型最近密集到有点不讲道理。七月底到八月中,Kimi K3、Qwen3.8-Max先后放出权重、DeepSeek V4 Pro正式版也刚刚上线。与此同时,沉寂了一年多的美国开源也回来了,Meta拿出Muse Glimmer,英伟达跟上Nemotron 3.5 Lightning。 如此盛况,那可就必须把五个模型接进同一个测试环境测一测,是骡子是马拉出来遛遛。 这次的测试中,每道题额外设了统一的输出上限(输出长度),思考和作答共用这个额度,超了就算没交卷,同时超过额度的任务会重新放开上限单独完整跑一遍作为对照,所有结果由脚本+真人盲评判分。 先直接上成绩:绿格最多的是K3,十项里六项满分,DeepSeek排第二。需要注意的是表里的0分,部分是因为模型思考太长被截断,没有完整输出,后文有具体解释。 模型测试成绩 接下来我们来看看这几个开源模型的具体表现。 1 逻辑推理:两个小模型交了白卷 第一组题是24点和五位数密码锁。 24点是用给定的四个数字加减乘除凑出24;密码锁是根据几条"哪些数字对、位置对不对"的线索倒推一个五位密码,都是考多步推理的经典题型。题目全部新生成,里面还埋了一组无解的24点,看谁会硬编一个假解出来。 无解陷阱骗到了一家。K3、Qwen、Nemotron都识破了,Muse主测没答到这题,后来放开上限补跑时它上了当,硬编了一个把10用了两次的假解。 真正的意外在密码锁上,K3和Qwen全对,两个美国小模型却交了白卷,回答里一个字都没有。DeepSeek密码锁三次里有两次同样在思考撞上上限后交了白卷。 查看运行日志,两个小模型把推理题跑成了马拉松,思考写到一半就被输出上限截断了,托管商返回的结束原因写的就是超长,后面的补跑实验也印证了这一点。托管平台给这两个模型的单次输出额度本来也紧,一个只放16K token,一个只放24K。 Nemotron被上限截断的原始记录 按规则放开上限补跑。Muse Glimmer密码锁两次全对。Nemotron烧掉六万token,最后信心十足地交出错误答案。DeepSeek放开上限后,密码锁同样全对。 顺着这组题我们加了一个加时赛。 每个模型30美分,题型不变换一套新题,解不出可以重试,直到把预算花完。 Nemotron十轮花了不到10美分,24点全拿下,但密码锁还是十次都没成。 Muse密码锁前三次失败,第四次解出,15美分拿下五题全解。 K3一次认真的思考就要35美分,Qwen也要将近20美分,预算只够试一两轮。单独放开预算后K3把题解了,花费35美分,比预算线多出5美分。 这里表现突出的是DeepSeek。同一套题,它一轮全对,五题全解只花了4美分,比Muse靠重试磨出来的还便宜四倍。 2 代码画图能力:画熊猫、画地铁图、做网页,三道看得见的题 在代码呈现方面,我们先让五个模型用SVG代码画同样的画:一只白头鹰坐在共享单车前座蹬车,一只大熊猫坐后座撑伞。 SVG是用代码描述图形的格式,模型看不到画布,全凭想象在代码里摆坐标。 在这一轮,完成的最好的K3和Qwen都是能看图的多模态模型。K3的两张图都能一眼认出剧情,Qwen一张画得最满、一张没画完。 Nemotron和Muse的作品需要观众自带想象力,有点惨不忍睹。DeepSeek一张能认出剧情(鹰趴在车把上没蹬车),另一张直接没有产出。 第二道是做一个能用的网页。 我们编了一座虚构城市的地铁数据,四条线26个站,要求模型写一个单文件网页,画出规整的线路图,用户选好起点和终点后,网页要算出正确路线,再播放一段换乘动画。判分表有十项,路线算错直接判低分。 K3两次都拿满分,线路、换乘提示、动画一个不缺。Muse画出了图但路线算错,Nemotron的功能缺了一大半,Qwen在上限内没写完,页面打不开。放开上限补跑后,Qwen补交了一版完成度很高的。DeepSeek排第二。 K3寻路动画 五家地铁对比 放开上限后Qwen补交的地铁图 第三道测试把这次横评的真实数据喂给每个模型,让它们给自己的成绩单做可视化网页。 这道题输出量最大,Muse Glimmer两次都在上限内完成,拿下第二。K3一次满分,一次超限被截断。Qwen两次都没写完,放开上限补跑后完成。DeepSeek两次都在上限内完成,拿了这道题的最高分。 成绩单网页对比 DeepSeek生成的单页面 Kimi K3生成单页 3 Agent能力:接上工具修代码、洗账单,看谁能独立干完活 这个环节让模型自己动手,读文件,跑命令,改代码,一直干到收工。 agent的表现和运行环境有关,同一个模型装进不同的工具框架,成绩可能不一样。我们用最简单的循环,是为了让五家在完全相同的规则下比。 第一题是修一个埋了三个bug的小项目,要求把十二个测试全部修绿。中途我们伪造了一次工具超时,五家没有被假故障带偏,全都修到了全绿。最后的差别只在花费上,两个30B模型一次不到1美分,两个万亿参数的贵上几倍,而DeepSeek一次只要0.3美分。 看来只要是算账,就是DeepSeek赢。 修bug任务的轮次时间线 第二题是真实的脏活。 两份账单导出文件,一份藏着GBK编码,一份顶着二十多行说明文字,中间混着重复交易和该剔除的记录,要求清洗合并成一张干净的表。 K3、Qwen和DeepSeek全部满分,Muse十五轮全耗在编码问题上,Nemotron只拿到部分分数。另外我们第一次测试时托管商还不支持Nemotron的原生工具调用,这两道题它走的是纯文本协议。后面DeepInfra把支持补了上来,我们用原生工具重测了一遍,修bug依旧满分,账单题依旧没能通过。 4 写Blender脚本:建一座中式庭院 最后一个测试让模型给Blender写脚本,从零建一座低多边形的中式庭院,院墙、月亮门、松树、石灯笼、拱桥、水面都要有,脚本必须一次跑通并渲染出图。Blender的Python接口在版本之间变动很大,一个接口名写错,整个脚本就跑不起来。 K3两份脚本全部一次跑通,庭院像模像样。Qwen放开上限后也出了图。Muse的脚本一跑就报错。Nemotron先是被上限截断,放开后又把渲染引擎的接口名写错,还是没出图。 DeepSeek一份出图,另一份倒在一个早已废弃的接口参数上。 5 写作:谁更会说人话 很多人抱怨模型写东西一股AI味,我们出了四道改写题。 最简单的一道是把物业的官腔停水通知改成业主群消息,配了一道英文场景做对照。难的两道,一道是给已经吵起来的业主群写涨价说明,一道是把年度工作总结改成群里唠嗑的年终盘点。所有答卷打乱顺序,由真人盲评打分。 盲评工具 简单的题模型之间差距不大,每篇改写的关键信息倒是都没丢事实,分数差距主要在文风上。难的两道没有一个模型摸到4分,八股结构和口号频繁。DeepSeek简单题4分,难题也只有2分。K3是唯一在两道难题里都拿到3分的。不过需要说明的是,这轮测的文本都不长,结果仅供参考。 “说人话”题的高分与低分答卷 五模型核心对比(成绩、速度与价格) 6 开源模型路线更热闹了 五个模型测下来,最明显的感觉是,大模型和小模型的差距还在,但各自的长处也越来越明显。如果只看中国这三个模型,K3在冲能力上限,Qwen走稳和全能,DeepSeek则在拉升性价比。 K3的表现基本和最近几个公开benchmark的结果对得上,已经可以和最前沿闭源大模型放在一起比。这次测试里,它也是五个模型里做得最全面的一个,推理、写代码、Agent、Blender都很能打。缺点也很简单,相对贵,也偏慢。 Qwen的表现也很稳,难题基本都能做,但经常需要想很久。给它足够的时间和额度,很多事情都能做出来,只是花的时间多一些。 DeepSeek则是这次最让人意外的一个。能力不弱,价格还特别低。加时赛里五道题全做对,花费和两个小参数模型属于同一梯队。至少从这次实际花费看,它确实做到了又强又便宜。 如果这个价格还能保持下去,后面模型继续变强,DeepSeek带来的优势就不只是来自能力,而是性价比。它可能会把大家对“一个足够强模型到底该卖多少钱”的预期再往下拉一截。 小模型也没有失去意义。Muse和Nemotron在简单任务上又快又便宜,很多工作不需要上万亿参数的模型。但任务一旦变难,需要长时间推理、写复杂代码或者连续调用工具,大模型的优势还是很明显。 Meta预告旗舰Muse Spark 1.2的权重未来几周放出,阿里已经把Qwen3.8大杯的权重传上了Hugging Face。半个月里同时这么多开源模型出来的景象,一年前很难想象。不管怎么说,有了更多选择,对用模型的人来说总是一件好事。 (本次测试通过OpenRouter接入各家托管商的通道,文中的花费都按托管商标价结算,与官方API的价目表不完全匹配)
开源模型最近密集到有点不讲道理
- 开源模型最近密集到有点不讲道理
开源模型最近密集到有点不讲道理
七月底到八月中,Kimi K3、Qwen3
8-Max先后放出权重、DeepSeek V4 Pro正式版也刚刚上线
开源模型最近密集到有点不讲道理。七月底到八月中,Kimi K3、Qwen3.8-Max先后放出权重、DeepSeek V4 Pro正式版也刚刚上线。与此同时,沉寂了一年多的美国开源也回来了,Meta拿出Muse Glimmer,英伟达跟上Nemotron 3.5 Lightning。如此盛况,那可就必须把五个...... 本文来自微信公众号: 硅星GenAI ,作者:周一笑 开源模型最近密集到有点不讲道理。七月底到八月中,Kimi K3、Qwen3.8-Max先后放出权重、DeepSeek V4 Pro正式版也刚刚上线。与此同时,沉寂了一年多的美国开源也回来了,Meta拿出Muse Glimmer,英伟达跟上Nemotron 3.5 Lightning。 如此盛况,那可就必须把五个模型接进同一个测试环境测一测,是骡子是马拉出来遛遛。 这次的测试中,每道题额外设了统一的输出上限(输出长度),思考和作答共用这个额度,超了就算没交卷,同时超过额度的任务会重新放开上限单独完整跑一遍作为对照,所有结果由脚本+真人盲评判分。 先直接上成绩:绿格最多的是K3,十项里六项满分,DeepSeek排第二。需要注意的是表里的0分,部分是因为模型思考太长被截断,没有完整输出,后文有具体解释。 模型测试成绩 接下来我们来看看这几个开源模型的具体表现。 1 逻辑推理:两个小模型交了白卷 第一组题是24点和五位数密码锁。 24点是用给定的四个数字加减乘除凑出24;密码锁是根据几条"哪些数字对、位置对不对"的线索倒推一个五位密码,都是考多步推理的经典题型。题目全部新生成,里面还埋了一组无解的24点,看谁会硬编一个假解出来。 无解陷阱骗到了一家。K3、Qwen、Nemotron都识破了,Muse主测没答到这题,后来放开上限补跑时它上了当,硬编了一个把10用了两次的假解。 真正的意外在密码锁上,K3和Qwen全对,两个美国小模型却交了白卷,回答里一个字都没有。DeepSeek密码锁三次里有两次同样在思考撞上上限后交了白卷。 查看运行日志,两个小模型把推理题跑成了马拉松,思考写到一半就被输出上限截断了,托管商返回的结束原因写的就是超长,后面的补跑实验也印证了这一点。托管平台给这两个模型的单次输出额度本来也紧,一个只放16K token,一个只放24K。 Nemotron被上限截断的原始记录 按规则放开上限补跑。Muse Glimmer密码锁两次全对。Nemotron烧掉六万token,最后信心十足地交出错误答案。DeepSeek放开上限后,密码锁同样全对。 顺着这组题我们加了一个加时赛。 每个模型30美分,题型不变换一套新题,解不出可以重试,直到把预算花完。 Nemotron十轮花了不到10美分,24点全拿下,但密码锁还是十次都没成。 Muse密码锁前三次失败,第四次解出,15美分拿下五题全解。 K3一次认真的思考就要35美分,Qwen也要将近20美分,预算只够试一两轮。单独放开预算后K3把题解了,花费35美分,比预算线多出5美分。 这里表现突出的是DeepSeek。同一套题,它一轮全对,五题全解只花了4美分,比Muse靠重试磨出来的还便宜四倍。 2 代码画图能力:画熊猫、画地铁图、做网页,三道看得见的题 在代码呈现方面,我们先让五个模型用SVG代码画同样的画:一只白头鹰坐在共享单车前座蹬车,一只大熊猫坐后座撑伞。 SVG是用代码描述图形的格式,模型看不到画布,全凭想象在代码里摆坐标。 在这一轮,完成的最好的K3和Qwen都是能看图的多模态模型。K3的两张图都能一眼认出剧情,Qwen一张画得最满、一张没画完。 Nemotron和Muse的作品需要观众自带想象力,有点惨不忍睹。DeepSeek一张能认出剧情(鹰趴在车把上没蹬车),另一张直接没有产出。 第二道是做一个能用的网页。 我们编了一座虚构城市的地铁数据,四条线26个站,要求模型写一个单文件网页,画出规整的线路图,用户选好起点和终点后,网页要算出正确路线,再播放一段换乘动画。判分表有十项,路线算错直接判低分。 K3两次都拿满分,线路、换乘提示、动画一个不缺。Muse画出了图但路线算错,Nemotron的功能缺了一大半,Qwen在上限内没写完,页面打不开。放开上限补跑后,Qwen补交了一版完成度很高的。DeepSeek排第二。 K3寻路动画 五家地铁对比 放开上限后Qwen补交的地铁图 第三道测试把这次横评的真实数据喂给每个模型,让它们给自己的成绩单做可视化网页。 这道题输出量最大,Muse Glimmer两次都在上限内完成,拿下第二。K3一次满分,一次超限被截断。Qwen两次都没写完,放开上限补跑后完成。DeepSeek两次都在上限内完成,拿了这道题的最高分。 成绩单网页对比 DeepSeek生成的单页面 Kimi K3生成单页 3 Agent能力:接上工具修代码、洗账单,看谁能独立干完活 这个环节让模型自己动手,读文件,跑命令,改代码,一直干到收工。 agent的表现和运行环境有关,同一个模型装进不同的工具框架,成绩可能不一样。我们用最简单的循环,是为了让五家在完全相同的规则下比。 第一题是修一个埋了三个bug的小项目,要求把十二个测试全部修绿。中途我们伪造了一次工具超时,五家没有被假故障带偏,全都修到了全绿。最后的差别只在花费上,两个30B模型一次不到1美分,两个万亿参数的贵上几倍,而DeepSeek一次只要0.3美分。 看来只要是算账,就是DeepSeek赢。 修bug任务的轮次时间线 第二题是真实的脏活。 两份账单导出文件,一份藏着GBK编码,一份顶着二十多行说明文字,中间混着重复交易和该剔除的记录,要求清洗合并成一张干净的表。 K3、Qwen和DeepSeek全部满分,Muse十五轮全耗在编码问题上,Nemotron只拿到部分分数。另外我们第一次测试时托管商还不支持Nemotron的原生工具调用,这两道题它走的是纯文本协议。后面DeepInfra把支持补了上来,我们用原生工具重测了一遍,修bug依旧满分,账单题依旧没能通过。 4 写Blender脚本:建一座中式庭院 最后一个测试让模型给Blender写脚本,从零建一座低多边形的中式庭院,院墙、月亮门、松树、石灯笼、拱桥、水面都要有,脚本必须一次跑通并渲染出图。Blender的Python接口在版本之间变动很大,一个接口名写错,整个脚本就跑不起来。 K3两份脚本全部一次跑通,庭院像模像样。Qwen放开上限后也出了图。Muse的脚本一跑就报错。Nemotron先是被上限截断,放开后又把渲染引擎的接口名写错,还是没出图。 DeepSeek一份出图,另一份倒在一个早已废弃的接口参数上。 5 写作:谁更会说人话 很多人抱怨模型写东西一股AI味,我们出了四道改写题。 最简单的一道是把物业的官腔停水通知改成业主群消息,配了一道英文场景做对照。难的两道,一道是给已经吵起来的业主群写涨价说明,一道是把年度工作总结改成群里唠嗑的年终盘点。所有答卷打乱顺序,由真人盲评打分。 盲评工具 简单的题模型之间差距不大,每篇改写的关键信息倒是都没丢事实,分数差距主要在文风上。难的两道没有一个模型摸到4分,八股结构和口号频繁。DeepSeek简单题4分,难题也只有2分。K3是唯一在两道难题里都拿到3分的。不过需要说明的是,这轮测的文本都不长,结果仅供参考。 “说人话”题的高分与低分答卷 五模型核心对比(成绩、速度与价格) 6 开源模型路线更热闹了 五个模型测下来,最明显的感觉是,大模型和小模型的差距还在,但各自的长处也越来越明显。如果只看中国这三个模型,K3在冲能力上限,Qwen走稳和全能,DeepSeek则在拉升性价比。 K3的表现基本和最近几个公开benchmark的结果对得上,已经可以和最前沿闭源大模型放在一起比。这次测试里,它也是五个模型里做得最全面的一个,推理、写代码、Agent、Blender都很能打。缺点也很简单,相对贵,也偏慢。 Qwen的表现也很稳,难题基本都能做,但经常需要想很久。给它足够的时间和额度,很多事情都能做出来,只是花的时间多一些。 DeepSeek则是这次最让人意外的一个。能力不弱,价格还特别低。加时赛里五道题全做对,花费和两个小参数模型属于同一梯队。至少从这次实际花费看,它确实做到了又强又便宜。 如果这个价格还能保持下去,后面模型继续变强,DeepSeek带来的优势就不只是来自能力,而是性价比。它可能会把大家对“一个足够强模型到底该卖多少钱”的预期再往下拉一截。 小模型也没有失去意义。Muse和Nemotron在简单任务上又快又便宜,很多工作不需要上万亿参数的模型。但任务一旦变难,需要长时间推理、写复杂代码或者连续调用工具,大模型的优势还是很明显。 Meta预告旗舰Muse Spark 1.2的权重未来几周放出,阿里已经把Qwen3.8大杯的权重传上了Hugging Face。半个月里同时这么多开源模型出来的景象,一年前很难想象。不管怎么说,有了更多选择,对用模型的人来说总是一件好事。 (本次测试通过OpenRouter接入各家托管商的通道,文中的花费都按托管商标价结算,与官方API的价目表不完全匹配)
本条目归入「Technology AI」垂直,涉及真实话题:technology、ai。
· 市场:关注 technology、ai 对相关品类与竞争格局的潜在影响。
· 消费者:受众行为与偏好变化值得追踪。
· 品牌:本动向对品牌资产建设的启示。
· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。
· 核心话题:technology、ai。
· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?
面试中可引用「中美开源模型大会师:Kimi、Qwen、DeepSeek、Meta和英伟达五模大横评」:围绕 technology、ai,说明你对行业动向的判断与可落地动作。
本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。
开源模型最近密集到有点不讲道理。七月底到八月中,Kimi K3、Qwen3.8-Max先后放出权重、DeepSeek V4 Pro正式版也刚刚上线。与此同时,沉寂了一年多的美国开源也回来了,Meta拿出Muse Glimmer,英伟达跟上Nemotron 3.5 Lightning。如此盛况,那可就必须把五个...... 本文来自微信公众号: 硅星GenAI…
开源模型最近密集到有点不讲道理。七月底到八月中,Kimi K3、Qwen3.8-Max先后放出权重、DeepSeek V4 Pro正式版也刚刚上线。与此同时,沉寂了一年多的美国开源也回来了,Meta拿出Muse Glimmer,英伟达跟上Nemotron 3.5 Lightning。如此盛况,那可就必须把五个...... 本文来自微信公众号: 硅星GenAI…