玉溪塑料挤出机 实测智谱GLM-5.3:网罗安万能否成为下个落地场景?
国产开源大模子的桌上玉溪塑料挤出机,又落下张新。
8月14日, 智谱亮出我方的新答卷——新代基座模子GLM-5.3肃肃发布。
《科创板日报》记者获悉,该模子总参数界限7430亿,主要通过后老师竣事智商跃升,在代码与网罗安全两个进取的弘扬"出立项时预期":代码智商居开源模子,对都强闭源模子Claude Fable 5;在白盒代码审查与缝隙理等基础安全任务中过Mythos 5。
值得提的是,近期巨匠大模子新品密集迭代、上新节律明显提速。北京时辰8月13日凌晨,DeepSeek肃肃发布V4 Pro(DeepSeek-V4-Pro-0813)并上线API,新版块强化Agent智能体智商。
稍早前,马斯克旗下xAI刚刚发布Grok 4.6,调换此前亮相的Kimi K3、阿里通义千问新代旗舰版块,国表里厂商围聚加码复杂任务、器具调用向,大模子赛谈竞争跳跃升温。
实测GLM-5.3
智谱关连东谈主士对《科创板日报》记者称,与GLM-5.2比较,基座模子没变,但通过后老师Scaling竣事编程智商50普及,出现了出预期的模子智商。
关连数据涌现,在计议模子于简直末端环境中完成复杂任务的Terminal-Bench 3.0上玉溪塑料挤出机,GLM-5.3得分从4.6普及至28.3(Kimi K3为17.4);在聚焦长程软件工程与络续代码修改智商的DeepSWE v1.1上,得分从46.2普及至66.9(K3为67.5);在遮蔽多类简直业场景、强调跨器具和谐与长程任务的Agents' Last Exam上,得分从23.8普及至28.5(K3为27.6);在遮蔽44种处事、窥伺真不二价值常识职责的GDPval-AA v2中得分1769(K3为1682),展现出基于编程的业任务实际智商。
GLM-5.3莫得蜕变基座模子,依靠放大后老师界限就竣事编程智商50普及,在多个开源编程基准冲到。后老师Scaling是否仍是成为大模子迭代的新主流阶梯?
赛迪照拂人东谈主工智能与大数据照拂中心分析师白润轩对《科创板日报》记者分析,后老师Scaling正在成为大模子迭代的重要阶梯,这个判断在GLM-5.3上获取了比较明晰的考据。基座模子不绝堆算力的旯旮收益在收窄,行业内仍是运行把多资源插足到强化学习、长程任务环境和可考据励机制上,而不是味追求参数界限延迟。GLM-5.3基座没变,靠扩大后老师界限把编程智商往上拉了个台阶,诠释基座之上还有可不雅的智能空间不错被激活,这条路在工程上是建造的。
谈及这种智商暴涨是否为基准测试的“刷分应”,他判断,这种阶梯和单纯刷榜有内容辞别。刷榜依赖的是静态数据集和固定评测狡计,模子不错从东谈主类偏好里学习对都手段来提分数。而GLM-5.3的后老师依赖的是简直可实际的代码环境,模子须在末端里跑测试、看报错、反复修改,老师信号来自任务是否实在完成。是以它的智商根基接近简直软件工程场景,而不是对评测题观念模式匹配。GLM-5.3把后老师从调对话立场进到了搞定长链路工程问题这个层面,向自身是简直的,但具体迁徙果还要看后续在简直设备职责流里的沉稳、本钱率,以及面临非标准化需求时的泛化智商。
《科创板日报》记者时辰对GLM-5.3进行了数小时连厚实测,熟谙其在复杂3D工程全链路任务上的端到端生成智商。记者条目模子以资Three.js工程师兼分镜师的身份,从托福套无缺产物:既要在浏览器中竣事可交互的三东谈主称亮堂立场敞开寰宇Web Demo,还要复用同场景资源离线逐帧渲染出60fps电影感宣传片,全程仅提供瞎想规格、素材清单与验收标准,统共代码由模子自主编写,此外,还条目作念个3D小游戏大闹玉阙游戏的设备生成。
经过半小时傍边的运行,GLM-5.3顺利完成了全历程任务输出,既生成了可径直在浏览器中加载运行的敞开寰宇交互Demo代码,也同步产出了适配60fps帧率的电影感宣传片渲染剧本,整套托福物简直需东谈主工二次颐养即可落地运行,直不雅展现了其在复杂3D工程全链路任务上的端到端生成智商。
押注下个场景
智谱在网罗安全这条赛谈上的布局,并非临时起意。据智谱面临《科创板日报》记者先容,隔热条PA66生产设备其2025年9月就启动了网罗安全向照拂,在GLM-5.2、GLM-5.3研发工夫络续加码:搭建多长程任务环境、丰富的环境类型,并与国内安全实验室进行业的harness共创。
在CyberGym测试中,模子从白盒源代码动身,通过触发措施故障来识别和考据缝隙。GLM-5.3得分为84.5,于GLM-5.2的77.2,也略于Mythos 5的83.8和GPT-5.6 Sol的83.6。
《科创板日报》记者获悉,GLM-5.3发布前两周,智谱联清华、南开及多头部安全团队开展密集红队测试,累计发现缝隙2404个,其中中危1088个,遮蔽220个神情,部分遵循获微软致谢并进入CNVD、CNNVD官知道历程。敞开上先完成安全加固,甘休潜在流弊智商、保留御价值,中枢敏锐智商仅向受信考据用户敞开,三评估说明其御智商较强、缝隙哄骗难度。
智谱为什么选用在这个节点插足彀罗安全向?白润轩觉得,网罗安全是AI智商落地刚的场景之,智谱在这个节点选用重投,看到的是供给严重不及和规压力络续加大的双重需求。企业代码量爆炸式增长,守永迢遥于东谈主力颓势。许多企业的安全团队界限有限,与此同期,数据安全法、重要信息基础设施保护条例等监管条目趋严,企业须把安全审计镶嵌设备历程,不成再靠过后支援,规驱动的需求正在从金融、电信向政务、动力、医疗等域快速扩散。
白润轩判断,智谱从2025年就运行布局这个向,与国内头部安全实验室共建任务环境和评测框架,诠释它不仅仅把安全四肢模子智商的家具,而是四肢个可交易化的垂直进口。将来安全智商很可能成为大模子在B端落地的进攻合手手,尤其是在金融、电信、政务、动力这些对规和攻度敏锐的域,AI驱动的自动化安全审计和缝隙挖掘有望填补东谈主力缺口,改变攻不合称的格式。
把镜头拉远,这是盘大的棋。基础模子智商日渐趋同之后,对基础模子公司而言,下阶段的竞争不仅是模子智商之争,是价值场景之争。
个值得闪耀的行业信号是:巨匠头部AI公司正在殊途同归地把网罗安全智商摆上货架。本年4月,Anthropic发布以安全智商为点的Claude Mythos,仅向约150大型机构提供办事——安全智商被径直标价为面向大客户的商品;OpenAI则让模子攻网罗攻评测,其"逃狱"事件赶巧发生在这过程中。
Gartner官揣度,2025年巨匠书息安全开销达2130亿好意思元,2026年将增至2400亿好意思元,其中安全软件增长快,东谈主工智能被列为开销增长的主要驱动成分。
智商的落点,终指向交易化。Coding Agent、安全审计、企业办事,都可能成为基础模子公司下阶段交易化的进攻进口。
据先容,智谱已同步上线官编程器具ZCode、率器具AutoClaw及GLM Coding Plan订阅办事,API很快上线,无缺模子权重瞎想两周内开源。Q Q:183445502相关词条:罐体保温施工 异型材设备 锚索 玻璃棉 保温护角专用胶
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。
