Hi~新朋友,记得关注我们哟
Z.ai 的最新旗舰模型在 Artificial Analysis 的智能基准指数上,表现与开源权重领先者 Kimi K3 持平。该公司表示,这个模型在发现并利用软件漏洞方面能力提升,因此在发布其权重之前需要先进行安全测试。
● 最新消息:Z.ai 仅通过微调其前代模型 GLM-5.2,就提升了 GLM-5.3 在编码和智能体工作中的表现,而无需从头训练一个新模型或修改其架构。
✴ 输入/输出:输入文本最多 100 万 token,输出文本最多 128,000 token,速度为每秒 90 token
✴ 架构:混合专家 transformer,总参数量 7530 亿,每个 token 激活 400 亿参数
✴ 功能:可调推理级别(低、高、最大)、工具调用、结构化输出、流式传输、上下文缓存
✴ 性能:在 Artificial Analysis 的 Intelligence Index 上获得 60 分;在对 Z.ai 的测试中,其在 CyberGym(漏洞检测基准)上取得所有模型中的最高分
✴ 可用性/价格:GLM Coding Plan 订阅(每月 18 美元至 168 美元)和 ZCode 开发环境;Z.ai 的 API 价格为每百万输入/cached/输出 token $1.40/ $0.26/ $4.40
✴ 权重/许可证:权重预计在发布后约两周提供,许可证尚未公布(GLM-5.2 使用 MIT 许可证)
✴ 未披露:知识截止时间、GLM-5.3 的具体训练数据
● 工作原理:公司扩大了 GLM-5.2 的微调方案,将其应用到规模更大、更多样化的环境集合中(即模型尝试执行指定任务的模拟工作区)。该方案包括单次 rollout 的异步优化,这是一种强化学习方法,它一次只训练一个尝试,而不是等待整批完成。训练方法还会把智能体尝试过程中的长记录切分并压缩成片段,使模型能从长时间运行的任务中学习,而不只是短任务。
✴ 公司设计的编码相关训练任务,更像长期的软件工程工作,而不是规整、独立的谜题。在其中一个任务里,模型获得了一个机器学习工程师的工作环境,被要求找出训练流水线变慢的原因,然后优化流水线,并在不降低输出质量的前提下证明提速有效。
✴ Z.ai 训练所需的环境数量,超过了开发者自己能够构建的范围。公司使用智能体来构建环境,并在某些任务中也用智能体来提供奖励信号。
✴ 另一个独立的评分智能体会先检查每个任务在对应环境中是否可解,然后再对模型表现打分。Z.ai 构建每个评分器时都不会向其展示任务的参考答案。只有当评分器接受了正确解法,并且正确拒绝了未经修改或未完成的方案时,它的判定才算有效。
✴ 公司还研究并试图阻止模型进行奖励黑客行为,即模型利用漏洞骗取奖励而不是真正完成任务。
● 性能表现:独立测试显示,GLM-5.3 与顶级开源权重模型处于同一水平,只比领先的专有模型低几个百分点,但在智能体工作上有显著提升。Z.ai 自己的测试显示,其在智能体编码和网络安全方面的提升最大。
✴ 在 Artificial Analysis 的 Intelligence Index 上,(这是一项由九个对经济上有用任务的评估组成的综合指标),GLM-5.3 将推理设为最大时得分 60 分(每项任务 0.68 美元),与 Kimi K3(每项任务 0.84 美元)表现持平,并比将推理设为最大时的 GLM-5.2(每项任务 0.44 美元)高出 7 分。它落后于领先的专有模型,包括将推理设为最大的 Claude Opus 5(63 分,每项任务 2.34 美元)、将推理设为最大的 GPT-5.6 Sol(61 分,每项任务 0.96 美元/1.23 美元)以及将推理设为高的 Grok 4.6(61 分,每项任务 0.84 美元)。
✴ 在 Z.ai 的网络安全测试中,GLM-5.3 在 CyberGym (通过触发错误来寻找并确认源代码中的漏洞)上获得 84.5%,这是该基准上的最高分,超过 Claude Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。在 ExploitBench(测试针对加固软件的漏洞利用尝试)上,GLM-5.3 达到 54.4%,是 GLM-5.2(24.4%)的两倍多,也领先于 Kimi K3(32.2%),但远远落后于 Claude Mythos 5(78.0%)和 GPT-5.6 Sol(76.5%)。
✴ GLM-5.3 的通用知识成绩就没那么亮眼了。它在 Humanity’s Last Exam 上答对了 42.3% 的问题(落后于较旧的 Grok 和 Claude Opus 模型),在 GPQA Diamond 上解决了 91.72% 的问题(在中等设置下落后于 Gemini 3.7 Flash),而且其 AA-Omniscience Accuracy 得分只有 34%,远低于其他顶级模型。
✴ 在 Code Bench 上,这是 Z.ai 针对编码任务设计的自有基准,基于完成度和逐步准确率评分;将推理设为最大时,GLM-5.3 使用大约每个任务 75,000 个输出 token 完成了 34.5% 的任务,领先于将推理设为最大的 Claude Opus 4.8(29.5%,每个任务 120,000 token),但落后于将推理设为最大的 Claude Fable 5(39.5%,每个任务 57,000 token)。
● Z.ai 的低调发布:本周,Z.ai 确认,Ox Alpha——一个处于低调模式、在 OpenRouter 和其他平台用户中迅速走红的多模态模型——实际上就是 GLM-5.3 Flash。公司还依据 MIT 许可证发布了这个 3200 亿参数模型的权重。
● 新闻背后:GLM-5.3 出现在关于“具有先进网络安全能力的开源权重模型是否危险到不应发布”的争论中,并同时为双方的观点提供了可信度。
✴ Z.ai 选择的是临时护栏,而不是 OpenAI 和 Anthropic 采取的永久性方案;后两者都要求组织注册后才能使用其最擅长安全利用的模型。相反,Z.ai 公布了该模型在 CyberGym 和 ExploitBench 上的得分,并选择只在与经过筛选的安全合作伙伴进行两周安全评估后才发布模型权重。
✴ GLM-5.3 的发布引来了竞争对手的直接回应。在 8 月 17 日的一篇帖子中,OpenAI 总裁 Greg Brockman 警告称,具备接近或达到最先进水平网络技能的开源权重模型,可能会“显著加速威胁态势”,并附上了 GLM-5.3 的发布页面链接。他的警告出现在数周之后;此前,OpenAI 自己的评估智能体曾从其 ExploitGym 环境中逃脱,并攻破了 Hugging Face 的基础设施。
✴ 对其他开源权重模型的早期测试表明,这种警报可能超过了实际威胁。7 月,美国和英国的 AI 安全研究机构联合评估了 Kimi K3,发现它在 41 项 ExploitBench 任务中没有执行任意代码——这是最严重的结果。最强大的专有模型在关闭防护后,平均会执行 20 次任意代码。
●重要原因:Z.ai 的目标是打造更强的智能体编码器,但同时也得到了一个非常擅长发现安全漏洞的模型。公司有意加入了数据和环境,当模型发现网络安全缺陷时就会获得奖励。按预期,随着训练规模扩大,这项能力也随之提升,并在 CyberBench 上超过了其他所有模型。但该模型在构建漏洞利用方面的进步,超过了设计者在发现漏洞方面的目标。公司并不打算让 GLM-5.3 在 ExploitBench 上的得分比前代提高一倍以上;模型只是通过追逐利用漏洞所带来的可用奖励,变得更强了。
● 我们在想:Z.ai 每次发布的模型都比上一次更强,也引发了更多关注。所有用户都会受益于 AI 实验室彼此竞争、不断超越对方——尤其是在它们把权重开放给所有人研究、修改,并在自己的硬件上运行的时候。继续把新模型呈上来吧!
点击下方阅读原文查看更多有趣内容哦~