智谱发布GLM 5.3:称“编程能力最强的开源模型”,接近Fable 5

  8月14日 ,智谱(2513.HK)发布GLM-5.3 ,与GLM-5.2相比,基座模型没变,但通过极致的后训练Scaling大大提高了模型的智能上界:数十倍的长程任务环境、更丰富多样的环境类型 、超长的后训练时间 。智谱表示 ,在多项主流基准测试中GLM-5.3是当前排名比较高 的开源模型,编程与智能体能力接近Claude Fable 5,编程体感超过其他国产模型 。

智谱发布GLM 5.3:称“编程能力最强的开源模型”	,接近Fable 5-第1张图片

  智谱称,相比前代,GLM-5.3的新能力包括:更强的编程能力 、网络安全能力、后训练Scaling以及开源。

  根据智谱介绍 ,在衡量模型于真实终端环境中完成复杂任务的Terminal-Bench 3.0上,GLM-5.3得分从4.6提升至28.3;在聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1上,得分从46.2提升至66.9;在覆盖多类真实专业场景、强调跨工具协作与长程任务的Agents‘ Last Exam上 ,得分从23.8提升至28.5。在覆盖44种职业 、考察真实高价值知识工作的GDPval-AA v2中得分1769,展现基于编程能力涌现的专业任务执行能力 。

智谱发布GLM 5.3:称“编程能力最强的开源模型	”,接近Fable 5

  在白盒代码审查与漏洞发现等安全任务中 ,GLM-5.3的表现持平Mythos 5。“从任务链条看 ,网络安全能力大致包括代码审查、漏洞验证、漏洞利用以及真实环境中的攻防闭环。我们选取了覆盖漏洞分析 、验证和利用不同阶段的三个基准,对GLM-5.3的网络安全能力进行了全面评估,GLM-5.3当前优势主要集中在前半段 。 ”智谱表示 ,在CyberGym测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞。GLM-5.3得分为84.5% ,高于GLM-5.2的77.2%,也略高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%。

  近期,大模型领域频频上新 。

  8月13日凌晨 ,DeepSeek V4 Pro正式推出,并已更新至API,模型版本为DeepSeek-V4-Pro-0813 ,新版本增强了Agent能力。根据DeepSeek给出的模式测试对比成绩,与此前V4-Pro-Preview版本相比,V4-Pro-0813已经全面提升 ,例如在AI编程智能体基准测试DeepSWE中 ,得分从Preview的7.3,大幅提升至62.7,甚至超越了Claude Opus 4.8。在AI安全智能体基准测试Cybergym、智能体基准测试AutomationBench中甚至超越近来 公认最强大的Claude Fable 5 。

  随后 ,DeepSeek首款智能体也开放测试,13日晚间,DeepSeek宣布 ,DeepSeek Harness的开发者预览版(v0.1 版本)面向全球 Harness开发者开放测试,并同步以 MIT 协议开放源代码。DeepSeek Harness 采取“一切皆插件”的设计思路。我们采用插件式开放架构来构建 Agent Harness:模型、工具 、技能、会话、沙箱 、存储、循环、调度 、UI 等所有 Agent 能力均由插件组合而成,可自由替换 、灵活重组 。

  与此同时 ,SpaceXAI发布Grok 4.6 。SpaceXAI表示,新模型是在Grok 4.5基础上进一步升级,重点提升长流程任务中的表现 ,以及处理更复杂的交互式、视觉和知识工作任务的能力。

  截至发稿时,智谱跌超4%。

  澎湃新闻

文章推荐

  • 【北京新增确诊例数多少,北京新确诊病例】

      8月14日,智谱(2513.HK)发布GLM-5.3,与GLM-5.2相比,基座模型没变,但通过极致的后训练Scaling大大提高了模型的智能上界:数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间。智谱表示,在多项主流基准测试中GLM-5.3是当前排名比较高的开...

    2026年08月14日
    0
  • 【AC米兰主帅确诊,AC米兰换帅】

      8月14日,智谱(2513.HK)发布GLM-5.3,与GLM-5.2相比,基座模型没变,但通过极致的后训练Scaling大大提高了模型的智能上界:数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间。智谱表示,在多项主流基准测试中GLM-5.3是当前排名比较高的开...

    2026年08月14日
    3
  • 铅标准费用/铅定费用

      8月14日,智谱(2513.HK)发布GLM-5.3,与GLM-5.2相比,基座模型没变,但通过极致的后训练Scaling大大提高了模型的智能上界:数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间。智谱表示,在多项主流基准测试中GLM-5.3是当前排名比较高的开...

    2026年08月14日
    0
  • 铜白银费用/白铜和白银的费用

      8月14日,智谱(2513.HK)发布GLM-5.3,与GLM-5.2相比,基座模型没变,但通过极致的后训练Scaling大大提高了模型的智能上界:数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间。智谱表示,在多项主流基准测试中GLM-5.3是当前排名比较高的开...

    2026年08月14日
    4