GLM-4-Plus在SuperCLUE基准测评和司南Compass Arena榜单均位居国内第一
2024/11/16 13:24AI云资讯139777
11月8日,中文大模型测评基准SuperCLUE发布《中文大模型基准测评2024年10月报告》,智谱GLM-4-Plus凭借出色的能力表现,在43个国内外大模型中位居第一梯队,总得分位列国内大模型首位。


SuperCLUE中文大模型基准测评旨在通过多维度综合性测评,对国内外大模型的发展趋势和综合效果进行实时跟踪。本次10月报告聚焦通用能力测评,选取了国内外有代表性的43个大模型,采用多维度、多层次的综合性测评方案进行测评。测评结果显示,o1-preview的推出进一步拉大了与其他模型的差距,国内大模型第一梯队竞争激烈,持续迭代表现不俗。其中国内闭源模型GLM-4-Plus、SenseChat 5.5、AndesGPT-2.0表现优异,与ChatGPT-4o-latest相距2分以内。基于大模型在基础能力和应用能力的表现,共有23个国内大模型入选SuperCLUE模型象限。智谱GLM-4-Plus位居【卓越领导者】,代表模型在基础和场景应用上处于领先位置,引领国内大模型发展。

11月14日,在司南OpenCompass公布的大语言模型对战榜单Compass Arena中,智谱GLM-4-Plus的竞技场评级分数位列榜首,领先GPT-4o-20240513。
Compass Arena 大语言模型对战榜单致力于构建一个完全基于用户真实反馈的公正、开放、透明的榜单。用户根据与大模型的真实对话体验进行投票,依据投票结果,使用 Elo 评分系统对大模型进行排名。

据悉,GLM-4-Plus 是智谱全自研 GLM 大模型的最新版本,它标志着智谱继续瞄准通用人工智能,持续推进大模型技术的独立自主创新。作为智谱最新旗舰模型,在语言理解、逻辑推理、指令遵循、长文本输出方面都有较大突破。GLM-4-Plus 成为智谱全模型家族坚实的能力底座,在代码计算、数据分析、图像/视频特征识别等领域均实现性能的大幅提升,及成本的大幅下降,目前已上线智谱开放平台。
相关文章
- 傲融云客大模型方案落地家电售后,AI智能客服助力企业降本增效
- 让大模型少做重复计算 中科曙光发布ParaCache
- 西门子ICX给企业AI大模型构建业务“数字孪生”
- BOE(京东方)蓝鲸显示大模型亮相央视《焦点访谈》 让AI真正走进制造核心环节
- 礼博士旗下“依明科技”PLM大模型破解服装行业信息衰减难题
- 寒武纪2026上半年业绩高增 持续推进国产大模型适配优化
- 艾瑞报告认证:唯一双维度标杆!东软添翼定义医疗大模型产业化新范式
- CFP 开放丨KCD 杭州站邀您共议 Agent 时代的云原生、可观测与大模型推理
- VIPKID参与教育大模型相关标准建设,探索智能化学习新路径
- RTX 5090 移动版碾压 M5 Max:生成速度最高快 1.3 倍,但大模型面前光环褪色
- 韶音发布首款AI耳机OpenFit 2 AI,携手千问大模型打造「耳边生产力」
- 2026北京礼品展收官|茶小牛AI泡茶机以AI大模型赋能传统茶礼消费场景
- 助力企业 AI 落地,南凌科技「智枢 AI 网关」让大模型接得快、用得稳、看得见、算得清
- 中国唯一具身智能大模型重点实验室,银河通用牵头获批!
- 云知声入选2026 IDC中国AI 50强,以U2原生Agent大模型驱动产业智能化
- 忆联AM6B0:为端侧AI提速,UMA时代的大模型存储“标配”!
AI企业
更多>>AI硬件
更多>>AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









