Compass Arena首期大模型竞技场榜单揭晓,智谱AI GLM-4系列模型展示领先实力
2024/06/15 11:17AI云资讯16563
6月13日,司南OpenCompass和魔搭ModelScope联手推出的大语言模型竞技场 Compass Arena公布首期大模型对战榜单。智谱AI的GLM-4 w/search 排名仅次于GPT-4o,位列国内大模型第一。相比 GLM-4,GLM-4 w/search 可以在交互过程中引入外部搜索引擎信息辅助内容生成。

Compass Arena司南大模型竞技场是由司南OpenCompass团队和魔搭ModelScope团队共同推出的大语言模型 (LLM) 评测平台,旨在为国内的大语言模型领域引入一种全新的竞技模式,为广大互联网用户提供了一个匿名、随机的大语言模型竞技环境,以产生更加客观和真实的评价。Compass Arena汇集了Qwen-Max、GLM-4、abab6.5以及Llama 3系列等 20 余个主流大语言模型,通过创新的竞技模式,让用户在直观体验比较不同模型的性能后,根据自己对生成内容质量的主观判断,自由评估选择生成效果更为出色的大模型。
Compass Arena大模型竞技场首期对战榜单收集了截至6月12日接近6000条由用户真实反馈的大模型匿名对战数据,经过数据清洗和过滤后利用Bradley-Terry模型估计了大语言模型的竞技场Elo等级分数和95%置信区间,并使用该等级分数对大模型进行排名。榜单中,智谱AI的GLM-4w/search凭借回答环节引入外部搜索引擎信息能力的辅助,有效提升了生成内容的准确性和完整性,排名仅次于GPT-4o位列第二名,成为Compass Arena大模型竞技场首期对战榜单国内大模型第一名。

值得一提的是,智谱AI的GLM-4系列模型自发布以来便收获业内及广大用户认可,并多次在权威榜单与全球顶级大模型一较高下。清华《SuperBench大模型综合能力评测报告》显示,GLM-4在语义理解等方面的能力表现超过众多国际一流模型,在代码、智能体等方面,排名国内第一。在SuperCLUE-Fin(SC-Fin)中文原生金融大模型测评基准中,GLM-4斩获一项A+及多项A级评价,在国内大模型中排名第一。
据了解,智谱AI于今年1月推出新一代基座大模型GLM-4,并在6月初发布最新开源模型GLM-4-9B,该模型拥有更强的基础能力,支持更长的上下文(最高支持1M/约两百万字),有更精准的函数调用和AllTools能力,并在这个尺寸上首次具备了多模态能力。GLM-4-9B综合能力相比ChatGLM3-6B提升40%,全面超过Llama-3-8B-Instruct,中文学科能力提升50%,最高支持达1百万tokens长文本,支持多达26种语言,函数调用(Function Call)能力媲美GPT-4-Turbo。
上述模型均已在智谱AI MaaS大模型开放平台上线,开发者可以通过bigmodel.cn便捷接入GLM-4全系列模型开放API,从而体验智谱大模型的卓越性能。
相关文章
- 中国唯一具身智能大模型重点实验室,银河通用牵头获批!
- 云知声入选2026 IDC中国AI 50强,以U2原生Agent大模型驱动产业智能化
- 忆联AM6B0:为端侧AI提速,UMA时代的大模型存储“标配”!
- 如视×苏州博物馆:业内首款博物馆专属大模型Argus Museum上线
- 依托自研同传大模型 讯飞 AI 翻译耳机重塑专业翻译新标准
- 从“接入大模型“到“经营AI“:千匠网络的企业级实践
- 杭叉集团举办首届AI DAY科技日 正式发布LogiMind具身大模型与全系列叉车机器人
- 破局大模型落地“最后一公里“:WAIC 2026超云展示全栈推理方案的技术路径与产业实践
- 天谱乐大模型发布4.7,让AI音乐更懂“二次创作”
- 它石智航AWE 3.5具身基座大模型正式发布,打造改变世界的物理AI
- 全栈算力破局落地难题,超云携全新大模型推理方案亮相 WAIC2026
- AI记忆头部公司获亿元Pre-A轮融资,要改写大模型训练范式
- 科大讯飞联合主办WAIC法律大模型分论坛 星火晓法超级智能体首次发布
- WAIC 2026|M50 Inside终端集中亮相,端侧大模型迈入规模化商用新进程
- 3B参数跑赢千亿大模型!Om AI联汇携全球首个端侧原生VLX模型系列亮相WAIC
- 物理世界大模型率先落地能源行业,洞察时空携手皖能集团产业研究院打造“安徽能源智能体”
AI企业
更多>>AI硬件
更多>>AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









