引领多模态大模型新高度,山海UniGPT-mMed登顶MMMU权威测评榜
2024/10/09 15:50AI云资讯108117
近日,多模态人工智能模型基准评测集MMMU更新榜单,云知声山海多模态大模型UniGPT-mMed以通用能力、医疗专业能力双双排名第一的优异成绩登顶榜首,力压GPT-4V,充分彰显其硬核实力。

作为国内权威多模态基准评测,MMMU由IN.AI Research等多家机构联合构建,专注于考量人工智能在解决大学层次多学科问题时的多模态理解与推理能力。
该评测集涉及艺术与设计、商科、科学、健康与医学、人文与社会科学、技术与工程等六个常见学科,包含 1.15 万个精心选取的多模态问题,涵盖 30 个不同的科目和183 个子领域。同时,MMMU 中许多问题都需要专家级的推理能力,例如,使用傅立叶变换或均衡理论来推导问题的解,这在满足评测内容广泛性的同时,也确保了其深度。
此外,MMMU还提出了两个独特的挑战:一是其涵盖多种图像格式,从照片和绘画等视觉场景到图表和表格,可用于测试 LMM 的感知能力;二是MMMU的输入形式是文本和图像的混合,要求AI模型能够将图像和文本信息结合起来进行深入理解,并在此基础上执行复杂推理。这不仅考验了模型的学科知识储备,也对其综合分析和应用能力提出了更高要求。
评测结果显示,云知声山海多模态大模型UniGPT-mMed以总分57的优异成绩登顶榜首,并在健康与医学细分赛道超越GPT-4V,力压一众大模型拔得头筹,充分展现出其在拥有业内一流的通用能力之外,更具备打造世界领先的行业大模型的能力。

UniGPT-mMed是云知声基于山海大模型底座构建的多模态大模型。其通过分析和整合海量论文、书籍及网站数据,利用精细化数据处理技术,自动识别并提取图片及其相关文本描述,并通过多模态分析技术评估图片的质量和图文之间的匹配度,筛选出最优数据。与此同时,系统能够参考图片和上下文信息对图片进行重新描述,使得图文数据更加对齐。
通过预设问答场景,UniGPT-mMed能够将图文对齐数据转化为高质量的场景问答数据集,并采用思维链和自我反思技术,进一步优化生成数据,最终构建起一个包含数亿条高质量图文问答的数据集,进而为用户提供更加丰富、准确和可靠的信息检索和问答服务。
此次评测,是云知声在多模态大模型赛道持续深耕、不断技术创新的成果体现。
作为中国AGI技术产业化的先行者,云知声于2016年开始打造Atlas人工智能基础设施,并以此为基础,构建云知大脑(UniBrain)技术中台——以山海(UniGPT)通用认知大模型为核心,结合多模态感知与生成、知识图谱、物联平台等智能组件,为云知声智慧物联、智慧医疗、智慧座舱、智慧交通等业务提供高效的产品化支撑,持续推动“U(云知大脑)+X(应用场景)”战略布局,致力推动千行百业的智慧化升级。
作为云知大脑的核心,山海大模型具备语言生成、语言理解、知识问答、逻辑推理、代码能力、数学能力、安全合规能力七项通用能力及插件扩展、领域增强、企业定制三项行业落地能力,能够满足更多场景的应用需求。今年8月,云知声推出山海多模态大模型,通过整合跨模态信息,山海多模态大模型能够接收文本、音频、图像等多种形式作为输入,并实时生成文本、音频和图像的任意组合输出,带来实时多模态拟人交互体验,开启AGI新范式。
目前,山海大模型已相继在OpenCompass大模型评测、SuperCLUE中文大模型基准测评、MedBench评测、Flageval大模型评测、SuperBench等多个权威评测中屡创佳绩,稳居国内大模型第一梯队;在医疗专业能力上,其基于山海大模型孵化的医疗大模型在CCKS 2023 PromptCBLUE医疗大模型评测中夺得通用赛道一等奖,并在MedBench评测中位列全球第一,各项指标全面超越GPT-4。
登顶MMMU评测榜,充分印证了云知声山海多模态大模型在通用能力、专业能力层面的突出实力,也将鞭策云知声持续迭代多模态大模型技术底座,实现大模型技术在多领域场景下的渗透和应用,以技术创新为各行各业带来更多智能化变革。
相关文章
- 中山大学、南洋理工大学、混沌摆实验室提出 ProSA 多模态文档解析评测框架|EMNLP 2026
- Clipto MCP斩获 Product Hunt 月榜第一:为全球智能体补上个人多模态记忆
- 紫东太初开源 ZDTaichu5.0-9B:10B 参数内空间具身能力最强通用多模态大模型
- 中科融合NANO微小型多模态高速扫描模组赋能具身智能迈向精细化作业
- 2026时序数据技术创新大会:多模态时序数智化软件栈发布,生态计划启动
- 联合影像 × 华力创科学,共筑具身智能的多模态感知底座
- 填补行业空白!宇视科技联合多家权威机构发布中小学心理健康多模态智能动态评估团体标准
- 原生统一多模态进阶!SenseNova U1.5-Lite-Preview开源,生成编辑能力再进化
- 商汤发布日日新SenseNova U1 Pro,面向长程任务的交付级原生多模态智能体基座
- 当虹科技AI多模态能力体系,首次亮相WAIC2026
- 看懂一条素材,不能只靠字幕和肉眼:钛动科技把多模态理解拉进营销现场
- 合合信息一季度财报营收同比增27.53%,联手亚马逊云科技落地多模态文档智能体
- 多模态、无代码、全流程 东软多模态医学人工智能平台 让医生轻松用AI
- 旷视多模态上下文学习工作被全球顶会ICML 2026录用,亮相韩国首尔
- 灵科超声波多模态控制与全链互联重构全球焊接柔性生产线
- Om AI联汇发布VLX:全球首个面向物理世界的端侧流式多模态模型
AI企业
更多>>AI硬件
更多>>- 陶瓷电容银浆电极“铜替银”:振华真空双面连续溅射生产线稳定量产14年
- 106TOPS 端侧算力释放,联发科 Genio Pro 5100 叩开物理 AI 大门
- 三星Galaxy Z8系列影像创新的幕后故事:人像视频功能如何重现专业镜头质感
- 海康存储亮相2026第六届智能汽车芯片生态大会 全栈车规存储方案赋能智能汽车“芯”生态
- 七腾机器人品牌发布会定档9月22日:十六年“先行”之后,这次要亮什么牌?
- BOE(京东方)携手努比亚打造全球首款AI智能体手机 以屏为媒开启全场景AI体验新纪元
- 索尼正式发布400mm和600mm超轻超远摄定焦G大师镜头
- HGDC 2026:从多端到无界,荣耀携手开发者共创更智慧更流畅的全场景新生态
AI产业
更多>>AI技术
更多>>- 科大讯飞发布Spark-Audio-1.0-Preview,全国产语音基座大模型实现从“听清”到“听懂”
- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式









