中文大模型幻觉测评:豆包大模型准确率全球第一,超越DeepSeek-R1、Gemini-2.5、GPT-4o
2025/05/24 21:41AI云资讯16195
近日,根据SuperCLUE 发布的最新一轮中文大模型忠实性幻觉测评结果,豆包大模型1.5 Pro(Doubao-1.5-pro-32k)以仅4%的幻觉率、96%的准确率排名总榜第一,超越 DeepSeek-R1、DeepSeek-V3、Gemini-2.5-pro、GPT-4o-latest 等中外主流模型。

在涵盖文本摘要、多文本问答、对话补全等关键任务的细分评测中,豆包大模型1.5 Pro也均位列全球第一,在阅读理解任务中,其准确率则为国内最高,展现出在复杂语言理解与生成场景中的出色能力。

SuperCLUE 由独立第三方推出,是当前中文大语言模型评测的重要基准体系。其中 SuperCLUE-Faith 聚焦中文内容生成过程中的忠实性与幻觉控制能力,从文本摘要、阅读理解、多文本问答以及对话补全等角度展开测评,对象包括国内外共计16款具有代表性的模型,评估结果具备较强公信力与行业参考价值。
目前,豆包大模型家族已覆盖全模态、全场景,包括大语言模型、深度思考模型、视觉理解模型、语音大模型,以及图像、视频等视觉大模型,企业可以通过字节跳动旗下云服务平台火山引擎使用豆包大模型API服务。其中, 豆包大模型1.5 Pro 基于 MoE 架构构建并采用训练-推理一体化设计思路,在保证高性能的同时显著降低推理成本。通过激活有限参数实现对大规模场景的精准理解与生成,其综合性能已超过多款超大稠密预训练模型。
截至2025年3月底,豆包大模型日均 tokens 调用量已超过12.7万亿,是2024年12月的3倍,是一年前刚刚发布时的106倍。IDC 报告显示,2024年中国公有云大模型调用量激增,火山引擎以46.4%的市场份额位居中国市场第一。

据悉,火山引擎将于6月11日在北京举办FORCE原动力大会,将带来豆包大模型的最新升级进展与能力进化。
相关文章
- 它石智航AWE 3.5具身基座大模型正式发布,打造改变世界的物理AI
- 全栈算力破局落地难题,超云携全新大模型推理方案亮相 WAIC2026
- AI记忆头部公司获亿元Pre-A轮融资,要改写大模型训练范式
- 科大讯飞联合主办WAIC法律大模型分论坛 星火晓法超级智能体首次发布
- WAIC 2026|M50 Inside终端集中亮相,端侧大模型迈入规模化商用新进程
- 3B参数跑赢千亿大模型!Om AI联汇携全球首个端侧原生VLX模型系列亮相WAIC
- 物理世界大模型率先落地能源行业,洞察时空携手皖能集团产业研究院打造“安徽能源智能体”
- 努比亚智能体大模型率先通过备案 为AI手机筑牢安全根基
- “首发,前沿大模型突破渗透测试新范式”——绿盟智能渗透测试系统2.0正式发布
- OpenAI发布GPT-Live-1大模型,智能语音模式全面升级
- 国内首个!飞渡科技工业级空间智能大模型“峥嵘“通过国家网信办备案 空间智能产业迎来合规商用里程碑
- 视频生成大模型搞不定几何一致,如视让每一帧符合物理世界的逻辑
- 人人都有大模型,千匠网络押注的是落地能力
- AI大模型产业应用创变营顺利举办,智数集团携东莞软协共探AI产业落地路径
- 全球前三!中国电信网络大模型及智能体 斩获GSMA多项国际权威认证
- 大模型重塑视觉 AI,商汤获Gartner认定为全球前沿技术创新者
AI企业
更多>>AI硬件
更多>>AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









