中国移动发布《审计行业大模型评测白皮书》及配套测试集,为审计大模型建立“度量衡”
2025/10/12 21:58AI云资讯11894
10月11日,在2025中国移动全球合作伙伴大会上,中国移动正式发布《审计行业大模型评测体系白皮书》(以下简称《白皮书》)及配套测试集。作为国内首个面向审计行业的系统性大模型评测标准框架,该体系为审计大模型的科学评估、选型与应用筑牢了“标准底座”,有效填补了通用大模型评测体系在审计行业适配性与应用价值评估上的空白。

《白皮书》指出,审计行业大模型作为融合前沿技术的创新产物,正在逐渐重塑审计业务的流程与模式,其在提升审计效率、增强风险识别、助力精准决策等方面展现出巨大潜力。然而,随着审计领域各类大模型的不断涌现,其质量与性能参差不齐,如何科学、客观且全面地评测审计行业大模型就显得尤为重要。现有通用大模型评测侧重于文本流畅性与开放任务泛化能力,难以量化审计场景特定需求,在数据、方法和落地上面临三重鸿沟。
为深度洞察不同审计行业大模型的专业适配性与实际效能,精准辨析各模型的优势与短板,推动审计行业大模型技术健康发展,中国移动依据国家标准 GB/T45288.2-2025《人工智能大模型第 2 部分:评测指标与方法》,并结合中国移动联合发布的《通用大模型评测标准》,编制完成《审计行业大模型评测体系白皮书》,创新性地提出面向审计行业的大模型评测体系,以“2+4+6”层级架构为核心:聚焦基础能力层与审计应用层“两大”核心场景,并将审计应用评测按审计流程细分为不同场景下的30余项具体应用任务。针对每项审计应用任务,白皮书清晰指明适用的评测方式、指标、数据与工具“四项”关键评测要素,同时细化反映功能性、准确性、可靠性等“六大”审计评测维度的具体指标,为评测工作提供了切实可行的落地级指南,有效弥补了通用评测在审计行业适配性与应用价值评估上的不足。
此外,中国移动还同步发布了与《白皮书》配套的标准化的专业测试集,包含国家权威审计类考试题目2万余条,及覆盖企业审计业务六大场景的真实数据5千余条,为模型能力评估提供了真实、全面的数据支撑。
《白皮书》及测试集的发布推动审计行业大模型的发展迈入了更加标准化、规范化的新阶段。未来,中国移动将持续推动大模型安全、透明、高效地赋能审计现代化,铸就“科技强审”新范式,铸牢审计之盾。
相关文章
- 中国移动智算底座加持, 长三角(嘉兴)Token运营中心正式启航
- 从中国移动“通话焕新“到领先运营商通话+AI的商用发布,AI重塑原生通话价值
- 中国移动邵春菊:智算融通,共创Token经济开放多元未来
- 中国移动数智事业部智能标书平台荣获ITU人工智能向善优秀案例奖
- 中国移动黄宇红:以网强基,融智而行——直击痛点构建感通算智融合工业互联网技术能力
- 中国移动上海公司发布三大智能服务应用场景 共谱AI赋能发展新篇章
- 中国移动与中国电气装备签署战略合作框架协议
- 中国移动与上汽集团签署战略合作协议
- 中国移动研究院完成无GNSS场景的手机直连卫星技术实验室验证
- 中国移动咪咕《呼叫我的球搭子》厦门站圆满收官,打造数智观赛新范式
- 中国移动亮相2026中国互联网大会 全景呈现“AI+”数智创新成果
- 中国移动副总经理李慧镝:深耕高阶自智网络,共启数字产业新篇
- 中国移动江苏公司开展“人工智能+制造”专项宣讲活动
- 中国移动副总经理张冬:筑牢网络强国根基 共创数智美好未来
- 中国移动携手产业合作伙伴打造业界首个5G-A具身智能人形机器人训练场及消防救援应用示范
- 中国移动联合中天钢铁发布全国首个“5G+AI+新型工业控制”工厂创新实践成果
AI企业
更多>>AI硬件
更多>>AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









