中国移动发布《审计行业大模型评测白皮书》及配套测试集,为审计大模型建立“度量衡”
2025/10/12 21:58AI云资讯12012
10月11日,在2025中国移动全球合作伙伴大会上,中国移动正式发布《审计行业大模型评测体系白皮书》(以下简称《白皮书》)及配套测试集。作为国内首个面向审计行业的系统性大模型评测标准框架,该体系为审计大模型的科学评估、选型与应用筑牢了“标准底座”,有效填补了通用大模型评测体系在审计行业适配性与应用价值评估上的空白。

《白皮书》指出,审计行业大模型作为融合前沿技术的创新产物,正在逐渐重塑审计业务的流程与模式,其在提升审计效率、增强风险识别、助力精准决策等方面展现出巨大潜力。然而,随着审计领域各类大模型的不断涌现,其质量与性能参差不齐,如何科学、客观且全面地评测审计行业大模型就显得尤为重要。现有通用大模型评测侧重于文本流畅性与开放任务泛化能力,难以量化审计场景特定需求,在数据、方法和落地上面临三重鸿沟。
为深度洞察不同审计行业大模型的专业适配性与实际效能,精准辨析各模型的优势与短板,推动审计行业大模型技术健康发展,中国移动依据国家标准 GB/T45288.2-2025《人工智能大模型第 2 部分:评测指标与方法》,并结合中国移动联合发布的《通用大模型评测标准》,编制完成《审计行业大模型评测体系白皮书》,创新性地提出面向审计行业的大模型评测体系,以“2+4+6”层级架构为核心:聚焦基础能力层与审计应用层“两大”核心场景,并将审计应用评测按审计流程细分为不同场景下的30余项具体应用任务。针对每项审计应用任务,白皮书清晰指明适用的评测方式、指标、数据与工具“四项”关键评测要素,同时细化反映功能性、准确性、可靠性等“六大”审计评测维度的具体指标,为评测工作提供了切实可行的落地级指南,有效弥补了通用评测在审计行业适配性与应用价值评估上的不足。
此外,中国移动还同步发布了与《白皮书》配套的标准化的专业测试集,包含国家权威审计类考试题目2万余条,及覆盖企业审计业务六大场景的真实数据5千余条,为模型能力评估提供了真实、全面的数据支撑。
《白皮书》及测试集的发布推动审计行业大模型的发展迈入了更加标准化、规范化的新阶段。未来,中国移动将持续推动大模型安全、透明、高效地赋能审计现代化,铸就“科技强审”新范式,铸牢审计之盾。
相关文章
- 中国移动副总经理张冬:强网兴算筑牢数智底座 智汇生态共创美好未来
- 高通与中国移动开展端到端原型样机测试,推动6G关键技术迈入系统化验证新阶段
- 中国移动牵头组建6G应用创新实验室 加速推进6G技术应用创新与产业落地
- 走进雄安新区智慧城市科创中心 中国移动打造科技服务民生新范式
- 筑牢AI时代数据安全新底座 中国移动重磅发布AI可信计算产品
- 中国移动河南公司携手华为筑牢5G-A网络根基,打造“头等舱”式全新网络体验
- 中国移动亮相2026算力大会,展示全栈算网创新成果
- 中国移动发布智算中心液冷全链条创新成果
- 中国移动“通算智”全栈能力 亮相2026智博会
- 聚智向新 共育智能经济新形态 中国移动携最新成果亮相2026年服贸会
- 中国移动:聚智向新,共育现代化 应急新形态
- 打通“最后一公里”!中国移动在吉隆口岸900米处开通4/5G共模基站
- 中国移动携手国机集团、华润集团举办央企消费帮扶聚力行动
- 中国移动副总经理张冬:可信AI筑基,数据智能赋能——共建国际合作新生态
- 算力如水随取随用 中国移动携手湖北大数据集团筑牢算网底座,赋能中部算力枢纽建设
- 强力落地环京智算核心战略 中国移动天津公司加速在津算力AI产业布局
AI企业
更多>>AI硬件
更多>>AI产业
更多>>AI技术
更多>>- 阶跃这次够狠:AA 全球开源前二,价格打到 Claude 的 1/8
- 科大讯飞发布Spark-Audio-1.0-Preview,全国产语音基座大模型实现从“听清”到“听懂”
- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练









