提升高质量数据供给能力,推动通用人工智能大模型领域创新
2023-08-06 15:21:24AI云资讯1600
近年来,大规模预训练模型(以下简称“大模型”)作为人工智能取得突破性进展的重要驱动力之一,显著加速人工智能工程化和普惠化发展进程,有望成为新一代智能技术底座。人工智能大模型的突破源于高质量数据的不断发展,提升高质量数据要素供给能力是推动通用人工智能大模型领域创新的关键。
2020年的一项重要研究工作发现,模型效果与模型的参数、数据和计算量之间存在幂律发展规律“ScalingLaws”。模型参数、数据和计算量呈指数级增长,模型在测试集上的损失呈指数级下降,模型性能越好。
也就是说,在计算量给定、参数规模较小的情况下,增加模型参数量对模型性能的影响远高于数据和训练次数的贡献模型的步骤。
因此,业界对大型模型的性能形成了普遍的认识,即模型的参数和容量越多,模型的性能越好。
从AI产业链的发展情况和未来发展趋势来看,中国AI数据服务行业的市场规模正在逐步扩大。随着行业内对训练数据需求类型的增加以及对服务标准要求的提高,产业链的专业化分工愈加清晰。

在青年先锋论坛活动上,云测数据总经理贾宇航指出,作为人工智能的“燃料”,AI数据的质量影响着大模型的最终的结果的好坏。数据的数量越多、质量越高,模型的训练和性能优化就越充分、性能就越好,高质量的AI数据将助力人工智能应用具备更强大的服务能力。
谈及面向大模型高质量数据需求,云测数据在相关层面有哪些优势布局时,贾宇航表示云测数据一直将数据质量作为AI数据服务的发展核心,不仅聚焦于技术研发优化,更是延伸至人才培养、产品服务等环节,为企业提供高质量的场景化的AI数据服务。业务层面通过数据采集、数据清洗、数据标注等方式为企业引入AI数据处理,以标准API接口支持数据导入和导出、支持已有算法预标注功能,可以提供多项AI数据产品应用和AI数据服务,跟任何的企业的数据库打通,完成原始数据到标注数据的快速积累,加速AI模型的开发进程。
相关文章
- 中科闻歌重磅发布通用决策大模型Decitron决策机,内测邀请开启
- 端侧AI构筑“新丝路”:面壁智能大模型开源与端侧推理框架的出海实践
- 告别“数据枯竭”,迈向“价值坐标”——艺恩发布《全球大模型数据市场白皮书》
- 星辰大模型能力升级 天翼智铃推出30秒长视频动画制作
- 牧原携手阿里云共建养猪大模型 AI赋能传统产业升级
- 大模型落地“最后一公里“:Testin XAgent工程化评测实践
- 元戎 CEO 周光:大模型范式进入共识期,正在重构辅助驾驶行业
- 从ViP创新工艺到维擎垂域大模型,维信诺金砖论坛集中展示显示产业“中国方案”
- 卓世科技与戴盟机器人达成战略合作,共筑”行业大模型+具身智能”新生态
- 云工场科技推进CPU+GPU协同推理,推动大模型应用降本增效
- 东软添翼医疗大模型荣登“医疗AI大模型最具应用价值产品榜”
- 群核科技空间智能大模型完成国家备案,加速走向产业应用
- 破解大模型“幻觉”,徐剑军选择“可信”之道
- 携手共建“物理世界大模型”联合实验室,洞察时空与上海电信达成战略合作
- 东软添翼医疗大模型领跑 医疗AI进入“可信时代”
- 直接上智能体,还需要统一基座大模型吗?医院智能化走到十字路口
人工智能企业
更多>>人工智能硬件
更多>>人工智能产业
更多>>人工智能技术
更多>>- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠
- Seedance 2.0面向企业公测,豆包大模型日均Token使用量突破120万亿
- 端到端OCR模型第一!百度千帆Qianfan-OCR正式发布
- 云知声Unisound U1-OCR大模型发布!首个工业级文档智能基础大模型,开启OCR 3.0时代









