下载app

扫码下载

扫码关注

新华报业网  > 公司新闻 > 正文
蚂蚁数科发布新AI平台,剑指大模型高质量数据短缺问题

11月19日下午,行业大模型、具身智能、算力、芯片、数据合成等10项首发成果在乌镇峰会登台路演,其中AI数据合成与生产平台AIGD(AIGeneratedData)因聚焦“数据合成”获广泛关注。“未来的AI应用需要大量稀缺且难以获取的长尾数据,如自动驾驶中的极端天气与极端路况数据,具身智能训练所需要的复杂场景数据。在此背景下,数据合成成为关键。”蚂蚁数科AI科技技术负责人、蚂蚁天玑实验室主任李哲说。

AI发展正面临着高质量数据短缺问题。近年来,伴随着大模型技术快速发展,机器学习也正从“以模型为中心”转向“以数据为中心”,高质量数据可以更好地模拟客观世界,提升模型的准确性和稳定性。业内人士普遍认为,“高质量数据”是AI大模型深入到产业的重要基础,没有好的数据做支撑,一切AI应用都是空中楼阁。

不过,据EpochAIResearch研究团队预测,到2026年,现存的用于AI模型训练的高质量语言数据将耗尽。Gartner研究报告预测,2024年60%的AI数据将是合成数据,用于模拟、预测场景和降低风险,到2030年合成数据将成为AI模型的主要训练数据来源。

据介绍,AIGD平台是由蚂蚁数科申报的首发成果,平台可通过大规模合成互联网所不覆盖的高质量、高价值垂直语料数据,帮助科技厂商进行AI模型训练。据了解,AIGD具备PB级数据生产能力,支持数据从生成到训练全流程自动化处理,自动化率达到80%,能极大提高数据处理的效率和质量。此外,平台自研15余种数据合成工具,目前可以合成图片、视频、3D模型、多模态图文视频对、多轮对话、语音信号、心率脑电信号、结构化交易数据等多模态数据,以满足多种应用场景下的AI模型训练需求。

“数据合成”是蚂蚁数科AIGD平台的主要功能之一,此外还包括数据标注、质检等能力。在数据标注方面,通过人机协同进行标注,人工智能算法能够自动识别和预处理大部分基础信息,预标注模型依赖人工标注量降低了70%以上。在数据质检方面,平台会根据元信息支持不同粒度的数据质量统计,最大程度理解数据,保证合成及标注后的数据符合预期质量要求。

今年以来,蚂蚁数科陆续迭代发布了多款AI产品,包括大模型安全评测与防御产品“蚁天鉴”、反深伪造产品ZOLOZDeeper等。作为一家面向ToB服务的科技公司,蚂蚁数科旗下主要包含“企业用云服务”“企业区块链服务”“企业AI服务”三大核心业务,李哲在乌镇峰会上表示,“我们即将迎来AI服务产业的黄金年代,蚂蚁数科将会坚定在AIToB领域投入,让AI深入千行百业。”

 

责编:赵文婷
版权和免责声明

版权声明: 凡来源为"交汇点、新华日报及其子报"或电头为"新华报业网"的稿件,均为新华报业网独家版权所有,未经许可不得转载或镜像;授权转载必须注明来源为"新华报业网",并保留"新华报业网"的电头。

免责声明: 本站转载稿件仅代表作者个人观点,与新华报业网无关。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或者承诺,请读者仅作参考,并请自行核实相关内容。

专题
视频

扫码下载

交汇点新闻APP

Android版

iPhone版

分享到微信朋友圈
打开微信,点击底部的“发现”,使用 “扫一扫” 即可将网页分享到我的朋友圈。
分享到QQ
手机QQ扫描二维码,点击右上角 ··· 按钮分享到QQ好友或QQ空间