高质量数据集“作坊式”生产效率低下

据京数智估算,过去4年全球企业人工智能采用率增长了270%,我国更是增长了320%。随着“人工智能+”和“数据要素×”不断发展和相向而行,人工智能重点正从优化模型转向提高数据集的质量。正如具有“人工智能之父”之称的吴恩达认为,“人工智能世界在这十年中需要经历的最重要转变将是转向以数据为中心的人工智能”。我国也正式开启了高质量数据集的规模化、体系化建设进程。当前,高质量数据集正处于起步阶段。

面向行业应用的高质量数据集供给严重不足。根据《全国数据资源调查报告(2025年)》,2025年我国数据生产总量为52.26泽字节(ZB),同比增长27.28%,占全球约27.44%。系统软件、人工智能产生的数据量为26.92ZB,首次超过摄像头、传感器等物联感知数据量的25.34ZB。然而,我国高质量数据集供给规模和质量差距巨大,海量数据与多样化场景优势的潜能远未充分释放。从数据到高质量数据集的进化是数据资源价值化的过程,须经清洗、标注、加工、分析等不同数据处理活动,但是,以下三方面问题严重阻碍了高质量数据集的构建。一是高质量数据集构建的投入产出不成比例。专业化数据的高质量标注需要庞大的资金投入且同时关联安全责任风险,这与数据应用的收益回报比例之间存在错位。二是行业领域公共数据场景化加工的程度与紧迫性不足,难以发挥公共数据对于数据开发利用的引领作用与催化作用。从现有国家政策来看,我国工业、医疗、交通、气象等具体场景的数据供给能力尚未作为专门对象加以细化规定,领域差异化数据统归于公共数据范畴的做法难以匹配垂直领域的细化要求。三是数据加工技术存在优化空间,专业人才供给难以充分满足需求,致使场景化加工效果欠佳。在数据标注自动化工程尚未成熟的阶段,将杂乱无序的低价值数据在工业互联网等特定场景加工为标准化、目录化、高价值数据资源需要高级别的专业技术技能,人工智能训练与推理阶段涉及多模态数据、高维度数据、跨领域数据,对计算机科学专业技术需求更加严苛,这为我国数据加工的现代化场景转向带来一定挑战。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值