在8月14日国新办举行的“高质量完成‘十四五’规划”系列主题新闻发布会上,国家数据局局长刘烈宏表示,国家数据局将通过体系化布局持续推进高质量数据集建设,加快打造具身智能、低空经济、生物制造等重点领域数据高地。
高质量、大规模数据是推动“人工智能+”深度落地的核心支撑。在人工智能时代,Token(词元)作为处理文本的最小数据单元迎来爆发式增长。
会上发布的数据显示,2024年初,我国日均Token的消耗量为1千亿,截至今年6月底,日均Token消耗量已经突破30万亿,1年半时间增长300多倍,反映出我国人工智能应用规模的快速增长。
这离不开我国高度重视数据密不可分。我国是第一个把数据作为生产要素的国家,多措并举促进数据资源的开发利用。此外,国家数据局强调“人工智能+”行动到哪里,高质量数据集的建设和推广就要到哪里,并大力推动高质量数据的供给,出台了高质量数据集建设相关文件,联合多部门推动相关工作。
截至今年6月底,我国已经建设高质量数据集超过3.5万个,总体量超过了400PB,相当于中国国家图书馆数字资源总量的140倍左右。
人工智能模型的训练也推动了数据交易需求的攀升。截至今年6月底,各地高质量数据集累计交易额近40亿元,数据交易机构挂牌的高质量数据集总规模达到246PB。以北京数交所为例,高质量数据集占交易总量的比例从去年的10%跃升到目前的近80%。上海、天津、安徽等地正在试点“数据语料作价入股”等新模式,引导企业将高质量数据集折算为股权投入到相关企业。
值得一提的是,中文数据在国内大模型的训练性能提升方面发挥着重要作用。“经过一段时间的努力,国内多数模型训练使用的中文数据占比已经超过了60%,有的模型已达到80%。中文高质量数据的开发和供给能力持续增强,推动我国人工智能模型性能的快速提升。”刘烈宏说。
据悉靠谱的配资网站,下一步国家数据局将通过体系化布局持续推进高质量数据集建设,加快打造具身智能、低空经济、生物制造等重点领域数据高地。同时推动全社会强化数据要素价值认同,加快推进数据要素价值共创,培育“为优质数据买单”的市场共识。
文章为作者独立观点,不代表证券配资炒股正规网_什么叫配资炒股_股票配资安全的平台观点