发生了什么

在2026年中国国际大数据产业博览会上,国家数据局局长刘烈宏提出“三个全新”:数据赋能人工智能发展进入新阶段,人工智能成为激活数据要素潜能的新利器,词元正开辟数据要素价值释放的新路径。他同时描绘了“场景牵引数据、数据驱动模型、模型赋能应用、应用创造价值”的良性循环。据记者观察,产业界的探索正从单点突破转向全链条协同,涵盖数据供给、开发机制和商业模式等多个层面。

场景正在重新定义数据供给。根据《全国数据资源调查报告(2025年)》,2025年我国用于人工智能训练和推理的数据总量达199.48艾字节,同比增长42.86%,其中推理数据量首次超过训练数据量。具身智能领域的数据生产量同比增幅更高达477.78%。业内人士反映,真实场景采集面临成本高、周期长等问题,有企业尝试通过虚拟环境仿真训练机器人,再将数据用于本体训练;同时,机器人与人交互产生的社交数据大量缺失,缺乏高质量数据被视为行业首要瓶颈。

在数据加工与流通环节,高质量数据集和可信数据空间成为关键基础设施。刘烈宏披露,截至2026年8月,全国累计建成高质量数据集超过12.6万个,数据总体量超1815PB,较3月增长超89%。相关企业指出,可信数据空间能够支撑多方接入、权限管控和存证审计,借助“可用不可见”的机制保障原始数据安全流通。词元端的变化同样显著:2025年全年词元调用量约21100万亿,日均调用量从年初超过1万亿增至年末100万亿,围绕模型接入、算力调度和统一结算的新服务需求开始涌现。

为什么重要

词元正在成为打通数据、模型与算力之间价值传导的关键标尺。随着词元被用于计量、定价、交易和结算,模型调用能力得以转化为可交易、可结算的服务,数据产业的商业模式可能从单纯的“卖数据”转向“卖智能服务”,这将重塑整个价值链的分配逻辑。

具身智能等新场景对数据质量提出更高要求,而高质量数据集和可信数据空间的建设则试图解决安全、合规与效率的矛盾。如果“场景—数据—模型—应用”的全链条协同能够落地,数据价值释放将获得更具操作性的路径,而非停留于政策口号。

关键事实

国家数据局局长刘烈宏在2026数博会上提出“三个全新”,并倡导形成“场景牵引数据、数据驱动模型、模型赋能应用、应用创造价值”的良性循环。

2025年中国用于人工智能训练和推理的数据总量达到199.48艾字节,同比增长42.86%;推理数据量101.34艾字节,首次超过训练数据量。

具身智能领域数据生产量同比增长477.78%。

截至2026年8月,全国累计建成高质量数据集超过12.6万个,数据总体量超过1815PB,较3月增长超过89%。

2025年中国全年词元调用量约21100万亿,日均调用量从年初超1万亿增长至年末100万亿。

可信数据空间被多方视为数据流通的基础设施,旨在实现数据“可用不可见”“可用不可得”。

接下来看什么

具身智能数据能否借助仿真训练与真实场景采集补齐质量短板,并解决跨场景泛化问题,将直接影响模型在物理世界中的表现。

可信数据空间能否形成统一的跨主体流通规则,决定了海量高质量数据集能否持续、合规地支撑模型训练。

词元交易会否从通用Token的价格与供给竞争,转向面向医疗、工业等专业场景的场景Token,值得持续跟踪。

来源