新华财经上海7月19日电(记者杜康)记者从2026世界人工智能大会“语料筑基、智生时代”语料创新论坛获悉 ,截至今年6月底,全国已建成高质量数据集12万个,总体量超过1565PB;七个数据标注先行先试城市标注规模超过119PB ,已服务425个大模型研发 。

随着人工智能从通用基础大模型向行业大模型深入拓展 、从数字空间向物理世界延伸,高质量数据集正成为支撑模型训练和行业应用的重要基础。

论坛围绕平台能力升级、行业产品创新、标准体系建设 、科学智能发展和高价值语料征集等方向,集中发布七项成果。
其中 ,语料运营公共服务平台2.0正式发布 。平台构建“筛选—转换—合成 ”三层十级数据进化路线,并集成语料工程平台、行业专家经验语料平台和专家众包网络,推动语料从一次性交付转向持续使用、评测和更新。
面向医疗 、工业、交通、供应链和城市治理等场景,论坛还发布专病、焊接 、城市轨道交通、交通基础设施运维、航运物流 、港口堆场、世界 物流供应链、消防等系列语料库 ,推动医疗知识 、工业经验和行业规则转化为可训练、可推理、可调用 、可评测的数据资源。
标准建设方面,论坛新增发布15项团体标准和2项行业标准,覆盖高端装备、消防、医疗专病 、世界 物流供应链、文物、钢铁、合成数据和大模型数据集开发管理等方向 ,贯通语料采集 、清洗、标注、评测和运营管理等环节 。
当天,科学数据服务AI4S可持续发展倡议正式发起。倡议提出,将围绕流程重塑 、标准引领、价值对齐和平台创新 ,推动科学数据采集、预处理 、标注、流通和使用全流程贯通,促进科学数据向AI-Ready、Agent-Ready演进。
“DARE GO达·高”跨领域高价值语料数据征集计划也同步启动。该计划将面向各行业征集带有具体环境 、任务要求、评价标准和借鉴 答案的专业难题,探索形成“专家出题—社会答题—模型验证—价值回流”的持续机制 ,推动模型从“学习知识 ”向“完成任务”转变 。
此次论坛由世界人工智能大会组委会指导,上海库帕思科技有限公司、上海市人工智能行业协会主办。
(文章来源:新华财经)