科技与出版, 2026, 45(8): 5-14 doi:

专稿

关于“模数共振”驱动科技出版社构建行业数据集的思考与路径探索

刘鲲翔1,2, 隗静秋3

1. 机械工业出版社,100037,北京

2. 国家新闻出版署语义出版与知识服务重点实验室,430072,武汉

3. 浙江传媒学院出版学院,310018,杭州

Reflections and Path Exploration on Building Industry Datasets for Sci-Tech Publishers Driven by "Model-Data Resonance"

LIU Kunxiang1,2, KUI Jingqiu3

1. China Machine Press, 100037, Beijing, China

2. Key Laboratory of Semantic Publishing and Knowledge Services, National Press and Publication Administration, 430072, Wuhan, China

3. School of Publishing, Communication University of Zhejiang, 310018, Hangzhou, China

基金资助: 浙江大学教育基金会出版教育基金出版理论研究课题“大学出版社学术出版智慧服务模式创新研究”.  LLYJ-2025-YB001

Abstract

Competition in the artificial intelligence industry is increasingly shifting from a contest of general-purpose capabilities to deep industry applications, yet the insufficient supply of high-quality industry datasets has become the key bottleneck constraining the "AI+" empowerment of diverse industries. Science and technology publishers (STPs), with their long-accumulated professional knowledge resources and deep-rooted industry networks, are well positioned to become core suppliers, yet they simultaneously face multiple challenges including lagging strategic awareness, structural supply-demand mismatches, high processing costs and technical difficulties, the absence of shared tools and standards, underdeveloped circulation mechanisms, and a critical shortage of interdisciplinary talent. This paper systematically reviews recent national policies on "AI+" and grounded in the core concept of "model-data resonance", elucidates its positive feedback loop: high-quality industry data train more models with stronger domain knowledge, and the application of these models in turn generates new scenarios and produces fresh data, which then feeds back to further optimize the models. The paper clarifies the definition of industry datasets, which encompass multimodal and multidimensional data forms across three hierarchical layers—basic data modalities, specialized professional data forms, and knowledge organization structures—and analyzes the driving factors, role positioning, distinctive advantages, and practical challenges that STPs face in constructing such datasets. Building on this analysis, the paper proposes nine concrete pathways at both strategic and implementation levels. Strategically, these include raising strategic awareness of the data economy, strengthening policy research to align with national directives, clearly defining priority industry directions, and fostering a deeply integrated ecosystem that brings together government, industry, academia, research, and application stakeholders. On the execution front, the pathways consist of maintaining the core traditional publishing business while leveraging it as a foundation, adopting a "three-step method" for data identification, annotation, and iterative validation to optimize the development process, co-developing shared tools and standards in collaboration with industry partners, assembling interdisciplinary professional teams that combine editorial, technical, and domain expertise, and placing special emphasis on constructing industry ontology datasets to ensure semantic interoperability and long-term reusability. The paper contends that 2026 marks a pivotal year for China's AI trajectory—the transition from general-purpose conversational AI to practical industry applications. For science and technology publishers, this represents a strategic window of opportunity. Guided by the principle of "model-data resonance", these publishers should accelerate their transformation from traditional content producers to data service providers, converting their accumulated intellectual capital from professional publishing into a distinctive competitive advantage in the intelligent age, thereby providing robust support for building China's independent knowledge system and enhancing the nation's overall scientific and technological competitiveness.

Keywords: high-quality industry datasets ; science and technology publishing ; model-data resonance ; artificial intelligence ; knowledge services

PDF (1754KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

刘鲲翔, 隗静秋. 关于“模数共振”驱动科技出版社构建行业数据集的思考与路径探索. 科技与出版[J], 2026, 45(8): 5-14 doi:

LIU Kunxiang, KUI Jingqiu. Reflections and Path Exploration on Building Industry Datasets for Sci-Tech Publishers Driven by "Model-Data Resonance". Science-Technology & Publication[J], 2026, 45(8): 5-14 doi:

当前,人工智能正处于范式跃迁的关键窗口期。以大语言模型为代表的通用人工智能技术,在参数规模与训练数据爆发式增长后,其竞争焦点已从追求模型能力边界的“通用智能”竞赛,逐步转向推动智能技术在特定行业场景中落地生根、创造真实价值的“行业深耕”阶段。2025年8月,国务院发布的《关于深入实施“人工智能+”行动的意见》提出了“人工智能+产业发展”“人工智能+科学技术”等六项重点任务[1];2026年3月,国家“十五五”规划纲要明确要“抢占人工智能产业应用制高点,全方位赋能千行百业”[2];5月,国家网信办等四部委联合印发《智能体规范应用与创新发展实施意见》,在强化应用牵引部分,明确了19个与行业密切结合的典型应用场景[3];6月,国家数据局发布了《关于推进行业数据集建设行动的实施方案》(以下简称《实施方案》)[4]。这一系列政策的密集出台,清晰地表明国家人工智能发展的重心正在向产业落地端加速转移,也对行业数据集的供给规模、质量和形态提出了更高要求。

在这一跃迁进程中,与各行业紧密相关的科技出版社(以下简称“科技社”),凭借高质量的专业知识资源,以及长期积累的专业作者、企业机构等丰富的行业资源,有机会发挥重大作用,探索出融合发展的新模式。而其中的关键,在于如何以“模数共振”的理念与方式,构建面向行业的高质量数据集。

1 “模数共振”的内涵和意义

“模数共振”一词最早见于2026年4月28日工业和信息化部、国家数据局联合发布的《关于联合实施2026年“模数共振”行动的通知》(以下简称《通知》)[5],并在随后出台的《实施方案》等文件中被多次重申和深化[4]。其中,“模”指人工智能模型体系,包括掌握行业机理的行业大模型、应用于细分场景的专用模型及自主智能体;“数”指经过标准化、专业化处理的高质量行业数据,分为覆盖通用知识的通识数据集和面向特定场景的专识数据集。而“共振”是数据与模型深度协同的正向循环:高质量数据训练出更懂行业的模型,模型挖掘数据隐含的规律并催生应用场景,场景产生的新数据再反向优化模型,形成持续演进的增强回路。

《通知》旨在以模型需求牵引数据治理,以高质量数据赋能模型迭代,实现双向赋能。对我国AI产业而言,“模数共振”模式为打破“模数分离”困局,化解通用模型与行业机理脱节、数据与模型脱节、研发与场景脱节三大关键矛盾,使AI技术真正扎根实体经济、解决实际问题提供了政策和理论的指引。对科技社而言,“模数共振”模式则不仅明确提出了数据加工、治理和交付的具体要求与标准,更为其充分释放科技出版专业知识的数据价值、打造面向行业数智化转型应用场景的高质量数据集产品与服务指明了一条切实可行的路径,对探索科技出版深度融合发展的新方向、新模式具有重大意义。

2 行业数据集的定义与主要形态

科技社开发面向行业的高质量数据集,首先要厘清行业数据集的定义和主要的数据形态。

2.1 行业数据集的定义

行业数据集是经过采集、加工等数据处理流程,可直接用于开发和训练人工智能模型,能有效提升模型性能的行业数据的集合,包含行业通识和行业专识数据集。行业数据集是推动“人工智能+”赋能千行百业、实现产业落地的基础性、关键性资源[4]。

2.2 行业数据集的主要形态

行业数据集的数据形态正朝着多模态、多维度的方向发展。根据《实施方案》及相关行业实践,其数据形态主要可从以下三个层面进行归纳[4]。

2.2.1 基础数据形态:覆盖主流模态

行业数据集中的基础数据形态涵盖了当前人工智能模型训练所需的文本、图像、音频、视频、代码等主要数据类型。其中,文本数据包括科研报告、技术文档、行业标准、政策文件、学术论文等,是行业知识的直接载体;图像数据涵盖各类行业场景、产品外观、工程图纸等,支撑视觉理解类模型训练;音频数据用于语音识别、合成及分析,适用于语音交互场景;视频数据记录动态场景、操作流程和监控画面,服务于视频分析与行为识别;代码数据面向软件开发与程序分析,提供编程语料。

2.2.2 专业数据形态:面向特定场景

除上述通用模态外,部分行业还涉及点云数据、时序数据、科学数据等更具专业性的数据形态。点云数据由三维空间中的大量点构成,广泛应用于智能驾驶、数字孪生、地理测绘、建筑信息模型等场景。时序数据是按时间序列记录的数据,常见于工业制造、智慧能源、交通运输、气象服务等行业。科学数据是面向科学研究领域的实验数据、观测数据、模拟数据等,支撑科学研究范式创新。

2.2.3 知识组织形态:面向智能应用

为满足行业智能体等新型智能应用的需求,行业数据集还以知识库、知识图谱、本体等更高阶的知识组织形式存在。知识库是结构化存储的领域知识集合,便于检索与调用。知识图谱是以图结构组织实体及其关联,支持复杂推理与关联分析。本体是对领域概念及其关系的形式化描述,支撑语义理解、幻觉消除与知识共享。

根据上述三个层次数据形态的描述,科技出版内容对其均有不同程度的覆盖。在基础数据形态方面,科技出版内容涵盖除代码数据外的所有类型,尤以文本数据和图片数据为主;在专业数据形态方面,虽缺乏非知识性的点云数据和时序数据,但科技期刊中的学术论文通常含有大量实验数据、观测数据等科学数据;在知识组织形态方面,科技出版内容经结构化加工可转化为知识条目、问答对、长思维链等结构化数据并构建成知识库,亦可通过对概念、实体、属性及关系的识别与抽取,构建知识图谱和本体。总体而言,科技出版内容经不同程度的加工与标注,可较好地符合行业数据集在上述三个层面的形态要求。

3 科技社构建行业数据集的驱动因素与现实条件

然而,“内容可适配”并不等于“能力可胜任”。面对这一新兴领域,科技社是否具备足够的驱动力与紧迫感付诸行动,是否具备将专业内容资源转化为高质量行业数据集的现实条件,以及其独特的禀赋优势与结构性短板又分别是什么,需要我们认真思考分析。本节将从外部牵引与内部驱动两个层面剖析其深层动因,继而从角色定位、特有优势、面临挑战三个维度评估科技社构建行业数据集的现实基础,为后续战略路径的提出奠定逻辑前提。

3.1 驱动因素

科技社进行行业数据集建设,是外部环境驱动与内部发展需要交汇下的必然选择。外因层面,政策体系已形成从顶层设计到实施细则的完整闭环并充分释放了政策利好信号,下游行业应用市场亦释放出对专业知识数据的强劲需求;内需层面,科技出版数智化转型已进入深水区,传统业务模式遭遇增长天花板,专业模型和智能体的训练开发投入高、变现前景不明确,行业数据集成为寻求转型突破的关键。

3.1.1 外因:政策引领与行业需求

一方面是政策引领形成系统性推力。国家层面围绕人工智能与数据要素密集出台的配套政策,尤其是《实施方案》的出台,构成了从宏观战略定向到数据基建制度供给的完整政策闭环[4]。这一体系为科技社参与行业数据集建设,明确了战略价值、角色定位、重点行业、数据标准及交易环境等关键问题,提供了清晰的政策依据与制度空间。可以说,政策已备好“入场券”与“路线图”,只待有能力、有思路的科技社将蓝图转化为实践。

另一方面是行业应用形成刚性牵引。当前,我国行业数据集供给不足、专识数据匮乏,导致模型“通识有余、专识不足”,难以支撑深度应用。科研范式的AI化转型亟需深度理解学科术语的辅助工具,企业研发决策依赖权威可信的行业通识和专识知识,政府对各个行业的治理和相关政策的制定同样需要系统、可信的知识基础,而互联网信息质量参差不齐、行业内部数据孤岛化,市场亟需兼具学术权威性与工业级可用性的数据产品。科研、产业、治理三层需求共同表明:行业数据集是智能时代知识驱动创新的“必需品”,而非锦上添花的“可选品”。科技社正是连接权威内容与行业数据需求的关键枢纽。

3.1.2 内需:科技出版数智化转型的迫切需要

如果说政策引领与行业需求构成外部推力,那么科技出版行业自身的发展困局与转型压力,则是其构建高质量数据集的内生驱动力。

一方面是当前科技出版传统业务模式面临增长瓶颈。科技出版长期依赖的“选题—出版—发行”线性模式正面临深层挑战。这里的传统业务既包含传统纸质图书业务,也包含传统的数字业务。科技纸质图书与期刊的发行量整体呈下行趋势,数字出版收入虽有增长,但以电子书、传统数据库为主的产品形态单一、应用场景偏窄,附加值有限。传统的机构订阅与数据库销售模式也因用户预算约束与开放获取运动的冲击而增长乏力。近两年来生成式人工智能的飞速发展深层次地改变了用户获取知识的方式,对科技出版传统业务带来了更大的冲击。

另一方面,科技出版数智化转型本身亦面临多重困境。其一,转型所需的算力、模型等要素的资金与技术门槛较高,中小型科技社难以承担;其二,当前AI技术对科技出版的赋能方式主要还聚焦于对既有生产环节和产品的赋能,本质上仍属存量市场的竞争内卷,尚未转化为增量市场的创新商业模式;其三,科技社开发的多数智能应用,其专业性与功能性相较豆包等通用免费模型并无显著优势,甚至存在明显差距,用户打开率低,实用价值有限;其四,大部分数据业务仍停留于交易原始出版内容的初级阶段,知识密度稀疏、价值含量低、数据安全性差,难以充分释放科技出版数据的内在潜能。

面对以上两方面的发展困局,科技社亟待寻求新的商业模式和收入增长点,以及切实可行的数智化转型路径。开发行业数据集,正成为科技社打破当前困局,推动数智化转型的迫切需求。其迫切性和重要性主要体现在以下三方面。

一是对生产流程进行数智化改造的迫切需求。当前,人工智能工具在选题策划、文稿审校、设计排版等出版生产环节已被广泛应用,但面对科技领域专业内容时,通用智能工具的应用效果远未达到理想水平,深层原因在于支撑这些智能工具的经过深度标注的高质量专业数据严重不足。要实现真正意义上的科技内容生产智能化升级,必须强化行业数据集的建设。

二是知识服务模式升级的内在要求。科技出版的核心竞争力正从面向行业的“内容提供”转向“知识服务”,而“知识服务”的模式也正在从数字化向智能化跃迁。专业读者用户不再满足于获取文献全文,而是期望出版社能够提供关联分析、知识发现、智能问答、趋势预测、辅助决策等更高级的增值服务。而服务模式的提升则依赖于专业领域的推理思维链、知识图谱、本体网络等高级形态的行业数据集的支撑。

三是探索专业内容数据资产化和流通变现的强烈驱动。当前大模型逐渐成为吞噬一切流量的超级入口,互联网平台与AI技术公司凭借算法和算力优势,正加速渗透专业知识服务领域,试图绕开传统出版的知识传播路径,通过大模型直接对接作者和用户。科技社亟待将积累的权威内容转化为权属清晰、标准规范、持续更新,并且可被AI发现、理解、计算、应用的行业数据集,重新巩固自身在知识服务生态中的专业、核心地位,同时在数据要素市场中获得全新的资产价值认可,从而构筑起智能时代新的内容护城河。

3.2 现实条件
3.2.1 科技社的角色定位

在整个行业数智化转型的生态体系中,受资金、技术、人才及经营范围等多重因素制约,科技社通常不具备直接面向行业提供算力、垂类模型、行业智能体等知识数据以外的智能化产品服务的能力。聚焦于知识数据领域,国家标准《高质量数据集分类指南(征求意见稿)》将其划分为通识数据集、行业通识数据集和行业专识数据集三类[6]。其中,通识数据集面向社会公众,无需专业背景即可解读,信息主要来源于互联网及综合性图书;行业通识数据集面向行业从业人员,使用者需具备一定的专业背景方能理解,信息主要来源于论文、标准、专著、文献等专业出版物;行业专识数据集面向内部业务人员,使用者需具备较强专业背景方可理解,信息主要来源于组织机构内部系统平台或专业文献。可见,与科技社出版内容匹配度最高的应为行业通识数据集,行业专识数据集亦有涉及。综上,科技社在行业数智化转型生态体系中最恰当的角色定位,是行业通识及专识数据集的提供方与运营方。

3.2.2 科技社的特有优势

除出版业开发高质量数据集普遍具备的知识权威性、版权合规性、来源可追溯性、形态多样性、语义规范性、体系完备性及更新及时性等共性优势外[7],科技社深耕垂直领域,还拥有以下五方面独特禀赋,使其在行业数据集建设中形成了不可替代的优势。

第一,高度的行业匹配性。《实施方案》重点覆盖科学研究、工业制造、交通运输、医疗卫生等18个重点领域及低空经济、具身智能、智能驾驶等5个创新方向[4],绝大多数与科技社长期积累的专业学科版图直接对应——从基础数理化到前沿交叉学科,从传统工学到新兴智能技术,高度契合。这种“出版即对准”的天然匹配,使科技社能够将数十年来积累的学术专著、技术手册等存量内容快速转化为结构化数据集,大幅降低从零起步的调研与梳理成本。

第二,深厚的行业公信力。众多科技社长期服务于国家科技战略与产业升级,经常承担或参与国家级、省部级重大出版项目和知识工程,在诸多行业领域积淀了深厚的品牌信任度和学术话语权,其出版物被广泛视为行业权威参考,品牌势能可直接将出版物迁移至数据集建设,使产品天然具备公信力与可采纳性。同时,科技社与行业学会、协会、标准化组织保持密切协作,深度参与技术路线图制定与职业资格认证,能够将数据集建设与行业业务流程、人才评价标准深度绑定,显著提升推广效率。

第三,丰富的行业资源网络。科技社汇聚了覆盖各专业领域的顶尖专家智库,与行业头部企业、骨干院校、重点科研院所构建了“产学研用”一体化联动机制。专家资源可为数据集的内容准确性与前沿性提供持续把关,企业和科研院所则能提供真实应用场景与工程案例,形成“内容源头—场景验证—反馈优化”的完整链条,确保数据集始终贴近行业实际需求。

第四,强大的需求洞察能力。科技社通过走访、专题会议、实地调研等多种形式,与一线科研人员、工程技术骨干保持高频互动,能够第一时间感知行业数智化转型中的真实痛点与数据缺口,精准把握数据集的内容形态、标注要求与更新周期。相较外部机构依赖公开资料或滞后调研,科技社具备“嵌入式”需求洞察能力,能够前瞻性地预判需求方向,实现数据集建设与行业转型同频共振。

第五,专业的数据加工能力。科技社拥有职业化、多学科背景的编辑团队,深谙知识组织体系与语义标引规范,能够对原始内容进行结构化拆解、元数据标注和知识关联构建,确保数据集兼具学术严谨性与机器可读性。同时可借助众筹协作模式,动员专业读者和作者参与数据校验与补充标注,实现规模化、高质量的人工标注。这种“编辑主导+众筹协同”的双轨机制,既保障了加工的专业基准,又通过社群智慧提升了效率,为模型训练提供可靠的数据燃料。

3.2.3 科技社面临的挑战

科技社虽具备天然优势,但行业数据集较通用数据集在专业性、准确性方面的要求更高,开发过程也更加复杂。要完全满足“模数共振”的标准,除版权界定模糊等共性问题外,科技社还面临以下六方面的特有挑战。

第一,战略认识滞后。人工智能浪潮正深刻重塑科技出版的知识传播逻辑,传统“专业内容→专业读者”的路径正加速失效,取而代之的是“专业内容→专业AI→专业读者(专业设备)”的全新链路。高质量数据集正是实现这一转变的核心枢纽——它将仅供人类阅读的专业内容,转化为AI可计算、可训练的结构化资源。然而,当前多数科技社从决策层到执行层,尚未充分意识到这一底层逻辑的根本转变,对行业数据集建设的战略价值严重低估,导致开发投入不足,整体进展明显滞后。

第二,数据供需匹配结构错位。已开展数据集业务的科技社普遍面临供给与需求的多重错位,主要体现在以下五个方面。一是,内容错位,科技社往往优先基于畅销或获奖图书开发数据产品,而行业实际需求往往是具备“专精特新”特点的小众化、特色化的数据。二是,格式错位,科技社多数沿用以往面向人类阅读的EPUB、Docbook等传统标准加工数据,而行业应用更需适配AI高效解析的“AI-Ready”标准的格式(如MarkDown)。三是,规模错位,单体科技社数据体量偏小、学科覆盖面窄,难以支撑行业大规模、系统性数据应用。四是,价值认知错位,科技社看重数据的版权属性和资产安全,使用方则更关注数据的稀缺性与规模效应,双方对数据价值评判标尺不同,对成交造成了困扰。五是,安全诉求错位,科技社恪守“数据不出社”,使用方则期望数据深度嵌入自身环境。多重错位相互叠加,将科技出版内容数据推入“不敢用、不能用、不会用”的困局。

第三,数据加工技术难、成本高。高质量数据集的构建需要对专业内容进行深度解构、语义标注、结构化组织和多维度关联,涉及复杂内容和版式的自动识别、专业术语的实体抽取、知识图谱构建、公式与图表语义解析等一系列技术环节。科技出版内容包含大量非结构化元素(如复杂数学公式、化学分子式、专业图表、代码块等),自动化处理精度远低于通用文本,仍高度依赖人工干预与专家审核,导致加工效率低、周期长、成本居高不下。加之单体社数据规模有限,难以摊薄前期研发和加工成本,商业化闭环也难以形成,规模化生产受限。

第四,工具与标准的双重缺失。当前面向科技出版的专业数据加工工具链尚不成熟,缺乏从采集、清洗、标注、转换到验证的一站式数据治理平台,科技社往往拼凑多种通用工具,流程割裂、效率低下。更为关键的是,行业层面尚未建立面向AI训练的专业数据标准体系,格式规范、元数据描述、知识标注、质量评估等标准均处于空白或碎片化状态。各社各行其是,数据互操作性差、复用难度大,即便单个科技社完成开发,也难以实现行业层面的互联互通与规模化聚合,加剧了“数据孤岛”问题。

第五,流通机制不健全。高质量数据的价值释放依赖安全高效的流通机制,但当前环境仍不健全。除确权与定价机制模糊外,还存在两点问题:一是跨行业数据流通的安全与隐私保护技术尚不成熟,科技社对数据出境风险高度敏感,联邦学习、隐私计算、数据沙箱等方案在实际工作中的落地条件仍不充分;二是行业和企业级可信数据空间建设尚处起步阶段,缺乏统一接入标准、互认机制和治理框架,高质量数据难以在安全可控前提下实现跨机构、跨行业的有效流通与价值共创。

第六,复合型专业人才匮乏。行业数据集建设需要精通科技出版、AI数据工程和行业应用的复合型人才,但社内编辑多擅长内容策划,对数据技术缺乏认知;外部数据人才不熟悉专业内容体系和用户需求。科技社在薪酬和发展空间上较互联网企业缺乏竞争力,引才留才困难,且培养体系尚未建立,这都严重制约数据集开发进程。

4 科技社构建行业数据集的路径探索

基于以上背景,结合作者在机械工业出版社(以下简称“机工社”)开发行业数据集的相关思考和初步实践经验,以及对其他科技社的走访调研,可以将科技社构建行业数据集的核心路径归纳为战略和执行两个层面共九项工作。

4.1 战略层面

战略层面包括提升认知水平、加强政策研究、明确行业方向和构建生态体系四项工作。

4.1.1 提升对行业数据集的认知水平

首先从国家宏观视角出发,科技社要充分认识到开发行业数据集,以及构建科技出版知识内容的新传播渠道和应用场景,不仅关系到科技社自身的经济效益,还关系到数智时代科技社是否还能够继续发挥传承、传播优秀科技知识主力军的作用,是否还能够为我国科技进步、科技人才培养、提升国家科技核心竞争力和国际科技话语权、构建中国自主的知识体系提供有力的智力支撑和服务保障。

其次从企业微观视角来看,科技社要正确认识开发行业高质量数据集的三个关键点:一是所谓的“高质量数据集”不是由科技社自身定义,而是由行业应用场景的需求反向定义,是否满足“模数共振”的要求是评价行业数据集的核心标准;二是行业数据集的数据形态不是PDF、EPUB等出版领域的原始资源或经过简单加工的初级形态的出版数据,而是高质量问答对、深度标引的多模态数据、思维链推理数据(COT)、知识图谱数据、本体网络数据等可直接用于开发和训练行业人工智能模型,能有效提升模型性能的行业数据;三是出版社必须建立起自主数据深度加工和标注能力,才能形成行业数据集的核心竞争力和高附加值。

4.1.2 加强对相关政策和理论的跟踪研究

随着人工智能技术的迅猛发展,国家和地方有关行业数据集的政策法规、标准规范及研究报告密集出台,信息密度与更新频率持续提升。科技社应系统梳理并密切跟踪行业数据集、数据要素市场、数据版权保护等领域的政策动向,同时针对出版数据确权、分级分类、安全合规、流通交易等关键制度环节开展前瞻性研究,这不仅有助于锚定战略方向、及时把握政策红利窗口、规避合规风险,还能为数据产品的设计开发和商业模式创新提供理论支撑。同时,跟踪研究前沿理论成果并积极转化,有助于提升科技社在数据科学、AI等交叉领域的话语权,推动科技社从内容生产者向数据服务商转型。

4.1.3 梳理应用场景,锚定行业方向

科技社还要聚焦自身的行业领域优势,通过梳理实际应用场景,确定开发行业数据集的主攻方向。以机工社为例,其立足优势领域的数据禀赋,结合深入细致的行业需求调研成果,在社“十五五”规划中提出了面向产业发展、科研探索和教学创新三个方向开发行业数据集的规划。

(1)赋能产业发展

深入对接机械、电子、汽车等核心优势领域中行业大模型训练对通识与专识数据的需求,基于专业知识库,提取凝练行业基本原理、工艺流程、标准规范等共性知识,面向产品设计、生产排程、资源计划、安全监控、故障诊断、风险识别、质量控制、车辆设备维修保养等行业具体应用场景,开发包含问答对、标注图像、推导思维链、本体网络等多种形态的专业系列垂直领域高质量数据集产品。

(2)支撑科研探索

面向工程技术、基础科学等重点学科领域,构建支撑科研创新全流程的高质量专业数据集。重点开发学科知识图谱、专著与专利结构化数据、实验参数与仿真数据、公式与图表数据集、领域术语库及科研案例库等数据产品。面向文献智能分析、知识发现、实验设计辅助、学术成果评价等科研智能体训练场景,提升数据集的专业性、可追溯性与可计算性,有效赋能科研人员知识获取与创新研究。

(3)支撑教学创新

基于专业高质量数据集,与院系在共建专业细分领域的专业知识库、垂类小模型、教学智能体方面开展多层次、多形式合作,深度服务专业院系科研及教学活动的数智化升级和创新,形成面向“人工智能+新工科教育”的知识服务新模式。

4.1.4 建立“政产学研用”深度融合的生态体系

构建“政产学研用”深度融合的生态体系,是科技社持续高效推进行业数据集建设的关键保障。一是主动对接国家数据局、工信部、科技部、国家新闻出版署等政府相关部门及行业协会,积极参与行业数据集相关政策的制定与试点工作。二是加强科技社间的产业横向合作,推动专业数据资源的跨社汇聚与重组,促进关键共性技术、工具和标准的共研共享,有效破解单个出版社数据规模小、领域窄、研发成本高等瓶颈,例如机工社正与其他三家兄弟科技社共同推进“科技出版+人工智能”共性基础平台的建设;三是紧密联动行业相关高校和科研院所,通过联合设立实验室、共同承担课题项目等方式,在人才培养、关键技术攻关、专业数据标注等领域开展全面合作,例如机械工业出版社与武汉大学依托联合实验室平台,正协同推进关键技术研发及专业数据标注工作。四是深化与行业下游企业在数据集应用层面的纵向协作,聚焦智能制造、具身智能、低空经济、节能减排等重点领域,深入挖掘企业数据需求,将高质量数据集嵌入产品设计、生产优化、故障诊断、售后服务等典型业务场景,通过联合开发、共建中试平台等举措,加速数据集在行业中的落地见效。五是联合生态各方,加快推进面向行业的可信数据空间建设,有条件的科技社可试点以出版社为核心构建企业可信数据空间,为行业数据的交易流通提供安全支撑。由此,形成以科技社为枢纽,政策支撑、产业合作、人才培养、技术研发、场景落地、安全保障等多维度协同联动的行业数据集生态体系。

4.2 执行层面

在执行层面,则包括做好传统出版、路径优化、工具标准建设、专业团队组建、重视行业本体数据集开发五个方面的工作。

4.2.1 坚持做好传统科技出版业务

对于科技社而言,开发行业数据集的根本前提,是坚定不移地做好传统科技出版主业。科技图书当前仍是专业作者高效、系统地输出领域新知与深度见解的重要载体,也是作者实现知识内容产权固化确权最直接、最权威的路径。优质科技图书的持续产出,既是出版社积累核心内容资源、构筑知识壁垒的基础工程,也是维系和团结广大专家作者队伍的关键纽带,更是科技社当下最主要的营收来源与品牌支撑。因此,科技社必须坚持将传统出版的规模、品质做大做优,为行业数据集的开发奠定坚实的内容底座与行业公信力。

4.2.2 “三步法”优化数据集开发路径

从优质科技出版内容到行业数据集,需跨越诸多业务与技术环节。机工社创新性提出“三步法”优化数据集开发路径,系统推进这一跃迁。

第一步,升级资源管理平台,推动专业资源结构化与深度加工。通过对原有社数字资源管理平台的智能化改造,实现全类型内容资源的自动化采集与管理,推动社内资源的复用共享。同时打破以“书”为单元的传统聚合方式,推进内容碎片化、结构化加工,转向以词条、图片、短视频等细粒度资源为最小知识单元的组织管理模式。借助人工智能技术实现资源的自动分类与主题词标引,支持知识资源按需灵活重组与应用,真正做到数字资源“应收尽收”“存得进、分得清、取得出、用得好”,为数据资产化夯实基础。

第二步,依托优势领域建设专业知识库体系。专业知识库是按专业分类、完整知识体系组织的科技出版内容集合,涵盖电子书、数字期刊、词条、图片等多种经过初步数字化加工但未经专业化标注的数据资源类型。构建知识库的核心目的是通过全局知识体系构建,以及内容筛选去重、更新重组等知识工程相关的处理工作,为后续行业数据集开发做好知识准备。机工社计划在“十五五”期间,建立以机械、电工电子、汽车工程、计算机科学、经济管理五大优势领域为核心,以智能制造、具身智能、新能源汽车、低空经济、绿色低碳转型等重点热点领域为延伸的“5+N”垂类专业知识库体系,打造体系完整、内容权威、热点覆盖、更新及时的“科技出版内容数据中台”。

第三步,坚持“模数共振”理念,推进行业数据集的开发与应用。行业数据集具有领域特性强、质量要求高、开发成本高、更新迭代快等特点,加之当前以行业和企业可信数据空间为核心的数据交易流通体系尚不成熟,科技社难以按标准化产品模式建设和交付数据集。因此科技社必须坚持以“模数共振”的理念建设、推广和应用行业数据集,其核心在于“行业需求驱动”,具体体现为企业驱动、场景驱动、模型驱动和项目驱动等多种需求形式。科技社应立足行业真实需求,从专业知识库中按需抽取数据,进行定制化加工与标注,并通过安全可信的交付方式,最终形成可直接用于模型训练、切实提升模型性能的行业数据集产品。

“三步法”中随着科技出版内容数据形态的升级,数据加工标注精细化程度越来越高,数据的知识密度和价值密度也随之提升,如图 1所示。

图 1

图 1   “三步法”优化数据集开发路径


4.2.3 共建工具与标准体系

工具与标准是行业数据集工程化落地的关键支撑。单个科技社受限于研发投入,难以独立完成覆盖数据全生命周期的工具链与标准体系建设,科技社共建共享是可行路径。在标准方面,当前《出版业高质量数据集:建设与应用指南》《出版业高质量数据集:格式与分类要求》等团体标准已在开发过程中[8],科技社应积极参与标准起草与试点,将自身优势领域的数据建设经验转化为行业通用规范,同时对标高质量数据集相关国家标准体系,确保兼容衔接。在工具方面,聚焦数据标注、质量评估、安全交付等共性技术瓶颈,联合开发面向垂直领域的专业标注工具、自动化质量评测平台及安全交付工具,探索共建行业数据治理与服务平台,实现技术共享,降低重复研发成本。

4.2.4 组建复合型专业团队

既懂科技出版业务,又懂数据科学,还懂行业应用的复合型人才不好培养也不好招聘。但科技社可以通过组建技能互补、分工明确、协同高效的复合型专业团队承担开发行业数据集的相关工作。团队应涵盖数据产品经理、领域知识专家、数据工程师等角色,形成从需求分析到成果交付的完整能力链条。在内部推动科技出版编辑向领域知识专家转型,利用其深厚的学科积累承担知识体系构建、知识注入与质量把控职责;在外部引进人工智能、数据科学等领域的高层次人才,联合高校开展人才定制化培养,解决科技社技术能力不足的问题。同时建立项目制协同机制,让业务人员与技术人员在实践中磨合,锻造“业务懂技术、技术懂业务”的复合型专业团队。

4.2.5 重视行业本体数据集开发

在《实施方案》中,本体数据首次被纳入高质量数据集范畴[4]。本体数据是对一个特定领域(比如医学、科研、工程技术)内的概念、概念属性以及它们之间的关系,进行明确的、形式化的、可共享的规范说明,从而构建一个高度抽象的本体语义网络。本体数据通过与模型的结合,在政务、军事和金融领域发挥着越来越重要的作用。在工业领域,以本体为基础,可以确保工业智能体遵循基本规律和约束运行,有效提升安全性与准确率,减少“幻觉”风险,因此被视为未来工业智能的数据基石,相较于普通的实体知识图谱数据,行业本体数据无疑具有更高的战略价值。科技社长期积累的工程技术出版内容中,蕴含着大量共性基础性的概念、流程与约束条件,这正是构建行业本体数据集不可多得的高价值语料资源。例如,机工社以汽车设计类图书内容为基础为某整车设计企业定制开发了“汽车设计知识本体数据集”,显著提升了其工业智能体的性能和安全性。可预见行业本体数据集将成为行业数据集建设的重要方向和热点,对科技社而言,这既是政策导向,更是重塑知识服务核心价值的战略机遇。科技社要尽快形成行业本体数据集自主开发能力,从而抢占行业数据集价值链高端节点。

5 结语

2026年无疑是中国人工智能从“通用对话”迈向“行业落地”的关键转折之年。从4月两部门联合启动“模数共振”行动,到6月国家数据局发布《实施方案》,政策信号密集而清晰:人工智能的竞争已从“拼算力”“拼算法”转向“拼数据”“拼应用”,高质量行业数据供给不足正成为产业落地的瓶颈。截至2026年第一季度,全国已建成高质量数据集超11.6万个,数据要素市场正在以前所未有的速度扩容。对科技社而言,这是不容错失的战略窗口,但挑战同样严峻:标准不统一、接口不兼容,跨机构协同机制缺失,更有出版社直言开发行业数据集“优质难优价”的现实困局。机遇与短板并存,但方向与路径渐明,科技社唯有打破观望、躬身入局,以“模数共振”为核心理念加快行业数据集业务布局,方能在智能时代将科技出版内容知识积累转化为不可替代的竞争壁垒。

参考文献

国务院关于深入实施"人工智能+"行动的意见[EB/OL]. (2025-08-21)[2026-06-24]. https://www.gov.cn/zhengce/content/202508/content_7037861.htm.

[本文引用: 1]

中华人民共和国国民经济和社会发展第十五个五年规划纲要[EB/OL]. (2026-03-13)[2026-06-24]. https://www.gov.cn/yaowen/liebiao/202603/content_7062633.htm.

[本文引用: 1]

智能体规范应用与创新发展实施意见[EB/OL]. (2026-05-08)[2026-06-24]. https://www.cac.gov.cn/2026-05/08/c_1779979789523320.htm.

[本文引用: 1]

关于推进行业高质量数据集建设行动的实施方案[EB/OL]. (2026-06-08)[2026-06-24]. https://www.nda.gov.cn/sjj/zwgk/tzgg/0608/20260608172117399715004_pc.html.

[本文引用: 7]

工业和信息化部办公厅, 国家数据局综合司. 关于联合实施2026年"模数共振"行动的通知[EB/OL]. (2026-04-28)[2026-06-24]. https://www.nda.gov.cn/sjj/zwgk/tzgg/0428/20260428215540161552208_pc.html.

[本文引用: 1]

全国数据标准化技术委员会. 国家标准《高质量数据集  分类指南》(征求意见稿)编制说明[EB/OL]. (2026-01-30)[2026-06-09]. https://www.nda.gov.cn/sjj/ywpd/szkjyjcss/0408/ff808081-9b5e8657-019d-6bc2a8d3-0dbf.pdf.

[本文引用: 1]

刘鲲翔,王飚.

"数据要素×"背景下关于出版业数据资产化的思考

[J].出版发行研究,2024(8):5-15.

[本文引用: 1]

中国音像与数字出版协会. 《出版业高质量数据集: 建设与应用指南》和《出版业高质量数据集: 格式与分类要求》两项团体标准工作组稿评审会在京召开[EB/OL]. (2026-04-02)[2026-06-24]. https://www.cadpa.org.cn/3282/202604/41787.html.

[本文引用: 1]

/

〈 〉