周毅,陈成丨我国可信数据空间研究:框架构建、主题演化与未来方向
转载请注明“刊载于《电子政务》2026年第8期”。
引用参考文献格式:
周毅,陈成. 我国可信数据空间研究:框架构建、主题演化与未来方向[J]. 电子政务,2026(08): 29-40.
摘 要:可信数据空间作为数据要素市场化配置的核心基础设施,对破解数据孤岛、保障数据流通安全、释放数据要素价值具有关键战略意义。结合信息生态、利益相关者等理论,构建我国可信数据空间研究的分析框架,采用BERTopic主题模型验证该框架的科学性与合理性,据此对我国可信数据空间的研究进展进行全方位、系统性梳理与扫描。研究发现,我国可信数据空间研究已形成“基础结构-功能特性-参与主体-应用场景-动态进化”的基本分析框架,并在上述五个维度均形成了一系列共识性观点和演进趋势。在批判性反思的基础之上,提出后续研究应在基础结构维度深化技术与制度的融合、在功能特性维度建立特性协同模型、在参与主体维度强化多主体权责分配、在应用场景维度提高跨场景服务能力、在动态进化维度揭示跃迁动力与机制,从而拓展我国可信数据空间研究领域,进一步深化相关研究主题。
关键词:可信数据空间;数据空间;数据要素;数据治理
DOI:10.16582/j.cnki.dzzw.2026.08.003
一、引言
可信数据空间作为保障数据要素市场化配置的新型基础设施,越来越受到学术界与产业界的广泛关注。其主要思想源于欧盟“数据主权”战略,核心要义在于通过技术、法律与治理框架的协同,构建安全、可信、高效的数据共享环境,破解数据要素治理中“信任赤字”“数据孤岛”“安全风险”等现实困境。Precisely公司2024年调查显示,超67%的决策者对所用数据质量缺乏信任;OECD报告更将“增强数据访问的同时保持信任”列为全球共同挑战,凸显了可信数据空间建设的紧迫性和必要性[1]。
我国在2021年《“十四五”数字经济发展规划》中提出构建“可信数据流通环境”,2024年发布的《可信数据空间发展行动计划(2024—2028年)》将其定位为“全国一体化数据市场的核心载体”,计划到2028年建成100个以上可信数据空间[2]。近年来,学界从可信数据空间的内涵特征、制度基础、技术架构、运营模式、实践路径等多方面进行了深入探索,对其开展系统性文献分析有利于洞察我国在该领域的研究进展与热点问题,并形成关于未来研究动态的基本判断。
基于上述研究背景与现实需求,本文运用有关理论和BERTopic主题模型构建和验证我国可信数据空间研究的分析框架,并基于该框架全面梳理核心观点、学术分歧、典型实践,提出可信数据空间的未来研究方向,以期为我国可信数据空间的理论完善与实践推进提供参考。
二、可信数据空间研究的框架构建
(一)框架构建的基本依据与内在逻辑
以国家数据局《可信数据空间发展行动计划(2024—2028年)》为权威政策依据,整合数据治理理论、信息生态系统理论、利益相关者理论等,针对传统框架中技术与制度混杂、维度层级模糊的问题,遵循本体认知与实践发展的双重逻辑,构建由“基础结构-功能特性-参与主体-应用场景-动态进化”组成的五维分析框架。
上述理论框架的内在逻辑是:基础结构包括基础设施、技术保障和规则约束等,它为数据流动提供可信的数据、技术与制度底座;其彰显的核心价值由功能特性定义,明确可信数据空间的信任、共享、安全等属性特征;上述属性特征的实现依赖多元主体参与,通过各方协同将相关理念转化为具体行动;有关实践行动以差异化的应用场景为载体实际运行,从而创造服务价值并实现数据价值的释放与增值;应用场景的迭代更新不断驱动数据治理实践和研究的深化,从而实现可信数据空间研究的整体动态进化。在动态进化中所提出的新理论、新技术和新制度等,将反馈并驱动可信数据空间从基础结构开始的新一轮研究升级,从而构成一个从理论构建到实践优化完善的闭环系统。
与学界较流行的技术、制度和应用三维框架相比较[3],本文提出的五维分析框架的创新体现在三个方面:一是提出功能特性这一维度,以揭示出可信数据空间的核心特征;二是参与主体维度的显性化,对政府、市场、社会力量等不同主体进行全要素分析,从而深化利益相关者理论在可信数据空间建设中的应用,揭示可信数据空间建设与运行的内在动力;三是通过动态进化维度将可信数据空间研究从静态结构切片调整为动态演化过程与规律分析,从而为其未来发展指明主要方向。
可信数据空间研究的分析框架所对应的基本问题、理论依据和参考观点来源可参见表1。

(二)框架的内部结构与主要内容
⒈框架的内部结构
本文聚焦可信数据空间研究构建形成的分析框架,其基本结构包括五个维度,各维度的内涵与关系可参见图1。

⒉框架的主要内容
基础结构是可信数据空间稳定运行的核心骨架。它一般采用设施层、服务层、应用层的三级设计方案,融入技术标准、制度规则等以保障其协同运行。设施层以技术为核心构建可信数据底座,服务层融合技术与制度规范以促进数据有序流动,应用层聚焦数据价值转化与数据生态建设。
功能特性是可信数据空间核心功能及其主要特征的集中体现。主要包括五个核心特征,即可信性保障数据全生命周期可追溯,共享性旨在打破数据孤岛,安全性锁定“技术+制度”的双安全防护机制,高效性是为提升数据资源配置效率进行相关机制设计,包容性强调多元主体参与、各类数据标准协同及数据的可接入。
参与主体是强调可信数据空间建设运行中多主体的协同互动。基于利益相关者理论,明确政府负责规则制定、公共数据供给与监管,市场主体承担数据运营与价值转化,社会主体提供需求反馈与监督等不同角色,通过三者协同形成政府引导、市场主导、社会参与的治理格局。
应用场景是可信数据空间及其数据价值实现的具体载体。基于需求适配、规划试点的原则,将其划分为三类差异化场景。行业数据空间赋能产业数字化转型,城市数据空间支撑智慧城市建设,领域数据空间满足特色化数据需求。
动态进化是指可信数据空间发展具有显著的阶段性特征。在探索阶段主要解决基础设施建设问题,在实践试点阶段重点推进典型场景建设与验证,在规模化发展阶段主要是通过场景创新迭代和技术与服务升级实现数据价值的共创,在生态成熟阶段将实现多类型应用场景的协同并发,数据价值链不断强化,数据赋能数字经济、数字社会和数字政府的功能将得到明显提高,数据空间成为数字中国的核心基础设施。
(三)基于BERTopic主题模型对框架的验证
为了实际验证本文构建的分析框架是否符合近年来我国可信数据空间研究状况,本文采用BERTopic主题模型对可信数据空间研究动态进行内容识别,并揭示出主题分析结果与分析框架两者之间的映射或呼应关系,从而进一步验证前文所构建分析框架的科学性与合理性。
⒈文献准备
本文选择中国知网CNKI作为文献检索来源,采用系统化分层筛选与多重核验的方式确保筛选的客观性和准确性。具体步骤如下:通过对中国知网数据库进行文献检索,检索时间为2025年7月30日,检索式为:TKA=‘可信数据空间’OR TKA=‘数据信任’OR KY=‘数据空间’,时间范围不限,初步检索得到文献总量:n=845;通过类型排除和主题相关性核验两轮文献筛选。根据中国知网数据库的文献类型标识,剔除非学术论文类型文献。剔除具体情况如下:会议论文(n=25)、报纸文章(n=55)、图书章节(n=4)、标准文献(n=3)、科技成果(n=13)。筛选后剩余文献量:n=845-100=745。在此基础上通过“标题-关键词”初筛,获得待定文献:n=312,并通过对312篇文献的摘要进行逐篇精读,保留有效文献量:n=745-550=195。最终纳入的195篇文献涵盖期刊论文和学位论文,为后续文献内容分析提供了数据基础。
⒉基于BERTopic的主题内容分析
BERTopic主题模型分析依托预训练语言模型(BERT)的语义理解能力与无监督聚类算法,对文献文本内容进行深度语义挖掘,通过BERT将文本转化为高维语义向量,捕捉词汇背后的隐性语义关联,结合聚类算法实现研究主题的自动识别、分类与演化路径追踪,生成具有语义代表性的主题标签,提升主题解释性。本文采用BERTopic主题模型结合层次聚类法,对195篇文献的文本内容展开分析,最终识别出七大类主题簇(参见图2、图3)。具体展开过程与主要结果下文详述。


⑴BERTopic主题模型分析法的实施过程
BERTopic主题模型分析法聚焦语义深层关联挖掘。具体流程如下:
第一,语义嵌入与降维。通过SentenceTransformer库调用擅长捕捉跨语言语义的paraphrase-multilingual-mpnet-base-v2预训练模型,将经过分词的文献摘要文本转化为高维语义向量。为提升计算效率,采用预计算策略,生成并保存了所有文献的嵌入向量。随后,使用UMAP算法对高维向量进行降维,以保留数据拓扑结构并提升后续聚类效果。关键参数设置为:n_neighbors=5(平衡局部与全局结构)、n_components=5(降至5维空间)、min_dist=0.0(允许点紧密聚集)及metric='cosine'(使用余弦距离)。
第二,密度聚类与主题识别。采用基于密度的HDBSCAN算法对降维后的向量进行聚类。该算法的优势在于能自动确定簇的数量并有效区分噪声点。参数设置为:min_cluster_size=3(形成一个主题所需的最小文档数),min_samples=1(此设置可放宽核心点的条件,旨在减少被标记为噪声的文档数量,以将更多文献纳入主题分析)。为提升主题的区分度与可解释性,在构建词频矩阵时,将领域内泛在的高频但区分度低的词汇自定义为停用词,包括“数据”“空间”“可信”等,并在CountVectorizer中设置,以便在建模前完成过滤。
第三,主题数确定与优化。本文的主题数并非预先设定,而是通过“算法初筛+人工研判”的迭代过程确定。具体依据如下:首先,由HDBSCAN根据上述密度参数对全部文献进行初始聚类,自动生成若干主题簇。然后,利用BERTopic内置的visualize_hierarchy功能,生成基于主题语义相似度的层次聚类树图。依据此树图所揭示的主题间亲疏关系,并结合对主题关键词与代表性文献的解读,通过merge_topics函数进行多轮人工指导的主题合并。合并的原则是将关键词高度重叠、语义高度相关或指向同一研究子领域的细碎初始主题进行归并。最终,在确保每个主题具有足够区分度和丰富内涵的前提下,确定了代表当前研究结构的7个核心主题。
⑵BERTopic主题模型分析结果及其对框架的映射
BERTopic主题模型分析结果所形成的主题簇与前文提出的分析框架高度呼应,主题簇实质构成了对分析框架的实际映射。具体表现为:
第一,数据要素市场化与流通治理。该主题聚焦数据要素市场化配置与流通体系构建,呼应映射“基础结构-数据流通服务层”“参与主体-市场主体”“功能特性-共享性/高效性”。
第二,产业数字化与价值链重构。该主题围绕企业数字化转型与价值链优化,对应“应用场景-行业数据空间”“基础结构-生态应用层”“功能特性-高效性”。
第三,个人隐私保护与安全技术。该主题关注隐私保护机制与数据安全技术,关联“功能特性-安全性”“基础结构-基础设施层”。
第四,智慧城市基础设施管理。该主题涵盖数字城市基础设施建设与管理,契合“应用场景-城市数据空间”“基础结构-基础设施层”。
第五,数据质量管理与分析方法。该主题探讨数据质量控制与相关技术方法,反映“基础结构-基础设施层”和“功能特性-可信性”。
第六,农业教育科研数据治理。该主题聚焦相关领域数据治理模式,对应“应用场景-领域数据空间”“基础结构-数据应用层”和“功能特性-包容性”。
第七,医疗健康数据共享与治理。该主题研究医疗数据共享机制与治理,呼应并映射“应用场景-行业数据空间”“功能特性-共享性/安全性”“基础结构-数据流通服务层”。
综合来看,基于BERTopic主题模型识别的七大主题簇与分析框架形成了全覆盖、强映射的逻辑关系。从维度覆盖来看,七大主题簇分别映射五维框架的核心维度,未出现框架维度与主题脱节的情况;从逻辑关联来看,主题簇的核心内容均是分析框架对应维度的实践具象化,这印证了本文所构建的分析框架对研究领域的解构逻辑具有科学性;从研究脉络来看,主题簇天然形成“技术支撑-规则设计-场景落地”的递进关系,与分析框架中提出的“基础结构-功能特性-应用场景”的逻辑高度一致。
基于BERTopic识别的七大主题簇结果表明,本文所构建的五维分析框架可以很好地覆盖近年来我国可信数据空间的研究进展。这表明,该框架可以成为归纳我国可信数据空间研究进展的依据。
三、基于分析框架对我国可信数据空间研究进展的解构
基于五维分析框架,结合国内可信数据空间领域的核心研究成果与实践经验,通过观点论证、案例支撑和文献佐证等方式,系统梳理各维度的研究共识、学术分歧与演进趋势,从而进一步深化对研究现状的认识。
(一)基础结构维度
⒈核心观点
国内学界与业界已形成“基础设施-流通服务-生态应用”三级架构的普遍共识,架构设计的核心逻辑从“技术单一堆砌”向“技术-制度双向内嵌”转型。在基础设施层,技术维度表现为数联网分布式架构、身份认证体系及加密存储等硬性支撑,而制度维度则通过技术标准、接入协议等软性规范对底层运行进行约束;在数据流通服务层,技术与制度的融合更加具体化,表现为将数据确权、估值定价、合规审计等管理制度转化为算法逻辑、智能合约与可操作的流程规范,确保制度规则在流通环节的自动化执行;在应用层,则侧重于通过场景驱动,将技术效能与制度红利转化为产业赋能的具体实践。然而,现有研究在跨层级联动、制度规则等方面存在理论与工程实践的断裂,尚未形成动态闭环的整合体系。基础结构的关键研究信息可见整合表(参见表2)。

⒉演进趋势
基础结构形态正从“静态分层”向“动态闭环”演进,突出应用层实践对基础层、服务层的反向优化作用。例如,通过应用试点中暴露的合规问题,反向调整服务层的制度规则嵌入逻辑;基于技术迭代速度,优化基础层的模块兼容设计[21]。同时,制度规则算法化成为核心转型方向,智能合约、区块链存证等技术被用于将数据确权、监管要求转化为可执行代码,推动技术赋能制度落地、制度规范技术应用的深度融合[24]。
⒊批判性反思
现有研究存在三个主要局限,其一,技术与制度呈现“两张皮”现象。多数基础结构设计停留在技术模块的物理叠加,未实现技术与制度规则的实时映射,如数据确权规则如何转化为自动化执行的智能合约就缺乏可落地的技术方案[3];其二,跨层级协同缺乏统一标准。不同主体设计的架构在接口规范、数据格式等方面兼容性不足[22],制约了跨域数据流通[25];其三,基础结构的动态适配能力薄弱。基础结构设计多基于静态场景假设,未充分考虑技术迭代与场景拓展带来的调整需求,从而导致基础结构的生命周期较短[21]。
(二)功能特性维度
⒈核心观点
学界已明确可信数据空间的可信性、共享性、安全性、高效性、包容性等核心特性,在理解上述特征时已实现从“单一维度强化”向“多维动态耦合”转型,但在安全与共享的平衡路径、功能特性与场景化适配标准等方面存在一定分歧。功能特性的关键研究信息可见整合表(参见表3)。

⒉演进趋势
功能特性正从“静态预设”向“动态调整”转型,即根据数据敏感等级、应用场景类型等自动适配功能特性的权重。例如,高敏感医疗数据优先强化安全性与可信性,降低共享范围,这一适配逻辑在多项医疗数据空间实践中得到验证[30];政务公开数据则侧重提升共享性与高效性,简化安全管控流程[29]。同时,包容性逐渐成为功能特性体系的重要补充,研究焦点从“满足主流主体需求”转向“适配中小微主体、特殊领域数据的接入需求”[21]。
⒊批判性反思
当前研究存在三个方面问题:一是功能特性的协同缺乏量化模型。现有研究多定性描述“功能特性的耦合”,但未明确不同场景下可信性、安全性、共享性的最优组合方案,如工业数据空间中安全[26]与高效性的平衡阈值缺乏量化依据[21];二是功能标准统一化与场景化适配存在内在矛盾。通用型功能特性标准难以满足行业、领域的差异化需求,而过度场景化又导致功能特性标准的碎片化,不利于跨域数据流通[31];三是对包容性与其他功能特性的冲突协调研究不足。如中小微企业接入数据空间时,如何平衡接入成本(包容性)与数据安全管控(安全性),尚未形成成熟解决方案[21]。
(三)参与主体维度
⒈核心观点
基于利益相关者理论,对可信数据空间建设中“政府-市场-社会”等参与主体架构及其主要分工已形成共识,关于主体协同逻辑正从“点状分散参与”向“生态价值共创”转型。目前,研究重心集中于相关主体的宏观角色定位,对中观层面的利益分配、风险共担机制等则相对关注不够,这就导致在可信数据空间建设中市场主体和社会主体的实质性参与仍有不足。参与主体的关键研究信息可见整合表(参见表4)。

⒉演进趋势
参与主体的协同形态正从“单向互动”向“价值共创”转型,各类数商企业、数据交易所、第三方运营平台等主体的枢纽作用日益凸显,成为利益协调、风险分担的核心节点[23]。同时,以应用场景为中心实现主体权责清单细化正成为研究热点[31],例如,在医疗数据空间中,政府负责制定隐私保护规则,企业提供技术方案,行业协会承担标准校验,社会主体享有数据知情权与异议权[32]。
⒊批判性反思
现有研究的主要短板在于宏观角色清晰,中观机制缺失。其一,多主体的利益分配机制模糊。例如,在公共数据授权运营中,政府、市场主体、数据源头方的收益分配比例缺乏量化依据[35],Shapley值法等分配算法的实践应用案例极少[32];其二,多主体的风险共担机制有待完善。例如,数据流通中的安全风险、合规风险如何在多主体间划分就缺乏明确的制度设计,导致主体参与积极性受限[21];其三,社会主体参与流于形式。多数研究仅强调用户知情权与监督权,但未设计有效的诉求表达渠道与权益保障机制,数据信托等创新模式仍处于理论探索阶段[33]。
(四)应用场景维度
⒈核心观点
可信数据空间的应用场景已形成行业、城市、领域三类分化形态,场景落地逻辑正从“通用化推广”向“行业化、领域化”的细分转型。但目前研究缺乏对多场景共性规律的提炼,跨场景互联互通标准缺失,导致应用模式可复制性较差。应用场景的关键研究信息可见整合表(参见表5)。

⒉演进趋势
应用场景正从“单一化”向“跨域融合”转型。例如,研究认为城市数据空间可以与行业数据空间联动,实现政务数据与产业数据的融合应用[36];领域数据空间可以与行业数据空间交叉,形成文化产业数据流通生态[31]。同时,场景化建设模式的提炼已经成为重要研究方向。通过总结典型场景的架构设计、特性适配、主体协同经验,目标是形成可迁移的参考方案[28]。
⒊批判性反思
应用场景研究存在三个主要问题。其一,碎片化特征显著。在对全国100余个试点案例进行研究后发现,现有研究多聚焦单一场景的描述性分析,对这些案例缺乏系统性比较,未提炼出跨场景的共性规律。其二,跨场景互联互通标准缺失。不同场景数据空间的接口规范、数据格式、安全协议不统一,导致“数据孤岛”从行业内延伸至场景间[25]。其三,本土化适配深度不足。部分场景方案照搬国外经验,未充分结合我国制度环境与治理需求,如红色文化资源数字化、政务数据授权运营等本土场景的专属化治理研究相对薄弱[36]。
(五)动态进化维度
⒈核心观点
学界普遍认可“有限探索-实践试点-规模化发展-生态建设”四阶段演进路径。当前,我国可信数据空间建设正处于“实践试点”向“规模化发展”过渡的关键时期,研究重心正从“阶段内任务描述”向“阶段间转型条件分析”演变,但对实现阶段转型的动力、瓶颈和突破路径等研究仍显不足。动态进化的关键研究信息可见整合表(参见表6)。

⒉演进趋势
可信数据空间的动态进化阶段从“线性递进”向“有序迭代”转型。可信数据空间动态进化的各阶段边界日益模糊[21],部分领先场景在试点期即开展规模化准备工作,如部分行业数据空间同步推进技术标准化与跨域拓展[31]。同时,政策红利与技术创新的协同驱动作用日益凸显,《可信数据空间发展行动计划(2024—2028年)》明确的“3+5+5”工作体系为规模化跃迁提供政策保障,数联网、隐私计算等技术突破为这种规模化发展提供核心支撑[31]。
⒊批判性反思
现有研究的主要局限在于对不同动态进化阶段的演变动力、演变机制关注不足。其一,演变动力认知碎片化。目前尚未形成“技术-政策-市场-组织”的整合性分析框架[21],难以识别关键触发条件[22]。其二,瓶颈突破路径研究薄弱。在目前研究中对规模化发展阶段面临的技术标准统一、制度互认、利益协调等核心问题缺乏可操作的解决方案[25]。其三,动态进化的评估体系缺失。目前,尚未从理论上建立起相应评估指标体系,以指导当前建设处于演进发展的哪个关键节点等进行科学判断,这就导致政策制定与实践推进缺乏精准指引[23]。
四、讨论与展望
(一)研究进展总结
依托基础结构、功能特性、参与主体、应用场景和动态进化五维分析框架,可以发现我国可信数据空间研究正在构建起理论共识和实践验证的总体格局。
在理论层面,通过五维分析框架的归纳,可以发现在部分问题上已形成了共识。在基础结构上,确立“基础-服务-应用”分层逻辑,数联网成为基础设施层的核心技术方向,基础结构正从静态固化向韧性适配、动态可调转型;在功能特性上,明确可信性、共享性、安全性、高效性、包容性五大核心特征,且它们之间呈现出动态耦合态势,特性协同逻辑从简单静态平衡向精准动态优化演进;在参与主体上,形成政府、市场、社会的多主体协同,其协同逻辑逐步向价值共创转型;在应用场景上,分化为行业、城市、领域三类形态,正形成以点带面的实践推进逻辑,场景间协同从物理叠加正向有机融合过渡;在动态进化上,提出了“有限探索-实践试点-规模化发展-生态建设”四阶段的实现路径,当前正处于实践试点向规模化发展过渡的关键时期,阶段跃迁的动力和机制有待进一步厘清。
在实践层面,依托全国100余个国家试点案例,学界提出的有关理论成果与技术方案正得到验证。在技术支持方面,数联网、隐私计算、区块链时空码等核心技术方案在多场景深度应用;在制度保障层面,数据确权、三权分置、数据信托等制度创新举措取得初步成效,数据流通规则体系逐步完善;在场景落地层面,南通家纺产业链数据共享空间、上海跨部门审批数据共享平台、智慧教育平台等典型案例,实现了行业、城市、领域三类数据空间的具象化落地;在阶段推进上,已完成基础标准制定与试点效果核验,跨域数据空间互联互通测试、技术架构国家标准发布等工作有序推进,为后续规模化推广夯实了基础。
(二)研究局限与成因分析
⒈主要研究局限
在基础结构维度上,研究中存在技术与制度协同不足。多数基础架构研究仅停留在技术模块的物理叠加,未能实现制度规则的实时映射和动态联动,跨层级协同缺乏统一标准,接口规范与数据格式的兼容性不足,难以有效应对技术快速迭代与应用场景持续拓展的现实需求。
在功能特性维度上,研究未涉及对不同场景下可信性、安全性、共享性等特性配置的量化依据分析。功能特性的统一化与场景化适配之间存在内在矛盾。
在参与主体维度上,研究重心多集中于不同主体的宏观角色定位,在中观层面的利益分配与风险共担机制设计上存在明显短板。例如,在公共数据授权运营的收益分配研究中缺乏科学量化依据,未界定数据流通各环节的风险责任边界,数据信托等创新协同模式仍停留在理论研究的起步阶段。
在应用场景维度上,研究呈现显著碎片化特征。目前研究较少对试点案例进行跨场景比较分析,未能提炼出可复制的跨场景共性规律。同时,本土化适配研究也有不足,部分场景方案照搬国外经验。
在动态进化维度上,对阶段间跃迁动力与机制的研究较为薄弱。由于目前在理论研究中尚未构建“技术-政策-市场-组织”的一体化整合分析思路,所以难以精准识别阶段跃迁的关键触发条件,也难以从理论上对动态进化态势进行有效预判。
⒉局限成因探析
跨学科协同壁垒显著。可信数据空间作为典型交叉学科领域,涵盖计算机科学、法学、经济学、管理学等多个学科,但学科间的研究壁垒尚未完全打破。缺乏常态化跨学科研究团队与整合性研究方法,学者多局限于自身学科视角开展研究,这在一定程度上制约了研究的整体性与深度。
实践数据可获得性不高。可信数据空间建设与数据流通等涉及主体权益、商业秘密、公共安全等敏感议题,其试点案例数据公开度偏低,这就导致研究难以获取丰富的高质量数据支撑,从而直接制约了跨场景比较研究的开展,增加了实践共性规律提炼的难度。
多主体利益博弈复杂。在可信数据空间建设中,不同参与主体对数据权益、数据安全、流通效率等的诉求存在显著差异,多主体间的利益协调难度较大。这就导致在研究中较难形成行业、城市和领域的可信数据空间建设普适化模式。
研究重点方向上的偏差。部分研究过度依赖政策文件解读或单一技术突破,忽视了可信数据空间的复杂系统特性,陷入技术工具主义或政策依附性误区;部分研究聚焦短期试点成效,缺乏对长期演进规律的跟踪研究,难以支撑可信数据空间建设理论体系构建;部分研究停留在宏观对策提出,未结合具体实践场景细化操作路径。
(三)未来研究方向
基于本文构建的分析框架,结合前文梳理的局限与成因,未来研究可以聚焦五大核心方向,通过高质量理论研究推动可信数据空间实践的高质量发展。
在基础结构维度上,深化技术、制度深度融合研究。重点研究如何将数据确权、合规监管等核心制度规则转化为智能合约、访问控制等可执行技术,实现制度与技术的实时映射;加快制定数据空间的跨层级协同统一标准,规范数据空间接口与数据格式,提升数据空间结构的兼容性与互操作性;引入数据空间结构韧性评估模型,强化动态适配能力,设计基于场景反馈、技术迭代与风险预警的全流程数据空间结构优化机制,推动数据空间结构设计动态进化转型。
在功能特性维度上,研究建立功能特性的协同适配模型。基于不同场景的数据敏感等级、数据来源和核心需求差异等,确定其可信性、安全性、共享性等特性的适配阈值与动态优先级;研究构建与可信数据空间建设密切相关的国家数据基础标准、行业与区域补充标准的分层标准体系,既保障跨域数据流通效率,又满足行业差异化需求。
在参与主体维度上,加强多主体协同机制的实现途径研究。研究构建多主体利益分配量化模型,科学界定公共数据授权运营、数据信托等不同情境下的各类参与主体的收益分配比例;研究建立多元化风险共担机制,引入数据保险、保证金等工具,清晰划分数据流通各环节的风险责任;分析数据信托等创新模式从理论走向实践的具体路径。
在应用场景维度上,提炼跨场景建设的共性规律。在对全国试点案例进行比较研究的基础上,提炼不同场景在基础结构、特性适配、主体权责划分等方面的共性规律与差异化适配逻辑;加快制定跨场景互联互通标准,统一接口规范、数据格式与安全协议;深化红色文化资源数字化、政务数据跨域共享等本土特色场景研究,设计专属化方案,提升场景建设模式的可复制性。
在动态进化维度上,研究阶段跃迁的动力和机制。以复杂系统理论为支撑,整合技术、政策、市场、组织多维度因素,建立可信数据空间阶段跃迁的整合性分析框架,精准识别规模化发展的关键触发条件与阻滞因素;针对技术标准统一、制度互认等核心瓶颈,提出推进可信数据空间阶段跃迁的实现机制。
研究通过五维分析框架的构建和主题内容的分析,揭示了我国可信数据空间研究的进展与局限,可以为未来研究指明方向。本文的主要局限是虽然构建了一个分析框架并运用BERTopic主题模型结果验证了其科学性与合理性,但在学理性研究分析上仍显不足。依据分析框架所总结提炼的关于可信数据空间研究现状与趋势的判断仍有待运用其他方法进一步佐证。
参考文献:
(略)
作者简介:
周毅(1966—),男,博士,教授,博士生导师,研究方向为政府信息管理、数据治理、可信数据空间建设。
陈成(2003—),男,硕士研究生,研究方向为可信数据空间建设。
*基金项目:国家社会科学基金重大专项“加强网络内容建设与管理的政策体系研究”(项目号:26&ZDA082)。