一、连接器在可信数据空间中的位置
在可信数据空间中,连接器是非常核心的底层组件。它位于数据提供方、可信数据空间平台和数据使用方之间,负责把本地数据资源、安全策略、身份认证、访问控制、使用合约、日志审计、计量结算等能力连接起来。
连接器不是普通接口,也不是单纯的 API 网关,而是可信数据空间中的“数据流通网关”。它既要连接数据,又要执行规则;既要支持数据访问,又要控制数据使用;既要对外提供服务,又要保证数据提供方对数据保持控制权。

图1 可信数据空间连接器完整架构图:数据不裸奔、访问可控制、使用可审计
从架构上看,连接器向下连接本地数据源,向上对接可信数据空间平台,向外支撑数据使用方调用。其核心特征是数据不直接暴露原始数据库,而是通过连接器完成资源封装、合约执行、动态编目和审计追踪。
配图说明:本图作为全文主图,展示了本地数据源、可信数据连接器、可信数据空间平台和数据使用方之间的关系。后文会将主图中的能力进一步拆解到对应章节。
二、连接器完整架构:连接、控制、安全、运营一体化
一个完整的可信数据连接器不是单一程序,而是一组能力组合。它既要具备数据接入能力,也要具备元数据采集、数据血缘采集、资源封装、身份认证、策略执行、数据脱敏、日志审计和计量结算能力。

图2 可信数据空间连接器技术架构图
这张技术架构图可以理解为连接器的“工程蓝图”。左侧是本地数据源,中间是连接器内部能力,右侧是可信数据空间平台和数据使用方。连接器不是简单地把数据传出去,而是在数据输出之前完成身份校验、授权判断、策略执行、脱敏处理和日志记录。
连接器内部的能力可以归纳为四组:连接能力、控制能力、安全能力和运营能力。连接能力解决数据如何接入;控制能力解决谁能访问、如何访问;安全能力解决数据如何保护;运营能力解决调用如何审计、如何计量、如何结算。
三、连接器的核心定位
连接器的核心定位可以概括为五句话。第一,它是数据资源的接入点;第二,它是数据服务的封装器;第三,它是访问控制的执行端;第四,它是使用合约的落地点;第五,它是审计追踪的采集端。
数据提供方通过连接器将本地数据资源注册到可信数据空间中,而不是直接暴露数据库或内部系统。外部主体访问数据时,也不是绕过提供方直接取数,而是经过连接器进行身份认证、授权校验、策略判断和受控输出。
- 接入点:连接数据库、数据湖、业务系统、文件资源、内部 API 和模型服务。
- 封装器:将原始表、文件或接口封装为数据集、指标服务、API 服务、模型服务和数据产品。
- 执行端:根据授权合约和策略引擎决定访问范围、字段范围、调用频率和输出方式。
- 落地点:将合约中的使用目的、期限、范围、输出限制转化为可执行的技术控制。
- 采集端:记录数据调用、策略判断、脱敏处理、结果返回和计量结算全过程。
四、连接器九大模块拆解
一个完整的可信数据连接器通常可以拆成九个模块:数据源适配、元数据采集、数据血缘采集、资源封装、身份认证、授权与策略执行、数据处理与脱敏、日志审计、计量结算。

图3可信数据连接器核心模块拆解
1. 数据源适配模块
数据源适配模块负责连接本地数据环境,支持关系型数据库、NoSQL 数据库、数据湖、对象存储、文件服务器、业务系统 API、消息队列、模型服务等。它解决的是“连接器如何访问本地数据”的问题。
2. 元数据采集模块
元数据采集模块负责提取和维护数据资源的描述信息,包括资源名称、来源系统、字段结构、更新时间、质量状态、敏感等级、开放条件、责任主体和使用限制。其输出结果进入动态数据资源目录,供空间内主体检索、申请和订阅。
3. 数据血缘采集模块
数据血缘采集模块负责记录数据从哪里来、经过哪些加工、形成了哪些资源,又被哪些服务、模型或应用使用。如果元数据回答“这个数据是什么”,数据血缘回答的就是“这个数据从哪里来、如何加工、影响到哪里去”。
4. 资源封装模块
资源封装模块负责把本地数据封装成可流通的数据服务。连接器可以把原始表、接口、文件和模型结果封装为数据集、查询服务、指标服务、API 服务、报表服务和数据产品。
5. 身份认证模块
身份认证模块负责确认访问请求来自谁。它需要结合可信数据空间中的身份体系,确认调用方身份、所属机构、角色类型、信任等级和授权状态。
6. 授权与策略执行模块
授权与策略执行模块是连接器中最关键的部分。它负责判断一次数据访问是否符合授权规则和使用策略,并决定允许访问、拒绝访问、字段脱敏、聚合返回、进入沙箱或触发审批。
7. 数据处理与脱敏模块
数据处理与脱敏模块负责在数据返回之前完成字段过滤、行级过滤、脱敏、聚合、加密、格式转换、单位转换和结果审查。它的重点是让数据“按规则输出”,而不是“原样输出”。
8. 日志审计模块
日志审计模块记录调用主体、调用时间、调用资源、请求参数、授权合约、策略判断、返回结果类型、脱敏方式和异常信息,用于安全追踪、监管检查、责任认定和运营分析。
9. 计量结算模块
计量结算模块统计 API 调用次数、数据返回条数、字段数、文件下载次数、计算任务次数、模型调用次数和服务使用时长,为费用结算、收益分配和资源评估提供依据。
五、动态数据资源目录与数据血缘采集
动态数据资源目录是本文的重点之一。传统数据资源目录更多依赖人工登记、定期维护和静态发布,适合描述“已经整理好的数据资源”,但很难反映数据源、字段、接口、服务、质量状态和授权状态的持续变化。
图4 从元数据采集到动态数据资源目录
可信数据空间中的资源目录不应只是静态清单,而应当是由连接器持续采集元数据、血缘关系、质量状态、授权状态和运行状态后形成的数据资源地图。它能够随着本地数据源变化、数据服务变化、授权状态变化和血缘关系变化而持续更新。
连接器在动态数据资源目录中承担四类工作:资源发现、元数据同步、血缘关系同步和状态持续更新。通过这四类工作,目录不再只是“有什么数据”的列表,而是能够展示“数据从哪里来、怎么加工、能否使用、当前是否可用、影响到哪些服务”的动态地图。
- 资源发现:自动扫描本地数据库、数据湖、文件系统、业务系统 API 和模型服务。
- 元数据同步:同步字段结构、更新时间、质量状态、敏感等级、开放条件和责任主体。
- 血缘同步:同步数据来源、加工链路、字段映射、上下游依赖和服务调用关系。
- 状态更新:当字段变更、接口下线、质量异常或授权变化时,自动同步目录状态。
章节要点:元数据采集和数据血缘采集共同支撑动态数据资源目录,是连接器区别于传统 API 网关的重要能力。
六、授权与策略执行机制
连接器真正体现“可信”的地方,在于它能够执行授权与策略控制。访问控制解决的是“能不能访问”,使用控制解决的是“访问之后能怎么用”。在可信数据空间中,仅能访问是不够的,还要控制用途、范围、期限、频次、输出粒度和结果导出方式。

图5 连接器如何执行授权与策略控制
连接器在收到访问请求后,会先完成身份认证,再校验授权合约,并调用策略引擎进行动态判断。策略判断结果并不只有允许或拒绝,还可能包括字段脱敏、聚合返回、进入沙箱、触发审批、限制导出等多种处理方式。
- 判断条件:调用主体、所属机构、授权合约、数据资源、敏感等级、请求字段、调用时间、调用频率和声明用途。
- 执行结果:允许访问、拒绝访问、字段脱敏、部分字段返回、聚合结果返回、进入可信计算环境或触发人工审批。
- 审计要求:每一次策略判断都要记录审计日志,并关联授权合约、访问凭证和计量信息。
七、一次典型调用流程
连接器的一次典型调用流程可以分为资源发现、动态编目、数据申请、合约生成、凭证下发、连接器校验、策略执行、数据处理、结果返回、日志审计和计量结算等环节。

图6 可信数据连接器调用流程图
八、连接器与 API 网关的区别
很多人容易把连接器理解成 API 网关,但两者并不一样。API 网关主要解决接口统一入口、路由、限流、认证、监控等问题,更关注服务访问;连接器不仅关注接口访问,还关注数据资源、数据合约、数据主权、使用控制、审计追溯和价值计量。
图7 连接器不是 API 网关
可以这样区分:API 网关管理的是接口,连接器管理的是数据资源;API 网关控制的是访问入口,连接器控制的是数据使用过程;API 网关更偏系统集成,连接器更偏跨主体可信协作。
一句话区分:API 网关回答“能不能调接口”,连接器回答“能不能在合约约束下使用数据”。
九、连接器与数据中台的区别
数据中台通常强调企业内部数据汇聚、治理、开发和服务化。它的典型方式是把多个业务系统的数据汇聚到统一平台,再进行建模、开发和服务输出。连接器则更适合跨主体数据流通场景,不要求所有数据集中到同一个平台。
二者可以协同,但不是同一个东西。数据中台可以作为企业内部的数据底座,连接器可以作为企业对外参与可信数据空间的数据出口。在实际建设中,连接器可以对接企业数据中台,把数据中台中已经治理好的数据资源进一步封装为可信数据空间中的数据服务。
- 数据中台负责企业内部数据治理和服务化。
- 连接器负责跨组织数据资源发布、授权、调用和审计。
- 数据中台强调汇聚与开发,连接器强调受控流通与合约执行。
十、连接器部署模式
连接器常见部署模式有三种:提供方侧部署、平台侧托管部署和混合部署。不同模式适用于不同的数据敏感等级、运维能力和协作场景。
图8 可信数据连接器三种部署模式
1. 提供方侧部署
连接器部署在数据提供方本地环境中,直接对接提供方的数据源。这是最常见的模式,适用于数据敏感度较高、数据提供方控制要求较强的场景。
2. 平台侧托管部署
连接器由可信数据空间运营方统一部署和运维,数据提供方通过安全通道接入。这种模式降低了数据提供方部署成本,但对运营方安全隔离和合规能力要求较高。
3. 混合部署
核心数据通过提供方侧连接器访问,低敏数据或公共数据通过平台侧连接器托管。该模式在实际项目中较为常见,可以兼顾安全控制和运维效率。
十一、连接器安全机制与工程实现
连接器需要具备多层安全控制能力,包括通信安全、身份安全、权限安全、数据安全、运行安全和审计安全。通信层需要加密传输,身份层需要统一认证,权限层需要细化到资源、字段、时间、频率和用途,数据层需要支持脱敏、加密、聚合和输出审查。
在工程落地时,连接器不是一个单一程序,而是一组服务组合。常见技术实现包括数据源适配器、元数据采集器、数据血缘采集器、API 服务封装层、身份认证客户端、策略执行引擎、脱敏处理组件、日志采集组件、计量统计组件、配置管理组件、安全通信组件和运维监控组件。
- 通信安全:连接器与平台、使用方、本地数据源之间采用加密通信。
- 身份安全:所有访问请求必须经过身份认证,不能只依赖静态密钥或简单白名单。
- 权限安全:访问权限细化到资源、字段、接口、时间、频率和用途。
- 数据安全:支持脱敏、加密、聚合、采样、输出审查等保护手段。
- 运行安全:具备容器隔离、配置加固、密钥管理、漏洞修复和异常检测能力。
- 审计安全:关键行为记录日志,并保证日志不可随意篡改、删除或伪造。
十二、连接器的数据输出模式
连接器不一定总是输出原始数据。根据数据等级和授权合约,可以采用不同输出模式,包括明细数据输出、脱敏数据输出、聚合结果输出、API 服务输出、模型结果输出、沙箱内使用和隐私计算输出。
- 明细数据输出:适用于低敏数据或已经明确授权的数据资源。
- 脱敏数据输出:适用于包含敏感字段的数据资源。
- 聚合结果输出:适用于不能暴露明细但可以提供统计结果的场景。
- API 服务输出:将数据封装为标准 API,供使用方通过接口调用。
- 模型结果输出:使用方不直接获取数据,只获取模型推理、评分或预测结果。
- 沙箱内使用:数据不直接导出,使用方只能在受控环境中分析。
- 隐私计算输出:多方数据不直接汇聚,通过隐私计算完成联合统计、联合建模或联合分析。
十三、连接器能力成熟度模型
连接器可以按能力成熟度分为四级:L1 基础连接型、L2 安全访问型、L3 合约执行型和 L4 可信协同型。成熟度越高,连接器越能支撑复杂的数据空间生态协作。
图9 可信数据连接器能力成熟度模型
- L1 基础连接型:具备数据源连接、API 封装和简单鉴权能力。
- L2 安全访问型:具备身份认证、权限控制、脱敏处理和访问日志能力。
- L3 合约执行型:具备数据合约、策略执行、用途控制、计量统计和审计追踪能力。
- L4 可信协同型:具备动态目录、血缘追踪、隐私计算、数据沙箱、监管接口和跨主体互认能力。
十四、建设清单与总结
企业在建设可信数据空间连接器时,可以围绕接入、编目、控制、安全、审计和运营六个方向进行能力检查。连接器能力不是一次性全部建设完成,而是可以根据业务场景逐步增强。
建设清单
- 是否支持多类型数据源接入。
- 是否支持元数据自动采集和数据血缘采集。
- 是否支持数据资源动态发现和动态数据资源目录同步。
- 是否支持数据资源封装、统一身份认证和授权合约校验。
- 是否支持策略动态执行、字段级访问控制和行级访问控制。
- 是否支持数据脱敏、聚合结果输出、访问日志记录和调用计量。
- 是否支持血缘追踪、影响分析、异常告警、密钥管理和接口限流。
- 是否支持服务监控、沙箱或隐私计算对接以及监管审计接口。
总结
可信数据空间连接器是数据流通中的关键底层组件。它不是简单接口,也不是普通 API 网关,而是集数据接入、动态编目、资源封装、身份认证、授权校验、策略执行、数据血缘采集、脱敏处理、日志审计和计量结算于一体的可信数据网关。
连接器的核心价值在于:数据提供方不需要直接暴露本地数据库,也不一定需要把数据全部搬到中心平台,而是可以通过连接器把数据封装成受控服务,在合约和策略约束下对外开放。
因此,连接器可以被看作可信数据空间的“动态数据流通网关”。它向下连接企业本地数据资源,向上对接数据空间公共服务,向外支撑数据使用方受控调用,最终让跨主体数据协作具备可执行、可验证、可追溯、可持续更新的技术基础。