
五、编程路径:技术栈分层选型
5.1 技术栈的六层模型
"编程路径"的本质是一组分层选型决策。我们将医疗智能体技术栈解构为六层(图 3):模型层、编排层、工具协议层、知识层、护栏评测层、部署运维层。
[图 3] 技术栈六层参考架构图(详见 HTML 版图 3)。
5.2 模型层:双轨制的现实
医疗智能体的认知骨干面临"闭源 API vs 开源自部署"的分野,中国医院的实践已收敛为双轨制:非敏感/低风险任务使用 API 旗舰模型换取最强推理能力;涉及患者数据的任务使用开源自部署模型满足"数据不出院"的合规要求。开源医疗基座的代表是 Google 2025 年 5 月发布的 MedGemma(Health AI Developer Foundations 计划核心项目):基于 Gemma 3 架构,4B 多模态版本(医学影像+文本,MIMIC CXR 五分类平均 F1 达 88.9,显著超过基座 Gemma 3 的 81.1)与 27B 文本版本(MedQA 四选一 87.7%,配合测试时扩展最高 89.8%),支持 128K 上下文,权重完全开放可本地运行与微调【A】。必须强调其官方定位:MedGemma 是开发者基座模型而非获批医疗器械——需要针对特定应用微调并验证后方可部署【A】。国内实践则以 DeepSeek 本地化部署为主流(详见第八章),其开发生态与可本地化特性是医院青睐的主因【B】。
模型层选型的三条经验法则:(1) 场景倒推规模——7B 级模型在 MedAgentBench 上成功率仅 4%,小模型承担严肃临床任务尚不现实【A】;(2) 开源≠合规——开源模型的训练数据透明度、偏差评估与版本治理仍需建设方自行补齐;(3) 模型无关性优先——通过标准化工具协议隔离模型层,避免供应商锁定【B】。
5.3 编排层:确定性 vs 协作性的哲学分野
编排框架(Orchestration Framework)定义智能体如何通信、委派与合并结果【B】。当前主流框架呈现两种互补哲学:
| 控制流 | 智能体与工具为节点、有向边定义转换;显式支持条件分支、循环、重试、并行 | CrewAI 以 Planner/Executor/Reviewer/Critic 角色分工自适应协作;AutoGen 事件驱动、支持智能体派生与异步消息 |
| 状态管理 | 持久化图状态对象,中间结果确定性地跨节点传递,长流程不丢上下文 | 框架托管消息传递、共享内存与轮次 |
| 确定性 | 支持确定性重放(deterministic replay)——每个转换显式定义,输出可逐步审计 | 协作路径动态生成,可复现性依赖额外工程 |
| 人机协同 | 一等公民:可在图中插入需人类批准的节点 | 通过角色(Reviewer)实现,粒度较粗 |
| 最适场景 | 受监管、协议约束、安全攸关的工作流(医疗正是典型) | 探索性、创意性、需要多元推理的开放任务 |
| 证据等级 | B(多源综述互证) | B |
这并非二选一:现代系统日趋采用混合设计——LangGraph 定义全局控制流,特定节点内部委托给 CrewAI 式协作团队,兼得图执行的确定性与角色协作的推理多样性【B】。对医疗团队的直接建议是:主干用图、枝叶用队——凡涉及医嘱、处方、病历写入的主干流程用确定性图编排;鉴别诊断探讨、多学科会诊模拟等枝叶环节可用多智能体辩论提升质量。
5.4 工具协议层:MCP + FHIR 正在成为事实标准
智能体"做事"的通道是工具接口,而医疗工具接口正在经历一次关键标准化:**MCP(Model Context Protocol,模型上下文协议)**与 **FHIR(Fast Healthcare Interoperability Resources)**的结合。其工程逻辑如下:
- FHIR 是医疗数据的通用语:MedAgentBench 环境即构建于 FHIR 合规 API 之上,使用现代 EMR 系统的标准接口,因此智能体能力可直接迁移至生产 EHR【A】。智能体永不直接访问数据库裸表——一切经由 FHIR API,由其强制授权、记录访问日志、保证数据一致性【B】。
- MCP 是模型-工具的标准化桥:MCP 服务器将 FHIR 操作封装为工具,把智能体的工具调用请求翻译为 FHIR REST 调用并返回结构化结果——LLM 无需理解 FHIR 查询语法。2025 年发表的开源 MCP-FHIR 框架验证了这一架构可支撑动态查询、上下文感知提示生成与 EHR 数据实时摘要,支持医生/照护者/患者多视角 persona 输出,且通过声明式 JSON 配置而非硬编码实现集成【A/B】(arXiv 预印本,基于合成 FHIR R4 数据验证,其临床决策支持声明尚待实测)。
- MCP 的医疗价值清单:标准化工具接口(一次定义、跨模型复用);授权穿透(MCP 服务器强制 SMART on FHIR 权限域,确保 LLM 不越权访问);审计轨迹(每次工具调用连同输入输出被记录——恰是 HIPAA 要求的审计形态);模型无关(更换 LLM 供应商无需重写 FHIR 集成层)【B】。
- 更深层的问题:上下文碎片化。医疗 AI 的隐患不只是单点错误,而是"各自为政的智能体"——预约机器人不知道检验已开、症状筛查器忽略用药更新。MCP 通过上下文信封(context envelope)、访问范围层、本体映射(SNOMED CT/FHIR 词汇对齐)、记忆状态钩子与意图账本(cryptographically secure 的决策审计记录)解决跨系统连贯性【B】。
- 前瞻:HL7 AI Transparency on FHIR。HL7 正在制定的该规范将把 AI 溯源元数据直接编码进 FHIR 资源——模型来源与版本、置信度自评、生成时上下文中的证据资源链接、请求与审核元数据。虽尚未成为规范(normative),但现在就按此结构生成 FHIR 资源,可避免未来合规改造【B】。
实践路径建议:从 SMART App 起步做交互式临床工具;事件驱动模式做后台自动化;仅当需要亚 500ms 实时告警且契合标准钩子时才用 CDS Hooks;用 HAPI FHIR(开源)+ Synthea 合成数据搭建开发环境;授权(SMART auth)是最难的部分,应最早投入【B】。
5.5 知识层与检索工程细节
知识层的三项工程纪律直接决定 RAG 上限:(1) 来源治理——限定权威来源、记录数据血缘(采集机构、设备型号、参数)、合成数据使用需额外说明生成逻辑与局限【A】;(2) 检索组合——稠密检索负责语义意图、BM25 负责精确关键词(药品名、指南编号)、交叉编码器重排负责精排,RRF 融合是当前最优组合【A】;(3) 版本与时效——临床指南持续更新,系统必须有清晰的版本控制与更新流程,答案附显式来源链接与审核日期【B】。评测工具链方面,RAGAS 类框架聚焦医疗最关键的信号:忠实度(faithfulness,每个论断是否被检索证据支撑)等【B】。
5.6 部署运维层:从演示到生产的鸿沟
演示级与生产级 RAG 的差距被概括为四个词:接地(Grounded)——每个论断可追溯至可引用来源;受治(Governed)——提示、模型与数据均版本化并受访问控制;受监控(Monitored)——质量、漂移与安全被持续测量;可复现(Reproducible)——同一问题得到一致、可辩护的回答【B】。隐私工程则是中国语境的硬约束:本地化部署 + 模型加密确保患者信息"不出院"【B】;推理期风险同样真实——对抗性提示可能从模型响应中抽取训练数据中的患者属性,需要模型审计、差分隐私与实时监测【B】;多智能体系统共享信息扩大攻击面,须强制智能体间加密、身份验证与严格访问控制【B】。
六、参考实现:一条可落地的工程主线
将前五章的结论压缩为一条工程主线,一个面向"病历质控 + 辅助诊疗"的医院智能体可以按以下骨架组织(伪代码级描述,框架选型按 5.3 节逻辑):
| 编排主干 | LangGraph 图:intake → retrieve → reason → draft → guardrail → human_approve → fhir_write | 确定性重放 + 图内人审节点(B) |
| 模型接入 | 双轨:非敏感任务走 API;涉患者数据走本地 DeepSeek-R1:70B / MedGemma 类基座 | 数据不出院(B);开源基座需自行验证(A) |
| 工具通道 | MCP server 封装 FHIR R4 操作(Patient/Observation/Condition/MedicationRequest),SMART on FHIR 最小权限域 | 授权穿透 + 调用审计(B) |
| 知识管线 | 围墙花园(院内规范+国家指南+药典)→ 稠密+BM25 混合检索 → 交叉编码器重排 → RRF 融合 | 混合检索 +15%(A) |
| 可靠性环 | 自反式 RAG 自我批评 → 输出轨接地性检测 → 置信度低于阈值即弃权/升级人工 | 幻觉 5.8%(A);弃权策略(B) |
| 评测回归 | 接入 MedAgentBench 类动态基准 + RAGAS 忠实度指标,每次模型/提示/索引变更全量回归 | 行动类 SR 仅 ~54%(A) |
| 写回与溯源 | AI 生成文书经医生修改签署后回填病历;每个 FHIR 资源携带 AI 溯源扩展(模型/版本/置信度/证据链接) | HL7 AI Transparency 方向(B) |
这条主线的每一环都有对应证据支撑,且刻意把"人审"放在 fhir_write(写操作)之前——这是 MedAgentBench 行动类 54% 成功率给出的刚性约束【A】。医院信息化团队可按此骨架裁剪:先做"只读不写"的文书与质控场景,行动类能力(医嘱草案)成熟一个放开一个。
七、安全治理与监管框架
7.1 美国 FDA:TPLC 时代
2025 年 1 月 7 日,FDA 发布《人工智能设备软件功能:生命周期管理及上市提交建议草案》——首个覆盖 AI 设备全产品生命周期(TPLC, Total Product Life Cycle)的综合指南草案,将设计、开发、维护与文档建议串联成体系【A】。截至 2025 年,FDA 已通过既有上市前路径批准超过 1000 款 AI 设备,其中约 75–80% 集中于放射科;2025 年单年批准 258–295 款,创历史之最【B】。对智能体开发者最相关的监管构件有三个:
- PCCP(预定变更控制计划):2024 年 12 月最终化,允许厂商预先声明计划中的模型修改(算法更新、再训练协议、性能阈值调整)并获得授权,无需每次提交新的 510(k)。三大必备组件:修改描述、评估协议(预定义性能指标、验收标准、测试数据集)、影响评估。2025 年已有 10% 的 AI/ML 设备批准包含 PCCP;2025 年 2 月 Aidoc CARE1 成为首个获批的基础模型驱动临床 AI 设备,其批准即附带 PCCP【B】。2025 年 8 月,FDA、加拿大卫生部与英国 MHRA 联合发布 PCCP 五项指导原则【B】。
- 透明度与标签要求:TPLC 草案推荐使用模型卡(model card)——结构化描述模型特征、预期用途、性能指标(含人口学子分组测试)、已知偏差与局限、PCCP 监测计划;并要求以目标用户可理解的语言说明 AI 做什么、如何验证、边界在哪【B】。
- 基础模型专项关注:监管材料明确提出对使用基础模型(LLM)的设备进行标识(tag),并要求额外护栏——幻觉风险缓解、提示工程文档、内容安全性与准确性的上市后监测【B】。这意味着医疗智能体的提示模板、微调数据集、安全过滤器、输出清洗步骤与护栏有效性证据,都将进入监管提交物清单。
更早的基石是 FDA、加拿大卫生部与 MHRA 于 2021 年联合发布的 GMLP(良好机器学习实践)十项原则,其中多条与编程路径直接对应:全生命周期多学科协作(临床专家+数据科学家+软件工程师+生物统计师)、良好软件工程与安全实践、数据集代表性、用户反馈闭环等【B】。FDA 官方对草案的公开评论征询已于 2025 年 4 月 7 日截止【A】。
7.2 中国:政策供给的密集窗口
中国的监管框架在 2024–2025 年经历了一轮密集供给,形成"场景指引 → 实施意见 → 标准建设"的政策栈:
| 2024-11 | 《卫生健康行业人工智能应用场景参考指引》(卫健委等三部门) | 明确 4 大类 84 项 AI 应用场景;推进中文临床医学术语框架、行业 AI 语料等标准研究 | A |
| 2025-04 | 卫生健康行业可信数据空间创新发展试点(配合国家数据局) | 破解数据共享流通的供给意愿不足、流通机制不畅、应用深度不够难题 | A |
| 2025-10-20 印发(11月公开) | 《关于促进和规范"人工智能+医疗卫生"应用发展的实施意见》(国卫办规划发〔2025〕30号,五部门) | 2027 年:建成高质量数据集与可信数据空间,形成一批专病专科垂直大模型和智能体应用,建成国家 AI 应用中试基地;2030 年:基层诊疗智能辅助基本全覆盖,二级以上医院普遍开展影像智能辅助诊断与临床诊疗智能辅助决策。部署 8 方向 24 项重点应用 | A |
| 省级跟进 | 《湖北省加快推进人工智能在医疗卫生领域应用工作实施方案(2025—2027年)》等 | 量化指标示例:到 2027 年智能患者就诊服务覆盖 80% 三级医院、50% 二级医院;智能临床辅助诊疗覆盖 50% 三级医院、30% 二级医院 | A |
对编程路径的直接含义有三:其一,"智能体应用"已进入国家级目标清单(2027 年目标原文),医院构建智能体从"自选动作"变为"规定动作与窗口期"并存;其二,数据基础设施先于模型——高质量数据集与可信数据空间被置于基础位置;其三,基层是最大增量市场——2030 年基层全覆盖目标意味着轻量化、低成本、开源自部署路径将获得政策倾斜【A】。
7.3 国际治理与伦理基线
WHO 于 2021 年发布卫生健康领域 AI 伦理与治理指南、2024 年发布面向多模态大模型的专项指南,其核心要求——透明性、强制人类监督、可引用来源——与本报告五层防御体系互为印证【B】。欧盟 AI Act 将医疗 AI 列入高风险类别,HIPAA/GDPR 对数据处理提出严格约束【A】。放射学智能体综述补充了安全威胁清单:训练数据投毒(model poisoning)、提示注入(prompt injection)、后门攻击(backdoor),且多智能体协作放大攻击面【B】。值得注意的是,该综述同时指出:目前获批的 AI 医疗器械(AIaMD)仍以窄任务、确定性输出的影像检测/分割为主,智能体尚不典型存在于获批器械中——完全释放智能体能力需要整合多来源患者数据,这将是未来监管审查的核心地带【B】。
[图 4] 风险分级治理矩阵图(后果严重度 × 自主级别四象限;详见 HTML 版图 4。框架为 C 级归纳,象限内能力约束依据【A/B】证据)。
八、中国本土落地:案例、路径与窗口
8.1 医院侧实施路径:六路径的智能体化改造
结合国内医院运营语境(DRG/DIP 支付改革压力),我们建议将医疗智能体落地映射到六条业务路径,按"风险 × 见效速度 × 价值量级"排序推进(本框架为工程归纳,C 级;各路径场景依据见 A/B 级引用):
| ① 临床文书 | 文书起草智能体(病程记录、出院记录、报告解读),医生审核回填 | L2 起草人审 | 病历书写速度显著提升(新医大实践,B);医生时间回笼诊疗 |
| ② 病案编码与 DRG 运营 | 质控智能体:自动审查病历逻辑矛盾、术语错误、关键信息遗漏(科大附一院,B) | L2 | 质控耗时降低、格式准确率提升;编码准确度直接作用于 DRG 入组与支付 |
| ③ 患者流程与床位周转 | 预住院次序筛查、智能转诊、云陪诊(天津总院、实施意见场景,A/B) | L3 草案待签 | 流程类优化不触碰诊疗核心,风险可控而周转收益大 |
| ④ 耗材供应链(SPD) | 耗材用量分析、滥用预警(新医大:近三年耗材数据趋势分析与高值耗材预警,B) | L3 | 数据分析型任务,模型幻觉后果有限,现金流改善直接 |
| ⑤ 财务 RPA | 多智能体文档处理与核验(保险理赔流程编排) | L3 | 技术成熟度高(B),合规边界清晰 |
| ⑥ 导诊随访外呼 | 智能预问诊、随访、健康宣教(实施意见"患者服务"方向,A) | L4 受限自主 | 低风险高频率,政策明确鼓励 |
推进策略上建议"三阶段":**第一阶段(0–6 个月)**以①②文书与编码场景切入——技术成熟(L2 人审即可兜底)、见效最快,用于建立组织的智能体工程能力与评测基线;**第二阶段(6–18 个月)**扩展至③④⑤流程与运营场景,同步建设 FHIR/MCP 工具层与审计体系;**第三阶段(18 个月以上)**谨慎进入临床决策支持核心区(辅助诊断、用药建议),此时须具备 MedAgentBench 级动态评测的持续回归能力与高风险象限管控。这一顺序与国家政策节奏(2027 中期目标、2030 全覆盖)保持同频【A】。
九、成熟度模型与实施路线图
为使医院能够定位自身与规划投入,我们提出医疗智能体成熟度五级模型(框架归纳为 C 级;各级特征的技术依据标注 A/B):
| L0 | 工具期 | 员工自发使用通用聊天机器人;无系统集成、无审计 | 知识问答(风险自担) |
| L1 | 辅助期 | 本地化部署基础模型 + 院内知识库;只读、无工作流嵌入 | 文档解读、知识检索(天津/新医大初期形态,B) |
| L2 | 嵌入期 | 智能体嵌入 CDSS/病历/检验系统;L2 人审工作流;开始建设评测基线 | 文书起草、病历质控、报告解读(科大附一院,B) |
| L3 | 编排期 | 确定性图编排 + MCP/FHIR 工具层 + 四轨护栏 + 动态基准回归;行动草案待签 | 医嘱草案、跨系统任务链(对应 2027 年"智能体应用"政策目标,A) |
| L4 | 治理期 | 白名单内受限自主执行 + PCCP 式变更治理 + 全链路溯源 + 漂移监测 | 愿景态;对应 2030 年政策目标与 FDA TPLC 要求(A) |
从 L1 到 L2 的关键是场景选择与人审流程设计;从 L2 到 L3 的关键是工程体系(编排框架、工具协议、护栏、评测);从 L3 到 L4 的关键是治理体系(变更管理、溯源标准、监管对接)。多数 2025 年完成 DeepSeek 部署的三甲医院处于 L1–L2 之间;政策窗口(2027 目标)实质上要求头部医院在两年内具备 L3 能力【A】。
十、挑战、局限与未来方向
10.1 证据图谱中的六大开放挑战
10.2 本报告的局限
研究者须自省证据边界:(1) 部分量化结论(如幻觉率 15–40%、GPT-5 幻觉 9.6%)来自行业分析而非同行评审原始研究,标注为 B/C 级;(2) MCP-FHIR 框架的临床决策支持声明基于合成数据的定性演示,尚未在真实去标识记录上做实体级准确率测量【B】;(3) 医院案例的量化收益(效率提升 50%、规范性提升 30% 等)为机构自报口径,存在报道偏差,均为 B 级;(4) 成熟度模型与六路径推进策略为本报告的框架归纳(C 级),用于决策参考而非绩效承诺;(5) 领域演进极快,本报告证据快照截至 2026 年 9 月。
十一、结论与行动建议
核心结论重述
医疗智能体的"编程路径"不是一条单行道,而是一套分层决策体系:模型层双轨制(API 旗舰 + 开源自部署医疗基座);编排层以确定性图为主干、角色协作为枝叶;工具层收敛于 MCP + FHIR;知识层以围墙花园 + 混合检索为标准配置;可靠性层以五层防御体系(接地 → 护栏 → 弃权 → 确定性 → 人审)为最低门槛;治理层对接 FDA TPLC/PCCP 与中国五部门实施意见。可靠性数据给出的底线判断是:当前最强模型在真实病历环境中"读"的可靠性(85%)与"写"的可靠性(54%)之间存在鸿沟,一切触及医嘱与处方的自主性在当前均不具备工程正当性;而幻觉率可以被工程手段压缩一个数量级(64.1% → 5.8%),说明可靠性的主体杠杆在工程体系而非模型本身。
对不同角色的行动建议:
- 医院信息科/CDTO:以 L2 级(文书+质控)场景启动,6 个月内建立评测基线;同步建设院内知识库与 FHIR 接口能力——这两项是任何模型都无法替代的机构资产;优先选型支持确定性重放与人审节点的编排框架。
- 医疗 AI 工程团队:把 MedAgentBench 类动态基准纳入 CI/CD 回归;提示模板、护栏配置、检索快照全部版本化;为每个输出绑定证据引用与置信度;行动类功能一律"草案+待签"设计。
- 厂商与研究者:填补"写入类"智能体能力的评测与护栏研究空白(行动类 54% 是全行业的明确优化方向);对接 HL7 AI Transparency 与模型卡规范,把监管要求前置为产品设计。
- 政策与标准工作者:可信数据空间与高质量数据集是 2027 目标的前置条件,其建设速度将直接约束垂直智能体的上限;中文临床术语与语料标准是当下最高杠杆的标准动作【A】。
可核验引用清单
分级说明:【A】政策原文/官方文件/同行评审论文;【B】行业报告/权威媒体/机构技术文献;【C】本报告框架归纳(不入列)。A/B 级来源均附可访问 URL,检索与核验时间:2026 年 9 月 4 日。
医疗AI基础:构建可靠智能体的编程路径 · 2026 深度研究报告。证据框架 A/B/C 分级,全部 A/B 级论断可溯源至文末引用,检索与核验截止 2026-09-04。本报告为研究性文档,不构成医疗建议或投资建议;引用数据的时效性以原始来源为准。



