深度研究报告 | 2026年8月
摘要
“环境式病历 + Agent\”代表当前医疗AI最前沿的交叉方向。其核心在于用智能体(Agent) 模拟医生在真实、动态的临床环境(Environment) 中处理病历和做出决策的过程。这标志着医疗AI评估重点从\”模型能答对多少题\”转向\”模型能否像医生一样思考和行动”。本报告综合四条研究线索——CP-Env、ClinEnv两大前沿环境、Ambient Scribe临床应用、以及医疗Agent评估范式全景——系统呈现该领域的定义、进展、挑战与未来。
一、核心概念界定
1.1 “环境式”(Ambient)
指AI系统能被动地、无干扰地融入真实临床工作流。最典型应用是\”环境式AI病历助手\”(Ambient Scribe),它在医患对话时于后台自动记录、转录并生成结构化病历草稿,医生只需审核修改。其目标是让医生回归患者本身,而非屏幕。该技术被认为是医疗领域首个大规模应用的生成式AI工具。
1.2 “Agent”(智能体)
在AI领域,Agent指能自主感知环境、进行推理并采取行动的程序。在医疗场景中,Agent不再是被动的应答工具,而是能扮演\”医生\”、\”患者\”等角色,在模拟医院环境中主动进行信息收集、检查、诊断等序列化决策。
1.3 两者结合
\”环境式\”定义了AI的工作模式(融入、辅助),\”Agent\”定义了AI的能力层级(主动、自主)。两者结合,催生了新一代的医疗AI研究和应用范式:从知识检索到环境交互,从单轮答题到长程行动。
二、范式转移全景:从\”答题者\”到\”行动者\”
医疗AI正经历从静态选择题考试(MedQA、USMLE)到动态智能体评估的范式转移。代表性里程碑论文如下:
| AgentClinic | Stanford/JHU | 2024 | 首个开源模拟临床环境多模态agent benchmark;揭示对话式信息收集下诊断准确率骤降至静态分数1/10以下 |
| AI-SCI框架 | UC San Francisco | 2024 | 类比OSCE考试+自动驾驶\”碰撞测试\”理念,呼吁用蒙特卡洛模拟构建临床安全测试环境 |
| Agent Hospital | 清华大学AIR | 2024 | 自进化医疗智能体+MedAgent-Zero策略,时间加速100倍,MedQA准确率93.06% |
| MDAgents | MIT/Google | 2024 | 自适应多agent协作框架,10个benchmark中7个最佳 |
| MedChain | 港中文 | 2024 | 序列化临床决策benchmark,12,163例病例,覆盖5阶段临床工作流 |
| CP-Env | 上海交大/港中文 | 2025 | 端到端临床路径评估+三层评估框架 |
| MedAgentBench | Stanford ML Group | 2025 | FHIR标准EHR环境,300任务×100患者档案(70万数据元素) |
| ClinEnv | Georgia Tech/北大 | 2026 | 真实EHR轨迹+纵向住院模拟+过程/结果双重评估 |
主要医疗Agent Benchmark对比
| MedQA/MultiMedQA | ✗ | ✗ | ✗ | ✗ | ✓ | ✗ |
| EHRSQL/MIMIC-SQL | 部分 | ✗ | ✗ | ✗ | ✓ | ✗ |
| AgentClinic | ✗ | 部分 | ✓ | ✓ | ✗(LLM裁判) | ✗ |
| MedAgentGym | ✗ | ✗ | ✓ | ✓ | ✓ | ✗ |
| CP-Env | 部分 | ✓ | ✓ | ✓ | ✓ | ✓ |
| ClinEnv | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
ClinEnv是唯一同时在全部7个维度上达标的基准。
三、前沿研究一:CP-Env — 模拟完整临床路径
3.1 论文信息
- 标题:CP-Env: Evaluating Large Language Models on Clinical Pathways in a Controllable Hospital Environment
- 作者:Yakun Zhu, Zhongzhen Huang, Qianhan Feng 等(通讯:Shaoting Zhang, Qi Dou, X




