欢迎光临
我们一直在努力

医学大模型深度研究报告(2026年8月版第二部分)

3.4 多模态对齐

3.4.1 MedGemma 的公开配方(目前最完整)

【B】:

  • 编码器:SigLIP-400M;输入 896×896、像素归一化到 [−1,1];发现许多医学视觉任务在 448×448 已足够,故 MedSigLIP 单独以 448 发布,与 896 共享同一套权重,仅下采样位置嵌入——这是很实用的分辨率适配技巧;
  • CT 预处理(值得单独学习):用三种窗宽窗位(骨/肺、软组织、脑)分别映射到 RGB 三通道——把放射科阅片习惯直接编码进输入表示,远比单窗灰度复制三份合理;
  • 后训练:图文任意交错、128k 上下文;发现多模态阶段 RL 比 SFT 泛化更好,因此全部多模态后训练用 RL 完成;
  • 效果:27B 文本版 MedQA 89.8 / MedMCQA 74.2 / PubMedQA 76.8;OOD 上多模态 QA +2.6–10%、CXR 发现分类 +15.5–18.1%、agentic 评测 +10.8%;微调后 EHR 信息检索错误降低 50%。

另一条完整开源路线是阿里达摩院 Lingshu(arXiv:2506.07044):多阶段训练逐步注入医学专长,同时合成 caption、VQA 与 reasoning 样本,并探索 RLVR,配套 MedEvalKit 统一评测框架【B】。

3.4.2 病理 WSI:十亿像素 + 诊断区域极度稀疏

四条代表路线【A/B】:

工作
核心思路
WSI-LLaVA(ICCV 2025) 三阶段训练 + WSI-Bench(9,850 张 WSI、30 种癌症、18 万 VQA 对),提出 WSI-Precision / WSI-Relevance 两个专用指标
LoC-Path(arXiv:2512.05391) 指出 tile 特征存在强全局与局部冗余,用 Sparse Token Merger + MAE 预训练 resampler 压缩 tile token,替代昂贵的 slide-level encoder,性能持平而算力显存大降
PathChat+ / SlideSeek(arXiv:2506.20964) 100 万条病理指令 + 约 550 万轮 QA;SlideSeek 是多智能体迭代分层诊断推理(模拟病理医生逐级放大),产出可视化定位的可解释报告
HistoGPT(Nat Commun 2025) 皮肤病理 WSI → 报告生成,多中心(慕尼黑/明斯特/Mayo/Radboud)验证

3.4.3 3D 影像与其他模态

2026 年国内出现首个面向完整放射学检查的开源三维评测集 Med3DVQA(并入 MedBench v5.0):基于 2 万余例完整 CT/MRI 检查、约 50 万条影像报告问答,覆盖 7 类视觉问答任务【C】。同批发布的 MedRealMM 报告了一个值得注意的实证:图像信息对问诊评测影响显著,图像与纯文本评测分差可达 20–30 分【C】。

未证实【?】:心电、超声视频的建模难点(时序对齐、帧级标注稀缺)本轮未找到 2024–2026 的代表性开源工作与量化结论。

3.5 Agent 与工具编排

3.5.1 MDAgents:分诊式多智能体的标准范式

MIT Media Lab,NeurIPS 2024 Oral,arXiv:2404.15155【A】。四阶段:

  • 医学复杂度判定:Moderator(相当于 GP/急诊医生)把 query 分为 low / moderate / high;
  • 专家招募:low → 单个 PCC;moderate → MDT;high → ICT(整合照护团队);
  • 分析综合:solo 用 CoT + Self-Consistency;MDT 走多轮共识;ICT 走多团队报告汇总;
  • 决策。
  • 效果:10 个基准中 7 个最优,最高提升 4.2%(p<0.05)。消融显示\”moderator review + 外部医学知识\”用于群体协作时平均准确率提升 11.8%——这是多智能体设计中收益最大的单一组件,值得优先实现。

    3.5.2 MedAgentBench:读易写难的结构性瓶颈

    斯坦福,arXiv:2501.14654, NEJM AI【A】。基于 HAPI FHIR JPA 搭建 FHIR R4 兼容虚拟 EHR(Docker 可直接拉起),100 个真实患者档案、785,207 条记录,300 个医生编写任务分 10 类。只用 pass@1——理由是临床对单次错误零容忍。

    结果:最佳 Claude 3.5 Sonnet v2 总成功率 69.67%(query 85.33% / action 54.00%)。

    这是落地最需警惕的失效模式:读操作接近可用,写操作远不可用。任何计划让 Agent 回写 EMR 的项目,必须先做写操作的专项加固与人工确认闸门。

    3.5.3 MedAgentBench v2:极具操作性的改进清单

    PSB 2026【A】。改进措施:

    • 新增工具让 Agent 不必手写 HTTP 请求(原实现语法错误频发);
    • 新增数学计算工具与输出格式化工具;
    • 系统提示改为\”先输出计划再调工具 + step-by-step CoT\”,并给出好/坏输出的 few-shot;
    • 引入记忆组件(把历史失败经验追加进 system prompt)。

    结果:GPT-4.1 成功率从原实现提升到 无记忆 91.0% / 有记忆 98.0%;并观察到记忆能迁移到无对应记忆条目的新任务。

    这份清单可以直接作为医疗 Agent 的工程 checklist。收益之大(69.67% → 98.0%)说明:Agent 的瓶颈往往不在模型,在脚手架。

    3.5.4 评分量表必须是确定性工具

    GCS、CHA₂DS₂-VASc、Wells 评分等应作为确定性工具调用,而非模型内算。证据:MedAgentBench v2 加入 math 工具后成功率跃升;Rx-LLM 显示纯 LLM 的肾功能剂量调整 F1 仅 83.3%【A】。

    3.6 幻觉抑制与安全治理

    3.6.1 弃权能力:不随规模改善

    MedAbstain(EACL 2026 Long)【A】统一了医学 MCQA 的弃权评测协议,整合 conformal prediction + 对抗式题干扰动 + 显式弃权选项。三条核心发现:

  • 即便是高准确率的 SOTA 模型也经常\”该弃权时不弃权\”;
  • 提供显式弃权选项对提升安全弃权的作用,远大于输入扰动;
  • 单纯放大模型规模或用更高级的提示几乎无改善。
  • 含义:弃权必须在接口设计与训练目标层面解决,不能靠 prompt。 产品上就是要给模型一个\”我不确定,建议转诊\”的一等公民输出通道。

    补充证据:另有研究指出前沿模型 100% 给出确定性打分、从不弃权,而医生会随难度提高弃权率。

    3.6.2 免重训的不确定性治理层

    MedBayes-Lite(arXiv:2511.16625)【B】:零新增可训练参数 = MC dropout + 预测校准 + 置信度引导弃权。

    • MedMCQA / MedQA-USMLE 上 ECE 降低 0.23–0.33;
    • MedMCQA→MedQA 的域偏移下,\”高置信 + 错误 + 高危\”三重错误从约 21% 降至接近 0,校准漂移约减半;
    • 提出 Clinical Uncertainty Score,与有害过度自信相关 r≈0.88。

    作者诚实指出:该方法不改善 risk-coverage 排序,温度缩放或深度集成在校准成本/风险排序上可能更优。

    3.6.3 用药安全:确定性 AI 必须前置

    这是本报告最强的一条工程建议,证据链完整:

    Rx-LLM(2025, PMID 41404284)【A】:6 个用药基准各 250 组临床标注输入输出对。结果——LLaMA3-70B 在剂型匹配 F1 54.0%、医嘱生成准确率 88.0%、给药途径 F1 74.3%、适应症匹配 97.6%;GPT-4o-mini 的药物相互作用准确率仅 70.4%;跨基准的\”正确性一致性\”从 8.0% 到 97.6% 剧烈波动,没有任何模型全面稳定。

    前瞻性交叉研究(Cell Reports Medicine 2025,新加坡中央医院)【A】:40 个病例 vignette、16 个专科、91 个用药错误场景、中位 13 种合并用药。

    • 最佳模型 Claude 3.5 Sonnet 准确率仅 51%;
    • RAG 未带来显著提升;
    • “药师 + LLM” co-pilot 模式 61%,比药师独立审核 46% 提升 32.6%,LLM 单独 52%;
    • 但在\”剂量方案不适当\”这一类上,co-pilot 反而不如药师独立审核。

    推荐架构:

    [确定性规则层] [生成式层]
    药物相互作用检查器 ──┐
    过敏史检查器 ──┼──→ 结构化指令 ──→ LLM 负责解释/呈现/支撑
    剂量计算器 ──┤ ★ 不得改写或覆盖 ★
    禁忌/红线词库 ──┘

    国内落地样例:北京清华长庚医院\”清智·AI 合理用药大模型\”采用\”药学可信空间(病历+检验+手术史+说明书+药典+指南+共识)→ 大模型 + 智能体双引擎\”用于院内审方【C,无公开评测数据】。


    第四章 评测:分层评估体系

    4.1 三层评测框架(建议直接采用)

    任何医疗大模型项目都应建立三层评测,缺一层就是在裸奔:

    层级
    目的
    手段
    通过标准示例
    赞(0)
    未经允许不得转载:171主机测评 » 医学大模型深度研究报告(2026年8月版第二部分)
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址