
医疗 AI 的算力供给:异质互联、软硬协同设计与英伟达-昇腾-AMD 混合使用实践
研究截止日期:2026 年 8 月 6 日 面向读者:医院/医疗集团 CIO、区域卫生信息中心、医疗智算中心架构师、医疗 AI 厂商 Infra 负责人
信源置信度标记:◎ 官方文件/厂商技术文档 · ○ 学术论文/独立第三方实测 · △ 厂商或运营商自评口径 · ✕ 存疑或来源不可靠(本文引用时会同时说明)
执行摘要:十条可直接用于决策的结论
医疗 AI 的算力瓶颈不在 FLOPS,在显存带宽、显存容量和 IO。 3D 影像分割是特征图反复读写的带宽密集型负载;病理 WSI 是 IO 与预处理密集型;医疗 LLM 的 decode 阶段是纯带宽受限。按 TFLOPS 单价选卡是医疗场景最典型的选型错误。
病理基础模型不存在算力 scaling law。 Nature Communications 的系统性基准显示,22M 参数的 SP22M 在检出任务上与 1.1B 的 Prov-GigaPath 相当 ○。医院侧没有理由为病理模型堆超大集群。
异构卡之间不可能共享 scale-up 域,这是物理层协议、内存语义、集合通信库、调度器边界四层叠加的硬约束,不是软件问题。NVIDIA 官方数据:NVLink 域内 1.8 TB/s,跨域即降至 50 GB/s,断崖 36 倍 ◎。
跨厂商异构混合训练在 2026 年不是医疗行业的生产选项。 所有 90%+ 效率数字均为厂商/运营商自评 △,且 Tangram(2026)证明专门处理异构的规划器可能因牺牲重计算等优化而净亏 2.3 倍 ○。医院训练规模(通常 <100 卡)下收益为负。
性能是软件版本的函数,不是硬件参数的函数。 SemiAnalysis 实测:MI355X 跑 Kimi K2.5,仅 vLLM 从 v0.16 换到 v0.18(相差 25 天),吞吐提升 12 倍、等吞吐交互性提升 15.6 倍 ○。任何非 CUDA 平台的 POC 结论保质期以周计,验收条款必须锁软件版本 + 约定复测。
医疗影像是昇腾生态最大的短板。 MONAI Deploy 硬绑 CUDA 12.2+/驱动 535+,且即使不做推理也需要 CUDA runtime ◎;AMD 已用 amd_monai + hipCIM 系统性补位(MONAI 1.5.2 on ROCm 已发布)◎;昇腾侧未检索到任何 MONAI/nnU-Net 运行的官方或可信第三方记录。影像为主的医院,昇腾侧必须按\”自建框架层\”预留人力预算。
反过来,昇腾在\”可复现性\”上反而领先 ROCm。 msprobe 提供 NPU vs GPU 逐 API dump 比对、双千指标、ULP 误差法与确定性计算开关 ◎,官方披露的收敛实验为 loss 平均差异 <0.6%、最终 <0.1% ◎。这套工具链应直接写进医疗模型迁移的验收 SOP——ROCm 没有同级工具。
NMPA 的口径给了跨平台迁移一条明确通道,但不是免费通道。 指导原则明确\”算力所用计算资源本身不属于监管对象\”◎,但算法基本信息必须载明\”运行环境\”,重大软件更新需申请许可事项变更 ◎。2025 年第 63 号公告首次写入\”对在不同平台注册的同一人工智能软件功能,若能证明平台的等同性,简化审评要求\”◎——\”平台等同性论证\”是国产化替代路上必须提前准备的注册资产。
推荐架构是\”同构池 + 统一网关 + 异构纳管\”,不是\”混训混推\”。 中国电信的异构 PD 分离验证(吞吐 +30%~72%、成本 -42%)△ 值得试点,但 2026 年 7 月已有论文警示:现有 KV 传输引擎搬运的是字节而非张量语义,跨异构 PD 若两端格式理解不一致,不会报错但会被错误解释——医疗场景不可接受静默错误。
市场已经给出答案。 2026 年多个医院智算招标已把\”多芯异构统一纳管\”写成硬指标(南京市中医院 648 万项目明确要求兼容昇腾 910B + NVIDIA T4 + H800)◎;浙江省 2.83 亿医学 AI 基础设施项目直接写死\”智能算力硬件全面采用国产先进算力设备\”◎。混合不是选择题,是既成事实;问题只是怎么混。
第一部分 需求侧:医疗 AI 到底需要什么样的算力
1.1 五类负载的计算画像
医疗 AI 不是一个负载,是五个特征迥异的负载。按错误的画像选卡,是医院算力浪费的第一来源。
(1) 医学影像 3D 分割/检测 —— 带宽密集 + 显存容量墙
nnU-Net 官方要求:推理 ≥4GB 显存,训练 ≥10GB,CPU 至少 6 核 12 线程(数据增强会成为瓶颈,且随输入通道数放大)◎。
实际训练显存随分辨率近似立方增长。第三方复现给出的量级 ○:
| 2D | 4–8 GB | — |
| 3D LowRes | 8–12 GB | 2–3 天 |
| 3D FullRes | 12–18 GB | 3–4 天 |
| 3D Cascade | 16–24 GB+ | 5–7 天 |
厂商测算(量级参考,未经独立验证)△:512×512×150 的肝脏 CT 约需 20–24 GB;512×512×300 需 40–48 GB;Swin UNETR 训练 32–48 GB。
关键特征:编解码器的跳跃连接导致中间特征图被反复读写,中间激活占用可达权重的 5–10 倍。这是显存带宽敏感而非算力敏感的负载。同样 24GB 显存,HBM 卡与 GDDR 卡的实际训练效率差距远大于其 TFLOPS 差距。
(2) 数字病理 WSI —— IO 与预处理密集,且不吃大模型
单张 40× WSI 为 1–4 GB、超过 10 万 × 10 万像素,切成数千至上万 tile。
单张 WSI 端到端推理耗时(A100,含 tile 提取 + 编码 + MIL)○:UNI 99.9 s、Virchow 243.1 s、Virchow2-CLS 245.8 s(medRxiv 预印本,未同行评审)。轻量模型路线:WSInfer(ResNet34)在 Quadro RTX 8000 上 23 秒/张 ○。
预训练算力(Nature Communications 基准)○:UNI 用 32× A100-80GB(100k WSI / 100M tiles);Prov-GigaPath 1.1B 参数、32× A100-80GB(171,189 WSI / 1.3B tiles);SP85M 用 8× H100-80GB × 635 小时。
反直觉但极重要的结论:该基准明确指出病理领域未观察到算力/参数量的 scaling law——22M 的 SP22M 在检出任务上与 1.1B 的 Prov-GigaPath 相当;UNI 用远少的算力优于耗算力更多的 SP22M/SP85M ○。
对医院的含义:病理 AI 的投资应压在数据治理、扫描通量、存储与 IO 通路上,而不是堆卡。瑞金病理科年数据增量 1.5 PB △——这个数字比任何 TFLOPS 都更能决定病理 AI 项目的成败。

![[特殊字符]DeepSeek‑Harness(DSH)小白保姆教程-171主机测评](https://www.171host.com/wp-content/uploads/2026/08/20260816085112-6a817a009aabf-220x150.png)