Tiger AI Platform 模型全家福:框架 × 任务类型一览
导读:做 AI 应用最怕「模型散落在各处」——YOLO 一套脚本、transformers 一套环境、语音又要单独装 funasr。 Tiger AI Platform(CV Python Tigerpro) 把视觉、文本、语音、多模态推理统一纳管:从 HuggingFace / ModelScope / Roboflow 拉取权重,按任务即点即测,多数场景 纯 CPU 即可运行。 本文汇总平台已支持的 推理框架(library) 与 模型任务类型(task),方便选型与对外介绍。
文章目录
- **Tiger AI Platform** 模型全家福:框架 × 任务类型一览
-
- 一、先看全局:平台在管什么?
- 二、AI 模型框架(Library)汇总
-
- 2.1 一览表
- 2.2 框架怎么选?(速查)
- 三、模型任务类型(Task)汇总
-
- 3.1 计算机视觉
- 3.2 自然语言处理(NLP)
- 3.3 语音与多模态
- 四、内置种子模型(按场景举例)
-
- 4.1 视觉 · 检测与分割
- 4.2 视觉 · 姿态
- 4.3 文本 · NLP
- 4.4 语音 · ASR / TTS
- 五、不止「推理」:训练闭环也是一类「模型能力」
- 六、工作台与任务对照
- 七、选型与使用建议
- 八、写在最后

*图 1:Tiger AI Platform 首页 ——「视觉 · 文本 · 语音 · 训练闭环」一站式入口
一、先看全局:平台在管什么?
可以把 Tiger AI Platform 理解成三层结构:
| 模型管理 | 注册模型、选择框架与任务、从云端拉取权重、启停状态 |
| 任务工作台 | 图片/视频/摄像头检测、姿态、分割、文本、ASR/TTS、训练闭环等 |
| 权限与系统 | RBAC、部门数据范围、菜单按钮级权限 |
权重来源支持:
- HuggingFace
- ModelScope(魔搭)
- Roboflow
- 以及本地上传 / 训练部署回流

*图 2:模型管理 —— 按分类、框架、任务筛选与拉取权重
二、AI 模型框架(Library)汇总
平台用字段 library 标识推理引擎。新增模型时,在「模型管理」里选对框架,任务类型会自动建议默认值。
2.1 一览表
| ultralytics | YOLO 单文件权重 | 目标检测、姿态、追踪等 | ✅ |
| transformers | HuggingFace 模型目录 | 分类 / NER / QA / 摘要 / Whisper 等 | ✅ |
| rfdetr | Roboflow RF-DETR | 实时检测、实例分割 | ✅ |
| mobilesam | MobileSAM | 交互式分割(点选/框选) | ✅ |
| rtmlib | RTMO / RTMPose / DWPose(ONNX) | 人体姿态、全身 133 点 | ✅ |
| funasr | FunASR 原生 | SenseVoice、Paraformer 等 ASR | ✅ |
| funasr-onnx | FunASR ONNX 量化 | SenseVoice 轻量版 ASR | ✅ |
| funasr-nano | Fun-ASR-Nano | 通义 LLM-ASR(中英日等) | ✅(较慢) |
| sherpa-onnx | sherpa-onnx | MeloTTS 等语音合成 | ✅ |
| vibevoice | VibeVoice | 实时多音色 TTS | ✅ |
| voxcpm | VoxCPM | 合成 / 音色克隆 / 音色设计 | ✅ |
| rapidocr | RapidOCR(PaddleOCR ONNX) | 文字检测 + 识别 | ✅ |
| linly | Linly-Talker / SadTalker | 数字人说话头像 | ⚠️ 需 GPU 脚手架 |
说明:ByteTrack 等追踪算法挂在检测工作台流程中,与 ultralytics 检测权重配合使用;训练闭环默认产出 YOLOv8 权重并注册回 ultralytics。
2.2 框架怎么选?(速查)
要做目标检测 / 姿态 / 训练回流? → ultralytics 或 rfdetr / rtmlib
要做 NLP、图像分类、Whisper? → transformers
要做语音转写? → funasr / funasr-onnx / funasr-nano
要做语音合成? → sherpa-onnx / vibevoice / voxcpm
要做交互抠图? → mobilesam
要做 OCR? → rapidocr

*图 3:新建模型时选择推理框架
三、模型任务类型(Task)汇总
平台用字段 task 决定走哪条推理链路、打开哪个工作台。目前种子与 UI 覆盖的主要类型如下。
3.1 计算机视觉
| object-detection | 目标检测 | 图片检测、视频检测、摄像头、追踪 | ultralytics / transformers / rfdetr |
| instance-segmentation | 实例分割 | 图像分割 | rfdetr |
| interactive-segmentation | 交互分割 | 图像分割(点选/框选) | mobilesam |
| pose-estimation | 姿态估计 | 姿态估计页、羽毛球分析 | ultralytics / rtmlib |
| wholebody-pose-estimation | 全身姿态(133 点) | 姿态估计 · DWPose | rtmlib |
| image-classification | 图像分类 | 图像分类 | transformers |
| ocr | 端到端 OCR | 文字识别 | rapidocr 等 |
| text-detection | 文本检测 | PaddleOCR 检测支路 | rapidocr |
| text-recognition | 文本行识别 | PaddleOCR 识别支路 | rapidocr |
视觉输入形态:
- 图片 —— 单张检测 / 分类 / 分割 / OCR
- 视频 —— 逐帧检测、姿态视频、结果下载
- 摄像头 —— 实时推理与录制


图 4:视觉任务工作台示例(图片或视频检测)
3.2 自然语言处理(NLP)
| text-classification | 文本分类 | 文本分析 | transformers |
| zero-shot-classification | 零样本分类 | 文本分析 | transformers |
| fill-mask | 完形填空 | 文本生成相关 | transformers |
| summarization | 摘要 | 文本生成 | transformers |
| translation | 翻译 | 文本生成 | transformers |
| text-generation | 文本生成 | 文本生成 | transformers |
| token-classification | 命名实体识别 NER | 实体识别 | transformers |
| question-answering | 抽取式问答 | 智能问答 | transformers |
3.3 语音与多模态
| automatic-speech-recognition | 语音识别 ASR | 语音识别 | funasr / funasr-onnx / funasr-nano / transformers(Whisper) |
| text-to-speech | 语音合成 TTS | 文本转语音 | transformers / vibevoice / sherpa-onnx / voxcpm |
| talking-head | 数字人 | 数字人合成 | linly(GPU 脚手架) |

*图 5:语音识别工作台 —— SenseVoice / Paraformer / Fun-ASR-Nano / Whisper
四、内置种子模型(按场景举例)
以下为平台启动时自动注册的代表性模型(需在「模型管理」中 拉取权重 后方可推理)。
4.1 视觉 · 检测与分割
| YOLO 烟火 / PPE / 脑肿瘤 / 火箭检测等 | ultralytics | 目标检测 | 行业场景开箱即测 |
| YOLO26n / YOLO26s | ultralytics | 目标检测 | 新一代 YOLO 系列 |
| DETR-ResNet-50 | transformers | 目标检测 | Transformer 检测范式 |
| RF-DETR-Medium | rfdetr | 目标检测 | 实时检测 |
| RF-DETR-Seg-Medium | rfdetr | 实例分割 | 检测 + 掩膜 |
| MobileSAM | mobilesam | 交互分割 | 轻量可交互 |
4.2 视觉 · 姿态
| YOLO11n-Pose | ultralytics | 姿态估计 | COCO 17 点 |
| RTMO-S / RTMO-M | rtmlib | 姿态估计 | 多人、ONNX、CPU 友好 |
| RTMPose-M | rtmlib | 姿态估计 | 高精度姿态 |
| DWPose-M | rtmlib | 全身姿态 | 133 点(身体+手+脸+脚) |

*图 6:姿态估计(YOLO / RTMO / RTMPose / DWPose)
4.3 文本 · NLP
| FinBERT | 文本分类 | 金融情感 |
| BERT Emotion | 文本分类 | 情绪识别 |
| BART-MNLI | 零样本分类 | 自定义标签 |
| DistilBART-CNN | 摘要 | 新闻摘要 |
| Opus-MT en→zh | 翻译 | 英译中 |
| BERT-NER | 实体识别 | 人名/地名等 |
| DistilBERT-SQuAD | 问答 | 抽取式 QA |
| ViT-Base | 图像分类 | Vision Transformer |
4.4 语音 · ASR / TTS
| SenseVoice Small | funasr | 多语种 + 情感 + 音频事件 |
| SenseVoice ONNX | funasr-onnx | 体积更小、CPU 更快 |
| Paraformer 中英 | funasr | 工业级中文准确率 |
| Fun-ASR-Nano | funasr-nano | 通义 LLM-ASR,中英日与方言 |
| openai-whisper-small 等 | transformers | 多语种 Whisper |
| MeloTTS 中英混合 | sherpa-onnx | 纯 ONNX 合成 |
| VibeVoice Realtime | vibevoice | 多音色实时合成 |
| MMS-TTS Eng | transformers | 英文 VITS |
五、不止「推理」:训练闭环也是一类「模型能力」
平台还将 自定义检测模型 纳入同一套管理:
数据集(yolo_flat) → 视频抽帧 → 在线标注
→ 质量检测 / 格式转换 → 构建
→ YOLOv8 训练 → 部署到模型管理 → 图片/视频检测
训出来的权重以 ultralytics + object-detection 形式注册,与预置模型共用同一套检测页。
配套能力还包括:
- 标注质量检测:配对、类别分布、小/大目标统计
- 格式转换:LabelMe / VOC / YOLO / COCO 互转


*图 7:模型训练与数据标注闭环
六、工作台与任务对照
| 模型管理 | (纳管全部) | 全部 library |
| 图片检测 / 视频检测 / 摄像头 | object-detection | ultralytics / rfdetr / transformers |
| 目标追踪 | object-detection + 追踪 | ultralytics + ByteTrack |
| 姿态估计 | pose / wholebody-pose | ultralytics / rtmlib |
| 图像分割 | instance / interactive | rfdetr / mobilesam |
| 图像分类 | image-classification | transformers |
| 文字识别 / PaddleOCR | ocr / text-det / text-rec | rapidocr |
| 文本分析 / 生成 / NER / QA | NLP 系列 | transformers |
| 语音识别 | ASR | funasr 系 / Whisper |
| 文本转语音 | TTS | sherpa / vibevoice / voxcpm 等 |
| 数字人合成 | talking-head | linly |
| 模型训练 | 自训检测模型 | ultralytics |
| 羽毛球分析 / 水位检测 | 业务组合页 | 姿态 + 检测等 |
七、选型与使用建议
先定任务,再定框架 同一业务尽量统一 library,避免权重格式混用。
CPU 环境优先轻量方案
- 检测:YOLO nano/small、RF-DETR
- ASR:SenseVoice-onnx、Paraformer;Fun-ASR-Nano 精度高但更重
- TTS:sherpa-onnx / MeloTTS
行业场景用种子模型试水,再用训练闭环定制 烟火、PPE、火箭等可先验证流程,再用自己的视频抽帧标注训专属模型。
拉取权重后再测 模型管理中 filePath 为空时,工作台不会列出该模型;点「拉取」完成下载即可。
八、写在最后
Tiger AI Platform 的目标不是「再堆一个 Demo」,而是:
一个后台,管住多种框架;一个任务字段,打开正确工作台;一条训练闭环,让业务数据变成可用模型。
从 YOLO 到 transformers,从 SenseVoice 到 Fun-ASR-Nano,从 MobileSAM 到 RF-DETR,平台把分散的 AI 能力收束成可权限管理、可演示、可迭代的产品形态。
欢迎收藏本文作选型手册;也欢迎在评论区告诉我们:你们团队最常用的是哪一类任务?
相关入口
- 平台:登录后首页 / 模型管理 / 各 AI 任务页
- 文档:docs/数据标注功能说明.md、docs/姿态估计模型选型说明.md、docs/公众号-数据标注质量检测与格式转换.md
文档版本:v1.0 · 对应平台:Tiger AI Platform(CV Python Tigerpro)· 框架与任务以模型管理 UI + 种子数据为准

