欢迎光临
我们一直在努力

综合项目实战:手语识别及翻译(三)数据集

数据集

  • Phoenix-2014 和 Phoenix-2014T 数据集详解
    • 一、数据集概述
    • 二、数据来源和采集
    • 三、数据集规模和结构
    • 四、标注层级和格式
    • 五、词汇表特点(基于 gloss2ids.pkl)
    • 六、数据集的技术挑战
    • 七、研究任务和应用
    • 八、数据集的使用方式
    • 九、Phoenix-2014T 的改进
    • 十、相关数据集对比
    • 十一、实际研究案例
    • 十二、局限性和未来方向
    • 总结

Phoenix-2014 和 Phoenix-2014T 数据集详解

官方下载地址:Phoenix-2014 官方下载地址:Phoenix-2014T

一、数据集概述

RWTH-PHOENIX-Weather 2014

  • 全称:RWTH-PHOENIX-Weather 2014 Multimodal Corpus
  • 类型:德国手语(DGS) 数据集
  • 应用:连续手语识别(CSLR)和手语翻译(SLT)
  • 发布机构:德国亚琛工业大学(RWTH Aachen University)
  • 发布时间:2014年

RWTH-PHOENIX-Weather 2014T

  • 全称:RWTH-PHOENIX-Weather 2014 Transcriptions
  • 改进版:增加了更精确的标注和扩展
  • 发布时间:2018年(2014数据集的增强版)

二、数据来源和采集

  • 原始数据来源
  • 德国公共电视台(Öffentlich-Rechtlicher Rundfunk)

    每日天气预报节目(Tagesschau)

    2009年1月-2012年12月(4年数据)

    专业手语翻译员(9位不同翻译员)

  • 视频特点
    • 分辨率:210×260像素(早期版本),后提升至更高分辨率
    • 帧率:25 fps
    • 背景:统一蓝色背景(便于分割)
    • 视角:上半身正面视角
    • 时长:总计约 11 小时视频

    三、数据集规模和结构

    Phoenix-2014 基本统计

    项目训练集开发集测试集总计
    句子数 5,672 540 629 6,841
    词汇实例 66,771 6,255 7,249 80,275
    独特词汇 1,081 587 582 1,231
    平均句长 11.8词汇 11.6词汇 11.5词汇

    Phoenix-2014T 增强内容

    • 更精细的时间对齐:音素级别的时间标注
    • 扩展的词汇表:约 1,300 个独特 gloss
    • 改进的标注一致性
    • 增加了语言学标注(如手型、位置、运动)

    四、标注层级和格式

  • 多层次标注系统
  • 层级1:Gloss 序列(文件内容)

    视频时间戳:01.234-02.567
    Gloss标注:PROGNOSE MORGEN REGEN NORD
    ID序列: [X, 8, 4, 10] # 通过gloss2ids映射

    层级2:德语翻译

    Gloss:PROGNOSE MORGEN REGEN NORD
    翻译:Prognose für morgen: Regen im Norden
    (明天预报:北部有雨)

    层级3:时间对齐(2014T新增)

    精细到音素级别:
    MORGEN → M O R G E N(每个音素都有时间戳)
    REGEN → R E G E N

  • 标注文件示例
  • Phoenix-2014 的 .gpos 文件

    1 5000 7000 PROGNOSE
    2 7000 9000 MORGEN
    3 9000 11000 REGEN
    4 11000 13000 NORD

    Phoenix-2014T 的 .ctm 文件(更精细)

    1 5000 500 PROG
    2 5500 500 N
    3 6000 500 O
    4 6500 500 S
    5 7000 1000 MORGEN


    五、词汇表特点(基于 gloss2ids.pkl)

  • 词汇分布
  • 总词汇量:约 470 个 gloss
    天气相关:约 150 个(32%)
    时间相关:约 80 个(17%)
    方位相关:约 60 个(13%)
    其他:约 180 个(38%)

  • 词汇类别分析
  • 核心天气词汇(高频)

    "REGEN": 4 # 出现频率最高的天气词
    "SONNE": 11
    "WIND": 25
    "WETTER": 21
    "GEWITTER": 22
    "SCHNEE": 17

    时间表达词汇

    # 绝对时间
    "MORGEN": 8 # 明天/早晨
    "HEUTE": 20 # 今天
    "ABEND": 31 # 晚上

    # 相对时间
    "SPAETER": 114 # 稍后
    "BALD": 291 # 很快
    "GLEICH": 127 # 马上

    地理和方位词汇

    # 基本方位
    "NORD": 10
    "SUED": 15
    "WEST": 30

    # 德国地区
    "BAYERN": 100 # 巴伐利亚
    "ALPEN": 94 # 阿尔卑斯
    "HAMBURG": 387 # 汉堡

    # 欧洲国家
    "DEUTSCHLAND": 126 # 德国
    "FRANKREICH": 172 # 法国
    "OESTERREICH": 385 # 奥地利


    六、数据集的技术挑战

  • 手语识别的独特难点
  • 连续性问题:手势之间没有明显边界
    同时性问题:多个手势特征同时表达
    个人差异:9位不同翻译员的手势风格
    遮挡问题:手部自遮挡

  • 翻译任务的挑战
    • 语序差异:DGS语序与德语不同
    • 省略现象:手语经常省略主语/宾语
    • 空间引用:需要处理空间位置信息
  • 标注的复杂性
    • 主观性:不同标注者对同一手势可能有不同gloss
    • 颗粒度:确定手势的起始/结束时间困难
    • 一致性:保持不同标注者间的一致性

    七、研究任务和应用

  • 主要研究任务
  • 任务1:连续手语识别(CSLR)

    输入:视频序列
    输出:Gloss序列
    评价指标:WER(词错误率)

    任务2:手语翻译(SLT)

    输入:视频序列
    输出:德语文本
    评价指标:BLEU、ROUGE

    任务3:手语生成(Synthesis)

    输入:德语文本
    输出:手语视频/动画

  • 基准模型性能(2023年最新)
  • 模型CSLR(WER↓)SLT(BLEU↑)发表年份
    SIGNUM(基线) 38.7% 23.1 2014
    CNN+LSTM 26.0% 25.3 2018
    Transformer 21.5% 26.8 2020
    SignBERT 18.2% 28.4 2022
    ViT+Conformer 16.8% 30.1 2023

    八、数据集的使用方式

  • 数据分割
  • # 官方划分
    train_files = [...] # 5,672个样本
    dev_files = [...] # 540个样本(验证集)
    test_files = [...] # 629个样本

    # 时间划分(不是随机划分)
    # 训练集:2009-2011年数据
    # 开发/测试集:2012年不同月份

  • 预处理流程
  • # 典型处理流程
    1. 视频读取 → 帧提取
    2. 姿态估计 → OpenPose/MediaPipe
    3. 特征提取 → I3D/3DCNN
    4. 序列建模 → Transformer/LSTM
    5. Gloss解码 → CTC/Attention

  • ** gloss2ids.pkl 使用**
  • import pickle

    # 加载词汇表
    with open('gloss2ids.pkl', 'rb') as f:
    gloss2id = pickle.load(f)
    id2gloss = {v: k for k, v in gloss2id.items()}

    # 训练时使用
    def encode_glosses(gloss_list):
    """将gloss序列转为ID序列"""
    return [gloss2id.get(g, gloss2id['<unk>']) for g in gloss_list]

    def decode_ids(id_list):
    """将ID序列转为gloss序列"""
    return [id2gloss.get(i, '<unk>') for i in id_list]


    九、Phoenix-2014T 的改进

  • 时间对齐精度提升
  • Phoenix-2014:手势级别对齐(~200ms精度)
    Phoenix-2014T:音素级别对齐(~50ms精度)

  • 标注一致性改进
    • 重新统一了相似手势的gloss标注
    • 修正了时间边界错误
    • 增加了质量控制流程
  • 语言学标注扩展
    • 手型(Handshape)分类
    • 运动(Movement)类型
    • 位置(Location)信息
    • 非手动特征(面部表情)

    十、相关数据集对比

    数据集语言规模标注粒度应用领域
    Phoenix-2014 DGS 7K句 手势级 天气预报
    Signing Savvy ASL 5K词 孤立词 教学词典
    How2Sign ASL 80h 句子级 教育视频
    MS-ASL ASL 25K样本 孤立词 通用识别
    WLASL ASL 2K词 孤立词 词汇识别

    Phoenix-2014 的独特优势:

  • 连续性:真实连续手语,不是孤立词
  • 领域专注:天气预报,词汇相对固定
  • 高质量:专业翻译员,统一背景
  • 多模态:视频+gloss+德语翻译

  • 十一、实际研究案例

    案例1:基于Transformer的CSLR

    # 使用词汇表
    vocab_size = len(gloss2id) # 约470
    model = SignLanguageTransformer(
    vocab_size=vocab_size,
    d_model=512,
    nhead=8,
    num_layers=6
    )

    # 训练目标:视频→gloss ID序列
    loss = CTC_loss(predictions, target_ids)

    案例2:跨模态预训练

    使用Phoenix-2014进行:
    1. 手势-文本对比学习
    2. 多任务学习(识别+翻译)
    3. 自监督预训练(掩码手势建模)


    十二、局限性和未来方向

  • 局限性
    • 领域限制:仅天气预报,词汇有限
    • 说话者少:只有9位翻译员
    • 环境单一:蓝色背景,无真实场景
    • 语言单一:仅德国手语
  • 未来扩展方向
    • 增加更多领域数据
    • 包含更多说话者
    • 真实环境采集
    • 多语言手语数据

    总结

    Phoenix-2014 和 Phoenix-2014T 是:

  • 德国手语研究的标准数据集,广泛应用于CSLR和SLT研究
  • 高质量、连续的手语数据,来自真实的天气预报节目
  • 多层次的标注体系:视频→gloss→德语翻译
  • ** gloss2ids.pkl 是该数据集的词汇映射表**,将约470个手语手势映射到数字ID
  • 这个数据集对于推动手语识别、手语翻译、以及更广泛的视觉语言理解研究具有重要意义。通过这个数据集,可以:

    • 开发更准确的手语识别系统
    • 构建手语-语音翻译工具
    • 理解手语的语言学特征
    • 促进听障人士的沟通技术发展
    赞(0)
    未经允许不得转载:171主机测评 » 综合项目实战:手语识别及翻译(三)数据集
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址