数据集
- Phoenix-2014 和 Phoenix-2014T 数据集详解
-
- 一、数据集概述
- 二、数据来源和采集
- 三、数据集规模和结构
- 四、标注层级和格式
- 五、词汇表特点(基于 gloss2ids.pkl)
- 六、数据集的技术挑战
- 七、研究任务和应用
- 八、数据集的使用方式
- 九、Phoenix-2014T 的改进
- 十、相关数据集对比
- 十一、实际研究案例
- 十二、局限性和未来方向
- 总结
Phoenix-2014 和 Phoenix-2014T 数据集详解
官方下载地址:Phoenix-2014 官方下载地址:Phoenix-2014T
一、数据集概述
RWTH-PHOENIX-Weather 2014
- 全称:RWTH-PHOENIX-Weather 2014 Multimodal Corpus
- 类型:德国手语(DGS) 数据集
- 应用:连续手语识别(CSLR)和手语翻译(SLT)
- 发布机构:德国亚琛工业大学(RWTH Aachen University)
- 发布时间:2014年
RWTH-PHOENIX-Weather 2014T
- 全称:RWTH-PHOENIX-Weather 2014 Transcriptions
- 改进版:增加了更精确的标注和扩展
- 发布时间:2018年(2014数据集的增强版)
二、数据来源和采集
德国公共电视台(Öffentlich-Rechtlicher Rundfunk)
↓
每日天气预报节目(Tagesschau)
↓
2009年1月-2012年12月(4年数据)
↓
专业手语翻译员(9位不同翻译员)
- 分辨率:210×260像素(早期版本),后提升至更高分辨率
- 帧率:25 fps
- 背景:统一蓝色背景(便于分割)
- 视角:上半身正面视角
- 时长:总计约 11 小时视频
三、数据集规模和结构
Phoenix-2014 基本统计
| 句子数 | 5,672 | 540 | 629 | 6,841 |
| 词汇实例 | 66,771 | 6,255 | 7,249 | 80,275 |
| 独特词汇 | 1,081 | 587 | 582 | 1,231 |
| 平均句长 | 11.8词汇 | 11.6词汇 | 11.5词汇 | – |
Phoenix-2014T 增强内容
- 更精细的时间对齐:音素级别的时间标注
- 扩展的词汇表:约 1,300 个独特 gloss
- 改进的标注一致性
- 增加了语言学标注(如手型、位置、运动)
四、标注层级和格式
层级1:Gloss 序列(文件内容)
视频时间戳:01.234-02.567
Gloss标注:PROGNOSE MORGEN REGEN NORD
ID序列: [X, 8, 4, 10] # 通过gloss2ids映射
层级2:德语翻译
Gloss:PROGNOSE MORGEN REGEN NORD
翻译:Prognose für morgen: Regen im Norden
(明天预报:北部有雨)
层级3:时间对齐(2014T新增)
精细到音素级别:
MORGEN → M O R G E N(每个音素都有时间戳)
REGEN → R E G E N
Phoenix-2014 的 .gpos 文件
1 5000 7000 PROGNOSE
2 7000 9000 MORGEN
3 9000 11000 REGEN
4 11000 13000 NORD
Phoenix-2014T 的 .ctm 文件(更精细)
1 5000 500 PROG
2 5500 500 N
3 6000 500 O
4 6500 500 S
5 7000 1000 MORGEN
…
五、词汇表特点(基于 gloss2ids.pkl)
总词汇量:约 470 个 gloss
天气相关:约 150 个(32%)
时间相关:约 80 个(17%)
方位相关:约 60 个(13%)
其他:约 180 个(38%)
核心天气词汇(高频)
"REGEN": 4 # 出现频率最高的天气词
"SONNE": 11
"WIND": 25
"WETTER": 21
"GEWITTER": 22
"SCHNEE": 17
时间表达词汇
# 绝对时间
"MORGEN": 8 # 明天/早晨
"HEUTE": 20 # 今天
"ABEND": 31 # 晚上
# 相对时间
"SPAETER": 114 # 稍后
"BALD": 291 # 很快
"GLEICH": 127 # 马上
地理和方位词汇
# 基本方位
"NORD": 10
"SUED": 15
"WEST": 30
# 德国地区
"BAYERN": 100 # 巴伐利亚
"ALPEN": 94 # 阿尔卑斯
"HAMBURG": 387 # 汉堡
# 欧洲国家
"DEUTSCHLAND": 126 # 德国
"FRANKREICH": 172 # 法国
"OESTERREICH": 385 # 奥地利
六、数据集的技术挑战
连续性问题:手势之间没有明显边界
同时性问题:多个手势特征同时表达
个人差异:9位不同翻译员的手势风格
遮挡问题:手部自遮挡
- 语序差异:DGS语序与德语不同
- 省略现象:手语经常省略主语/宾语
- 空间引用:需要处理空间位置信息
- 主观性:不同标注者对同一手势可能有不同gloss
- 颗粒度:确定手势的起始/结束时间困难
- 一致性:保持不同标注者间的一致性
七、研究任务和应用
任务1:连续手语识别(CSLR)
输入:视频序列
输出:Gloss序列
评价指标:WER(词错误率)
任务2:手语翻译(SLT)
输入:视频序列
输出:德语文本
评价指标:BLEU、ROUGE
任务3:手语生成(Synthesis)
输入:德语文本
输出:手语视频/动画
| SIGNUM(基线) | 38.7% | 23.1 | 2014 |
| CNN+LSTM | 26.0% | 25.3 | 2018 |
| Transformer | 21.5% | 26.8 | 2020 |
| SignBERT | 18.2% | 28.4 | 2022 |
| ViT+Conformer | 16.8% | 30.1 | 2023 |
八、数据集的使用方式
# 官方划分
train_files = [...] # 5,672个样本
dev_files = [...] # 540个样本(验证集)
test_files = [...] # 629个样本
# 时间划分(不是随机划分)
# 训练集:2009-2011年数据
# 开发/测试集:2012年不同月份
# 典型处理流程
1. 视频读取 → 帧提取
2. 姿态估计 → OpenPose/MediaPipe
3. 特征提取 → I3D/3D–CNN
4. 序列建模 → Transformer/LSTM
5. Gloss解码 → CTC/Attention
import pickle
# 加载词汇表
with open('gloss2ids.pkl', 'rb') as f:
gloss2id = pickle.load(f)
id2gloss = {v: k for k, v in gloss2id.items()}
# 训练时使用
def encode_glosses(gloss_list):
"""将gloss序列转为ID序列"""
return [gloss2id.get(g, gloss2id['<unk>']) for g in gloss_list]
def decode_ids(id_list):
"""将ID序列转为gloss序列"""
return [id2gloss.get(i, '<unk>') for i in id_list]
九、Phoenix-2014T 的改进
Phoenix-2014:手势级别对齐(~200ms精度)
Phoenix-2014T:音素级别对齐(~50ms精度)
- 重新统一了相似手势的gloss标注
- 修正了时间边界错误
- 增加了质量控制流程
- 手型(Handshape)分类
- 运动(Movement)类型
- 位置(Location)信息
- 非手动特征(面部表情)
十、相关数据集对比
| Phoenix-2014 | DGS | 7K句 | 手势级 | 天气预报 |
| Signing Savvy | ASL | 5K词 | 孤立词 | 教学词典 |
| How2Sign | ASL | 80h | 句子级 | 教育视频 |
| MS-ASL | ASL | 25K样本 | 孤立词 | 通用识别 |
| WLASL | ASL | 2K词 | 孤立词 | 词汇识别 |
Phoenix-2014 的独特优势:
十一、实际研究案例
案例1:基于Transformer的CSLR
# 使用词汇表
vocab_size = len(gloss2id) # 约470
model = SignLanguageTransformer(
vocab_size=vocab_size,
d_model=512,
nhead=8,
num_layers=6
)
# 训练目标:视频→gloss ID序列
loss = CTC_loss(predictions, target_ids)
案例2:跨模态预训练
使用Phoenix-2014进行:
1. 手势-文本对比学习
2. 多任务学习(识别+翻译)
3. 自监督预训练(掩码手势建模)
十二、局限性和未来方向
- 领域限制:仅天气预报,词汇有限
- 说话者少:只有9位翻译员
- 环境单一:蓝色背景,无真实场景
- 语言单一:仅德国手语
- 增加更多领域数据
- 包含更多说话者
- 真实环境采集
- 多语言手语数据
总结
Phoenix-2014 和 Phoenix-2014T 是:
这个数据集对于推动手语识别、手语翻译、以及更广泛的视觉语言理解研究具有重要意义。通过这个数据集,可以:
- 开发更准确的手语识别系统
- 构建手语-语音翻译工具
- 理解手语的语言学特征
- 促进听障人士的沟通技术发展


