Transformer实战(35)——跨语言相似性任务
-
- 0. 前言
- 1. 使用 XLM-R 模型进行跨语言文本相似性
- 2. 使用 LaBSE 模型进行跨语言文本相似性
- 3. 可视化跨语言文本相似性
- 小结
- 系列链接
0. 前言
跨语言模型能够以统一的形式表示文本,即使句子来自不同的语言,只要它们的意义相近,就会被映射到向量空间中的相似向量,XLM-R (XLM-Robust) 是流行跨语言模型之一。接下来,我们使用 XLM-R 模型进行实际应用,应用跨语言模型来衡量不同语言之间的相似性。
1. 使用 XLM-R 模型进行跨语言文本相似性
在本节中,我们将学习如何使用在跨语言自然语言推理 (Cross-Lingual Natural Language Inference, XNLI) 数据集上预训练的跨语言模型,来查找不同语言中的相似文本,我们可以将其应用于抄袭检测系统。我们将使用阿塞拜疆语的句子,看看 XLM-R 是否能找到与之相似的英语句子。
(1) 首先,需要加载一个适用于此任务的模型:
from sentence_transformers import SentenceTransformer, util
model



