roberta-base-nli-stsb-bg开源多语言模型 - 免费生成保加利亚语句子嵌入向量

首页

Roberta Base Nli Stsb Bg

由 rmihaylov 开发

这是一个多语言Roberta模型，可用于生成保加利亚语句子的嵌入向量，训练灵感来自Sentence-BERT。

文本嵌入

Transformers

其他开源协议:MIT #保加利亚语句子嵌入 #多语言相似度计算 #翻译对齐训练

下载量 607

发布时间 : 4/18/2022

模型简介

该模型通过将翻译后的句子映射到与原句相同的向量空间位置，主要用于句子相似度计算任务。

模型特点

多语言支持

支持保加利亚语和英语的句子嵌入生成

区分大小写

能够区分单词的大小写形式（如'bulgarian'和'Bulgarian'）

基于Sentence-BERT原理

采用Sentence-BERT的训练方法，将翻译对映射到相同向量空间

模型能力

句子嵌入生成

跨语言句子相似度计算

保加利亚语文本处理

使用案例

信息检索

🚀 ROBERTA BASE (区分大小写) 在保加利亚语 - 英语私有平行数据上训练

这是一个多语言Roberta模型，可用于创建保加利亚语句子的嵌入向量。

该模型借鉴了 Sentence - BERT 的思想，其训练基于这样一个理念：翻译后的句子应与原句在向量空间中映射到相同位置。

此模型区分大小写，即“bulgarian”和“Bulgarian”是不同的。

它在保加利亚语 - 英语私有平行数据上进行训练。

🚀 快速开始

模型信息

属性	详情
推理功能	否
任务类型	句子相似度
支持语言	保加利亚语
许可证	MIT
训练数据集	oscar、chitanka、wikipedia
标签	torch

模型特点

多语言Roberta模型，用于保加利亚语句子嵌入。
基于Sentence - BERT思想训练，使翻译句和原句在向量空间映射到相同位置。
区分大小写。

训练数据

该模型在保加利亚语 - 英语私有平行数据上进行训练。

💻 使用示例

基础用法

>>> import scipy
>>> import torch
>>> from transformers import AutoModel, AutoTokenizer
>>> 
>>> model = AutoModel.from_pretrained('rmihaylov/roberta-base-nli-stsb-bg')
>>> tokenizer = AutoTokenizer.from_pretrained('rmihaylov/roberta-base-nli-stsb-bg')
>>>
>>> def embed(text):
>>>     inputs = tokenizer.encode_plus(text, return_tensors='pt')
>>>     outputs = model(**inputs)
>>>     sequence_output = outputs[0]
>>>     input_mask_expanded = inputs['attention_mask'].unsqueeze(-1).expand(sequence_output.size()).float()
>>>     embeddings = torch.sum(sequence_output * input_mask_expanded, 1) / torch.clamp(input_mask_expanded.sum(1), min=1e-9)
>>>     return embeddings.detach().numpy()[0]
>>> 
>>> 
>>> query_embedding = embed("Какви са съставките на бисквитките?")
>>> 
>>> questions = [
>>>     "Какво е бисквитка?",
>>>     "От какво са направени бисквитките?",
>>>     "Използват ли в Англия думата бисквитки?",
>>>     "Къде се правят бисквитките?",
>>>     "Какви видове бисквитки има?",
>>>     "Къде човек може да купи бисквитки?",
>>>     "Откъде дойде думата бисквитка?",
>>>     "Кое е чудовището на бисквитките?",
>>>     "Как да си направите бисквитки у дома?",
>>>     "Колко калории има типичната бисквитка?",
>>>     "Какви напитки вървят добре с бисквитките?",
>>>     "Бисквитките наричат ли се също сладки?"
>>>     ]
>>> 
>>> corpus, corpus_embeddings = [], []
>>> for question in questions:
>>>     embedding = embed(question)
>>>     corpus.append(question)
>>>     corpus_embeddings.append(embedding)
>>> 
>>> distances = scipy.spatial.distance.cdist([query_embedding], corpus_embeddings, "cosine")[0]
>>> 
>>> results = zip(range(len(distances)), distances)
>>> results = sorted(results, key=lambda x: x[1])
>>> 
>>> print([[corpus[idx].strip(), (1.0 - distance)] for idx, distance in results])

[['Какви видове бисквитки има?', 0.9749538412820795],
 ['От какво са направени бисквитките?', 0.9720467855849998],
 ['Къде се правят бисквитките?', 0.9622582076645853],
 ['Какво е бисквитка?', 0.9352896865855094],
 ['Използват ли в Англия думата бисквитки?', 0.8981422328370646],
 ['Откъде дойде думата бисквитка?', 0.8955433698658758],
 ['Кое е чудовището на бисквитките?', 0.8902666858687854],
 ['Бисквитките наричат ли се също сладки?', 0.8839303534407483],
 ['Какви напитки вървят добре с бисквитките?', 0.8582087653310524],
 ['Къде човек може да купи бисквитки?', 0.8570532540073935],
 ['Колко калории има типичната бисквитка?', 0.8387529949080176],
 ['Как да си направите бисквитки у дома?', 0.8243675958097614]]