roberta-base-nli-stsb-theseus-bg開源多語言模型 - 免費生成保英雙語句子嵌入向量

Home

Roberta Base Nli Stsb Theseus Bg

Developed by rmihaylov

這是一個多語言Roberta模型，可用於生成保加利亞語句子的嵌入向量，基於Sentence-BERT理念訓練，支持保加利亞語和英語。

文本嵌入

Transformers

OtherOpen Source License:MIT #保加利亞語嵌入 #雙語對齊 #句子相似度

Downloads 14

Release Time : 4/18/2022

Model Overview

該模型基於Sentence-BERT理念訓練，核心思想是翻譯後的句子應與原句在向量空間中映射到相同位置。模型區分大小寫，後期通過漸進式模塊替換技術進行了壓縮優化。

Model Features

多語言支持

支持保加利亞語和英語的句子嵌入生成

區分大小寫

能夠區分單詞的大小寫形式，如'bulgarian'和'Bulgarian'會被視為不同詞彙

漸進式模塊替換優化

通過漸進式模塊替換技術進行了壓縮優化，提高了模型效率

基於Sentence-BERT理念

採用Sentence-BERT的訓練方法，使翻譯對在向量空間中映射到相近位置

Model Capabilities

句子嵌入生成

跨語言句子相似度計算

文本語義匹配

Use Cases

信息檢索

跨語言文檔檢索

使用保加利亞語查詢檢索相關英語文檔

問答系統

相似問題匹配

在問答系統中匹配語義相似的保加利亞語問題

如示例所示，能準確識別與'餅乾成分'最相關的問題

🚀 ROBERTA BASE (cased) 在保加利亞語 - 英語私有平行數據上訓練的模型

這是一個多語言Roberta模型，可用於創建保加利亞語句子的嵌入表示。該模型借鑑了 Sentence - BERT 的思想，基於翻譯後的句子應與原句在向量空間中映射到相同位置的理念進行訓練。

此模型區分大小寫，例如能區分 “bulgarian” 和 “Bulgarian”。它在保加利亞語 - 英語私有平行數據上進行訓練，之後通過漸進式模塊替換方法進行了壓縮。

🚀 快速開始

本模型是一個多語言Roberta模型，可用於創建保加利亞語句子的嵌入表示。它基於翻譯後的句子應與原句在向量空間中映射到相同位置的理念進行訓練。

✨ 主要特性

多語言處理：可用於處理保加利亞語句子。
大小寫敏感：能夠區分大小寫，例如 “bulgarian” 和 “Bulgarian” 會被視為不同的內容。
訓練方式：在保加利亞語 - 英語私有平行數據上訓練，並通過漸進式模塊替換方法進行壓縮。

📦 安裝指南

文檔中未提及具體安裝步驟，可根據使用的深度學習框架（如PyTorch）的常規安裝方式進行安裝。

💻 使用示例

基礎用法

>>> import scipy
>>> import torch
>>> from transformers import AutoModel, AutoTokenizer
>>> 
>>> model = AutoModel.from_pretrained('rmihaylov/roberta-base-nli-stsb-theseus-bg')
>>> tokenizer = AutoTokenizer.from_pretrained('rmihaylov/roberta-base-nli-stsb-theseus-bg')
>>>
>>> def embed(text):
>>>     inputs = tokenizer.encode_plus(text, return_tensors='pt')
>>>     outputs = model(**inputs)
>>>     sequence_output = outputs[0]
>>>     input_mask_expanded = inputs['attention_mask'].unsqueeze(-1).expand(sequence_output.size()).float()
>>>     embeddings = torch.sum(sequence_output * input_mask_expanded, 1) / torch.clamp(input_mask_expanded.sum(1), min=1e-9)
>>>     return embeddings.detach().numpy()[0]
>>> 
>>> 
>>> query_embedding = embed("Какви са съставките на бисквитките?")
>>> 
>>> questions = [
>>>     "Какво е бисквитка?",
>>>     "От какво са направени бисквитките?",
>>>     "Използват ли в Англия думата бисквитки?",
>>>     "Къде се правят бисквитките?",
>>>     "Какви видове бисквитки има?",
>>>     "Къде човек може да купи бисквитки?",
>>>     "Откъде дойде думата бисквитка?",
>>>     "Кое е чудовището на бисквитките?",
>>>     "Как да си направите бисквитки у дома?",
>>>     "Колко калории има типичната бисквитка?",
>>>     "Какви напитки вървят добре с бисквитките?",
>>>     "Бисквитките наричат ли се също сладки?"
>>>     ]
>>> 
>>> corpus, corpus_embeddings = [], []
>>> for question in questions:
>>>     embedding = embed(question)
>>>     corpus.append(question)
>>>     corpus_embeddings.append(embedding)
>>> 
>>> distances = scipy.spatial.distance.cdist([query_embedding], corpus_embeddings, "cosine")[0]
>>> 
>>> results = zip(range(len(distances)), distances)
>>> results = sorted(results, key=lambda x: x[1])
>>> 
>>> print([[corpus[idx].strip(), (1.0 - distance)] for idx, distance in results])

[['От какво са направени бисквитките?', 0.9855158537034977],
 ['Къде се правят бисквитките?', 0.9774093134195002],
 ['Какви видове бисквитки има?', 0.9766014240577192],
 ['Използват ли в Англия думата бисквитки?', 0.9446492058523037],
 ['Кое е чудовището на бисквитките?', 0.9269786184641834],
 ['Къде човек може да купи бисквитки?', 0.9268900421152592],
 ['Какво е бисквитка?', 0.9188155080718263],
 ['Бисквитките наричат ли се също сладки?', 0.9060368627614406],
 ['Откъде дойде думата бисквитка?', 0.9048309659657036],
 ['Какви напитки вървят добре с бисквитките?', 0.890836765118977],
 ['Как да си направите бисквитки у дома?', 0.8878968487540497],
 ['Колко калории има типичната бисквитка?', 0.8652821650136402]]

🔧 技術細節

本模型借鑑了 Sentence - BERT 的思想，基於翻譯後的句子應與原句在向量空間中映射到相同位置的理念進行訓練。它在保加利亞語 - 英語私有平行數據上進行訓練，之後通過漸進式模塊替換方法進行了壓縮。

📄 許可證

本模型使用的許可證為MIT許可證。

屬性	詳情
模型類型	多語言Roberta模型
訓練數據	oscar、chitanka、wikipedia以及保加利亞語 - 英語私有平行數據
標籤	torch
推理	否
任務類型	句子相似度
語言	保加利亞語