roberta-base-use-qa-bg開源多語言模型 - 免費生成保加利亞語句子嵌入向量

首頁

Roberta Base Use Qa Bg

由rmihaylov開發

這是一個多語言Roberta模型，可用於生成保加利亞語句子的嵌入向量，訓練靈感來源於Sentence-BERT，教師模型為谷歌的USE模型。

文本嵌入

Transformers

其他開源協議:MIT #保加利亞語句子嵌入 #跨語言語義匹配 #問答系統優化

下載量 14

發布時間 : 4/18/2022

模型概述

該模型用於生成保加利亞語句子的嵌入向量，通過翻譯後的句子映射到與原句相同的向量空間位置來實現句子相似度計算。

模型特點

多語言支持

支持保加利亞語和英語的句子嵌入生成

區分大小寫

模型區分大小寫，例如'bulgarian'和'Bulgarian'會被視為不同

基於Sentence-BERT思想

採用翻譯句子映射到相同向量空間位置的方法

使用教師模型

訓練過程中使用谷歌的USE模型作為教師模型

模型能力

生成句子嵌入向量

計算句子相似度

支持保加利亞語處理

支持英語處理

使用案例

問答系統

問題答案匹配

計算用戶問題與候選答案的相似度

示例中展示瞭如何找到與問題最相關的答案

信息檢索

相關文檔檢索

根據查詢語句查找最相關的文檔

🚀 ROBERTA BASE (cased) 在保加利亞語-英語私有平行數據上訓練

這是一個多語言Roberta模型，可用於創建保加利亞語句子的嵌入向量。該模型基於 Sentence-BERT 的思想進行訓練，其核心思路是將翻譯後的句子映射到與原句在向量空間中的相同位置。教師模型為 Google的USE模型。

此模型區分大小寫，例如“bulgarian”和“Bulgarian”會被視為不同的詞彙。它在保加利亞語 - 英語私有平行數據上進行訓練。

🚀 快速開始

本模型是一個多語言Roberta模型，可用於創建保加利亞語句子的嵌入向量。通過特定的訓練思路，能將翻譯後的句子與原句在向量空間中映射到相同位置。

✨ 主要特性

多語言支持：可處理保加利亞語相關任務。
區分大小寫：能區分大小寫不同的詞彙，如“bulgarian”和“Bulgarian”。
特定訓練思路：基於 Sentence-BERT 的思想，以翻譯後的句子和原句在向量空間中映射到相同位置為目標進行訓練。

📦 安裝指南

文檔未提及安裝步驟，暫不提供相關內容。

💻 使用示例

基礎用法

以下是如何在PyTorch中使用此模型的示例代碼：

>>> import scipy
>>> import torch
>>> from transformers import AutoModel, AutoTokenizer
>>> 
>>> model = AutoModel.from_pretrained('rmihaylov/roberta-base-use-qa-bg')
>>> tokenizer = AutoTokenizer.from_pretrained('rmihaylov/roberta-base-use-qa-bg')
>>>
>>> query = "Какви са съставките на бисквитките?"
>>> 
>>> answers = [
>>>            "Бисквитката е печена или варена храна, която обикновено е малка, плоска и сладка.",
>>>            "Бисквитките обикновено съдържат брашно, захар и някакъв вид масло или мазнини. Те могат да включват други съставки като стафиди, овес, шоколадов чипс, ядки и др.",
>>>            "В повечето англоговорящи страни, с изключение на САЩ и Канада, хрупкавите бисквитки се наричат бисквити.",
>>>            "Бисквитите Chewier понякога се наричат бисквитки дори в Обединеното кралство. Някои бисквитки могат също да бъдат назовавани според формата им, като квадратчета с дата или барове.",
>>>            "Бисквитките или бисквитите могат да се произвеждат масово във фабрики, направени в малки пекарни или домашно приготвени.",
>>>            "Вариантите за бисквити или бисквити включват сандвич бисквити, като крем крем, Jammie Dodgers, Bourbons и Oreos, с пълнеж от ружа или конфитюр и понякога потопени в шоколад или друго сладко покритие.",
>>>            "Бисквитките често се сервират с напитки като мляко, кафе или чай.",
>>>            "Фабричните бисквитки се продават в магазини за хранителни стоки, магазини за удобство и автомати.",
>>>            "Американската употреба произлиза от холандското koekje „малка торта“, което е умалително от „koek“ („торта“), което произлиза от средно холандската дума „koke“.",
>>>            "Cookie Monster е Muppet в дългогодишното детско телевизионно шоу Sesame Street, който е най-известен с ненаситния си апетит към бисквитките и известните си фрази за ядене, като „Me want cookie!“, „Me eat cookie!“ (или просто „COOKIE!“) и „Om nom nom nom“ (казано през уста, пълна с храна).",
>>>            "Домашните бисквитки обикновено се правят от тесто, оформено на малки топчета и пуснато върху лист с бисквитки. След това се пекат във фурна за 5 до 15 минути, в зависимост от рецептата. Температурата на фурната варира от 250 до 350 градуса.",
>>>            "Повечето бисквитки със среден размер, ако са направени със захар, брашно и скъсяване, ще съдържат между 100 и 200 калории.",
>>>            ]
>>> 
>>> query_embedding = model.question(**tokenizer.encode_plus(query, return_tensors='pt')).detach().numpy()[0]
>>> 
>>> corpus, corpus_embeddings = [], []
>>> for answer in answers:
>>>     value_inputs = tokenizer.encode_plus(answer, answer, return_tensors='pt')
>>>     embedding = model.answer(**value_inputs).detach().numpy()[0]
>>>     corpus.append(answer)
>>>     corpus_embeddings.append(embedding)
>>> 
>>> distances = scipy.spatial.distance.cdist([query_embedding], corpus_embeddings, "cosine")[0]
>>> 
>>> results = zip(range(len(distances)), distances)
>>> results = sorted(results, key=lambda x: x[1])
>>> 
>>> print([[corpus[idx].strip(), (1.0 - distance)] for idx, distance in results])

[['Бисквитките обикновено съдържат брашно, захар и някакъв вид масло или мазнини. Те могат да включват други съставки като стафиди, овес, шоколадов чипс, ядки и др.',
  0.620301064877746],
 ['Бисквитката е печена или варена храна, която обикновено е малка, плоска и сладка.',
  0.5696434424179133],
 ['Повечето бисквитки със среден размер, ако са направени със захар, брашно и скъсяване, ще съдържат между 100 и 200 калории.',
  0.5496458499598336],
 ['Бисквитките или бисквитите могат да се произвеждат масово във фабрики, направени в малки пекарни или домашно приготвени.',
  0.5365738121336622],
 ['Бисквитите Chewier понякога се наричат \u200b\u200bбисквитки дори в Обединеното кралство. Някои бисквитки могат също да бъдат назовавани според формата им, като квадратчета с дата или барове.',
  0.5278547550921155],
 ['Вариантите за бисквити или бисквити включват сандвич бисквити, като крем крем, Jammie Dodgers, Bourbons и Oreos, с пълнеж от ружа или конфитюр и понякога потопени в шоколад или друго сладко покритие.',
  0.5231947553588652],
 ['Фабричните бисквитки се продават в магазини за хранителни стоки, магазини за удобство и автомати.',
  0.5222493948012543],
 ['В повечето англоговорящи страни, с изключение на САЩ и Канада, хрупкавите бисквитки се наричат \u200b\u200bбисквити.',
  0.5185776999549867],
 ['Домашните бисквитки обикновено се правят от тесто, оформено на малки топчета и пуснато върху лист с бисквитки. След това се пекат във фурна за 5 до 15 минути, в зависимост от рецептата. Температурата на фурната варира от 250 до 350 градуса.',
  0.5113299248563532],
 ['Cookie Monster е Muppet в дългогодишното детско телевизионно шоу Sesame Street, който е най-известен с ненаситния си апетит към бисквитките и известните си фрази за ядене, като „Me want cookie!“, „Me eat cookie!“ (или просто „COOKIE!“) и „Om nom nom nom“ (казано през уста, пълна с храна).',
  0.4642001162793412],
 ['Бисквитките често се сервират с напитки като мляко, кафе или чай.',
  0.44902199326988135],
 ['Американската употреба произлиза от холандското koekje „малка торта“, което е умалително от „koek“ („торта“), което произлиза от средно холандската дума „koke“.',
  0.25256183690274214]]