roberta-base-use-qa-theseus-bgオープンソース多言語モデル - ブルガリア語の文章埋め込みベクトルを無料で生成

ホーム

Roberta Base Use Qa Theseus Bg

rmihaylovによって開発

これは多言語Robertaモデルで、ブルガリア語の文の埋め込みベクトルを生成するために使用できます。Sentence-BERTの考え方に基づいてトレーニングされ、教師モデルはGoogleのUSEモデルです。

テキスト埋め込み

Transformers

その他オープンソースライセンス:MIT #ブルガリア語文埋め込み #クロスランゲージ意味マッチング #プログレッシブモデル圧縮

ダウンロード数 15

リリース時間 : 4/18/2022

モデル概要

このモデルはブルガリア語の文の埋め込みベクトルを生成するために使用され、文の類似度計算などのタスクに適しています。プログレッシブなモジュール置換技術によりモデル圧縮が行われています。

モデル特徴

多言語サポート

ブルガリア語と英語の文埋め込み生成をサポート

大文字小文字区別

モデルは大文字小文字を区別し、'bulgarian'と'Bulgarian'は異なる語彙として扱われます

モデル圧縮

プログレッシブなモジュール置換技術によるモデル圧縮

翻訳ペアに基づくトレーニング

ブルガリア語-英語並列コーパスを使用してトレーニングされ、翻訳文は同じベクトル空間にマッピングされます

モデル能力

ブルガリア語文埋め込み生成

英語文埋め込み生成

文類似度計算

使用事例

情報検索

質問応答システム

質問に最も関連性の高い回答を見つけるために使用

例では、質問と候補回答の類似度を計算する方法を示しています

テキストマッチング

類似文識別

意味的に類似した文を識別

🚀 ROBERTA BASE (cased) ブルガリア語-英語の並列データで学習されたモデル

このモデルは多言語Robertaモデルです。ブルガリア語の文章の埋め込み表現を作成するために使用できます。

Sentence - BERTのアイデアを利用し、翻訳された文章が元の文章と同じベクトル空間上の位置にマッピングされるという考え方に基づいて学習が行われています。

教師モデルはGoogleのUSEモデルです。

このモデルは大文字小文字を区別します。例えば、"bulgarian"と"Bulgarian"は異なるものとして扱われます。

このモデルは、非公開のブルガリア語 - 英語の並列データで学習され、その後progressive module replacingによって圧縮されました。

🚀 クイックスタート

このモデルはブルガリア語の文章の埋め込み表現を作成するために使用できます。学習にはブルガリア語 - 英語の並列データが使用され、Sentence - BERTのアイデアを取り入れています。

✨ 主な機能

ブルガリア語の文章の埋め込み表現を作成できます。
大文字小文字を区別した表現が可能です。
Progressive module replacingによってモデルが圧縮されています。

📦 インストール

このモデルを使用するには、transformersライブラリが必要です。以下のコマンドでインストールできます。

pip install transformers

💻 使用例

基本的な使用法

>>> import scipy
>>> import torch
>>> from transformers import AutoModel, AutoTokenizer
>>> 
>>> model = AutoModel.from_pretrained('rmihaylov/roberta-base-use-qa-theseus-bg')
>>> tokenizer = AutoTokenizer.from_pretrained('rmihaylov/roberta-base-use-qa-theseus-bg')
>>>
>>> query = "Какви са съставките на бисквитките?"
>>> 
>>> answers = [
>>>            "Бисквитката е печена или варена храна, която обикновено е малка, плоска и сладка.",
>>>            "Бисквитките обикновено съдържат брашно, захар и някакъв вид масло или мазнини. Те могат да включват други съставки като стафиди, овес, шоколадов чипс, ядки и др.",
>>>            "В повечето англоговорящи страни, с изключение на САЩ и Канада, хрупкавите бисквитки се наричат бисквити.",
>>>            "Бисквитите Chewier понякога се наричат бисквитки дори в Обединеното кралство. Някои бисквитки могат също да бъдат назовавани според формата им, като квадратчета с дата или барове.",
>>>            "Бисквитките или бисквитите могат да се произвеждат масово във фабрики, направени в малки пекарни или домашно приготвени.",
>>>            "Вариантите за бисквити или бисквити включват сандвич бисквити, като крем крем, Jammie Dodgers, Bourbons и Oreos, с пълнеж от ружа или конфитюр и понякога потопени в шоколад или друго сладко покритие.",
>>>            "Бисквитките често се сервират с напитки като мляко, кафе или чай.",
>>>            "Фабричните бисквитки се продават в магазини за хранителни стоки, магазини за удобство и автомати.",
>>>            "Американската употреба произлиза от холандското koekje „малка торта“, което е умалително от „koek“ („торта“), което произлиза от средно холандската дума „koke“.",
>>>            "Cookie Monster е Muppet в дългогодишното детско телевизионно шоу Sesame Street, който е най-известен с ненаситния си апетит към бисквитките и известните си фрази за ядене, като „Me want cookie!“, „Me eat cookie!“ (или просто „COOKIE!“) и „Om nom nom nom“ (казано през уста, пълна с храна).",
>>>            "Домашните бисквитки обикновено се правят от тесто, оформено на малки топчета и пуснато върху лист с бисквитки. След това се пекат във фурна за 5 до 15 минути, в зависимост от рецептата. Температурата на фурната варира от 250 до 350 градуса.",
>>>            "Повечето бисквитки със среден размер, ако са направени със захар, брашно и скъсяване, ще съдържат между 100 и 200 калории.",
>>>            ]
>>> 
>>> query_embedding = model.question(**tokenizer.encode_plus(query, return_tensors='pt')).detach().numpy()[0]
>>> 
>>> corpus, corpus_embeddings = [], []
>>> for answer in answers:
>>>     value_inputs = tokenizer.encode_plus(answer, answer, return_tensors='pt')
>>>     embedding = model.answer(**value_inputs).detach().numpy()[0]
>>>     corpus.append(answer)
>>>     corpus_embeddings.append(embedding)
>>> 
>>> distances = scipy.spatial.distance.cdist([query_embedding], corpus_embeddings, "cosine")[0]
>>> 
>>> results = zip(range(len(distances)), distances)
>>> results = sorted(results, key=lambda x: x[1])
>>> 
>>> print([[corpus[idx].strip(), (1.0 - distance)] for idx, distance in results])

[['Бисквитките обикновено съдържат брашно, захар и някакъв вид масло или мазнини. Те могат да включват други съставки като стафиди, овес, шоколадов чипс, ядки и др.',
  0.5449754306536151],
 ['Фабричните бисквитки се продават в магазини за хранителни стоки, магазини за удобство и автомати.',
  0.5049509545814316],
 ['В повечето англоговорящи страни, с изключение на САЩ и Канада, хрупкавите бисквитки се наричат \u200b\u200bбисквити.',
  0.5029661338050297],
 ['Бисквитките или бисквитите могат да се произвеждат масово във фабрики, направени в малки пекарни или домашно приготвени.',
  0.4991678233218718],
 ['Вариантите за бисквити или бисквити включват сандвич бисквити, като крем крем, Jammie Dodgers, Bourbons и Oreos, с пълнеж от ружа или конфитюр и понякога потопени в шоколад или друго сладко покритие.',
  0.49050297326146386],
 ['Повечето бисквитки със среден размер, ако са направени със захар, брашно и скъсяване, ще съдържат между 100 и 200 калории.',
  0.48950875441294106],
 ['Бисквитката е печена или варена храна, която обикновено е малка, плоска и сладка.',
  0.48646309549536737],
 ['Бисквитите Chewier понякога се наричат \u200b\u200bбисквитки дори в Обединеното кралство. Някои бисквитки могат също да бъдат назовавани според формата им, като квадратчета с дата или барове.',
  0.4840599482604815],
 ['Cookie Monster е Muppet в дългогодишното детско телевизионно шоу Sesame Street, който е най-известен с ненаситния си апетит към бисквитките и известните си фрази за ядене, като „Me want cookie!“, „Me eat cookie!“ (или просто „COOKIE!“) и „Om nom nom nom“ (казано през уста, пълна с храна).',
  0.45209677893728206],
 ['Домашните бисквитки обикновено се правят от тесто, оформено на малки топчета и пуснато върху лист с бисквитки. След това се пекат във фурна за 5 до 15 минути, в зависимост от рецептата. Температурата на фурната варира от 250 до 350 градуса.',
  0.4511516464302119],
 ['Бисквитките често се сервират с напитки като мляко, кафе или чай.',
  0.42364528401677803],
 ['Американската употреба произлиза от холандското koekje „малка торта“, което е умалително от „koek“ („торта“), което произлиза от средно холандската дума „koke“.',
  0.3267314582662877]]

📚 ドキュメント

学習データ：非公開のブルガリア語 - 英語の並列データ
教師モデル：GoogleのUSEモデル
圧縮手法：Progressive module replacing

🔧 技術詳細

このモデルは、Sentence - BERTのアイデアを取り入れ、翻訳された文章が元の文章と同じベクトル空間上の位置にマッピングされるように学習されています。教師モデルとしてGoogleのUSEモデルが使用され、その後Progressive module replacingによってモデルが圧縮されています。