TookaBERT-Baseオープンソースエンコーダモデル - ペルシャ語の自然言語処理タスクに無料で使用可能

Home

Tookabert Base

Developed by PartAI

TookaBERTはペルシャ語で訓練されたエンコーダーモデルファミリーで、基礎版と大規模版の2つのバージョンがあり、様々な自然言語処理タスクに適しています。

大規模言語モデル

Transformers

OtherOpen Source License:Apache-2.0 #ペルシャ語のマスク埋め込み #大規模事前学習 #マルチタスク微調整

Downloads 127

Release Time : 4/29/2024

Model Overview

TookaBERTモデルはペルシャ語で訓練されたエンコーダーモデルファミリーで、マスク埋め込みタスクに適しており、感情分析、テキスト分類、多肢選択、質問応答、固有表現認識などの様々な下流タスクをサポートします。

Model Features

多トピック事前学習

500GB以上のペルシャ語データで事前学習を行い、ニュース、ブログ、フォーラム、書籍など様々なトピックをカバーしています。

遮蔽言語モデリング

遮蔽言語モデリング（WWM）目標を用いて事前学習を行い、マスク埋め込みタスクをサポートします。

マルチタスクサポート

感情分析、テキスト分類、多肢選択、質問応答、固有表現認識などの様々な下流タスクをサポートします。

Model Capabilities

マスク埋め込み

感情分析

テキスト分類

多肢選択

質問応答

固有表現認識

Use Cases

感情分析

DeepSentiPers

ペルシャ語の感情分析タスクに使用

f1/acc: 85.66/85.78 (TookaBERT-large)

固有表現認識

MultiCoNER-v2

ペルシャ語の固有表現認識タスクに使用

f1/acc: 69.69/94.07 (TookaBERT-large)

質問応答

PQuAD

ペルシャ語の質問応答タスクに使用

best_exact/best_f1/HasAns_exact/HasAns_f1: 75.56/88.06/70.24/87.83 (TookaBERT-large)

🚀 TookaBERTモデル

TookaBERTモデルは、ペルシャ語で訓練されたエンコーダーモデルのファミリーで、baseとlargeの2つのサイズがあります。これらのモデルは、ニュース、ブログ、フォーラム、書籍など、様々なトピックを含む500GB以上のペルシャ語データで事前学習されています。2つのコンテキスト長を使用して、MLM（WWM）の目的で事前学習されています。

詳細については、arXivで論文を読むことができます。

🚀 クイックスタート

✨ 主な機能

TookaBERTモデルは、ペルシャ語の様々な自然言語処理タスクに使用できます。マスク付き言語モデリングに直接使用することができ、また、独自のデータセットでファインチューニングして、特定のタスクに合わせることも可能です。

📦 インストール

このモデルを使用するには、transformersライブラリが必要です。以下のコマンドでインストールできます。

pip install transformers

💻 使用例

基本的な使用法

以下のコードを使用して、このモデルをマスク付き言語モデリングに直接使用できます。

from transformers import AutoTokenizer, AutoModelForMaskedLM

tokenizer = AutoTokenizer.from_pretrained("PartAI/TookaBERT-Base")
model = AutoModelForMaskedLM.from_pretrained("PartAI/TookaBERT-Base")

# 入力の準備
text = "شهر برلین در کشور <mask> واقع شده است."
encoded_input = tokenizer(text, return_tensors='pt')

# 順伝播
output = model(**encoded_input)

高度な使用法

以下のように推論パイプラインを使用することもできます。

from transformers import pipeline

inference_pipeline = pipeline('fill-mask', model="PartAI/TookaBERT-Base")
inference_pipeline("شهر برلین در کشور <mask> واقع شده است.")

また、このモデルを独自のデータセットでファインチューニングして、特定のタスクに合わせることもできます。

DeepSentiPers（センチメント分析）
ParsiNLU - Multiple-choice（多肢選択問題）

📚 ドキュメント

評価

TookaBERTモデルは、センチメント分析（SA）、テキスト分類、多肢選択問題、質問応答、固有表現認識（NER）など、幅広い自然言語処理の下流タスクで評価されています。以下は、いくつかの主要な性能結果です。

モデル名	DeepSentiPers (f1/acc)	MultiCoNER-v2 (f1/acc)	PQuAD (best_exact/best_f1/HasAns_exact/HasAns_f1)	FarsTail (f1/acc)	ParsiNLU-Multiple-choice (f1/acc)	ParsiNLU-Reading-comprehension (exact/f1)	ParsiNLU-QQP (f1/acc)
TookaBERT-large	85.66/85.78	69.69/94.07	75.56/88.06/70.24/87.83	89.71/89.72	36.13/35.97	33.6/60.5	82.72/82.63
TookaBERT-base	83.93/83.93	66.23/93.3	73.18/85.71/68.29/85.94	83.26/83.41	33.6/33.81	20.8/42.52	81.33/81.29
Shiraz	81.17/81.08	59.1/92.83	65.96/81.25/59.63/81.31	77.76/77.75	34.73/34.53	17.6/39.61	79.68/79.51
ParsBERT	80.22/80.23	64.91/93.23	71.41/84.21/66.29/84.57	80.89/80.94	35.34/35.25	20/39.58	80.15/80.07
XLM-V-base	83.43/83.36	58.83/92.23	73.26/85.69/68.21/85.56	81.1/81.2	35.28/35.25	8/26.66	80.1/79.96
XLM-RoBERTa-base	83.99/84.07	60.38/92.49	73.72/86.24/68.16/85.8	82.0/81.98	32.4/32.37	20.0/40.43	79.14/78.95
FaBERT	82.68/82.65	63.89/93.01	72.57/85.39/67.16/85.31	83.69/83.67	32.47/32.37	27.2/48.42	82.34/82.29
mBERT	78.57/78.66	60.31/92.54	71.79/84.68/65.89/83.99	82.69/82.82	33.41/33.09	27.2/42.18	79.19/79.29
AriaBERT	80.51/80.51	60.98/92.45	68.09/81.23/62.12/80.94	74.47/74.43	30.75/30.94	14.4/35.48	79.09/78.84