マラーティ語文類似度（MarathiSentenceSimilarity）オープンソースモデル - 無料でマラーティ語のテキストをベクトル空間にマッピング

ホーム

Marathisentencesimilarity

sangambhamareによって開発

SBERTアーキテクチャに基づくマラーティー語文埋め込みモデルで、テキストを768次元ベクトル空間にマッピングできます。

テキスト埋め込み #マラーティー語の意味的類似度 #768次元ベクトル埋め込み #マルチタスクNLPサポート

ダウンロード数 240

リリース時間 : 7/19/2025

モデル概要

このモデルは、マラーティー語（Marathi）のテキストを処理するために特別に設計されており、文間の意味的類似度を計算でき、複数の下流NLPタスクをサポートします。

モデル特徴

マルチタスクサポート

意味的類似度計算、意味的検索、テキスト分類などの複数のNLPタスクをサポートします。

効率的なベクトル化

文を効率的に768次元の密ベクトル空間にマッピングし、意味情報を保持します。

長いテキスト処理

最大512トークンのシーケンス長をサポートし、段落レベルのテキストを処理できます。

モデル能力

意味的テキスト類似度計算

意味的検索

言い換えマイニング

テキスト分類

テキストクラスタリング

使用事例

情報検索

マラーティー語ドキュメント検索

クエリの意味に基づいて関連するドキュメントを照合します。

非正確一致の場合のリコール率を向上させることができます。

コンテンツ分析

ニュース記事の重複排除

同じイベントを報道する異なるニュース記事を識別します。

コンテンツの重複率を効果的に低下させます。

🚀 l3cube-pune/marathi-sentence-similarity-sbertに基づくSentenceTransformer

このモデルは、l3cube-pune/marathi-sentence-similarity-sbert から微調整された sentence-transformers モデルです。文章や段落を768次元の密ベクトル空間にマッピングし、意味的な文章の類似性、意味検索、言い換えマイニング、文章分類、クラスタリングなどに使用できます。

✨ 主な機能

文章や段落を768次元の密ベクトル空間にマッピングすることができます。
意味的な文章の類似性、意味検索、言い換えマイニング、文章分類、クラスタリングなどのタスクに使用できます。

📦 インストール

まず、Sentence Transformersライブラリをインストールします。

pip install -U sentence-transformers

💻 使用例

基本的な使用法

from sentence_transformers import SentenceTransformer

# 🤗 Hubからダウンロード
model = SentenceTransformer("sentence_transformers_model_id")
# 推論を実行
sentences = [
    'प्रादेशिक आणि आंतरराष्ट्रीय नॉन-प्रसार विषयांवर संवाद आणि वाटाघाटीद्वारे लक्ष दिले पाहिजे.',
    'दुसरा प्रस्ताव असा होता की प्रादेशिक आणि आंतरराष्ट्रीय नॉन-प्रसार-विषयांवर संवाद आणि वाटाघाटीद्वारे लक्ष दिले पाहिजे.',
    'अमेरिकेच्या बॉय स्काऊट्स समलिंगीवरील बंदीवर मतदानावर विलंब करतात',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 768]

# 埋め込みベクトルの類似度スコアを取得
similarities = model.similarity(embeddings, embeddings)
print(similarities.shape)
# [3, 3]

📚 ドキュメント

モデルの詳細

モデルの説明

属性	详情
モデルタイプ	Sentence Transformer
ベースモデル	l3cube-pune/marathi-sentence-similarity-sbert
最大シーケンス長	512トークン
出力次元数	768次元
類似度関数	コサイン類似度

モデルのソース

ドキュメント：Sentence Transformers Documentation
リポジトリ：Sentence Transformers on GitHub
Hugging Face：Sentence Transformers on Hugging Face

全モデルアーキテクチャ

SentenceTransformer(
  (0): Transformer({'max_seq_length': 512, 'do_lower_case': False}) with Transformer model: BertModel 
  (1): Pooling({'word_embedding_dimension': 768, 'pooling_mode_cls_token': False, 'pooling_mode_mean_tokens': True, 'pooling_mode_max_tokens': False, 'pooling_mode_mean_sqrt_len_tokens': False, 'pooling_mode_weightedmean_tokens': False, 'pooling_mode_lasttoken': False, 'include_prompt': True})
)

学習の詳細

学習データセット

無名データセット

サイズ：5,748個の学習サンプル
列：sentence_0、sentence_1、label

最初の1000サンプルに基づく概算統計：

	sentence_0	sentence_1	label
タイプ	文字列	文字列	浮動小数点数
詳細	最小：5トークン平均：16.13トークン最大：67トークン	最小：5トークン平均：16.26トークン最大：55トークン	最小：0.0 平均：0.55 最大：1.0

サンプル：

sentence_0	sentence_1	label
`बोलताना त्या माणसाने आपला सनग्लासेस काढून घेतला.`	`कठोर टोपी घातलेला माणूस बोलताना त्याचे चष्मा काढून टाकतो.`	`0.6799999999999999`
`दिवाणखान्यात लोकांचा एक गट.`	`चार लोकांचा एक गट राक्षस मशरूमच्या मागे चालत आहे.`	`0.16`
`अ‍ॅम्नेस्टी इंटरनॅशनलचा अहवाल सशस्त्र हिंसाचाराला विरोध करणार्‍या सेफरवर्ल्डसारख्या युरोपियन आणि आंतरराष्ट्रीय गैर-सरकारी संस्थांनी संकलित केला होता.`	`अ‍ॅम्नेस्टी आंतरराष्ट्रीय अहवाल युरोपियन आणि आंतरराष्ट्रीय गैर-सरकारी मंचांनी संकलित केला होता.`	`0.64`

損失関数：CosineSimilarityLoss これらのパラメータを使用：
```
{
    "loss_fct": "torch.nn.modules.loss.MSELoss"
}
```

学習ハイパーパラメータ

デフォルトではないハイパーパラメータ

num_train_epochs：4
multi_dataset_batch_sampler：round_robin

すべてのハイパーパラメータ

クリックして展開

overwrite_output_dir：False
do_predict：False
eval_strategy：no
prediction_loss_only：True
per_device_train_batch_size：8
per_device_eval_batch_size：8
per_gpu_train_batch_size：None
per_gpu_eval_batch_size：None
gradient_accumulation_steps：1
eval_accumulation_steps：None
torch_empty_cache_steps：None
learning_rate：5e-05
weight_decay：0.0
adam_beta1：0.9
adam_beta2：0.999
adam_epsilon：1e-08
max_grad_norm：1
num_train_epochs：4
max_steps：-1
lr_scheduler_type：linear
lr_scheduler_kwargs：{}
warmup_ratio：0.0
warmup_steps：0
log_level：passive
log_level_replica：warning
log_on_each_node：True
logging_nan_inf_filter：True
save_safetensors：True
save_on_each_node：False
save_only_model：False
restore_callback_states_from_checkpoint：False
no_cuda：False
use_cpu：False
use_mps_device：False
seed：42
data_seed：None
jit_mode_eval：False
use_ipex：False
bf16：False
fp16：False
fp16_opt_level：O1
half_precision_backend：auto
bf16_full_eval：False
fp16_full_eval：False
tf32：None
local_rank：0
ddp_backend：None
tpu_num_cores：None
tpu_metrics_debug：False
debug：[]
dataloader_drop_last：False
dataloader_num_workers：0
dataloader_prefetch_factor：None
past_index：-1
disable_tqdm：False
remove_unused_columns：True
label_names：None
load_best_model_at_end：False
ignore_data_skip：False
fsdp：[]
fsdp_min_num_params：0
fsdp_config：{'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}
fsdp_transformer_layer_cls_to_wrap：None
accelerator_config：{'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}
deepspeed：None
label_smoothing_factor：0.0
optim：adamw_torch
optim_args：None
adafactor：False
group_by_length：False
length_column_name：length
ddp_find_unused_parameters：None
ddp_bucket_cap_mb：None
ddp_broadcast_buffers：False
dataloader_pin_memory：True
dataloader_persistent_workers：False
skip_memory_metrics：True
use_legacy_prediction_loop：False
push_to_hub：False
resume_from_checkpoint：None
hub_model_id：None
hub_strategy：every_save
hub_private_repo：None
hub_always_push：False
hub_revision：None
gradient_checkpointing：False
gradient_checkpointing_kwargs：None
include_inputs_for_metrics：False
include_for_metrics：[]
eval_do_concat_batches：True
fp16_backend：auto
push_to_hub_model_id：None
push_to_hub_organization：None
mp_parameters：
auto_find_batch_size：False
full_determinism：False
torchdynamo：None
ray_scope：last
ddp_timeout：1800
torch_compile：False
torch_compile_backend：None
torch_compile_mode：None
include_tokens_per_second：False
include_num_input_tokens_seen：False
neftune_noise_alpha：None
optim_target_modules：None
batch_eval_metrics：False
eval_on_start：False
use_liger_kernel：False
liger_kernel_config：None
eval_use_gather_object：False
average_tokens_across_devices：False
prompts：None
batch_sampler：batch_sampler
multi_dataset_batch_sampler：round_robin

学習ログ

エポック	ステップ	学習損失
0.6954	500	0.0223
1.3908	1000	0.0172
2.0862	1500	0.0109
2.7816	2000	0.0069
3.4771	2500	0.0055

フレームワークのバージョン

Python：3.11.13
Sentence Transformers：4.1.0
Transformers：4.53.2
PyTorch：2.6.0+cu124
Accelerate：1.8.1
Datasets：2.14.4
Tokenizers：0.21.2

📄 引用

BibTeX

Sentence Transformers

@inproceedings{reimers-2019-sentence-bert,
    title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
    author = "Reimers, Nils and Gurevych, Iryna",
    booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
    month = "11",
    year = "2019",
    publisher = "Association for Computational Linguistics",
    url = "https://arxiv.org/abs/1908.10084",
}