nitibench-ccl-human-finetuned-bge-m3オープンソースモデル - タイ語の法律クエリとベクトル相互作用検索を無料でサポート

ホーム

Nitibench Ccl Human Finetuned Bge M3

VISAI-AIによって開発

BAAI/bge-m3モデルをタイ語法律クエリデータでファインチューニングしたバージョンで、密検索、語彙マッチング、マルチベクトル相互作用をサポート

テキスト埋め込み

Safetensors

その他オープンソースライセンス:MIT #タイ語法律検索 #マルチモーダル埋め込み #高精度再ランキング

ダウンロード数 51

リリース時間 : 2/15/2025

モデル概要

これはタイ語法律テキストに最適化された文埋め込みモデルで、特に法律条項検索や類似度計算タスクに適しています。WangchanX-Legal-ThaiCCL-RAGデータセットでファインチューニングされており、法律分野での性能が向上しています。

モデル特徴

マルチモーダル検索能力

密ベクトル検索、語彙マッチング、マルチベクトル相互作用の3つの検索方式を同時にサポート

法律分野最適化

タイ語法律テキスト向けに特別にファインチューニングされており、法律条項検索タスクで優れた性能を発揮

自動化ファインチューニングプロセス

完全自動化されたデータ準備とモデルファインチューニングプロセスを採用し、モデル品質を確保

モデル能力

テキスト埋め込み生成

文類似度計算

法律条項検索

語彙重み分析

マルチベクトル相互作用マッチング

使用事例

法律情報検索

法律条項マッチング

ユーザークエリに基づいて関連法律条項を自動マッチング

NitiBench-CCLデータセットでHR@10 0.938の高精度を達成

税務相談サポート

税務相談システムが正確な法規制参照を提供するのを支援

NitiBench-TaxデータセットでHR@10が0.8に到達

インテリジェントカスタマーサポート

法律QAシステム

金融機関向けに自動化された法律質問回答を提供

🚀 ヒューマンファインチューニング済みBGE - M3 CCL

このモデルは、文書の類似度を測定するために、[BAAI/bge - m3](https://huggingface.co/BAAI/bge - m3) を [airesearch/WangchanX - Legal - ThaiCCL - RAG](https://huggingface.co/datasets/airesearch/WangchanX - Legal - ThaiCCL - RAG) のクエリでファインチューニングしたものです。

[📄 技術レポート]

🚀 クイックスタート

このモデルは、文書の類似度を計算するために、事前学習済みのBGE - M3モデルを特定のデータセットでファインチューニングしたものです。以下のセクションでは、インストール方法、使用例、モデルの性能などについて説明します。

✨ 主な機能

文書の密ベクトル表現を生成することができます。
文書の疎ベクトル表現（語彙的重み）を生成することができます。
文書のマルチベクトル表現（ColBERT）を生成することができます。
文書ペアの類似度スコアを計算することができます。

📦 インストール

以下のいずれかの方法でインストールすることができます。

方法1: ソースコードからインストール

git clone https://github.com/FlagOpen/FlagEmbedding.git
cd FlagEmbedding
pip install -e .

方法2: pipを使用してインストール

pip install -U FlagEmbedding

💻 使用例

基本的な使用法

テキストの埋め込みを生成する

from FlagEmbedding import BGEM3FlagModel

model = BGEM3FlagModel('VISAI-AI/nitibench-ccl-human-finetuned-bge-m3',  
                       use_fp16=True) # Setting use_fp16 to True speeds up computation with a slight performance degradation

sentences_1 = ["What is BGE M3?", "Defination of BM25"]
sentences_2 = ["BGE M3 is an embedding model supporting dense retrieval, lexical matching and multi-vector interaction.", 
               "BM25 is a bag-of-words retrieval function that ranks a set of documents based on the query terms appearing in each document"]

embeddings_1 = model.encode(sentences_1, 
                            batch_size=12, 
                            max_length=8192, # If you don't need such a long length, you can set a smaller value to speed up the encoding process.
                            )['dense_vecs']
embeddings_2 = model.encode(sentences_2)['dense_vecs']
similarity = embeddings_1 @ embeddings_2.T
print(similarity)
# [[0.6265, 0.3477], [0.3499, 0.678 ]]

高度な使用法

疎埋め込み（語彙的重み）の生成

from FlagEmbedding import BGEM3FlagModel

model = BGEM3FlagModel('VISAI-AI/nitibench-ccl-human-finetuned-bge-m3',  use_fp16=True) # Setting use_fp16 to True speeds up computation with a slight performance degradation

sentences_1 = ["สถาบันทางการเงินสามารถลงทุนในหลักทรัพย์ เป็นอัตราส่วนร้อยละสิบของเงินกองทุนทั้งหมดของสถาบันการเงินนั้น สำหรับการถือหรือมีหุ้นในทุกบริษัทรวมกันได้หรือไม่?",
               "ในกรณีที่ธนาคารแห่งประเทศไทยมีคำสั่งปิดกิจการของสถาบันการเงิน เนื่องสถาบันการเงินดำรงเงินกองทุนต่ำกว่าร้อยละสามสิบห้าของอัตราตามที่กำหนด จะต้องนำเสนอต่อบุคคลใดหรือหน่วยงานใดเพื่อเพิกถอนใบอนุญาตของสถาบันการเงินนั้น"]
sentences_2 = ["พระราชบัญญัติธุรกิจสถาบันการเงิน พ.ศ. 2551 มาตรา 33 ภายใต้บังคับมาตรา 34 และมาตรา 35 ให้สถาบันการเงินลงทุนในหลักทรัพย์เพื่อเป็นกรรมสิทธิ์ของตนได้ ตามหลักเกณฑ์ที่ธนาคารแห่งประเทศไทยประกาศกำหนด", 
               "พระราชบัญญัติธุรกิจสถาบันการเงิน พ.ศ. 2551 มาตรา 97 ในกรณีที่สถาบันการเงินดำรงเงินกองทุนต่ำกว่าร้อยละสามสิบห้าของอัตราตามที่กำหนดในมาตรา 30 ให้ธนาคารแห่งประเทศไทยมีคำสั่งปิดกิจการของสถาบันการเงินนั้น เว้นแต่ในกรณีที่ธนาคารแห่งประเทศไทยเห็นว่าการมีคำสั่งปิดกิจการจะก่อให้เกิดผลกระทบ หรือความเสียหายต่อระบบเศรษฐกิจโดยรวมอย่างรุนแรง ธนาคารแห่งประเทศไทยอาจยังไม่สั่งปิดกิจการของสถาบันการเงินก็ได้\nเมื่อธนาคารแห่งประเทศไทยมีคำสั่งปิดกิจการตามวรรคหนึ่งแล้ว ให้เสนอรัฐมนตรีเพิกถอนใบอนุญาตของสถาบันการเงินนั้น"]

output_1 = model.encode(sentences_1, return_dense=True, return_sparse=True, return_colbert_vecs=False)
output_2 = model.encode(sentences_2, return_dense=True, return_sparse=True, return_colbert_vecs=False)

# you can see the weight for each token:
print(model.convert_id_to_token(output_1['lexical_weights']))
# [{'สถาบัน': 0.126, 'การเงิน': 0.10956, 'สามารถ': 0.07, 'ลงทุน': 0.1417, 'ใน': 0.01715, 'หลัก': 0.0758, 'ทรัพย์': 0.1702, 'อัตรา': 0.04926, 'ส่วน': 0.06107, 'ร้อยละ': 0.09, 'สิบ': 0.14, 'เงิน': 0.05026, 'กองทุน': 0.1205, 'ทั้งหมด': 0.03644, 'ถือ': 0.0987, 'หุ้น': 0.0928, 'ในทุก': 0.04883, 'บริษัท': 0.0999, 'รวม': 0.0835, 'กันได้': 0.09814, 'หรือไม่': 0.0398},
#  {'กรณี': 0.0323, 'ธนาคาร': 0.08136, 'แห่งประเทศไทย': 0.151, 'คําสั่ง': 0.161, 'ปิด': 0.1583, 'กิจการ': 0.1199, 'สถาบัน': 0.08545, 'การเงิน': 0.1334, 'เนื่อง': 0.006992, 'ดํารง': 0.1523, 'เงิน': 0.12146, 'กองทุน': 0.1776, 'ต่ํากว่า': 0.1335, 'ร้อยละ': 0.10126, 'สาม': 0.02498, 'ห้า': 0.1158, 'อัตรา': 0.12256, 'กําหนด': 0.0572, 'จะต้อง': 0.07074, 'นําเสนอ': 0.1752, 'ต่อ': 0.0696, 'บุคคล': 0.0817, 'ใด': 0.0577, 'หรือ': 0.0248, 'หน่วยงาน': 0.076, 'เพ': 0.02034, 'ิก': 0.0921, 'ถอน': 0.1582, 'ใบ': 0.04617, 'อนุญาต': 0.179}]


# compute the scores via lexical mathcing
lexical_scores = model.compute_lexical_matching_score(output_1['lexical_weights'][0], output_2['lexical_weights'][0])
print(lexical_scores)
# 0.10838508605957031

print(model.compute_lexical_matching_score(output_1['lexical_weights'][0], output_1['lexical_weights'][1]))
# 0.06803131103515625

マルチベクトル（ColBERT）の生成

from FlagEmbedding import BGEM3FlagModel

model = BGEM3FlagModel('VISAI-AI/nitibench-ccl-human-finetuned-bge-m3',  use_fp16=True) 

sentences_1 = ["สถาบันทางการเงินสามารถลงทุนในหลักทรัพย์ เป็นอัตราส่วนร้อยละสิบของเงินกองทุนทั้งหมดของสถาบันการเงินนั้น สำหรับการถือหรือมีหุ้นในทุกบริษัทรวมกันได้หรือไม่?",
               "ในกรณีที่ธนาคารแห่งประเทศไทยมีคำสั่งปิดกิจการของสถาบันการเงิน เนื่องสถาบันการเงินดำรงเงินกองทุนต่ำกว่าร้อยละสามสิบห้าของอัตราตามที่กำหนด จะต้องนำเสนอต่อบุคคลใดหรือหน่วยงานใดเพื่อเพิกถอนใบอนุญาตของสถาบันการเงินนั้น"]
sentences_2 = ["พระราชบัญญัติธุรกิจสถาบันการเงิน พ.ศ. 2551 มาตรา 33 ภายใต้บังคับมาตรา 34 และมาตรา 35 ให้สถาบันการเงินลงทุนในหลักทรัพย์เพื่อเป็นกรรมสิทธิ์ของตนได้ ตามหลักเกณฑ์ที่ธนาคารแห่งประเทศไทยประกาศกำหนด", 
               "พระราชบัญญัติธุรกิจสถาบันการเงิน พ.ศ. 2551 มาตรา 97 ในกรณีที่สถาบันการเงินดำรงเงินกองทุนต่ำกว่าร้อยละสามสิบห้าของอัตราตามที่กำหนดในมาตรา 30 ให้ธนาคารแห่งประเทศไทยมีคำสั่งปิดกิจการของสถาบันการเงินนั้น เว้นแต่ในกรณีที่ธนาคารแห่งประเทศไทยเห็นว่าการมีคำสั่งปิดกิจการจะก่อให้เกิดผลกระทบ หรือความเสียหายต่อระบบเศรษฐกิจโดยรวมอย่างรุนแรง ธนาคารแห่งประเทศไทยอาจยังไม่สั่งปิดกิจการของสถาบันการเงินก็ได้\nเมื่อธนาคารแห่งประเทศไทยมีคำสั่งปิดกิจการตามวรรคหนึ่งแล้ว ให้เสนอรัฐมนตรีเพิกถอนใบอนุญาตของสถาบันการเงินนั้น"]

output_1 = model.encode(sentences_1, return_dense=True, return_sparse=True, return_colbert_vecs=True)
output_2 = model.encode(sentences_2, return_dense=True, return_sparse=True, return_colbert_vecs=True)

print(model.colbert_score(output_1['colbert_vecs'][0], output_2['colbert_vecs'][0]))
print(model.colbert_score(output_1['colbert_vecs'][0], output_2['colbert_vecs'][1]))
# tensor(0.5813)
# tensor(0.5718)

テキストペアのスコアを計算する

from FlagEmbedding import BGEM3FlagModel

model = BGEM3FlagModel('VISAI-AI/nitibench-ccl-human-finetuned-bge-m3',  use_fp16=True) 

sentences_1 = ["สถาบันทางการเงินสามารถลงทุนในหลักทรัพย์ เป็นอัตราส่วนร้อยละสิบของเงินกองทุนทั้งหมดของสถาบันการเงินนั้น สำหรับการถือหรือมีหุ้นในทุกบริษัทรวมกันได้หรือไม่?",
               "ในกรณีที่ธนาคารแห่งประเทศไทยมีคำสั่งปิดกิจการของสถาบันการเงิน เนื่องสถาบันการเงินดำรงเงินกองทุนต่ำกว่าร้อยละสามสิบห้าของอัตราตามที่กำหนด จะต้องนำเสนอต่อบุคคลใดหรือหน่วยงานใดเพื่อเพิกถอนใบอนุญาตของสถาบันการเงินนั้น"]
sentences_2 = ["พระราชบัญญัติธุรกิจสถาบันการเงิน พ.ศ. 2551 มาตรา 33 ภายใต้บังคับมาตรา 34 และมาตรา 35 ให้สถาบันการเงินลงทุนในหลักทรัพย์เพื่อเป็นกรรมสิทธิ์ของตนได้ ตามหลักเกณฑ์ที่ธนาคารแห่งประเทศไทยประกาศกำหนด", 
               "พระราชบัญญัติธุรกิจสถาบันการเงิน พ.ศ. 2551 มาตรา 97 ในกรณีที่สถาบันการเงินดำรงเงินกองทุนต่ำกว่าร้อยละสามสิบห้าของอัตราตามที่กำหนดในมาตรา 30 ให้ธนาคารแห่งประเทศไทยมีคำสั่งปิดกิจการของสถาบันการเงินนั้น เว้นแต่ในกรณีที่ธนาคารแห่งประเทศไทยเห็นว่าการมีคำสั่งปิดกิจการจะก่อให้เกิดผลกระทบ หรือความเสียหายต่อระบบเศรษฐกิจโดยรวมอย่างรุนแรง ธนาคารแห่งประเทศไทยอาจยังไม่สั่งปิดกิจการของสถาบันการเงินก็ได้\nเมื่อธนาคารแห่งประเทศไทยมีคำสั่งปิดกิจการตามวรรคหนึ่งแล้ว ให้เสนอรัฐมนตรีเพิกถอนใบอนุญาตของสถาบันการเงินนั้น"]

sentence_pairs = [[i,j] for i in sentences_1 for j in sentences_2]

print(model.compute_score(sentence_pairs, 
                          max_passage_length=128, # a smaller max length leads to a lower latency
                          weights_for_different_modes=[0.4, 0.2, 0.4])) # weights_for_different_modes(w) is used to do weighted sum: w[0]*dense_score + w[1]*sparse_score + w[2]*colbert_score

# {
#   'colbert': [0.5812647342681885, 0.5717734098434448, 0.6460118889808655, 0.8784525990486145],
#   'sparse': [0.1083984375, 0.07684326171875, 0.07061767578125, 0.314208984375],
#   'dense': [0.61865234375, 0.58935546875, 0.666015625, 0.8916015625],
#   'sparse+dense': [0.4485676884651184, 0.41851806640625, 0.4675496518611908, 0.6991373896598816],
#   'colbert+sparse+dense': [0.5016465187072754, 0.47982022166252136, 0.538934588432312, 0.7708634734153748]
# }

📚 ドキュメント

ファインチューニングの詳細

元の airesearch/WangchanX-Legal-ThaiCCL-RAG では、人間が文書を再ランキングし、関連性のない文書を削除する必要がありますが、このモデルは完全に自動化された環境でファインチューニングされました。具体的には、WangchanX - Legal - ThaiCCL - RAGデータセットのクエリと検索対象の法律条文のセットが与えられた場合、以下の手順に従います。

BAAI/bge-m3 を使用して、スコアが0.8以上のN個の肯定的な法律条文を検索します。
それらN個の文書の中から、BAAI/bge-reranker-v2-m3 を使用して文書を再ランキングし、再ランキングスコアが0.8未満の文書をフィルタリングして、最終的な肯定的な法律条文を取得します。
(2) の肯定的な文書を使用して、BGE - M3モデルをファインチューニングします。

モデルの性能

以下の表は、モデルの性能を示しています。

データセット	Top - K	HR@k	Multi HR@k	Recall@k	MRR@k	Multi MRR@k
NitiBench - CCL	1	0.735	–	0.735	0.735	–
NitiBench - CCL	5	0.906	–	0.906	0.805	–
NitiBench - CCL	10	0.938	–	0.938	0.809	–
NitiBench - Tax	1	0.480	0.140	0.255	0.480	0.255
NitiBench - Tax	5	0.740	0.220	0.411	0.565	0.320
NitiBench - Tax	10	0.800	0.280	0.499	0.574	0.333

🔧 技術詳細

このモデルは、事前学習済みのBGE - M3モデルをベースにしています。BGE - M3は、密検索、語彙的マッチング、マルチベクトル相互作用をサポートする埋め込みモデルです。ファインチューニングには、WangchanX - Legal - ThaiCCL - RAGデータセットを使用しています。

📄 ライセンス

このプロジェクトはMITライセンスの下で公開されています。

謝辞

WangchanXプログラムのスポンサーであるPTT、SCB、およびSCBXからの寛大な支援に心から感謝します。彼らの資金提供により、このプロジェクトが可能になりました。また、このプロジェクトを実現する上で重要な役割を果たしたVISTECとの貴重な協力にも感謝します。

Pirat PothavornにはNitiBenchでのモデル性能評価、Supavish Punchunにはモデルのファインチューニングに貢献していただいたことに感謝します。また、このオープンソースプロジェクトのすべての著者にも感謝します。

引用

BibTeX

@misc{akarajaradwong2025nitibenchcomprehensivestudiesllm,
      title={NitiBench: A Comprehensive Studies of LLM Frameworks Capabilities for Thai Legal Question Answering}, 
      author={Pawitsapak Akarajaradwong and Pirat Pothavorn and Chompakorn Chaksangchaichot and Panuthep Tasawong and Thitiwat Nopparatbundit and Sarana Nutanong},
      year={2025},
      eprint={2502.10868},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2502.10868}, 
}