sft-sql-embeddingオープンソースモデル - 無料でSQLの意味的類似度計算と検索タスクを実現する

ホーム

Sft Sql Embedding

s2593817によって開発

これはsentence-transformersライブラリを微調整したSQL文埋め込みモデルで、SQLクエリ文を768次元のベクトル空間にマッピングし、セマンティック類似度計算と検索タスクに使用できます。

テキスト埋め込み #SQLセマンティック埋め込み #高次元ベクトルマッピング #データベースクエリの類似度

ダウンロード数 793

リリース時間 : 8/12/2024

モデル概要

このモデルはSQLクエリ文に特化して最適化されており、SQL文を高次元ベクトル表現に変換し、セマンティック類似度計算、SQLクエリ検索などのタスクをサポートします。

モデル特徴

SQL文専用埋め込み

SQLクエリ文に特化して微調整され、SQL構文とセマンティック特徴をよりよく捉えることができます。

高次元ベクトル表現

SQL文を768次元の密集ベクトル空間にマッピングし、豊富なセマンティック情報を保持します。

多タスクサポート

セマンティック類似度計算、セマンティック検索、テキスト分類などの様々な下流タスクに使用できます。

モデル能力

SQL文のベクトル化

SQLセマンティック類似度計算

SQLクエリ検索

SQLクエリクラスタリング

使用事例

データベース管理

類似SQLクエリ検索

データベースクエリログからセマンティック的に類似したSQL文を検索します。

実行意図が類似したクエリを効果的に識別できます。

SQLクエリの重複排除

ベクトル類似度を使って重複または高度に類似したクエリを検出します。

冗長なクエリ分析作業を削減します。

クエリ最適化

クエリパターン識別

クラスタリング分析によって一般的なクエリパターンを識別します。

データベースインデックス設計の最適化に役立ちます。

🚀 基于sentence-transformers/all-mpnet-base-v2の文変換器

このモデルは、sentence-transformers ライブラリをベースに、sentence-transformers/all-mpnet-base-v2 から微調整されたものです。文や段落を768次元の密ベクトル空間にマッピングし、意味的なテキスト類似度計算、意味検索、言い換え挖掘、テキスト分類、クラスタリングなどのタスクに使用できます。

🚀 クイックスタート

このモデルは、sentence-transformers ライブラリをベースに、sentence-transformers/all-mpnet-base-v2 から微調整されたものです。文や段落を768次元の密ベクトル空間にマッピングし、意味的なテキスト類似度、意味検索、言い換え挖掘、テキスト分類、クラスタリングなどの様々なタスクに使用できます。

✨ 主な機能

マルチタスク対応：意味的なテキスト類似度計算、意味検索、言い換え挖掘、テキスト分類、クラスタリングなどに使用できます。
高次元ベクトルマッピング：文や段落を768次元の密ベクトル空間にマッピングします。

📦 インストール

まず、Sentence Transformers ライブラリをインストールする必要があります。

pip install -U sentence-transformers

💻 使用例

基本的な使用法

from sentence_transformers import SentenceTransformer

# モデルを Hugging Face Hub からダウンロードする
model = SentenceTransformer("s2593817/sft-sql-embedding")
# 推論を実行する
sentences = [
    'SELECT alias1.col1 FROM table1 AS alias1 JOIN table2 AS alias2 ON alias1.col2 = alias2.col2 JOIN table3 AS alias3 ON alias2.col3 = alias3.col3 WHERE alias3.col4 = str INTERSECT SELECT alias1.col1 FROM table1 AS alias1 JOIN table2 AS alias2 ON alias1.col2 = alias2.col2 JOIN table3 AS alias3 ON alias2.col3 = alias3.col3 WHERE alias3.col4 = str',
    'SELECT count(col1) FROM table1 WHERE col2 = num',
    'SELECT count(DISTINCT col1) FROM table1',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 768]

# 埋め込みベクトルの類似度スコアを取得する
similarities = model.similarity(embeddings, embeddings)
print(similarities.shape)
# [3, 3]

📚 ドキュメント

モデル詳細

モデルの説明

属性	詳細
モデルタイプ	文変換器
ベースモデル	sentence-transformers/all-mpnet-base-v2
最大シーケンス長	384トークン
出力次元	768トークン
類似度関数	コサイン類似度

モデルの出所

ドキュメント：Sentence Transformers ドキュメント
リポジトリ：GitHub 上の Sentence Transformers
Hugging Face：Hugging Face 上の Sentence Transformers

完全なモデルアーキテクチャ

SentenceTransformer(
  (0): Transformer({'max_seq_length': 384, 'do_lower_case': False}) with Transformer model: MPNetModel 
  (1): Pooling({'word_embedding_dimension': 768, 'pooling_mode_cls_token': False, 'pooling_mode_mean_tokens': True, 'pooling_mode_max_tokens': False, 'pooling_mode_mean_sqrt_len_tokens': False, 'pooling_mode_weightedmean_tokens': False, 'pooling_mode_lasttoken': False, 'include_prompt': True})
  (2): Normalize()
)

🔧 技術詳細

学習詳細

学習データセット

未命名データセット

規模：300,000個の学習サンプル
列名：sentence1、sentence2、および score

最初の1000個のサンプルに基づく近似統計情報：

	sentence1	sentence2	score
タイプ	文字列	文字列	浮動小数点数
詳細	最小: 8トークン平均: 38.49トークン最大: 189トークン	最小: 7トークン平均: 37.44トークン最大: 153トークン	最小: 0.04 平均: 0.36 最大: 1.0

サンプル例：

sentence1	sentence2	score
`SELECT DISTINCT count(DISTINCT alias4.col1) , alias3.col2 FROM table1 AS alias1 JOIN table2 AS alias2 ON alias1.col3 = alias2.col3 JOIN table3 AS alias3 ON alias3.col4 = alias1.col4 JOIN table4 AS alias4 ON alias3.col4 = alias4.col5 WHERE alias2.col6 = str GROUP BY alias3.col2 ORDER BY count(DISTINCT alias4.col1) DESC`	`SELECT count(*) FROM table1 WHERE col1 = str`	`0.14221014492753623`
`SELECT DISTINCT count(alias2.col1) FROM table1 AS alias1 JOIN table2 AS alias2 ON alias1.col2 = alias2.col2 WHERE alias1.col3 = str`	`SELECT alias3.col1 FROM table1 AS alias1 JOIN table2 AS alias2 ON alias1.col2 = alias2.col2 JOIN table3 AS alias3 ON alias2.col3 = alias3.col3 WHERE alias1.col4 = str AND alias1.col5 = str`	`0.5468686868686868`
`SELECT count(*) FROM table1`	`SELECT count(*) FROM table1 WHERE col1 LIKE str`	`0.6269230769230769`

損失関数：CoSENTLoss、パラメータは以下の通り：

{
    "scale": 20.0,
    "similarity_fct": "pairwise_cos_sim"
}

学習ハイパーパラメータ

非デフォルトのハイパーパラメータ

per_device_train_batch_size: 160
learning_rate: 2e-05
num_train_epochs: 8
warmup_ratio: 0.2
fp16: True
dataloader_num_workers: 16
batch_sampler: no_duplicates

すべてのハイパーパラメータ

クリックして展開

overwrite_output_dir: False
do_predict: False
eval_strategy: no
prediction_loss_only: True
per_device_train_batch_size: 160
per_device_eval_batch_size: 8
per_gpu_train_batch_size: None
per_gpu_eval_batch_size: None
gradient_accumulation_steps: 1
eval_accumulation_steps: None
learning_rate: 2e-05
weight_decay: 0.0
adam_beta1: 0.9
adam_beta2: 0.999
adam_epsilon: 1e-08
max_grad_norm: 1.0
num_train_epochs: 8
max_steps: -1
lr_scheduler_type: linear
lr_scheduler_kwargs: {}
warmup_ratio: 0.2
warmup_steps: 0
log_level: passive
log_level_replica: warning
log_on_each_node: True
logging_nan_inf_filter: True
save_safetensors: True
save_on_each_node: False
save_only_model: False
restore_callback_states_from_checkpoint: False
no_cuda: False
use_cpu: False
use_mps_device: False
seed: 42
data_seed: None
jit_mode_eval: False
use_ipex: False
bf16: False
fp16: True
fp16_opt_level: O1
half_precision_backend: auto
bf16_full_eval: False
fp16_full_eval: False
tf32: None
local_rank: 0
ddp_backend: None
tpu_num_cores: None
tpu_metrics_debug: False
debug: []
dataloader_drop_last: False
dataloader_num_workers: 16
dataloader_prefetch_factor: None
past_index: -1
disable_tqdm: False
remove_unused_columns: True
label_names: None
load_best_model_at_end: False
ignore_data_skip: False
fsdp: []
fsdp_min_num_params: 0
fsdp_config: {'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}
fsdp_transformer_layer_cls_to_wrap: None
accelerator_config: {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}
deepspeed: None
label_smoothing_factor: 0.0
optim: adamw_torch
optim_args: None
adafactor: False
group_by_length: False
length_column_name: length
ddp_find_unused_parameters: None
ddp_bucket_cap_mb: None
ddp_broadcast_buffers: False
dataloader_pin_memory: True
dataloader_persistent_workers: False
skip_memory_metrics: True
use_legacy_prediction_loop: False
push_to_hub: False
resume_from_checkpoint: None
hub_model_id: None
hub_strategy: every_save
hub_private_repo: False
hub_always_push: False
gradient_checkpointing: False
gradient_checkpointing_kwargs: None
include_inputs_for_metrics: False
eval_do_concat_batches: True
fp16_backend: auto
push_to_hub_model_id: None
push_to_hub_organization: None
mp_parameters:
auto_find_batch_size: False
full_determinism: False
torchdynamo: None
ray_scope: last
ddp_timeout: 1800
torch_compile: False
torch_compile_backend: None
torch_compile_mode: None
dispatch_batches: None
split_batches: None
include_tokens_per_second: False
include_num_input_tokens_seen: False
neftune_noise_alpha: None
optim_target_modules: None
batch_eval_metrics: False
eval_on_start: False
batch_sampler: no_duplicates
multi_dataset_batch_sampler: proportional

学習ログ