english-phrases-bible開源模型 - 免費部署助力語義搜索，精準文本向量映射

首頁

English Phrases Bible

由iamholmes開發

基於DistilBert TAS-B模型的句子嵌入模型，針對語義搜索任務優化，可將文本映射到768維向量空間

文本嵌入

Transformers

開源協議:Apache-2.0 #語義搜索優化 #高效向量編碼 #問答匹配

下載量 28

發布時間 : 4/27/2022

模型概述

該模型是DistilBert TAS-B模型的sentence-transformers實現版本，專門用於生成句子和段落的語義嵌入向量，適用於信息檢索和語義相似度計算任務

模型特點

高效語義編碼

基於輕量級DistilBert架構，提供高效的句子和段落語義編碼能力

搜索優化

專門針對信息檢索和語義搜索任務進行優化

高維向量空間

將文本映射到768維稠密向量空間，捕捉豐富語義信息

模型能力

句子嵌入生成

語義相似度計算

信息檢索

文檔排序

使用案例

信息檢索

問答系統

通過計算查詢與候選答案的語義相似度，實現精準問答匹配

可有效識別與問題語義最相關的答案

文檔搜索

用於構建基於語義的文檔搜索引擎

相比關鍵詞搜索能提供更相關的結果

內容推薦

相關內容推薦

基於內容語義相似度推薦相關文章或產品

提高推薦準確性和用戶滿意度

🚀 sentence-transformers/msmarco-distilbert-base-tas-b

這是一個將 DistilBert TAS - B 模型遷移到 sentence-transformers 的模型。它能將句子和段落映射到 768 維的密集向量空間，並針對語義搜索任務進行了優化。

🚀 快速開始

本模型可通過兩種方式使用，下面為你詳細介紹。

📦 安裝指南

若要使用此模型，你需要安裝 sentence-transformers：

pip install -U sentence-transformers

💻 使用示例

基礎用法（Sentence - Transformers）

當你安裝了 sentence-transformers 後，使用該模型會變得非常簡單：

from sentence_transformers import SentenceTransformer, util

query = "How many people live in London?"
docs = ["Around 9 Million people live in London", "London is known for its financial district"]

#Load the model
model = SentenceTransformer('sentence-transformers/msmarco-distilbert-base-tas-b')

#Encode query and documents
query_emb = model.encode(query)
doc_emb = model.encode(docs)

#Compute dot score between query and all document embeddings
scores = util.dot_score(query_emb, doc_emb)[0].cpu().tolist()

#Combine docs & scores
doc_score_pairs = list(zip(docs, scores))

#Sort by decreasing score
doc_score_pairs = sorted(doc_score_pairs, key=lambda x: x[1], reverse=True)

#Output passages & scores
for doc, score in doc_score_pairs:
    print(score, doc)

高級用法（HuggingFace Transformers）

若未安裝 sentence-transformers，你可以按以下方式使用該模型：首先，將輸入傳遞給 Transformer 模型，然後對上下文詞嵌入應用正確的池化操作。

from transformers import AutoTokenizer, AutoModel
import torch

#CLS Pooling - Take output from first token
def cls_pooling(model_output):
    return model_output.last_hidden_state[:,0]

#Encode text
def encode(texts):
    # Tokenize sentences
    encoded_input = tokenizer(texts, padding=True, truncation=True, return_tensors='pt')

    # Compute token embeddings
    with torch.no_grad():
        model_output = model(**encoded_input, return_dict=True)

    # Perform pooling
    embeddings = cls_pooling(model_output)

    return embeddings


# Sentences we want sentence embeddings for
query = "How many people live in London?"
docs = ["Around 9 Million people live in London", "London is known for its financial district"]

# Load model from HuggingFace Hub
tokenizer = AutoTokenizer.from_pretrained("sentence-transformers/msmarco-distilbert-base-tas-b")
model = AutoModel.from_pretrained("sentence-transformers/msmarco-distilbert-base-tas-b")

#Encode query and docs
query_emb = encode(query)
doc_emb = encode(docs)

#Compute dot score between query and all document embeddings
scores = torch.mm(query_emb, doc_emb.transpose(0, 1))[0].cpu().tolist()

#Combine docs & scores
doc_score_pairs = list(zip(docs, scores))

#Sort by decreasing score
doc_score_pairs = sorted(doc_score_pairs, key=lambda x: x[1], reverse=True)

#Output passages & scores
for doc, score in doc_score_pairs:
    print(score, doc)

📚 詳細文檔

評估結果

若要對該模型進行自動化評估，請參考 Sentence Embeddings Benchmark：https://seb.sbert.net

完整模型架構

SentenceTransformer(
  (0): Transformer({'max_seq_length': 512, 'do_lower_case': False}) with Transformer model: DistilBertModel 
  (1): Pooling({'word_embedding_dimension': 768, 'pooling_mode_cls_token': True, 'pooling_mode_mean_tokens': False, 'pooling_mode_max_tokens': False, 'pooling_mode_mean_sqrt_len_tokens': False})
)