english-phrases-bible开源模型 - 免费部署助力语义搜索，精准文本向量映射

首页

English Phrases Bible

由 iamholmes 开发

基于DistilBert TAS-B模型的句子嵌入模型，针对语义搜索任务优化，可将文本映射到768维向量空间

文本嵌入

Transformers

开源协议:Apache-2.0 #语义搜索优化 #高效向量编码 #问答匹配

下载量 28

发布时间 : 4/27/2022

模型简介

该模型是DistilBert TAS-B模型的sentence-transformers实现版本，专门用于生成句子和段落的语义嵌入向量，适用于信息检索和语义相似度计算任务

模型特点

高效语义编码

基于轻量级DistilBert架构，提供高效的句子和段落语义编码能力

搜索优化

专门针对信息检索和语义搜索任务进行优化

高维向量空间

将文本映射到768维稠密向量空间，捕捉丰富语义信息

模型能力

句子嵌入生成

语义相似度计算

信息检索

文档排序

使用案例

信息检索

问答系统

通过计算查询与候选答案的语义相似度，实现精准问答匹配

可有效识别与问题语义最相关的答案

文档搜索

用于构建基于语义的文档搜索引擎

相比关键词搜索能提供更相关的结果

内容推荐

🚀 sentence-transformers/msmarco-distilbert-base-tas-b

这是一个将 DistilBert TAS - B 模型迁移到 sentence-transformers 的模型。它能将句子和段落映射到 768 维的密集向量空间，并针对语义搜索任务进行了优化。

🚀 快速开始

本模型可通过两种方式使用，下面为你详细介绍。

📦 安装指南

若要使用此模型，你需要安装 sentence-transformers：

pip install -U sentence-transformers

💻 使用示例

基础用法（Sentence - Transformers）

当你安装了 sentence-transformers 后，使用该模型会变得非常简单：

from sentence_transformers import SentenceTransformer, util

query = "How many people live in London?"
docs = ["Around 9 Million people live in London", "London is known for its financial district"]

#Load the model
model = SentenceTransformer('sentence-transformers/msmarco-distilbert-base-tas-b')

#Encode query and documents
query_emb = model.encode(query)
doc_emb = model.encode(docs)

#Compute dot score between query and all document embeddings
scores = util.dot_score(query_emb, doc_emb)[0].cpu().tolist()

#Combine docs & scores
doc_score_pairs = list(zip(docs, scores))

#Sort by decreasing score
doc_score_pairs = sorted(doc_score_pairs, key=lambda x: x[1], reverse=True)

#Output passages & scores
for doc, score in doc_score_pairs:
    print(score, doc)

高级用法（HuggingFace Transformers）

若未安装 sentence-transformers，你可以按以下方式使用该模型：首先，将输入传递给 Transformer 模型，然后对上下文词嵌入应用正确的池化操作。

from transformers import AutoTokenizer, AutoModel
import torch

#CLS Pooling - Take output from first token
def cls_pooling(model_output):
    return model_output.last_hidden_state[:,0]

#Encode text
def encode(texts):
    # Tokenize sentences
    encoded_input = tokenizer(texts, padding=True, truncation=True, return_tensors='pt')

    # Compute token embeddings
    with torch.no_grad():
        model_output = model(**encoded_input, return_dict=True)

    # Perform pooling
    embeddings = cls_pooling(model_output)

    return embeddings


# Sentences we want sentence embeddings for
query = "How many people live in London?"
docs = ["Around 9 Million people live in London", "London is known for its financial district"]

# Load model from HuggingFace Hub
tokenizer = AutoTokenizer.from_pretrained("sentence-transformers/msmarco-distilbert-base-tas-b")
model = AutoModel.from_pretrained("sentence-transformers/msmarco-distilbert-base-tas-b")

#Encode query and docs
query_emb = encode(query)
doc_emb = encode(docs)

#Compute dot score between query and all document embeddings
scores = torch.mm(query_emb, doc_emb.transpose(0, 1))[0].cpu().tolist()

#Combine docs & scores
doc_score_pairs = list(zip(docs, scores))

#Sort by decreasing score
doc_score_pairs = sorted(doc_score_pairs, key=lambda x: x[1], reverse=True)

#Output passages & scores
for doc, score in doc_score_pairs:
    print(score, doc)

📚 详细文档

评估结果

若要对该模型进行自动化评估，请参考 Sentence Embeddings Benchmark：https://seb.sbert.net

完整模型架构

SentenceTransformer(
  (0): Transformer({'max_seq_length': 512, 'do_lower_case': False}) with Transformer model: DistilBertModel 
  (1): Pooling({'word_embedding_dimension': 768, 'pooling_mode_cls_token': True, 'pooling_mode_mean_tokens': False, 'pooling_mode_max_tokens': False, 'pooling_mode_mean_sqrt_len_tokens': False})
)