roberta-base-use-qa-theseus-bg开源多语言模型 - 免费生成保加利亚语句子嵌入向量

首页

Roberta Base Use Qa Theseus Bg

由 rmihaylov 开发

这是一个多语言Roberta模型，可用于生成保加利亚语句子的嵌入向量。基于Sentence-BERT思想训练，教师模型为谷歌的USE模型。

文本嵌入

Transformers

其他开源协议:MIT #保加利亚语句子嵌入 #跨语言语义匹配 #渐进式模型压缩

下载量 15

发布时间 : 4/18/2022

模型简介

该模型用于生成保加利亚语句子的嵌入向量，适用于句子相似度计算等任务。通过渐进式模块替换技术进行了模型压缩。

模型特点

多语言支持

支持保加利亚语和英语的句子嵌入生成

区分大小写

模型区分大小写，如'bulgarian'和'Bulgarian'会被视为不同词汇

模型压缩

通过渐进式模块替换技术进行了模型压缩

基于翻译对训练

使用保加利亚语-英语平行语料库训练，翻译句子映射到相同向量空间

模型能力

保加利亚语句子嵌入生成

英语句子嵌入生成

句子相似度计算

使用案例

信息检索

问答系统

用于查找与问题最相关的答案

示例中展示了如何计算问题与候选答案的相似度

文本匹配

相似句子识别

识别语义相似的句子

🚀 ROBERTA BASE (cased) 在保加利亚语 - 英语私有并行数据上训练

这是一个多语言的Roberta模型，可用于创建保加利亚语句子的嵌入表示。该模型借鉴了 Sentence - BERT 的思想，其训练基于这样一个理念：翻译后的句子应与原句在向量空间中映射到相同的位置。

教师模型是 Google的USE模型。

此模型区分大小写，即 “bulgarian” 和 “Bulgarian” 会被视为不同的内容。

它在保加利亚语 - 英语私有并行数据上进行训练，随后通过渐进式模块替换进行了压缩。

🚀 快速开始

模型信息

属性	详情
推理	false
任务类型	句子相似度
支持语言	保加利亚语（bg）
许可证	MIT
训练数据集	oscar、chitanka、wikipedia
标签	torch

模型特点

多语言支持：可用于处理保加利亚语句子。
区分大小写：能够区分大小写不同的单词。
训练方式：基于翻译句子在向量空间映射相同位置的理念进行训练。
模型压缩：通过渐进式模块替换进行压缩。

📦 安装指南

文档未提供具体安装步骤，可参考 transformers 库的安装方式：

pip install transformers

💻 使用示例

基础用法

>>> import scipy
>>> import torch
>>> from transformers import AutoModel, AutoTokenizer
>>> 
>>> model = AutoModel.from_pretrained('rmihaylov/roberta-base-use-qa-theseus-bg')
>>> tokenizer = AutoTokenizer.from_pretrained('rmihaylov/roberta-base-use-qa-theseus-bg')
>>>
>>> query = "Какви са съставките на бисквитките?"
>>> 
>>> answers = [
>>>            "Бисквитката е печена или варена храна, която обикновено е малка, плоска и сладка.",
>>>            "Бисквитките обикновено съдържат брашно, захар и някакъв вид масло или мазнини. Те могат да включват други съставки като стафиди, овес, шоколадов чипс, ядки и др.",
>>>            "В повечето англоговорящи страни, с изключение на САЩ и Канада, хрупкавите бисквитки се наричат бисквити.",
>>>            "Бисквитите Chewier понякога се наричат бисквитки дори в Обединеното кралство. Някои бисквитки могат също да бъдат назовавани според формата им, като квадратчета с дата или барове.",
>>>            "Бисквитките или бисквитите могат да се произвеждат масово във фабрики, направени в малки пекарни или домашно приготвени.",
>>>            "Вариантите за бисквити или бисквити включват сандвич бисквити, като крем крем, Jammie Dodgers, Bourbons и Oreos, с пълнеж от ружа или конфитюр и понякога потопени в шоколад или друго сладко покритие.",
>>>            "Бисквитките често се сервират с напитки като мляко, кафе или чай.",
>>>            "Фабричните бисквитки се продават в магазини за хранителни стоки, магазини за удобство и автомати.",
>>>            "Американската употреба произлиза от холандското koekje „малка торта“, което е умалително от „koek“ („торта“), което произлиза от средно холандската дума „koke“.",
>>>            "Cookie Monster е Muppet в дългогодишното детско телевизионно шоу Sesame Street, който е най-известен с ненаситния си апетит към бисквитките и известните си фрази за ядене, като „Me want cookie!“, „Me eat cookie!“ (или просто „COOKIE!“) и „Om nom nom nom“ (казано през уста, пълна с храна).",
>>>            "Домашните бисквитки обикновено се правят от тесто, оформено на малки топчета и пуснато върху лист с бисквитки. След това се пекат във фурна за 5 до 15 минути, в зависимост от рецептата. Температурата на фурната варира от 250 до 350 градуса.",
>>>            "Повечето бисквитки със среден размер, ако са направени със захар, брашно и скъсяване, ще съдържат между 100 и 200 калории.",
>>>            ]
>>> 
>>> query_embedding = model.question(**tokenizer.encode_plus(query, return_tensors='pt')).detach().numpy()[0]
>>> 
>>> corpus, corpus_embeddings = [], []
>>> for answer in answers:
>>>     value_inputs = tokenizer.encode_plus(answer, answer, return_tensors='pt')
>>>     embedding = model.answer(**value_inputs).detach().numpy()[0]
>>>     corpus.append(answer)
>>>     corpus_embeddings.append(embedding)
>>> 
>>> distances = scipy.spatial.distance.cdist([query_embedding], corpus_embeddings, "cosine")[0]
>>> 
>>> results = zip(range(len(distances)), distances)
>>> results = sorted(results, key=lambda x: x[1])
>>> 
>>> print([[corpus[idx].strip(), (1.0 - distance)] for idx, distance in results])

[['Бисквитките обикновено съдържат брашно, захар и някакъв вид масло или мазнини. Те могат да включват други съставки като стафиди, овес, шоколадов чипс, ядки и др.',
  0.5449754306536151],
 ['Фабричните бисквитки се продават в магазини за хранителни стоки, магазини за удобство и автомати.',
  0.5049509545814316],
 ['В повечето англоговорящи страни, с изключение на САЩ и Канада, хрупкавите бисквитки се наричат \u200b\u200bбисквити.',
  0.5029661338050297],
 ['Бисквитките или бисквитите могат да се произвеждат масово във фабрики, направени в малки пекарни или домашно приготвени.',
  0.4991678233218718],
 ['Вариантите за бисквити или бисквити включват сандвич бисквити, като крем крем, Jammie Dodgers, Bourbons и Oreos, с пълнеж от ружа или конфитюр и понякога потопени в шоколад или друго сладко покритие.',
  0.49050297326146386],
 ['Повечето бисквитки със среден размер, ако са направени със захар, брашно и скъсяване, ще съдържат между 100 и 200 калории.',
  0.48950875441294106],
 ['Бисквитката е печена или варена храна, която обикновено е малка, плоска и сладка.',
  0.48646309549536737],
 ['Бисквитите Chewier понякога се наричат \u200b\u200bбисквитки дори в Обединеното кралство. Някои бисквитки могат също да бъдат назовавани според формата им, като квадратчета с дата или барове.',
  0.4840599482604815],
 ['Cookie Monster е Muppet в дългогодишното детско телевизионно шоу Sesame Street, който е най-известен с ненаситния си апетит към бисквитките и известните си фрази за ядене, като „Me want cookie!“, „Me eat cookie!“ (или просто „COOKIE!“) и „Om nom nom nom“ (казано през уста, пълна с храна).',
  0.45209677893728206],
 ['Домашните бисквитки обикновено се правят от тесто, оформено на малки топчета и пуснато върху лист с бисквитки. След това се пекат във фурна за 5 до 15 минути, в зависимост от рецептата. Температурата на фурната варира от 250 до 350 градуса.',
  0.4511516464302119],
 ['Бисквитките често се сервират с напитки като мляко, кафе или чай.',
  0.42364528401677803],
 ['Американската употреба произлиза от холандското koekje „малка торта“, което е умалително от „koek“ („торта“), което произлиза от средно холандската дума „koke“.',
  0.3267314582662877]]