Japanese - Hubert - base开源日语语音模型 - 依托大量语料支持日语语音处理

首页

Japanese Hubert Base

由 rinna 开发

由rinna株式会社训练的日语HuBERT基础模型，基于约19,000小时的日语语音语料库ReazonSpeech v1训练。

语音识别

Transformers

日语开源协议:Apache-2.0 #日语语音特征提取 #自监督学习 #大规模语音预训练

下载量 4,550

发布时间 : 4/28/2023

模型简介

这是一个基于HuBERT架构的日语语音表示学习模型，主要用于语音特征提取和语音相关任务。

模型特点

日语语音优化

专门针对日语语音数据进行训练和优化

大规模训练数据

使用约19,000小时的日语语音语料库ReazonSpeech v1进行训练

HuBERT架构

采用HuBERT的自监督学习架构，通过隐藏单元掩码预测进行语音表示学习

模型能力

语音特征提取

语音表示学习

使用案例

语音处理

语音特征提取

从日语语音中提取高级特征表示

语音相关下游任务

可作为语音识别、语音分类等任务的预训练模型

🚀 `rinna/japanese-hubert-base`

这是由rinna株式会社训练的日语HuBERT基础模型，可用于处理日语语音相关任务。

🚀 快速开始

本模型是日语的HuBERT基础模型，基于Transformer架构，可用于语音处理任务。以下是使用该模型的基本步骤：

import soundfile as sf
from transformers import AutoFeatureExtractor, AutoModel

model_name = "rinna/japanese-hubert-base"
feature_extractor = AutoFeatureExtractor.from_pretrained(model_name)
model = AutoModel.from_pretrained(model_name)
model.eval()

raw_speech_16kHz, sr = sf.read(audio_file)
inputs = feature_extractor(
    raw_speech_16kHz,
    return_tensors="pt",
    sampling_rate=sr,
)
outputs = model(**inputs)

print(f"Input:  {inputs.input_values.size()}")  # [1, #samples]
print(f"Output: {outputs.last_hidden_state.size()}")  # [1, #frames, 768]

你也可以从这里获取fairseq的检查点文件。

✨ 主要特性

模型概述

该模型架构与原始的HuBERT基础模型相同，包含12个具有12个注意力头的Transformer层。
模型使用官方仓库中的代码进行训练，详细的训练配置可在同一仓库和原始论文中找到。

训练情况

该模型在约19,000小时的日语语音语料库ReazonSpeech v1上进行训练。
语料库链接：ReazonSpeech

贡献者

发布日期

2023年4月28日

📚 详细文档

如何引用该模型

@misc{rinna-japanese-hubert-base,
    title = {rinna/japanese-hubert-base},
    author = {Hono, Yukiya and Mitsui, Kentaro and Sawada, Kei},
    url = {https://huggingface.co/rinna/japanese-hubert-base}
}

@inproceedings{sawada2024release,
    title = {Release of Pre-Trained Models for the {J}apanese Language},
    author = {Sawada, Kei and Zhao, Tianyu and Shing, Makoto and Mitsui, Kentaro and Kaga, Akio and Hono, Yukiya and Wakatsuki, Toshiaki and Mitsuda, Koh},
    booktitle = {Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024)},
    month = {5},
    year = {2024},
    pages = {13898--13905},
    url = {https://aclanthology.org/2024.lrec-main.1213},
    note = {\url{https://arxiv.org/abs/2404.01657}}
}

参考文献

@article{hsu2021hubert,
    author = {Hsu, Wei-Ning and Bolte, Benjamin and Tsai, Yao-Hung Hubert and Lakhotia, Kushal and Salakhutdinov, Ruslan and Mohamed, Abdelrahman},
    journal = {IEEE/ACM Transactions on Audio, Speech, and Language Processing},
    title = {HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units},
    year = {2021},
    volume = {29},
    pages = {3451-3460},
    doi = {10.1109/TASLP.2021.3122291}
}