ConvLLaVA-JP-1.3b-1280开源日语视觉语言模型 - 支持高分辨率图像输入对话

首页

Convllava JP 1.3b 1280

由 toshi456 开发

ConvLLaVA-JP是一款支持高分辨率输入的日语视觉语言模型，能够就输入图像进行对话。

图像生成文本

Transformers

日语#日语视觉问答 #高分辨率图像理解 #多阶段联合训练

下载量 31

发布时间 : 6/14/2024

模型简介

该模型结合了图像编码器和文本解码器，支持1280x1280高分辨率输入，能够进行图像描述生成和视觉问答等任务。

模型特点

高分辨率支持

支持1280x1280高分辨率图像输入，能够捕捉更丰富的视觉细节

多阶段训练

采用三阶段训练策略，先训练视觉投影器，再联合训练图像编码器和语言模型，最后进行微调

日语优化

专门针对日语进行训练和优化，在日语视觉语言任务上表现良好

模型能力

图像描述生成

视觉问答

图像对话

高分辨率图像理解

使用案例

图像理解

图像内容描述

对输入图像生成详细的日语描述

能够准确识别图像中的物体及其关系

视觉问答

回答关于图像内容的日语问题

在JA-VG-VQA-500和JA-VLM-Bench-In-the-Wild等基准测试中表现良好

人机交互

基于图像的对话系统

与用户就图像内容进行自然语言对话

能够理解复杂问题并给出相关回答

🚀 ConvLLaVA-JP模型卡片

ConvLLaVA-JP是一款视觉语言模型，能够针对输入的图像进行对话交流。该模型使用特定的图像编码器和文本解码器进行训练，支持高分辨率图像输入。以下是关于该模型的详细介绍。

🚀 快速开始

下载依赖

git clone https://github.com/tosiyuki/LLaVA-JP.git

推理示例

import requests
import torch
import transformers
from PIL import Image

from transformers.generation.streamers import TextStreamer
from llava.constants import DEFAULT_IMAGE_TOKEN, IMAGE_TOKEN_INDEX
from llava.conversation import conv_templates, SeparatorStyle
from llava.model.llava_gpt2 import LlavaGpt2ForCausalLM
from llava.train.dataset import tokenizer_image_token


if __name__ == "__main__":
    model_path = 'toshi456/ConvLLaVA-JP-1.3b-1280'
    device = "cuda" if torch.cuda.is_available() else "cpu"
    torch_dtype = torch.bfloat16 if device=="cuda" else torch.float32

    model = LlavaGpt2ForCausalLM.from_pretrained(
        model_path, 
        low_cpu_mem_usage=True,
        use_safetensors=True,
        torch_dtype=torch_dtype,
        device_map=device,
    )
    tokenizer = transformers.AutoTokenizer.from_pretrained(
        model_path,
        model_max_length=1532,
        padding_side="right",
        use_fast=False,
    )
    model.eval()

    conv_mode = "v1"
    conv = conv_templates[conv_mode].copy()

    # image pre-process
    image_url = "https://huggingface.co/rinna/bilingual-gpt-neox-4b-minigpt4/resolve/main/sample.jpg"
    image = Image.open(requests.get(image_url, stream=True).raw).convert('RGB')
    
    if device == "cuda":
        image_tensor = model.get_model().vision_tower.image_processor(image).unsqueeze(0).half().cuda().to(torch_dtype)
    else:
        image_tensor = model.get_model().vision_tower.image_processor(image).unsqueeze(0).to(torch_dtype)

    # create prompt
    # ユーザー: <image>\n{prompt}
    prompt = "猫の隣には何がありますか？"
    inp = DEFAULT_IMAGE_TOKEN + '\n' + prompt
    conv.append_message(conv.roles[0], inp)
    conv.append_message(conv.roles[1], None)
    prompt = conv.get_prompt()

    input_ids = tokenizer_image_token(
        prompt, 
        tokenizer, 
        IMAGE_TOKEN_INDEX, 
        return_tensors='pt'
    ).unsqueeze(0)
    if device == "cuda":
        input_ids = input_ids.to(device)

    input_ids = input_ids[:, :-1] # </sep>がinputの最後に入るので削除する
    stop_str = conv.sep if conv.sep_style != SeparatorStyle.TWO else conv.sep2
    keywords = [stop_str]
    streamer = TextStreamer(tokenizer, skip_prompt=True, timeout=20.0)

    # predict
    with torch.inference_mode():
        output_id = model.generate(
            inputs=input_ids,
            images=image_tensor,
            do_sample=False,
            temperature=1.0,
            top_p=1.0,
            max_new_tokens=256,
            streamer=streamer,
            use_cache=True,
        )
    """猫の隣にはノートパソコンがあります。"""

✨ 主要特性

模型类型：ConvLLaVA-JP是一个视觉语言模型，可以对输入图像进行对话。该模型使用laion/CLIP-convnext_large_d_320.laion2B-s29B-b131K-ft作为图像编码器，llm-jp/llm-jp-1.3b-v1.0作为文本解码器，支持1280 x 1280的高分辨率输入。
训练过程：
- 第一阶段：使用LLaVA-Pretrain-JA对Vision Projector和Stage 5进行初始训练。
- 第二阶段：使用LLaVA-Pretrain-JA对Image Encoder、Vision Projector、Stage 5和LLM进行训练。
- 第三阶段：使用LLaVA-v1.5-Instruct-620K-JA对Vision Projector和LLM进行微调。
模型对比：与其他视觉语言模型在多个基准测试中的表现对比如下： | 模型 | JA-VG-VQA-500
(ROUGE-L) | JA-VLM-Bench-In-the-Wild
(ROUGE-L) | Heron-Bench(Detail) | Heron-Bench(Conv) | Heron-Bench(Complex) | Heron-Bench(Average) | | ---- | ---- | ---- | ---- | ---- | ---- | ---- | | Japanese Stable VLM | - | 40.50 | 25.15 | 51.23 | 37.84 | 38.07 | | EvoVLM-JP-v1-7B | 19.70 | 51.25 | 50.31 | 44.42 | 40.47 | 45.07 | | Heron BLIP Japanese StableLM Base 7B llava-620k | 14.51 | 33.26 | 49.09 | 41.51 | 45.72 | 45.44 | | Heron GIT Japanese StableLM Base 7B | 15.18 | 37.82 | 42.77 | 54.20 | 43.53 | 46.83 | | llava-jp-1.3b-v1.0-620k | 12.69 | 44.58 | 51.21 | 41.05 | 45.95 | 44.84 | | llava-jp-1.3b-v1.1 | 13.33 | 44.40 | 50.00 | 51.83 | 48.98 | 50.39 | | ConvLLaVA-JP-1.3b-768 | 12.05 | 42.80 | 44.24 | 40.00 | 48.16 | 44.96 | | ConvLLaVA-JP-1.3b-1280 | 11.88 | 43.64 | 38.95 | 44.79 | 41.24 | 42.31 |

📦 安装指南

下载项目依赖：

git clone https://github.com/tosiyuki/LLaVA-JP.git

📚 详细文档

更多信息请参考：https://github.com/tosiyuki/LLaVA-JP/tree/main

📄 许可证

本模型使用的许可证为cc-by-nc-4.0。

精选推荐AI模型

Llama 3 Typhoon V1.5x 8b Instruct

专为泰语设计的80亿参数指令模型，性能媲美GPT-3.5-turbo，优化了应用场景、检索增强生成、受限生成和推理任务

Cadet-Tiny是一个基于SODA数据集训练的超小型对话模型，专为边缘设备推理设计，体积仅为Cosmo-3B模型的2%左右。

Roberta Base Chinese Extractive Qa

基于RoBERTa架构的中文抽取式问答模型，适用于从给定文本中提取答案的任务。

问答系统中文

uer

2,694

智启未来，您的人工智能解决方案智库

简体中文