VARGPT_LLaVA-v1开源多模态模型 - 具备视觉理解与生成能力，有效实用！

首页

VARGPT LLaVA V1

由 VARGPT-family 开发

VARGPT是一个统一的多模态模型，结合了视觉理解和生成能力，通过预测下一标记实现理解，预测下一尺度实现生成。

文本生成图像

Transformers

英语开源协议:Apache-2.0 #多模态理解生成 #视觉自回归 #统一建模

下载量 4,291

发布时间 : 1/21/2025

模型简介

VARGPT是一个7B+2B参数的多模态大语言模型，能够同时处理视觉理解和生成任务，支持英文交互。

模型特点

统一的理解与生成

在单一模型中整合视觉理解和生成两种范式

多模态交互

支持图像和文本的联合处理与生成

自回归预测

通过预测下一标记/尺度实现连续生成

模型能力

图像内容理解

文本到图像生成

多模态对话

视觉问答

使用案例

创意设计

艺术创作

根据文本描述生成画作

生成符合描述的艺术图像

内容分析

表情包解析

解释图像表情包的含义

输出对图像内容的文字解释

🚀 VARGPT：视觉自回归多模态大语言模型中的统一理解与生成

VARGPT（7B + 2B）将理解和生成建模为统一模型中的两种不同范式：为视觉理解预测下一个标记，为视觉生成预测下一个尺度。本模型可实现多模态理解与生成，为用户提供了便捷的使用体验。

我们提供了使用模型的简单生成过程。更多详细信息，您可以参考 GitHub：VARGPT-v1。

🚀 快速开始

多模态理解

以下是多模态理解的推理演示代码，您可以执行以下代码：

# Or execute the following code
import requests
from PIL import Image

import torch
from transformers import AutoProcessor, AutoTokenizer
from vargpt_llava.modeling_vargpt_llava import VARGPTLlavaForConditionalGeneration
from vargpt_llava.prepare_vargpt_llava import prepare_vargpt_llava 
from vargpt_llava.processing_vargpt_llava import VARGPTLlavaProcessor
from patching_utils.patching import patching

model_id = "VARGPT_LLaVA-v1"
prepare_vargpt_llava(model_id)

model = VARGPTLlavaForConditionalGeneration.from_pretrained(
    model_id, 
    torch_dtype=torch.float32, 
    low_cpu_mem_usage=True, 
).to(0)
patching(model)

tokenizer = AutoTokenizer.from_pretrained(model_id)
processor = VARGPTLlavaProcessor.from_pretrained(model_id)

# Define a chat history and use `apply_chat_template` to get correctly formatted prompt
# Each value in "content" has to be a list of dicts with types ("text", "image") 
conversation = [
    {
      "role": "user",
      "content": [
          {"type": "text", "text": "Please explain the meme in detail."},
          {"type": "image"},
        ],
    },
]
prompt = processor.apply_chat_template(conversation, add_generation_prompt=True)
image_file = "./assets/llava_bench_demo.png"
print(prompt)

raw_image = Image.open(image_file)
inputs = processor(images=raw_image, text=prompt, return_tensors='pt').to(0, torch.float32)

output = model.generate(
    **inputs, 
    max_new_tokens=2048, 
    do_sample=False)

print(processor.decode(output[0], skip_special_tokens=True))

多模态生成

以下是文本到图像生成的推理演示代码，您可以执行以下代码：

import requests
from PIL import Image

import torch
from transformers import AutoProcessor, AutoTokenizer
from vargpt_llava.modeling_vargpt_llava import VARGPTLlavaForConditionalGeneration
from vargpt_llava.prepare_vargpt_llava import prepare_vargpt_llava 
from vargpt_llava.processing_vargpt_llava import VARGPTLlavaProcessor
from patching_utils.patching import patching
model_id = "VARGPT_LLaVA-v1"

prepare_vargpt_llava(model_id)

model = VARGPTLlavaForConditionalGeneration.from_pretrained(
    model_id, 
    torch_dtype=torch.float32, 
    low_cpu_mem_usage=True, 
).to(0)

patching(model)
tokenizer = AutoTokenizer.from_pretrained(model_id)
processor = VARGPTLlavaProcessor.from_pretrained(model_id)

# some instruction examples:
# Please design a drawing of a butterfly on a flower.
# Please create a painting of a black weasel is standing in the grass.
# Can you generate a rendered photo of a rabbit sitting in the grass.
# I need a designed photo of a lighthouse is seen in the distance.
# Please create a rendered drawing of an old photo of an aircraft carrier in the water.
# Please produce a designed photo of a squirrel is standing in the snow.


conversation = [
    {
      "role": "user",
      "content": [
          {"type": "text", "text": "Please design a drawing of a butterfly on a flower."},
        ],
    },
]
prompt = processor.apply_chat_template(conversation, add_generation_prompt=True)
print(prompt)

inputs = processor(text=prompt, return_tensors='pt').to(0, torch.float32)
model._IMAGE_GEN_PATH = "output.png"
output = model.generate(
    **inputs, 
    max_new_tokens=2048, 
    do_sample=False)

print(processor.decode(output[0], skip_special_tokens=True))