开源PaliGemma 2模型 - 融合图与文处理能力，支持多语言多任务应用

首页

Paligemma2 10b Ft Docci 448

由 google 开发

PaliGemma 2是Google推出的多功能视觉语言模型(VLM)，结合图像和文本处理能力，支持多语言和多任务处理。

图像生成文本

Transformers

#多模态视觉语言 #高分辨率微调 #多语言VQA

下载量 2,207

发布时间 : 11/21/2024

模型简介

PaliGemma 2是基于Gemma 2架构的视觉语言模型，能够同时处理图像和文本输入，生成文本输出。该模型在多种视觉语言任务上表现出色，如图像描述、视觉问答、文本阅读等。

模型特点

多模态处理

能够同时处理图像和文本输入，生成文本输出

多语言支持

支持多种语言，适用于不同地区的用户

高性能微调

在多种视觉语言任务上具有出色的微调性能

高分辨率支持

支持448*448高分辨率输入图像处理

模型能力

图像描述生成

视觉问答

目标检测

目标分割

文本阅读

多语言处理

使用案例

图像理解

图像描述生成

为输入图像生成详细的文字描述

在COCO-35L数据集上英语描述得分142.4

视觉问答

回答关于图像内容的自然语言问题

在VQAv2数据集上准确率85.8%

文档处理

文档问答

从文档图像中提取信息回答问题

在DocVQA数据集上准确率76.6%

表格理解

解析和理解表格内容

在FinTabNet数据集上TEDS得分98.94

医疗影像

医学影像报告生成

根据医学影像生成诊断报告

在MIMIC-CXR数据集上Rouge-L得分32.41%

🚀 PaliGemma 2模型卡片

PaliGemma 2是一款多功能的视觉语言模型（VLM），它结合了图像和文本处理能力，可用于图像描述、视觉问答等多种任务。该模型基于Gemma 2架构，经过在多个数据集上的预训练和微调，具有出色的性能和广泛的适用性。

模型信息链接

模型页面：PaliGemma
资源和技术文档：
- PaliGemma 2 on Kaggle
- Responsible Generative AI Toolkit
使用条款：Terms
作者：Google

🚀 快速开始

要访问Hugging Face上的PaliGemma，你需要查看并同意Google的使用许可。请确保你已登录Hugging Face，然后点击下方按钮。请求将立即处理。 [确认许可](Acknowledge license)

Transformers PaliGemma 2 10B权重是在DOCCI数据集上使用448*448输入图像进行微调的。该模型仅以bfloat16格式提供，用于研究目的。微调配置可在big_vision中找到。

✨ 主要特性

多模态处理：能够同时处理图像和文本输入，生成文本输出。
多语言支持：支持多种语言，适用于不同地区的用户。
高性能微调：在多种视觉语言任务上具有出色的微调性能。

📦 安装指南

本部分未提及具体安装步骤，暂不提供相关内容。

💻 使用示例

基础用法

from transformers import (
    PaliGemmaProcessor,
    PaliGemmaForConditionalGeneration,
)
from transformers.image_utils import load_image
import torch

model_id = "google/paligemma2-3b-ft-docci-448"

url = "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/transformers/tasks/car.jpg"
image = load_image(url)

model = PaliGemmaForConditionalGeneration.from_pretrained(model_id, torch_dtype=torch.bfloat16, device_map="auto").eval()
processor = PaliGemmaProcessor.from_pretrained(model_id)

# Instruct the model to create a caption in English
prompt = "caption en"
model_inputs = processor(text=prompt, images=image, return_tensors="pt").to(torch.bfloat16).to(model.device)
input_len = model_inputs["input_ids"].shape[-1]

with torch.inference_mode():
    generation = model.generate(**model_inputs, max_new_tokens=100, do_sample=False)
    generation = generation[0][input_len:]
    decoded = processor.decode(generation, skip_special_tokens=True)
    print(decoded)

📚 详细文档

模型信息

模型概述

PaliGemma 2是PaliGemma视觉语言模型（VLM）的更新版本，它融合了Gemma 2模型的能力。PaliGemma系列模型受到PaLI - 3的启发，基于开放组件构建，如SigLIP视觉模型和Gemma 2语言模型。它以图像和文本作为输入，生成文本作为输出，支持多种语言。该模型专为在各种视觉语言任务（如图像和短视频描述、视觉问答、文本阅读、目标检测和目标分割）上实现领先的微调性能而设计。

模型架构

PaliGemma 2由Transformer解码器和Vision Transformer图像编码器组成。文本解码器从Gemma 2的2B、9B和27B参数大小版本初始化。图像编码器从SigLIP - So400m/14初始化。与原始的PaliGemma模型类似，PaliGemma 2按照PaLI - 3的方法进行训练。

输入和输出

输入：图像和文本字符串，如图像描述提示或问题。
输出：针对输入生成的文本，如图像描述、问题答案、目标边界框坐标列表或分割码字。

引用

@article{
    title={PaliGemma 2: A Family of Versatile VLMs for Transfer},
    author={Andreas Steiner and André Susano Pinto and Michael Tschannen and Daniel Keysers and Xiao Wang and Yonatan Bitton and Alexey Gritsenko and Matthias Minderer and Anthony Sherbondy and Shangbang Long and Siyang Qin and Reeve Ingle and Emanuele Bugliarello and Sahar Kazemzadeh and Thomas Mesnard and Ibrahim Alabdulmohsin and Lucas Beyer and Xiaohua Zhai},
    year={2024},
    journal={arXiv preprint arXiv:2412.03555}
}

模型数据

预训练数据集

PaliGemma 2在以下数据集的混合上进行预训练：

WebLI：WebLI (Web Language Image)是一个基于公共网络构建的网络规模多语言图像 - 文本数据集。使用了多种WebLI分割来获得通用的模型能力，如视觉语义理解、目标定位、视觉情境文本理解和多语言能力。
CC3M - 35L：从网页中精心挑选的英语图像 - 替代文本对（Sharma et al., 2018）。使用Google Cloud Translation API将其翻译成另外34种语言。
VQ²A - CC3M - 35L/VQG - CC3M - 35L：VQ2A - CC3M的一个子集（Changpinyo et al., 2022a），使用Google Cloud Translation API翻译成与CC3M - 35L相同的另外34种语言。
OpenImages：基于OpenImages数据集通过手工规则生成的检测和目标感知问题及答案（Piergiovanni et al. 2022）。
WIT：从维基百科收集的图像和文本（Srinivasan et al., 2021）。

PaliGemma 2基于Gemma 2，你可以在Gemma 2模型卡片中找到Gemma 2的预训练数据集信息。

数据责任过滤

为了在安全和负责任的数据上训练PaliGemma 2，对WebLI应用了以下过滤：

色情图像过滤：此过滤器去除被认为具有色情性质的图像。
文本安全过滤：识别并过滤掉与不安全文本配对的图像。不安全文本是指任何被认为包含或涉及儿童性虐待图像（CSAI）、色情内容、粗俗内容或其他冒犯性内容的文本。
文本毒性过滤：进一步使用Perspective API识别并过滤掉与被认为具有侮辱性、淫秽性、仇恨性或其他毒性的文本配对的图像。
文本个人信息过滤：使用Cloud Data Loss Prevention (DLP) API过滤某些个人信息和其他敏感数据，以保护个人隐私。去除了如社会安全号码和其他敏感信息类型等标识符。
其他方法：根据我们的政策和实践，基于内容质量和安全性进行过滤。

🔧 技术细节

硬件

PaliGemma 2使用最新一代的张量处理单元（TPU）硬件（TPUv5e）进行训练。

软件

训练使用JAX、Flax、TFDS和big_vision完成。

JAX允许研究人员利用最新一代的硬件（包括TPU）来更快、更高效地训练大型模型。

TFDS用于访问数据集，Flax用于模型架构。PaliGemma 2的微调代码和推理代码在big_vision GitHub仓库中发布。

📊 评估信息

基准测试结果

为了验证PaliGemma 2在各种学术任务上的可迁移性，我们在每个任务上对预训练模型进行微调。我们报告了不同分辨率下的结果，以了解哪些任务受益于更高的分辨率。重要的是，这些任务或数据集都不是预训练数据混合的一部分，并且它们的图像已从网络规模的预训练数据中明确移除。

按模型分辨率和大小划分的PaliGemma 2结果

基准测试	224 - 3B	224 - 10B	224 - 28B	448 - 3B	448 - 10B	448 - 28B
[AI2D][ai2d]	74.7	83.1	83.2	76.0	84.4	84.6
[AOKVQA - DA][aokvqa - da] (val)	64.2	68.9	70.2	67.9	70.8	71.2
[AOKVQA - MC][aokvqa - mc] (val)	79.7	83.7	84.7	82.5	85.9	87.0
[ActivityNet - CAP][anet - cap]	34.2	35.9	-	-	-	-
[ActivityNet - QA][anet - qa]	51.3	53.2	-	-	-	-
[COCO - 35L][coco - 35l] (avg34)	113.9	115.8	116.5	115.8	117.2	117.2
[COCO - 35L][coco - 35l] (en)	138.4	140.8	142.4	140.4	142.4	142.3
[COCOcap][coco - cap]	141.3	143.7	144.0	143.4	145.0	145.2
[ChartQA][chartqa] (aug)	74.4	74.2	68.9	89.2	90.1	85.1
[ChartQA][chartqa] (human)	42.0	48.4	46.8	54.0	66.4	61.3
[CountBenchQA][countbenchqa]	81.0	84.0	86.4	82.0	85.3	87.4
[DocVQA][docvqa] (val)	39.9	43.9	44.9	73.6	76.6	76.1
[GQA][gqa]	66.2	67.2	67.3	68.1	68.3	68.3
[InfoVQA][info - vqa] (val)	25.2	33.6	36.4	37.5	47.8	46.7
[MARVL][marvl] (avg5)	83.5	89.5	90.6	82.7	89.1	89.7
[MSRVTT - CAP][msrvtt]	68.5	72.1	-	-	-	-
[MSRVTT - QA][msrvtt]	50.5	51.9	-	-	-	-
[MSVD - QA][msvd - qa]	61.1	62.5	-	-	-	-
[NLVR2][nlvr2]	91.4	93.9	94.2	91.6	93.7	94.1
[NoCaps][nocaps]	123.1	126.3	127.1	123.5	126.9	127.0
[OCR - VQA][ocr - vqa]	73.4	74.7	75.3	75.7	76.3	76.6
[OKVQA][okvqa]	64.2	68.0	71.2	64.1	68.6	70.6
[RSVQA - hr][rsvqa - hr] (test)	92.7	92.6	92.7	92.8	92.8	92.8
[RSVQA - hr][rsvqa - hr] (test2)	90.9	90.8	90.9	90.7	90.7	90.8
[RSVQA - lr][rsvqa - lr]	93.0	92.8	93.5	92.7	93.1	93.7
[RefCOCO][refcoco] (testA)	75.7	77.2	76.8	78.6	79.7	79.3
[RefCOCO][refcoco] (testB)	71.0	74.2	73.9	73.5	76.2	74.8
[RefCOCO][refcoco] (val)	73.4	75.9	75.0	76.3	78.2	77.3
[RefCOCO+][refcoco +] (testA)	72.7	74.7	73.6	76.1	77.7	76.6
[RefCOCO+][refcoco +] (testB)	64.2	68.4	67.1	67.0	71.1	68.6
[RefCOCO+][refcoco +] (val)	68.6	72.0	70.3	72.1	74.4	72.8
[RefCOCOg][refcocog] (test)	69.0	71.9	70.7	72.7	74.8	73.7
[RefCOCOg][refcocog] (val)	68.3	71.4	70.5	72.3	74.4	73.0
[ST - VQA][st - vqa] (val)	61.9	64.3	65.1	80.5	82.0	81.8
[SciCap][scicap]	165.1	159.5	156.9	183.3	177.2	172.7
[ScienceQA][scienceqa]	96.1	98.2	98.2	96.2	98.5	98.6
[Screen2Words][screen2words]	113.3	117.8	122.8	114.0	119.1	123.4
[TallyQA][tallyqa] (complex)	70.3	73.4	74.2	73.6	76.7	76.8
[TallyQA][tallyqa] (simple)	81.8	83.2	83.4	85.3	86.2	85.7
[TextCaps][textcaps]	127.5	137.9	139.9	152.1	157.7	153.6
[TextVQA][textvqa] (val)	59.6	64.0	64.7	75.2	76.6	76.2
[VATEX][vatex]	80.8	82.7	-	-	-	-
[VQAv2][vqav2] (minival)	83.0	84.3	84.5	84.8	85.8	85.8
[VizWizVQA][vizwiz - vqa] (val)	76.4	78.1	78.7	77.5	78.6	78.9
[WidgetCap][widgetcap]	138.1	139.8	138.8	151.4	151.9	148.9
[XM3600][xm3600] (avg35)	42.8	44.5	45.2	43.2	44.6	45.2
[XM3600][xm3600] (en)	79.8	80.7	81.0	80.3	81.5	81.0
[xGQA][xgqa] (avg7)	58.6	61.4	61.1	60.4	62.6	62.1

其他基准测试

[ICDAR 2015 Incidental][icdar2015 - inc]

模型	精度	召回率	F1
PaliGemma 2 3B	81.88	70.73	75.9

[Total - Text][total - text]

模型	精度	召回率	F1
PaliGemma 2 3B	73.8	74.54	74.17

[FinTabNet][fintabnet]

模型	S - TEDS	TEDS	GriTS - Top	GriTS - Con
PaliGemma 2 3B	99.18	98.94	99.43	99.21

[PubTabNet][pubtabnet]

模型	S - TEDS	TEDS	GriTS - Top	GriTS - Con
PaliGemma 2 3B	97.6	97.31	97.99	97.84

[GrandStaff][grandstaff]

模型	CER	LER	SER
PaliGemma 2 3B	1.6	6.7	2.3

[PubChem][pubchem]

PaliGemma 2 3B，完全匹配：94.8

[DOCCI][docci]

模型	平均字符数	平均句子数	NES %
PaliGemma 2 3B	529	7.74	28.42
PaliGemma 2 10B	521	7.45	20.27

avg#char：平均字符数
avg#sent：平均句子数
NES：非蕴含句子

[MIMIC - CXR][mimic - cxr]

模型	CIDEr	BLEU4	Rouge - L	RadGraph F1
PaliGemma 2 3B	19.9%	14.6%	31.92%	28.8%
PaliGemma 2 10B	17.4%	15%	32.41%	29.5%

[Visual Spatial Reasoning][vsr]

模型	VSR零样本分割 (测试)	VSR随机分割 (测试)
PaliGemma 2 3B	0.75	0.82
PaliGemma 2 10B	0.80	0.87

📄 许可证

本模型基于gemma许可证。

精选推荐AI模型

Llama 3 Typhoon V1.5x 8b Instruct

专为泰语设计的80亿参数指令模型，性能媲美GPT-3.5-turbo，优化了应用场景、检索增强生成、受限生成和推理任务

Cadet-Tiny是一个基于SODA数据集训练的超小型对话模型，专为边缘设备推理设计，体积仅为Cosmo-3B模型的2%左右。

Roberta Base Chinese Extractive Qa

基于RoBERTa架构的中文抽取式问答模型，适用于从给定文本中提取答案的任务。

问答系统中文

uer

2,694

智启未来，您的人工智能解决方案智库

简体中文