gemma-3-12b-it-FP8-dynamic开源模型 - 支持多模态视觉文本输入输出

首页

Gemma 3 12b It FP8 Dynamic

由 RedHatAI 开发

基于google/gemma-3-12b-it的FP8量化模型，支持视觉-文本输入和文本输出，适用于多模态场景。

图像生成文本

Transformers

英语开源协议:Apache-2.0 #FP8量化 #多模态输入 #高效推理

下载量 505

发布时间 : 4/28/2025

模型简介

这是一个采用FP8数据类型对权重和激活进行量化的模型，可借助vLLM高效部署，适用于视觉-文本输入、文本输出的场景。

模型特点

FP8量化

对权重和激活均采用FP8量化，提高推理效率。

多模态支持

支持视觉和文本输入，能够处理图像和文本结合的提示。

高效部署

可借助vLLM后端高效部署，支持兼容OpenAI的服务。

模型能力

图像理解

文本生成

多模态推理

使用案例

图像理解与描述

图像内容描述

根据输入的图像生成描述性文本。

能够准确描述图像内容。

多模态问答

基于图像的问答

回答关于图像内容的提问。

能够根据图像内容生成相关回答。

🚀 gemma-3-12b-it-FP8-Dynamic

这是一个基于google/gemma-3-12b-it的量化模型，采用FP8数据类型对权重和激活进行量化，可借助vLLM高效部署，适用于视觉 - 文本输入、文本输出的场景。

🚀 快速开始

本模型可使用 vLLM 后端高效部署，以下是使用示例：

from vllm import LLM, SamplingParams
from vllm.assets.image import ImageAsset
from transformers import AutoProcessor

# Define model name once
model_name = "RedHatAI/gemma-3-12b-it-FP8-dynamic"

# Load image and processor
image = ImageAsset("cherry_blossom").pil_image.convert("RGB")
processor = AutoProcessor.from_pretrained(model_name, trust_remote_code=True)

# Build multimodal prompt
chat = [
    {"role": "user", "content": [{"type": "image"}, {"type": "text", "text": "What is the content of this image?"}]},
    {"role": "assistant", "content": []}
]
prompt = processor.apply_chat_template(chat, add_generation_prompt=True)

# Initialize model
llm = LLM(model=model_name, trust_remote_code=True)

# Run inference
inputs = {"prompt": prompt, "multi_modal_data": {"image": [image]}}
outputs = llm.generate(inputs, SamplingParams(temperature=0.2, max_tokens=64))

# Display result
print("RESPONSE:", outputs[0].outputs[0].text)

vLLM也支持兼容OpenAI的服务，更多详情请参阅文档。

✨ 主要特性

模型架构：gemma - 3 - 12b - it，支持视觉 - 文本输入，输出为文本。
模型优化：对权重和激活均采用FP8量化。
发布日期：2025年2月24日
版本：1.0
模型开发者：Neural Magic

📦 安装指南

文档未提及安装步骤，故跳过此章节。

💻 使用示例

基础用法

from vllm import LLM, SamplingParams
from vllm.assets.image import ImageAsset
from transformers import AutoProcessor

# Define model name once
model_name = "RedHatAI/gemma-3-12b-it-FP8-dynamic"

# Load image and processor
image = ImageAsset("cherry_blossom").pil_image.convert("RGB")
processor = AutoProcessor.from_pretrained(model_name, trust_remote_code=True)

# Build multimodal prompt
chat = [
    {"role": "user", "content": [{"type": "image"}, {"type": "text", "text": "What is the content of this image?"}]},
    {"role": "assistant", "content": []}
]
prompt = processor.apply_chat_template(chat, add_generation_prompt=True)

# Initialize model
llm = LLM(model=model_name, trust_remote_code=True)

# Run inference
inputs = {"prompt": prompt, "multi_modal_data": {"image": [image]}}
outputs = llm.generate(inputs, SamplingParams(temperature=0.2, max_tokens=64))

# Display result
print("RESPONSE:", outputs[0].outputs[0].text)

高级用法

文档未提及高级用法相关代码，故跳过此部分。

📚 详细文档

模型创建

本模型使用 llm - compressor 创建，以下是创建代码：

模型创建代码

import requests
import torch
from PIL import Image
from transformers import AutoProcessor, Gemma3ForConditionalGeneration
from llmcompressor.transformers import oneshot
from llmcompressor.modifiers.quantization import QuantizationModifier

# Load model.
model_id = google/gemma-3-12b-it
model = Gemma3ForConditionalGeneration.from_pretrained(
    model_id, device_map="auto", torch_dtype="auto"
)
processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True)

# Recipe
recipe = [
    QuantizationModifier(
        targets="Linear",
        scheme="FP8_DYNAMIC",
        sequential_targets=["Gemma3DecoderLayer"],
        ignore=["re:.*lm_head", "re:vision_tower.*", "re:multi_modal_projector.*"],
    ),
]

SAVE_DIR=f"{model_id.split('/')[1]}-FP8-Dynamic"

# Perform oneshot
oneshot(
    model=model,
    recipe=recipe,
    trust_remote_code_model=True,
    output_dir=SAVE_DIR
)

模型评估

本模型使用 lm_evaluation_harness 进行OpenLLM v1文本基准测试，评估命令如下：

评估命令

OpenLLM v1

lm_eval \
  --model vllm \
  --model_args pretrained="<model_name>",dtype=auto,add_bos_token=True,max_model_len=4096,tensor_parallel_size=<n>,gpu_memory_utilization=0.8,enable_chunked_prefill=True,trust_remote_code=True,enforce_eager=True \
  --tasks openllm \
  --batch_size auto

准确率

类别	指标	google/gemma - 3 - 12b - it	RedHatAI/gemma - 3 - 12b - it - FP8 - Dynamic	恢复率(%)
OpenLLM V1	ARC Challenge	68.43%	68.86%	100.62%
OpenLLM V1	GSM8K	88.10%	88.02%	99.91%
OpenLLM V1	Hellaswag	83.76%	83.78%	100.02%
OpenLLM V1	MMLU	72.15%	71.80%	99.51%
OpenLLM V1	Truthfulqa (mc2)	58.13%	59.35%	102.09%
OpenLLM V1	Winogrande	79.40%	79.48%	100.10%
OpenLLM V1	平均得分	74.99%	75.21%	100.29%
视觉评估	MMMU (val)	48.78%	49.00%	100.45%
视觉评估	ChartQA	68.08%	68.88%	101.18%
视觉评估	平均得分	58.43%	58.94%	100.81%