Gemma 3-27b-it-FP8-dynamicオープンソースモデル - ビジュアルテキスト入力をサポート、vLLMによる効率的な展開でテキスト出力

ホーム

Gemma 3 27b It FP8 Dynamic

RedHatAIによって開発

これはgoogle/gemma-3-27b-itの量子化バージョンで、FP8データ型を使用して重みを量子化し、ビジュアル - テキスト入力を受け取り、テキストを出力するのに適しており、vLLMによる効率的なデプロイで推論が可能です。

画像生成テキスト

Transformers

英語オープンソースライセンス:Apache-2.0 #FP8量子化 #マルチモーダル推論 #vLLMによる効率的なデプロイ

ダウンロード数 1,608

リリース時間 : 4/28/2025

モデル概要

Gemma-3-27b-itモデルに基づくFP8量子化バージョンで、マルチモーダル入力（ビジュアル + テキスト）をサポートし、テキスト出力を生成し、推論効率を最適化しています。

モデル特徴

FP8量子化

重みと活性化関数の両方をFP8データ型で量子化し、推論効率を大幅に向上させます。

マルチモーダルサポート

ビジュアルとテキストの同時入力をサポートし、画像内容を理解して関連するテキストを生成できます。

効率的なデプロイ

vLLMバックエンド向けに最適化され、効率的な推論デプロイをサポートします。

高精度維持

量子化後のモデルは、複数のベンチマークテストで元のモデルの99％以上の精度を維持します。

モデル能力

画像内容理解

マルチモーダルテキスト生成

ビジュアル質問応答

コンテキスト理解

使用事例

画像理解

画像内容記述

画像を入力した後、画像内容の文字記述を生成します

画像内の主要な要素とシーンを正確に識別します

スマート質問応答

ビジュアル質問応答

画像内容に基づいて関連する質問に答えます

MMMUとChartQAベンチマークテストで優れた性能を発揮します

🚀 gemma-3-27b-it-FP8-Dynamic

このモデルは、google/gemma-3-27b-it を量子化したバージョンで、画像とテキストを入力とし、テキストを出力するマルチモーダルモデルです。量子化により、モデルの推論を効率的に行うことができます。

🚀 クイックスタート

このモデルは、vLLM バックエンドを使用して効率的にデプロイできます。以下の例を参照してください。

from vllm import LLM, SamplingParams
from vllm.assets.image import ImageAsset
from transformers import AutoProcessor

# Define model name once
model_name = "RedHatAI/gemma-3-27b-it-FP8-dynamic"

# Load image and processor
image = ImageAsset("cherry_blossom").pil_image.convert("RGB")
processor = AutoProcessor.from_pretrained(model_name, trust_remote_code=True)

# Build multimodal prompt
chat = [
    {"role": "user", "content": [{"type": "image"}, {"type": "text", "text": "What is the content of this image?"}]},
    {"role": "assistant", "content": []}
]
prompt = processor.apply_chat_template(chat, add_generation_prompt=True)

# Initialize model
llm = LLM(model=model_name, trust_remote_code=True)

# Run inference
inputs = {"prompt": prompt, "multi_modal_data": {"image": [image]}}
outputs = llm.generate(inputs, SamplingParams(temperature=0.2, max_tokens=64))

# Display result
print("RESPONSE:", outputs[0].outputs[0].text)

vLLM は OpenAI 互換のサービングもサポートしています。詳細はドキュメントを参照してください。

✨ 主な機能

モデルアーキテクチャ: gemma-3-27b-it
- 入力: 画像とテキスト
- 出力: テキスト
モデル最適化:
- 重み量子化: FP8
- 活性化量子化: FP8
リリース日: 2025年2月24日
バージョン: 1.0
モデル開発者: Neural Magic

📦 インストール

このモデルを使用するには、必要なライブラリをインストールする必要があります。以下のコマンドを使用して、依存関係をインストールできます。

pip install vllm transformers

💻 使用例

基本的な使用法

from vllm import LLM, SamplingParams
from vllm.assets.image import ImageAsset
from transformers import AutoProcessor

# Define model name once
model_name = "RedHatAI/gemma-3-27b-it-FP8-dynamic"

# Load image and processor
image = ImageAsset("cherry_blossom").pil_image.convert("RGB")
processor = AutoProcessor.from_pretrained(model_name, trust_remote_code=True)

# Build multimodal prompt
chat = [
    {"role": "user", "content": [{"type": "image"}, {"type": "text", "text": "What is the content of this image?"}]},
    {"role": "assistant", "content": []}
]
prompt = processor.apply_chat_template(chat, add_generation_prompt=True)

# Initialize model
llm = LLM(model=model_name, trust_remote_code=True)

# Run inference
inputs = {"prompt": prompt, "multi_modal_data": {"image": [image]}}
outputs = llm.generate(inputs, SamplingParams(temperature=0.2, max_tokens=64))

# Display result
print("RESPONSE:", outputs[0].outputs[0].text)

📚 ドキュメント

モデルの作成

このモデルは、llm-compressor を使用して作成されました。以下のコードスニペットを実行して、モデルを作成できます。

モデル作成コード

import requests
import torch
from PIL import Image
from transformers import AutoProcessor, Gemma3ForConditionalGeneration
from llmcompressor.transformers import oneshot
from llmcompressor.modifiers.quantization import QuantizationModifier

# Load model.
model_id = google/gemma-3-27b-it
model = Gemma3ForConditionalGeneration.from_pretrained(
    model_id, device_map="auto", torch_dtype="auto"
)
processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True)

# Recipe
recipe = [
    QuantizationModifier(
        targets="Linear",
        scheme="FP8_DYNAMIC",
        sequential_targets=["Gemma3DecoderLayer"],
        ignore=["re:.*lm_head", "re:vision_tower.*", "re:multi_modal_projector.*"],
    ),
]

SAVE_DIR=f"{model_id.split('/')[1]}-FP8-Dynamic"

# Perform oneshot
oneshot(
    model=model,
    recipe=recipe,
    trust_remote_code_model=True,
    output_dir=SAVE_DIR
)

評価

このモデルは、lm_evaluation_harness を使用して OpenLLM v1 テキストベンチマークで評価されました。評価は、以下のコマンドを使用して行われました。

評価コマンド

OpenLLM v1

lm_eval \
  --model vllm \
  --model_args pretrained="<model_name>",dtype=auto,add_bos_token=True,max_model_len=4096,tensor_parallel_size=<n>,gpu_memory_utilization=0.8,enable_chunked_prefill=True,trust_remote_code=True,enforce_eager=True \
  --tasks openllm \
  --batch_size auto

精度

カテゴリ	メトリック	google/gemma-3-27b-it	RedHatAI/gemma-3-27b-it-FP8-Dynamic	回復率 (%)
OpenLLM V1	ARC Challenge	72.53%	72.70%	100.24%
OpenLLM V1	GSM8K	92.12%	91.51%	99.34%
OpenLLM V1	Hellaswag	85.78%	85.69%	99.90%
OpenLLM V1	MMLU	77.53%	77.45%	99.89%
OpenLLM V1	Truthfulqa (mc2)	62.20%	62.20%	99.99%
OpenLLM V1	Winogrande	79.40%	78.77%	99.20%
OpenLLM V1	平均スコア	78.26%	78.05%	99.73%
Vision Evals	MMMU (val)	50.89%	51.00%	100.22%
Vision Evals	ChartQA	72.16%	72.16%	100.0%
Vision Evals	平均スコア	61.53%	61.58%	100.11%