Llama-3.1-8B-vision-378オープンソースモデル - Llama 3に視覚機能を追加し、画像タスクを簡単に処理

ホーム

Llama 3.1 8B Vision 378

qresearchによって開発

このプロジェクトでは、Llama 3に視覚能力を追加するための投影モジュールを訓練し、SigLIP技術を使用してLlama-3.1-8B-Instructモデルに適用しました。

画像生成テキスト

Transformers

#マルチモーダル視覚質問応答 #SigLIP投影技術 #4ビット量子化サポート

ダウンロード数 203

リリース時間 : 7/23/2024

モデル概要

これは視覚と言語能力を組み合わせたマルチモーダルモデルで、画像とテキスト入力を処理し、テキスト出力を生成できます。

モデル特徴

視覚能力強化

投影モジュールの訓練によりLlama 3モデルに視覚処理能力を追加

SigLIP技術の応用

SigLIP技術を使用して画像とテキストの共同処理を実現

4ビット量子化サポート

4ビット量子化展開をサポートし、ハードウェア要件を低減

モデル能力

画像理解

画像説明生成

視覚質問応答

マルチモーダル推論

使用事例

画像理解

画像説明生成

画像を入力すると、モデルは画像内容のテキスト説明を生成できます

簡潔で正確な画像説明を生成

視覚質問応答

画像内容に基づいて関連する質問に回答

画像内容に関連する正確な回答を提供

🚀 llama-3.1-8B-vision-378

SigLIPを使用してLlama 3にビジョン機能を追加するためにトレーニングされた投影モジュールを、Llama-3.1-8B-Instructに適用しました。@yeswondwerr と @qtnx_ によって構築されました。

🚀 クイックスタート

ライセンス

属性	详情
ライセンス	llama3.1
トレーニングデータ	liuhaotian/LLaVA-CC3M-Pretrain-595K
パイプラインタグ	画像テキストからテキスト

💻 使用例

基本的な使用法

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
from PIL import Image
import requests
from io import BytesIO

url = "https://huggingface.co/qresearch/llama-3-vision-alpha-hf/resolve/main/assets/demo-2.jpg"
response = requests.get(url)
image = Image.open(BytesIO(response.content))


model = AutoModelForCausalLM.from_pretrained(
    "qresearch/llama-3.1-8B-vision-378",
    trust_remote_code=True,
    torch_dtype=torch.float16,
).to("cuda")

tokenizer = AutoTokenizer.from_pretrained("qresearch/llama-3.1-8B-vision-378", use_fast=True,)

print(
    model.answer_question(
        image, "Briefly describe the image", tokenizer, max_new_tokens=128, do_sample=True, temperature=0.3
    ),
)

高度な使用法

import torch
from PIL import Image
from transformers import AutoModelForCausalLM, AutoTokenizer
from transformers import BitsAndBytesConfig
import requests
from io import BytesIO


url = "https://huggingface.co/qresearch/llama-3-vision-alpha-hf/resolve/main/assets/demo-2.jpg"
response = requests.get(url)
image = Image.open(BytesIO(response.content))

bnb_cfg = BitsAndBytesConfig(
    load_in_4bit=True,
    bnb_4bit_compute_dtype=torch.float16,
    llm_int8_skip_modules=["mm_projector", "vision_model"],
)

model = AutoModelForCausalLM.from_pretrained(
    "qresearch/llama-3.1-8B-vision-378",
    trust_remote_code=True,
    torch_dtype=torch.float16,
    quantization_config=bnb_cfg,
)

tokenizer = AutoTokenizer.from_pretrained(
    "qresearch/llama-3.1-8B-vision-378",
    use_fast=True,
)

print(
    model.answer_question(
        image, "Briefly describe the image", tokenizer, max_new_tokens=128, do_sample=True, temperature=0.3
    ),
)

                                       .x+=:.                                                             
                                      z`    ^%                                                  .uef^"    
               .u    .                   .   <k                           .u    .             :d88E       
    .u@u     .d88B :@8c       .u       .@8Ned8"      .u          u      .d88B :@8c        .   `888E       
 .zWF8888bx ="8888f8888r   ud8888.   .@^%8888"    ud8888.     us888u.  ="8888f8888r  .udR88N   888E .z8k  
.888  9888    4888>'88"  :888'8888. x88:  `)8b. :888'8888. .@88 "8888"   4888>'88"  <888'888k  888E~?888L 
I888  9888    4888> '    d888 '88%" 8888N=*8888 d888 '88%" 9888  9888    4888> '    9888 'Y"   888E  888E 
I888  9888    4888>      8888.+"     %8"    R88 8888.+"    9888  9888    4888>      9888       888E  888E 
I888  9888   .d888L .+   8888L        @8Wou 9%  8888L      9888  9888   .d888L .+   9888       888E  888E 
`888Nx?888   ^"8888*"    '8888c. .+ .888888P`   '8888c. .+ 9888  9888   ^"8888*"    ?8888u../  888E  888E 
 "88" '888      "Y"       "88888%   `   ^"F      "88888%   "888*""888"     "Y"       "8888P'  m888N= 888> 
       88E                  "YP'                   "YP'     ^Y"   ^Y'                  "P'     `Y"   888  
       98>                                                                                          J88"  
       '8                                                                                           @%    
        `                                                                                         :"