どうぶつ-2B-PT-756オープンソース視覚言語モデル - 軽量級設計、カスタマイズ可能なシーンファインチューニングに対応

ホーム

Doubutsu 2b Pt 756

qresearchによって開発

doubutsuはカスタマイズシナリオの微調整のために設計された軽量視覚言語モデルシリーズです。

画像生成テキスト

Transformers

英語オープンソースライセンス:Apache-2.0 #軽量視覚言語モデル #画像からテキスト生成 #微調整アダプターが必要

ダウンロード数 129

リリース時間 : 7/22/2024

モデル概要

このモデルは視覚言語モデルで、画像に基づいてテキスト記述を生成でき、画像からテキスト生成タスクに適しています。

モデル特徴

軽量設計

カスタマイズシナリオの微調整のために特別に設計されており、軽量アプリケーションに適しています。

視覚言語モデル

画像とテキスト情報を組み合わせて、関連するテキスト記述を生成できます。

微調整が必要

モデルは単独で使用できず、微調整または既存アダプターの使用が必要です。

モデル能力

画像キャプション生成

視覚的質問応答

画像とテキストの組み合わせタスク

使用事例

画像理解

画像キャプション生成

入力画像に基づいて詳細なテキスト記述を生成します。

視覚的質問応答

画像内容に関する特定の質問に答えます。

🚀 ドウブツ-2B-PT-756

doubutsu は、独自のユースケースに合わせてファインチューニングできる小型の視覚言語モデル (VLM) ファミリーです。

@qtnx_ と @yeswondwerr によって構築されました。

🚀 クイックスタート

このモデルは単独で使用することを想定していません。以下のいずれかの方法で使用する必要があります。

ノートブックを使ってファインチューニングする
既存のアダプターを使用する

⚠️ 重要提示

このモデルは単独で使用することを想定していません。このノートブックでファインチューニングするか、既存のアダプターを使用する必要があります。

💡 使用建议

これらのモデルは小さい温度値を必要とします。温度値は 0.1 - 0.3 を推奨します。

✨ 主な機能

このモデルは、画像とテキストを入力として受け取り、テキストを出力するタスクに適しています。

📦 インストール

このセクションでは、モデルの使用に必要な依存関係をインストールする方法を説明します。

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
from PIL import Image

💻 使用例

基本的な使用法

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
from PIL import Image

model_id = "qresearch/doubutsu-2b-pt-756"
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    trust_remote_code=True,
    torch_dtype=torch.float16,
).to("cuda")

tokenizer = AutoTokenizer.from_pretrained(
    model_id,
    use_fast=True,
)

model.load_adapter("qresearch/doubutsu-2b-lora-756-docci")

image = Image.open("IMAGE")

print(
    model.answer_question(
        image, "Describe the image", tokenizer, max_new_tokens=128, temperature=0.1
    ),
)

📚 ドキュメント

データセット

liuhaotian/LLaVA-CC3M-Pretrain-595K

パイプラインタグ

image-text-to-text

ライセンス

Apache-2.0

🔧 技術詳細

このモデルは、LLaVA や AnyMAL などの先行研究に基づいて構築されています。

参考文献

Liu et al. : LLaVA
Moon et al. : AnyMAL
vikhyatk : moondream codebase

                                       .x+=:.                                                             
                                      z`    ^%                                                  .uef^"    
               .u    .                   .   <k                           .u    .             :d88E       
    .u@u     .d88B :@8c       .u       .@8Ned8"      .u          u      .d88B :@8c        .   `888E       
 .zWF8888bx ="8888f8888r   ud8888.   .@^%8888"    ud8888.     us888u.  ="8888f8888r  .udR88N   888E .z8k  
.888  9888    4888>'88"  :888'8888. x88:  `)8b. :888'8888. .@88 "8888"   4888>'88"  <888'888k  888E~?888L 
I888  9888    4888> '    d888 '88%" 8888N=*8888 d888 '88%" 9888  9888    4888> '    9888 'Y"   888E  888E 
I888  9888    4888>      8888.+"     %8"    R88 8888.+"    9888  9888    4888>      9888       888E  888E 
I888  9888   .d888L .+   8888L        @8Wou 9%  8888L      9888  9888   .d888L .+   9888       888E  888E 
`888Nx?888   ^"8888*"    '8888c. .+ .888888P`   '8888c. .+ 9888  9888   ^"8888*"    ?8888u../  888E  888E 
 "88" '888      "Y"       "88888%   `   ^"F      "88888%   "888*""888"     "Y"       "8888P'  m888N= 888> 
       88E                  "YP'                   "YP'     ^Y"   ^Y'                  "P'     `Y"   888  
       98>                                                                                          J88"  
       '8                                                                                           @%    
        `                                                                                         :"