# 目標檢測分割

Paligemma2 3b Mix 224 Jax
PaliGemma 2是基於Gemma 2的升級版視覺語言模型,支持多語言圖文輸入與文本輸出,專為視覺語言任務設計
文本生成圖像
P
google
38
1
Paligemma2 28b Mix 448
PaliGemma 2是基於Gemma 2的視覺語言模型,支持圖像+文本輸入,輸出文本響應,適用於多種視覺語言任務。
圖像生成文本 Transformers
P
google
198
26
Paligemma2 10b Pt 224
PaliGemma 2是一款視覺語言模型(VLM),結合了Gemma 2模型的能力,能夠同時處理圖像和文本輸入,並生成文本輸出,支持多種語言。適用於圖像和短視頻字幕、視覺問答、文本閱讀、目標檢測和目標分割等多種視覺語言任務。
圖像生成文本 Transformers
P
google
3,362
8
Paligemma2 3b Pt 896
PaliGemma 2是一款多模態視覺語言模型,結合圖像和文本輸入生成文本輸出,支持多語言,適用於多種視覺語言任務。
圖像生成文本 Transformers
P
google
2,536
22
Paligemma2 3b Pt 224
PaliGemma 2是Google開發的視覺語言模型(VLM),結合了Gemma 2語言模型和SigLIP視覺模型的能力,支持多語言視覺語言任務。
圖像生成文本 Transformers
P
google
30.51k
148
Paligemma2 10b Mix 224
PaliGemma 2是基於Gemma 2的視覺語言模型,支持圖像和文本輸入,生成文本輸出,適用於多種視覺語言任務。
圖像生成文本 Transformers
P
google
701
7
Paligemma2 3b Mix 448
PaliGemma 2是基於Gemma 2的視覺語言模型,支持圖像與文本輸入,輸出生成文本,適用於多種視覺語言任務。
圖像生成文本 Transformers
P
google
20.55k
44
Paligemma2 3b Mix 224
PaliGemma 2是Google開發的升級版視覺語言模型,結合了Gemma 2的能力,支持圖像和文本輸入,生成文本輸出,適用於多種視覺語言任務。
圖像生成文本 Transformers
P
google
15.23k
28
Florence 2 Large No Flash Attn
MIT
Florence-2是微軟開發的先進視覺基礎模型,採用基於提示的方法處理多樣化視覺任務,通過統一表徵實現圖像描述、目標檢測等多種功能。
文本生成圖像
F
multimodalart
73.91k
16
Florence 2 Base Ft
MIT
Florence-2是微軟開發的先進視覺基礎模型,採用基於提示的方法處理廣泛的視覺和視覺語言任務。
圖像生成文本 Transformers
F
lodestones
14
0
Paligemma 3b Ft Widgetcap 224
PaliGemma是一款多功能輕量級視覺語言模型,結合圖像和文本輸入生成文本輸出,支持多語言,在多種視覺語言任務中表現出色。
圖像生成文本 Transformers
P
google
135
2
Paligemma 3b Ft Scicap 448
PaliGemma是一款多功能輕量級視覺語言模型,結合圖像和文本輸入生成文本輸出,支持多語言。
文本生成圖像 Transformers
P
google
123
0
Paligemma 3b Ft Cococap 224
PaliGemma是一款多功能輕量級視覺語言模型(VLM),支持多語言輸入輸出,適用於多種視覺語言任務。
圖像生成文本 Transformers
P
google
209
1
Paligemma 3b Pt 448
PaliGemma是一款輕量級多功能視覺語言模型,基於SigLIP視覺模型和Gemma語言模型構建,支持多語言圖像文本交互任務。
圖像生成文本 Transformers
P
google
2,708
29
Paligemma 3b Ft Nlvr2 224
PaliGemma是一款多功能輕量級視覺語言模型(VLM),支持多語言輸入輸出,擅長圖像字幕、視覺問答等多種視覺語言任務。
文本生成圖像 Transformers
P
google
2,056
1
Paligemma 3b Mix 448
PaliGemma是一款多功能輕量級視覺語言模型(VLM),基於SigLIP視覺模型和Gemma語言模型構建,支持圖像和文本輸入並生成文本輸出
圖像生成文本 Transformers
P
google
5,488
109
Paligemma 3b Ft Nlvr2 448
PaliGemma是一款多功能且輕量級的視覺語言模型(VLM),支持圖像和文本輸入,生成文本輸出,適用於多種視覺語言任務。
文本生成圖像 Transformers
P
google
2,350
0
Paligemma 3b Ft Vqav2 224
PaliGemma是一款多功能輕量級視覺語言模型,結合圖像和文本輸入生成文本輸出,支持多語言。
文本生成圖像 Transformers
P
google
150
2
Paligemma 3b Ft Docvqa 896
PaliGemma是Google開發的輕量級視覺語言模型,基於SigLIP視覺模型和Gemma語言模型構建,支持多語言圖像文本理解與生成。
圖像生成文本 Transformers
P
google
519
9
Paligemma 3b Ft Scicap 224
PaliGemma是一款輕量級視覺語言模型,結合圖像和文本輸入生成文本輸出,支持多語言和多任務處理。
圖像生成文本 Transformers
P
google
107
0
Paligemma 3b Ft Vqav2 448
PaliGemma是Google開發的輕量級視覺語言模型,結合圖像理解和文本生成能力,支持多語言任務。
文本生成圖像 Transformers
P
google
121
17
Paligemma 3b Ft Ocrvqa 896
PaliGemma是一款多功能輕量級視覺語言模型,支持圖像和文本輸入,生成文本輸出,適用於多種視覺語言任務。
圖像生成文本 Transformers
P
google
2,056
14
Paligemma 3b Ft Science Qa 224
PaliGemma是一款多功能輕量級視覺語言模型(VLM),支持圖像和文本輸入,生成文本輸出,適用於多種視覺語言任務。
文本生成圖像 Transformers
P
google
113
1
AIbase
智啟未來,您的人工智能解決方案智庫
© 2025AIbase