Qwen2.5vl
Qwen2.5-VL是基於圖像文本到文本的多模態模型,在視覺理解、視頻處理、結構化輸出等方面有顯著提升。
Downloads 110
Release Time : 7/3/2025
Model Overview
Qwen2.5-VL是Qwen家族的最新成員,專注於構建更實用的視覺語言模型,具備強大的視覺理解能力和智能代理功能。
Model Features
強大的視覺理解能力
擅長識別常見物體,並能高效分析圖像中的文本、圖表、圖標、圖形和佈局。
智能代理功能
可直接作為視覺代理,能夠進行推理並動態調用工具,支持計算機和手機的使用場景。
長視頻理解與事件捕捉
可以理解超過1小時的視頻,並且新增了通過定位相關視頻片段來捕捉事件的能力。
多格式視覺定位
可以通過生成邊界框或點來精確地定位圖像中的物體,並能為座標和屬性提供穩定的JSON輸出。
結構化輸出支持
對於發票、表單、表格等掃描數據,支持對其內容進行結構化輸出,在金融、商業等領域具有廣泛應用價值。
Model Capabilities
圖像分析
視頻理解
文本識別
圖表解析
視覺定位
結構化數據輸出
智能代理
多模態推理
Use Cases
金融與商業
發票處理
自動識別和結構化輸出發票信息
提高數據處理效率
表格解析
從掃描文檔中提取表格數據
減少人工錄入工作
教育
圖表理解
解析數學和科學圖表
輔助學習
視頻分析
長視頻理解
分析超過1小時的視頻內容
事件捕捉和關鍵片段定位
Featured Recommended AI Models
Qwen2.5 VL 7B Abliterated Caption It I1 GGUF
Apache-2.0
Qwen2.5-VL-7B-Abliterated-Caption-it的量化版本,支持多語言圖像描述任務。
圖像生成文本
Transformers Supports Multiple Languages

Q
mradermacher
167
1
Nunchaku Flux.1 Dev Colossus
Other
Colossus Project Flux 的 Nunchaku 量化版本,旨在根據文本提示生成高質量圖像。該模型在優化推理效率的同時,將性能損失降至最低。
圖像生成 English
N
nunchaku-tech
235
3
Qwen2.5 VL 7B Abliterated Caption It GGUF
Apache-2.0
這是一個基於Qwen2.5-VL-7B模型的靜態量化版本,專注於圖像描述生成任務,支持多種語言。
圖像生成文本
Transformers Supports Multiple Languages

Q
mradermacher
133
1
Olmocr 7B 0725 FP8
Apache-2.0
olmOCR-7B-0725-FP8是基於Qwen2.5-VL-7B-Instruct模型,使用olmOCR-mix-0225數據集微調後量化為FP8版本的文檔OCR模型。
圖像生成文本
Transformers English

O
allenai
881
3
Lucy 128k GGUF
Apache-2.0
Lucy-128k是基於Qwen3-1.7B開發的專注於代理式網絡搜索和輕量級瀏覽的模型,在移動設備上也能高效運行。
大型語言模型
Transformers English

L
Mungert
263
2