Qwen2.5-VL開源多模態模型 - 視覺理解和視頻處理能力顯著提升！

Home

Qwen2.5vl

Developed by NexaAI

Qwen2.5-VL是基於圖像文本到文本的多模態模型，在視覺理解、視頻處理、結構化輸出等方面有顯著提升。

圖像生成文本 EnglishOpen Source License:Apache-2.0 #多模態視覺理解 #長視頻事件捕捉 #結構化數據輸出

Downloads 110

Release Time : 7/3/2025

Model Overview

Qwen2.5-VL是Qwen家族的最新成員，專注於構建更實用的視覺語言模型，具備強大的視覺理解能力和智能代理功能。

Model Features

強大的視覺理解能力

擅長識別常見物體，並能高效分析圖像中的文本、圖表、圖標、圖形和佈局。

智能代理功能

可直接作為視覺代理，能夠進行推理並動態調用工具，支持計算機和手機的使用場景。

長視頻理解與事件捕捉

可以理解超過1小時的視頻，並且新增了通過定位相關視頻片段來捕捉事件的能力。

多格式視覺定位

可以通過生成邊界框或點來精確地定位圖像中的物體，並能為座標和屬性提供穩定的JSON輸出。

結構化輸出支持

對於發票、表單、表格等掃描數據，支持對其內容進行結構化輸出，在金融、商業等領域具有廣泛應用價值。

Model Capabilities

圖像分析

視頻理解

文本識別

圖表解析

視覺定位

結構化數據輸出

智能代理

多模態推理

Use Cases

金融與商業

發票處理

自動識別和結構化輸出發票信息

提高數據處理效率

表格解析

從掃描文檔中提取表格數據

減少人工錄入工作

教育

圖表理解

解析數學和科學圖表

輔助學習

視頻分析

長視頻理解

分析超過1小時的視頻內容

事件捕捉和關鍵片段定位

🚀 NexaAI/qwen2.5vl

本項目提供了基於圖像文本到文本的多模態模型 NexaAI/qwen2.5vl，它在視覺理解、視頻處理、結構化輸出等方面有顯著提升，可通過 nexa-sdk 直接運行。

🚀 快速開始

在安裝 nexa-sdk 後，可直接運行該模型。在 nexa-sdk 命令行界面中執行以下命令：

NexaAI/qwen2.5vl

可用的量化模型

文件名	量化類型	文件大小	分割	描述
Qwen2.5-VL-7B-Instruct-Q4_K_M.gguf	Q4_K_M	4.68 GB	false	4 位模型。視覺處理需要 `mmproj`。
mmproj-F16.gguf	f16	1.35 GB	false	視覺投影文件，必需。

✨ 主要特性

在 Qwen2-VL 發佈後的五個月裡，眾多開發者基於該視覺語言模型構建了新模型，並提供了寶貴反饋。在此期間，團隊專注於構建更實用的視覺語言模型。如今，我們很高興地推出 Qwen 家族的最新成員：Qwen2.5-VL。

主要改進點：

強大的視覺理解能力：Qwen2.5-VL 不僅擅長識別常見的花鳥魚蟲等物體，還能高效分析圖像中的文本、圖表、圖標、圖形和佈局。
智能代理功能：Qwen2.5-VL 可直接作為視覺代理，能夠進行推理並動態調用工具，支持計算機和手機的使用場景。
長視頻理解與事件捕捉：Qwen2.5-VL 可以理解超過 1 小時的視頻，並且新增了通過定位相關視頻片段來捕捉事件的能力。
多格式視覺定位：Qwen2.5-VL 可以通過生成邊界框或點來精確地定位圖像中的物體，並能為座標和屬性提供穩定的 JSON 輸出。
結構化輸出支持：對於發票、表單、表格等掃描數據，Qwen2.5-VL 支持對其內容進行結構化輸出，在金融、商業等領域具有廣泛應用價值。

📚 詳細文檔

圖像基準測試結果

基準測試	InternVL2.5-8B	MiniCPM-o 2.6	GPT-4o-mini	Qwen2-VL-7B	Qwen2.5-VL-7B
MMMU_val	56	50.4	60	54.1	58.6
MMMU-Pro_val	34.3	-	37.6	30.5	41.0
DocVQA_test	93	93	-	94.5	95.7
InfoVQA_test	77.6	-	-	76.5	82.6
ChartQA_test	84.8	-	-	83.0	87.3
TextVQA_val	79.1	80.1	-	84.3	84.9
OCRBench	822	852	785	845	864
CC_OCR	57.7			61.6	77.8
MMStar	62.8			60.7	63.9
MMBench-V1.1-En_test	79.4	78.0	76.0	80.7	82.6
MMT-Bench_test	-	-	-	63.7	63.6
MMStar	61.5	57.5	54.8	60.7	63.9
MMVet_GPT-4-Turbo	54.2	60.0	66.9	62.0	67.1
HallBench_avg	45.2	48.1	46.1	50.6	52.9
MathVista_testmini	58.3	60.6	52.4	58.2	68.2
MathVision	-	-	-	16.3	25.07

視頻基準測試結果

基準測試	Qwen2-VL-7B	Qwen2.5-VL-7B
MVBench	67.0	69.6
PerceptionTest_test	66.9	70.5
Video-MME_{wo/w subs}	63.3/69.0	65.1/71.6
LVBench		45.3
LongVideoBench		54.7
MMBench-Video	1.44	1.79
TempCompass		71.7
MLVU		70.2
CharadesSTA/mIoU	43.6