Q

Qwen2.5 VL 72B Instruct AWQ Fix

由Benasd開發
Qwen2.5-VL 是 Qwen 家族的最新視覺語言模型,具備強大的視覺理解和代理能力,支持多格式視覺定位和結構化輸出生成。
下載量 94
發布時間 : 2/26/2025

模型概述

Qwen2.5-VL 是一個多模態視覺語言模型,擅長圖像和視頻理解、文本分析、圖表解析等任務,適用於金融、商業等多個領域。

模型特點

視覺理解能力
不僅能識別常見物體,還能高效分析圖像中的文本、圖表、圖標、圖形和佈局。
代理能力
可直接作為視覺代理,進行推理並動態調用工具,支持計算機和手機操作。
長視頻理解與事件捕捉
能理解超過1小時的視頻,並新增了通過精確定位相關片段捕捉事件的能力。
多格式視覺定位
可通過生成邊界框或點精確標註圖像中的物體,並穩定輸出座標和屬性的 JSON 格式。
結構化輸出生成
對於發票、表格等數據掃描件,支持結構化內容輸出,適用於金融、商業等領域。

模型能力

圖像理解
視頻理解
文本分析
圖表解析
視覺定位
結構化輸出生成

使用案例

金融
發票處理
自動解析發票內容並生成結構化數據
提高數據處理效率和準確性
商業
表格解析
從掃描件中提取表格數據
簡化數據錄入流程
多媒體
視頻內容分析
理解長視頻內容並定位關鍵事件
提升視頻檢索效率
AIbase
智啟未來,您的人工智能解決方案智庫
© 2025AIbase