SmolDocling-256M-preview開源文檔理解模型 - 解析結構、提取內容，圖像轉數據

首頁

Smoldocling 256M Preview Mlx Bf16 Docling Snap

由ds4sd開發

這是一個256M參數的預覽版文檔理解模型，專為文檔結構解析和內容提取任務設計，支持將圖像文檔轉換為結構化數據。

圖像生成文本

Transformers

英語#文檔圖像轉結構化文本 #多模態文檔處理 #輕量級視覺語言模型

下載量 246

發布時間 : 4/30/2025

模型概述

該模型基於MLX框架轉換，能夠處理圖像文本到文本的轉換任務，特別適合文檔數字化和結構化處理場景。

模型特點

文檔結構解析

能夠識別文檔中的表格、列表等結構化元素並轉換為標準格式

MLX優化

專為MLX框架優化的BF16精度版本，提升推理效率

Docling兼容

內置支持Docling文檔標準格式輸出

模型能力

圖像文檔理解

表格識別與轉換

列表識別與轉換

文檔結構化輸出

使用案例

文檔數字化

紙質文檔電子化

將掃描的紙質文檔轉換為結構化電子文檔

生成符合Docling標準的標記化輸出

表格數據提取

從圖像文檔中識別並提取表格數據

結構化表格數據輸出

🚀 SmolDocling-256M-preview-mlx-bf16

SmolDocling-256M-preview-mlx-bf16 模型是將 ds4sd/SmolDocling-256M-preview 轉換為 MLX 格式的版本，適用於圖像文本到文本的任務。它使用了 mlx-vlm 版本 0.1.18 進行轉換，並且配置文件經過調整，可與 Docling-Snap 配合使用。

🚀 快速開始

安裝依賴

pip install -U mlx-vlm pillow docling-core

使用示例

基礎用法

# /// script
# requires-python = ">=3.12"
# dependencies = [
#     "docling-core",
#     "mlx-vlm",
#     "pillow",
# ]
# ///
from io import BytesIO
from pathlib import Path
from urllib.parse import urlparse

import requests
from PIL import Image
from docling_core.types.doc import ImageRefMode
from docling_core.types.doc.document import DocTagsDocument, DoclingDocument
from mlx_vlm import load, generate
from mlx_vlm.prompt_utils import apply_chat_template
from mlx_vlm.utils import load_config, stream_generate

## Settings
SHOW_IN_BROWSER = True  # Export output as HTML and open in webbrowser.

## Load the model
model_path = "ds4sd/SmolDocling-256M-preview-mlx-bf16"
model, processor = load(model_path)
config = load_config(model_path)

## Prepare input
prompt = "Convert this page to docling."

# image = "https://ibm.biz/docling-page-with-list"
image = "https://ibm.biz/docling-page-with-table"

# Load image resource
if urlparse(image).scheme != "":  # it is a URL
    response = requests.get(image, stream=True, timeout=10)
    response.raise_for_status()
    pil_image = Image.open(BytesIO(response.content))
else:
    pil_image = Image.open(image)

# Apply chat template
formatted_prompt = apply_chat_template(processor, config, prompt, num_images=1)

## Generate output
print("DocTags: \n\n")

output = ""
for token in stream_generate(
    model, processor, formatted_prompt, [image], max_tokens=4096, verbose=False
):
    output += token.text
    print(token.text, end="")
    if "</doctag>" in token.text:
        break

print("\n\n")

# Populate document
doctags_doc = DocTagsDocument.from_doctags_and_image_pairs([output], [pil_image])
# create a docling document
doc = DoclingDocument(name="SampleDocument")
doc.load_from_doctags(doctags_doc)

## Export as any format
# Markdown
print("Markdown: \n\n")
print(doc.export_to_markdown())

# HTML
if SHOW_IN_BROWSER:
    import webbrowser

    out_path = Path("./output.html")
    doc.save_as_html(out_path, image_mode=ImageRefMode.EMBEDDED)
    webbrowser.open(f"file:///{str(out_path.resolve())}")