SmolDocling-256M-preview开源文档理解模型 - 解析结构、提取内容，图像转数据

首页

Smoldocling 256M Preview Mlx Bf16 Docling Snap

由 ds4sd 开发

这是一个256M参数的预览版文档理解模型，专为文档结构解析和内容提取任务设计，支持将图像文档转换为结构化数据。

图像生成文本

Transformers

英语#文档图像转结构化文本 #多模态文档处理 #轻量级视觉语言模型

下载量 246

发布时间 : 4/30/2025

模型简介

该模型基于MLX框架转换，能够处理图像文本到文本的转换任务，特别适合文档数字化和结构化处理场景。

模型特点

文档结构解析

能够识别文档中的表格、列表等结构化元素并转换为标准格式

MLX优化

专为MLX框架优化的BF16精度版本，提升推理效率

Docling兼容

内置支持Docling文档标准格式输出

模型能力

图像文档理解

表格识别与转换

列表识别与转换

文档结构化输出

使用案例

文档数字化

纸质文档电子化

将扫描的纸质文档转换为结构化电子文档

生成符合Docling标准的标记化输出

表格数据提取

从图像文档中识别并提取表格数据

结构化表格数据输出

🚀 SmolDocling-256M-preview-mlx-bf16

SmolDocling-256M-preview-mlx-bf16 模型是将 ds4sd/SmolDocling-256M-preview 转换为 MLX 格式的版本，适用于图像文本到文本的任务。它使用了 mlx-vlm 版本 0.1.18 进行转换，并且配置文件经过调整，可与 Docling-Snap 配合使用。

🚀 快速开始

安装依赖

pip install -U mlx-vlm pillow docling-core

使用示例

基础用法

# /// script
# requires-python = ">=3.12"
# dependencies = [
#     "docling-core",
#     "mlx-vlm",
#     "pillow",
# ]
# ///
from io import BytesIO
from pathlib import Path
from urllib.parse import urlparse

import requests
from PIL import Image
from docling_core.types.doc import ImageRefMode
from docling_core.types.doc.document import DocTagsDocument, DoclingDocument
from mlx_vlm import load, generate
from mlx_vlm.prompt_utils import apply_chat_template
from mlx_vlm.utils import load_config, stream_generate

## Settings
SHOW_IN_BROWSER = True  # Export output as HTML and open in webbrowser.

## Load the model
model_path = "ds4sd/SmolDocling-256M-preview-mlx-bf16"
model, processor = load(model_path)
config = load_config(model_path)

## Prepare input
prompt = "Convert this page to docling."

# image = "https://ibm.biz/docling-page-with-list"
image = "https://ibm.biz/docling-page-with-table"

# Load image resource
if urlparse(image).scheme != "":  # it is a URL
    response = requests.get(image, stream=True, timeout=10)
    response.raise_for_status()
    pil_image = Image.open(BytesIO(response.content))
else:
    pil_image = Image.open(image)

# Apply chat template
formatted_prompt = apply_chat_template(processor, config, prompt, num_images=1)

## Generate output
print("DocTags: \n\n")

output = ""
for token in stream_generate(
    model, processor, formatted_prompt, [image], max_tokens=4096, verbose=False
):
    output += token.text
    print(token.text, end="")
    if "</doctag>" in token.text:
        break

print("\n\n")

# Populate document
doctags_doc = DocTagsDocument.from_doctags_and_image_pairs([output], [pil_image])
# create a docling document
doc = DoclingDocument(name="SampleDocument")
doc.load_from_doctags(doctags_doc)

## Export as any format
# Markdown
print("Markdown: \n\n")
print(doc.export_to_markdown())

# HTML
if SHOW_IN_BROWSER:
    import webbrowser

    out_path = Path("./output.html")
    doc.save_as_html(out_path, image_mode=ImageRefMode.EMBEDDED)
    webbrowser.open(f"file:///{str(out_path.resolve())}")