im2latex开源模型 - 免费部署，轻松将图像转换为LaTeX公式！

首页

Im2latex

由 DGurgurov 开发

基于VisionEncoderDecoderModel的基准模型，针对从图像生成LaTeX公式的数据集进行了微调。

图像生成文本

Transformers

开源协议:MIT #图像转LaTeX #数学公式识别 #Swin-GPT架构

下载量 288

发布时间 : 7/15/2024

模型简介

该模型能够将包含数学公式的图像转换为LaTeX代码，适用于学术文档处理和数学公式识别等场景。

模型特点

混合架构

结合视觉编码器(Swin Transformer)和文本解码器(GPT-2)，有效处理图像到文本的转换任务

高精度公式识别

在测试集上达到0.67的BLEU分数，能够准确识别复杂数学公式

分布式训练

使用PyTorch的分布式数据并行(DDP)进行高效训练

模型能力

图像识别

数学公式转换

LaTeX代码生成

使用案例

学术研究

论文公式数字化

将扫描文档或图片中的数学公式转换为可编辑的LaTeX代码

提高学术文档处理效率

教育辅助工具

帮助学生和教师快速获取图片中公式的LaTeX表示

便于数学内容共享和教学

文档处理

PDF公式提取

从PDF文档中提取公式图像并转换为可编辑格式

简化文档编辑流程

🚀 im2latex

本模型是一个基础的视觉编码器 - 解码器模型（VisionEncoderDecoderModel），在一个用于从图像生成 LaTeX 公式的数据集上进行了微调。

✨ 主要特性

能够根据图像生成 LaTeX 公式。
采用 Swin Transformer 作为编码器，GPT - 2 作为解码器。
使用 PyTorch 框架，并在训练中运用了分布式数据并行（DDP）技术。

📦 安装指南

文档未提及安装步骤，暂不展示。

💻 使用示例

基础用法

from transformers import VisionEncoderDecoderModel, AutoTokenizer, AutoFeatureExtractor
import torch
from PIL import Image

# load model, tokenizer, and feature extractor
model = VisionEncoderDecoderModel.from_pretrained("DGurgurov/im2latex")
tokenizer = AutoTokenizer.from_pretrained("DGurgurov/im2latex")
feature_extractor = AutoFeatureExtractor.from_pretrained("microsoft/swin-base-patch4-window7-224-in22k") # using the original feature extractor for now

# prepare an image
image = Image.open("path/to/your/image.png")
pixel_values = feature_extractor(images=image, return_tensors="pt").pixel_values

# generate LaTeX formula
generated_ids = model.generate(pixel_values)
generated_texts = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)

print("Generated LaTeX formula:", generated_texts[0])

📚 详细文档

模型详情

编码器：Swin Transformer
解码器：GPT - 2
框架：PyTorch
分布式数据并行（DDP）：用于训练

模型架构

训练数据

数据来源于 OleehyO/latex - formulas，并按照 80:10:10 的比例划分为训练集、验证集和测试集。划分方式如下：

dataset = load_dataset(OleehyO/latex-formulas, cleaned_formulas)
train_val_split = dataset["train"].train_test_split(test_size=0.2, seed=42)
train_ds = train_val_split["train"]
val_test_split = train_val_split["test"].train_test_split(test_size=0.5, seed=42)
val_ds = val_test_split["train"]
test_ds = val_test_split["test"]

评估指标

该模型在测试集上的评估结果如下：

测试损失：0.10
测试 BLEU 分数：0.67

训练脚本

此模型的训练脚本可在以下仓库中找到：GitHub

引用信息

如果您在研究中使用了此工作，请引用我们的论文：

@misc{gurgurov2024imagetolatexconvertermathematicalformulas,
      title={Image-to-LaTeX Converter for Mathematical Formulas and Text}, 
      author={Daniil Gurgurov and Aleksey Morshnev},
      year={2024},
      eprint={2408.04015},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2408.04015}, 
}