百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 文章教程 > 正文

使用GPT-4o将 PDF 解析为 Markdown 的工具,实现pdf转word完美转档

yund56 2025-03-12 15:48 4 浏览

仅293行代码,它可以几乎完美地解析任何PDF文件,包括排版、数学公式、表格、图片和图表等内容,平均每页成本为 $0.013,如果有免费的api,那就是零成本。

工作原理:使用PyMuPDF库,首先对PDF进行解析出所有非文本区域,并做好标记 然后使用GPT-4o进行解析,得到markdown文件。

项目名称:gptpdf[1]

主程序

def parse_pdf(pdf_path, output_dir='./', api_key=None, base_url=None, model='gpt-4o', verbose=False, gpt_worker=1):
    
    """
    解析PDF文件到markdown文件
    :param pdf_path: pdf文件路径
    :param output_dir: 输出目录。存储所有的图片和markdown文件
    :param api_key: OpenAI API Key(可选)。如果未提供,则使用OPENAI_API_KEY环境变量。
    :param base_url: OpenAI Base URL。(可选)。如果未提供,则使用OPENAI_BASE_URL环境变量。
    :param model: OpenAI Vison LLM Model,默认为'gpt-4o'。您还可以使用qwen-vl-max
    :param verbose: 详细模式,默认为False
    :param gpt_worker: gpt解析工作线程数,默认为1
    :return: (content, all_rect_images), markdown内容,带有![](path/to/image.png) 和 所有矩形图像(图像、表格、图表等)路径列表。
    """
    import os
    if not os.path.exists(output_dir):
        os.makedirs(output_dir)

    image_infos = _parse_pdf_to_images(pdf_path, output_dir=output_dir)
    content = _gpt_parse_images(image_infos, output_dir=output_dir, api_key=api_key, base_url=base_url, model=model, verbose=verbose, gpt_worker=gpt_worker)

    # 删除每页的图片 & 保留所有的矩形图片
    all_rect_images = []
    for page_image, rect_images in image_infos:
        if os.path.exists(page_image):
            os.remove(page_image)
        all_rect_images.extend(rect_images)
    
    return content, all_rect_images

用法

python环境下直接安装gptpdf:

pip install gptpdf

在代码中直接导入parse_pdf,输入参数包括,输入pdf文件,gpt api等,其他参数可以缺省。

import os
# laod environment variables from .env file
import dotenv
dotenv.load_dotenv()

def test_use_api_key():
    from gptpdf import parse_pdf
    pdf_path = '../examples/attention_is_all_you_need.pdf'
    output_dir = '../examples/attention_is_all_you_need/'
    api_key = os.getenv('OPENAI_API_KEY')
    base_url = os.getenv('OPENAI_API_BASE')
    # Manually provide OPENAI_API_KEY and OPEN_API_BASE
    content, image_paths = parse_pdf(pdf_path, output_dir=output_dir, api_key=api_key, base_url=base_url, model='gpt-4o', gpt_worker=6)
    print(content)
    print(image_paths)
    # also output_dir/output.md is generated

if __name__ == '__main__':
    test_use_api_key()
    # test_use_env()

如果使用代理api可以参数上加上base_url。

示例

原文件为:

解析出markdown格式为:

解析出markdown文件基本准确,可用性较高。

测试

在cnki下一篇文章,通过它来解析:

整体识别还是比较不错,个别地方是给出整张图片,没有解析文字。这个距离pdf转word已经很近了,可以直接把markdown转doc。

markdown转doc

直接把markdown转成doc完成最后一步:

def markdown_to_docx(markdown_file, output_file):
    # 读取Markdown文件内容,指定编码为GB2312
    with open(markdown_file, 'r', encoding='gb2312') as f:
        markdown_text = f.read()
    # 使用mistune解析Markdown文本
    html = mistune.markdown(markdown_text)

    # 使用BeautifulSoup解析HTML
    soup = BeautifulSoup(html, 'html.parser')

    # 创建一个新的docx文档
    doc = Document()

    # 递归解析HTML并添加到docx文档中
    def parse_html(element, parent):
        if isinstance(element, NavigableString):
            # 为纯文本创建一个段落并添加文本
            new_paragraph = parent.add_paragraph()
            new_paragraph.add_run(str(element))
        elif element.name in ['h1', 'h2', 'h3', 'h4', 'h5', 'h6']:
            # 添加标题
            heading_level = int(element.name[1])  # heading level 1-6
            new_paragraph = parent.add_heading(element.text.strip(), level=heading_level)
        elif element.name == 'p':
            # 添加段落
            new_paragraph = parent.add_paragraph(element.text)
            # 遍历段落内的img标签并处理图片
            for img in element.find_all('img'):
                img_src = img.get('src')
                if img_src:
                    img_full_path = os.path.join(os.path.dirname(markdown_file), img_src)
                    if os.path.exists(img_full_path):
                        try:
                            # 添加图片到段落中
                            run = new_paragraph.add_run()
                            run.add_picture(img_full_path, width=Inches(4))
                        except Exception as e:
                            print(f"Error adding image: {e}")
                    else:
                        print(f"Warning: Image file '{img_full_path}' not found.")
        elif element.name in ['ul', 'ol']:
            # 添加列表项
            bullet_style = 'ListBullet' if element.name == 'ul' else 'ListNumber'
            for li in element.find_all('li'):
                new_paragraph = parent.add_paragraph(li.text.strip(), style=bullet_style)
        else:
            # 递归处理其他元素
            for child in element.children:
                parse_html(child, parent)

    # 遍历soup的子元素并解析
    for element in soup.children:
        parse_html(element, doc)
    # 保存docx文档
    doc.save(output_file)

转成word最后的效果:

现在的问题是word文档有好多空行,还有一些表,它把表以图的形式放在文档中,又通过gpt转成了表,后续作者优化应该可以解决。

脚本下载

如果上github不方便,可以后台回复gptpdf获取作者的代码,以及markdown转word部分代码。

相关推荐

如何在Office 中编辑 PDF?附详细化步骤

PDF很受欢迎,因为它能在不同的设备和操作系统上仍然保持原有格式。但是,这也意味着直接更改PDF文件比其他格式更难更复杂。值得庆幸的是,Microsoftoffice和UPDF帮你解决这一难题。一...

我的 Windows 装机必备软件清单

今天给大家分享下我的装机必备软件,都是用了好多年的软件神器。靠谱、好用、无广告,Windows电脑必备软件,收藏这一篇就够了!01.浏览器王者:Chromehttps://www.google.c...

Docnet Core 是一个轻量级、高性能的 .NET PDF 操作库

DocnetCore介绍DocnetCore是一个轻量级、高性能的.NETPDF操作库,依托于PDFium渲染引擎,提供强大的PDF文档解析、渲染、操作等功能。它完全支持.NET...

分享三款好用的PDF编辑软件,轻松处理PDF

作为一名需要经常和PDF文件打交道的工作者,我来分享一下几款好用的PDF编辑软件,并详细分析了它们的优缺点,希望能帮你找到合适的工具。1.AdobeAcrobatDC作为PDF格式的发明者,Ado...

PDF文档创建工具软件:novaPDF OEM 11.9 Build 432 for Windows

novaPDFOEM是一款实用高效的软件,从头开始设计,让您尽可能轻松地在应用程序中添加PDF打印功能。换句话说,这个实用程序是专门为应用程序开发人员设计的,可以直接在程序安装程序中集成为PDF打印...

线性表顺序存储结构求集合的并,交,补,差(源代码附上 超详细)

一:算法分析1)用数组A,B,C,E表示集合。假定A={1,3,4,5,6,7,9,10},  B={2,,3,4,7,8,10},E={1,2,3,4,5,6,7,8,9,10},  输入数组A...

分享一套SpringBoot开发博客系统源码,包含完整开发文档和视频

基本信息项目名称:eblog摘要:eblog是一个基于Springboot2.1.2开发的博客学习项目,为了让项目融合更多的知识点,达到学习目的,编写了详细的从0到1开发文档。主要学习包括:自定义Fr...

通达信指标合集〔源码齐全〕

很多朋友问到我哪款指标好用,这里我说一下,之所以有很多不同的指标是因为我们在针对不同的盘面情况的时候使用的指标是不同的,我给到的指标一般来讲就目前的环境来讲都是比较适合的,今天我就把我平时自己常用的指...

巅峰对决!Spring Boot VS .NET 6

SpringBoot和ASP.NETCore都是企业中流行的Web框架,对于喜欢C#的人会使用ASP.NETCore,而对于Java或Kotlin等基于JVM的语...

在asp.net core 中控制访问权限的方法

Intro#由于项目需要,需要在基于asp.netmvc的Web项目框架中做权限的控制,于是才有了这个权限控制组件,最初只是支持netframework,后来dotnetcore2.0...

ASP.NET是否无生存之地?

ASP.NET,这个已经很久的技术,总觉得已经被时代淘汰,我们公司是一个10人小公司,几个十年十五年的项目还是用ASP.NET开发的。这两年由于客户的需求变化,我们公司也顺势开始对这些项目重新开发,改...

Spring Boot + Vue.js 实现前后端分离(附源码)

作者:梁小生0101链接:juejin.im/post/5c622fb5e51d457f9f2c2381SpringBoot+Vue.js前后端涉及基本概念介绍,搭建记录,本文会列举出用到环...

ASP.NET Core 中的 Mapster 使用入门教程

在本文中,我们将学习如何在ASP.NETCore应用程序中使用Mapster。首先,我们将了解Mapster是什么以及如何将其安装到.NETCore应用程序中。然后,我们将在使用...

Asp.net常用方法及request和response-a

asp.net教程asp.net常用方法:1、Request.UrlReferrer请求的来源,可以根据这个判断从百度搜的哪个关键词、防下载盗链、防图片盗链,可以伪造(比如迅雷)。(使用全局一般处理...

ASP.NET Core使用功能开关控制路由访问

前言在前面的文章,我们介绍了使用Middleware有条件地允许访问路由(《ASP.NETCore使用Middleware有条件地允许访问路由》)。而对于一些试验性的功能,我们并不希望用密码去控制是...