百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 文章教程 > 正文

使用GPT-4o将 PDF 解析为 Markdown 的工具,实现pdf转word完美转档

yund56 2025-03-12 15:48 13 浏览

仅293行代码,它可以几乎完美地解析任何PDF文件,包括排版、数学公式、表格、图片和图表等内容,平均每页成本为 $0.013,如果有免费的api,那就是零成本。

工作原理:使用PyMuPDF库,首先对PDF进行解析出所有非文本区域,并做好标记 然后使用GPT-4o进行解析,得到markdown文件。

项目名称:gptpdf[1]

主程序

def parse_pdf(pdf_path, output_dir='./', api_key=None, base_url=None, model='gpt-4o', verbose=False, gpt_worker=1):
    
    """
    解析PDF文件到markdown文件
    :param pdf_path: pdf文件路径
    :param output_dir: 输出目录。存储所有的图片和markdown文件
    :param api_key: OpenAI API Key(可选)。如果未提供,则使用OPENAI_API_KEY环境变量。
    :param base_url: OpenAI Base URL。(可选)。如果未提供,则使用OPENAI_BASE_URL环境变量。
    :param model: OpenAI Vison LLM Model,默认为'gpt-4o'。您还可以使用qwen-vl-max
    :param verbose: 详细模式,默认为False
    :param gpt_worker: gpt解析工作线程数,默认为1
    :return: (content, all_rect_images), markdown内容,带有![](path/to/image.png) 和 所有矩形图像(图像、表格、图表等)路径列表。
    """
    import os
    if not os.path.exists(output_dir):
        os.makedirs(output_dir)

    image_infos = _parse_pdf_to_images(pdf_path, output_dir=output_dir)
    content = _gpt_parse_images(image_infos, output_dir=output_dir, api_key=api_key, base_url=base_url, model=model, verbose=verbose, gpt_worker=gpt_worker)

    # 删除每页的图片 & 保留所有的矩形图片
    all_rect_images = []
    for page_image, rect_images in image_infos:
        if os.path.exists(page_image):
            os.remove(page_image)
        all_rect_images.extend(rect_images)
    
    return content, all_rect_images

用法

python环境下直接安装gptpdf:

pip install gptpdf

在代码中直接导入parse_pdf,输入参数包括,输入pdf文件,gpt api等,其他参数可以缺省。

import os
# laod environment variables from .env file
import dotenv
dotenv.load_dotenv()

def test_use_api_key():
    from gptpdf import parse_pdf
    pdf_path = '../examples/attention_is_all_you_need.pdf'
    output_dir = '../examples/attention_is_all_you_need/'
    api_key = os.getenv('OPENAI_API_KEY')
    base_url = os.getenv('OPENAI_API_BASE')
    # Manually provide OPENAI_API_KEY and OPEN_API_BASE
    content, image_paths = parse_pdf(pdf_path, output_dir=output_dir, api_key=api_key, base_url=base_url, model='gpt-4o', gpt_worker=6)
    print(content)
    print(image_paths)
    # also output_dir/output.md is generated

if __name__ == '__main__':
    test_use_api_key()
    # test_use_env()

如果使用代理api可以参数上加上base_url。

示例

原文件为:

解析出markdown格式为:

解析出markdown文件基本准确,可用性较高。

测试

在cnki下一篇文章,通过它来解析:

整体识别还是比较不错,个别地方是给出整张图片,没有解析文字。这个距离pdf转word已经很近了,可以直接把markdown转doc。

markdown转doc

直接把markdown转成doc完成最后一步:

def markdown_to_docx(markdown_file, output_file):
    # 读取Markdown文件内容,指定编码为GB2312
    with open(markdown_file, 'r', encoding='gb2312') as f:
        markdown_text = f.read()
    # 使用mistune解析Markdown文本
    html = mistune.markdown(markdown_text)

    # 使用BeautifulSoup解析HTML
    soup = BeautifulSoup(html, 'html.parser')

    # 创建一个新的docx文档
    doc = Document()

    # 递归解析HTML并添加到docx文档中
    def parse_html(element, parent):
        if isinstance(element, NavigableString):
            # 为纯文本创建一个段落并添加文本
            new_paragraph = parent.add_paragraph()
            new_paragraph.add_run(str(element))
        elif element.name in ['h1', 'h2', 'h3', 'h4', 'h5', 'h6']:
            # 添加标题
            heading_level = int(element.name[1])  # heading level 1-6
            new_paragraph = parent.add_heading(element.text.strip(), level=heading_level)
        elif element.name == 'p':
            # 添加段落
            new_paragraph = parent.add_paragraph(element.text)
            # 遍历段落内的img标签并处理图片
            for img in element.find_all('img'):
                img_src = img.get('src')
                if img_src:
                    img_full_path = os.path.join(os.path.dirname(markdown_file), img_src)
                    if os.path.exists(img_full_path):
                        try:
                            # 添加图片到段落中
                            run = new_paragraph.add_run()
                            run.add_picture(img_full_path, width=Inches(4))
                        except Exception as e:
                            print(f"Error adding image: {e}")
                    else:
                        print(f"Warning: Image file '{img_full_path}' not found.")
        elif element.name in ['ul', 'ol']:
            # 添加列表项
            bullet_style = 'ListBullet' if element.name == 'ul' else 'ListNumber'
            for li in element.find_all('li'):
                new_paragraph = parent.add_paragraph(li.text.strip(), style=bullet_style)
        else:
            # 递归处理其他元素
            for child in element.children:
                parse_html(child, parent)

    # 遍历soup的子元素并解析
    for element in soup.children:
        parse_html(element, doc)
    # 保存docx文档
    doc.save(output_file)

转成word最后的效果:

现在的问题是word文档有好多空行,还有一些表,它把表以图的形式放在文档中,又通过gpt转成了表,后续作者优化应该可以解决。

脚本下载

如果上github不方便,可以后台回复gptpdf获取作者的代码,以及markdown转word部分代码。

相关推荐

SM小分队Girls on Top,女神战队少了f(x)?

这次由SM娱乐公司在冬季即将开演的smtown里,将公司的所有女团成员集结成了一个小分队project。第一位这是全面ACE的大姐成员权宝儿(BoA),出道二十年,在日本单人销量过千万,韩国国内200...

韩国女团 aespa 首场 VR 演唱会或暗示 Quest 3 将于 10 月推出

AmazeVR宣布将在十月份举办一场现场VR音乐会,观众将佩戴MetaQuest3进行体验。韩国女团aespa于2020年11月出道,此后在日本推出了三张金唱片,在韩国推出了...

韩网热议!女团aespa成员Giselle在长腿爱豆中真的是legend

身高163的Giselle,长腿傲人,身材比例绝了...

假唱而被骂爆的女团:IVE、NewJeans、aespa上榜

在韩国,其实K-pop偶像并不被认为是真正的歌手,因为偶像们必须兼备舞蹈能力、也经常透过对嘴来完成舞台。由于科技的日渐发达,也有许多网友会利用消音软体来验证K-pop偶像到底有没有开麦唱歌,导致假唱这...

新女团Aespa登时尚大片 四个少女四种style

来源:环球网

韩国女团aespa新歌MV曝光 画面梦幻造型超美

12月20日,韩国女团aespa翻唱曲《DreamsComeTrue》MV公开,视频中,她们的造型超美!WINTER背后长出一双梦幻般的翅膀。柳智敏笑容甜美。宁艺卓皮肤白皙。GISELLE五官精致...

女网友向拳头维权,自称是萨勒芬妮的原型?某韩国女团抄袭KDA

女英雄萨勒芬妮(Seraphine)是拳头在2020年推出的第五位新英雄,在还没有正式上线时就备受lsp玩家的关注,因为她实在是太可爱了。和其他新英雄不同的是,萨勒芬妮在没上线时就被拳头当成虚拟偶像来...

人气TOP女团是?INS粉丝数见分晓;TWICE成员为何在演唱会落泪?

现在的人气TOP女团是?INS粉丝数见分晓!现在爱豆和粉丝之间的交流方法变得多种多样,但是Instagram依然是主要的交流手段。很多粉丝根据粉丝数评价偶像的人气,拥有数百、数千万粉丝的组合作为全球偶...

韩国女团MVaespa Drama MV_韩国女团穿超短裙子跳舞

WelcometoDrama.Pleasefollow4ruleswhilewatchingtheDrama.·1)Lookbackimmediatelywhenyoufe...

aespa师妹团今年将出道! SM职员亲口曝「新女团风格、人数」

记者刘宛欣/综合报导南韩造星工厂SM娱乐曾打造出东方神起、SUPERJUNIOR、少女时代、SHINee、EXO等传奇团体,近年推出的aespa、RIIZE更是双双成为新生代一线团体,深受大众与粉丝...

南韩最活跃的女团aespa,新专辑《Girls》即将发布,盘点昔日经典

女团aespa歌曲盘点,新专辑《Girls》即将发布,期待大火。明天也就是2022年的7月8号,aespa新专辑《Girls》即将发行。这是继首张专辑《Savage》之后,时隔19个月的第二张专辑,这...

章泽天女团aespa出席戛纳晚宴 宋康昊携新片亮相

搜狐娱乐讯(山今/文玄反影/图科明/视频)法国时间5月23日晚,女团aespa、宋康昊、章泽天等明星亮相戛纳晚宴。章泽天身姿优越。章泽天肩颈线优越。章泽天双臂纤细。章泽天仪态端正。女团aespa亮...

Aespa舞台暴露身高比例,宁艺卓脸大,柳智敏有“TOP”相

作为SM公司最新女团aespa,初舞台《BlackMamba》公开,在初舞台里,看得出来SM公司是下了大功夫的,虽然之前SM公司新出的女团都有很长的先导片,但是aespa显然是有“特殊待遇”。运用了...

AESPA女团成员柳智敏karina大美女

真队内速度最快最火达成队内首个且唯一两百万点赞五代男女团中输断层第一(图转自微博)...

对来学校演出的女团成员语言性骚扰?韩国这所男高的学生恶心透了

哕了……本月4日,景福男子高中相关人士称已经找到了在SNS中上传对aespa成员进行性骚扰文章的学生,并开始着手调查。2日,SM娱乐创始人李秀满的母校——景福高中迎来了建校101周年庆典活动。当天,S...