百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 文章教程 > 正文

Python解析HTML方法指南

yund56 2025-04-11 20:27 16 浏览

在 Python 中解析 HTML 的常用方法主要依赖以下两个库:BeautifulSouplxml。它们可以高效地提取、修改和操作 HTML/XML 数据。以下是详细指南:


1. BeautifulSoup

  • 简介:简单易用,适合快速开发,支持多种解析器(如 html.parser, lxml, html5lib)。
  • 安装

bash

pip install beautifulsoup4 requests # 推荐搭配 requests 获取网页

  • 基本用法

python

from bs4 import BeautifulSoup

import requests


# 获取网页内容

url = "https://example.com"

response = requests.get(url)

html_content = response.text


# 解析 HTML

soup = BeautifulSoup(html_content, "html.parser") # 或用 "lxml" 加速


# 通过标签名查找元素

title = soup.title.text

paragraphs = soup.find_all("p") # 所有

标签


# 通过属性查找

link = soup.find("a", {"class": "external"}) # 类名为 external 的

div_id = soup.find("div", id="header") # id 为 header 的


# 提取数据

print(link["href"]) # 获取属性

print(div_id.get_text()) # 获取文本内容


2. lxml

bash

pip install lxml requests

python

from lxml import html

import requests


url = "https://example.com"

response = requests.get(url)

tree = html.fromstring(response.content)


# 使用 XPath 查找元素

title = tree.xpath("//title/text()")[0]

links = tree.xpath("//a[@class='external']/@href") # 所有类名为 external 的链接


# 使用 CSS 选择器

paragraphs = tree.cssselect("p.highlight") # 类为 highlight 的

标签


3. 对比与选择

优点

缺点

BeautifulSoup

语法简单,容错性强

依赖外部解析器,速度较慢

lxml

速度快,支持 XPath/CSS

学习曲线稍高

  • 推荐场景
  • O 快速开发/简单任务 → BeautifulSoup

    O 高性能/复杂解析 → lxml + XPath。


    4. 高级技巧

    python

    element = soup.find("div", id="nonexistent")

    if element:

    print(element.text)


    5. 示例:提取所有链接

    python

    # 使用 BeautifulSoup

    for a in soup.find_all("a", href=True):

    print(a["href"])


    # 使用 lxml + XPath

    links = tree.xpath("//a/@href")

    print(links)


    6. 注意事项

    如果需要处理复杂 JSON API 或大规模数据,可结合 Scrapy 框架(专为爬虫设计)。

    相关推荐

    SM小分队Girls on Top,女神战队少了f(x)?

    这次由SM娱乐公司在冬季即将开演的smtown里,将公司的所有女团成员集结成了一个小分队project。第一位这是全面ACE的大姐成员权宝儿(BoA),出道二十年,在日本单人销量过千万,韩国国内200...

    韩国女团 aespa 首场 VR 演唱会或暗示 Quest 3 将于 10 月推出

    AmazeVR宣布将在十月份举办一场现场VR音乐会,观众将佩戴MetaQuest3进行体验。韩国女团aespa于2020年11月出道,此后在日本推出了三张金唱片,在韩国推出了...

    韩网热议!女团aespa成员Giselle在长腿爱豆中真的是legend

    身高163的Giselle,长腿傲人,身材比例绝了...

    假唱而被骂爆的女团:IVE、NewJeans、aespa上榜

    在韩国,其实K-pop偶像并不被认为是真正的歌手,因为偶像们必须兼备舞蹈能力、也经常透过对嘴来完成舞台。由于科技的日渐发达,也有许多网友会利用消音软体来验证K-pop偶像到底有没有开麦唱歌,导致假唱这...

    新女团Aespa登时尚大片 四个少女四种style

    来源:环球网

    韩国女团aespa新歌MV曝光 画面梦幻造型超美

    12月20日,韩国女团aespa翻唱曲《DreamsComeTrue》MV公开,视频中,她们的造型超美!WINTER背后长出一双梦幻般的翅膀。柳智敏笑容甜美。宁艺卓皮肤白皙。GISELLE五官精致...

    女网友向拳头维权,自称是萨勒芬妮的原型?某韩国女团抄袭KDA

    女英雄萨勒芬妮(Seraphine)是拳头在2020年推出的第五位新英雄,在还没有正式上线时就备受lsp玩家的关注,因为她实在是太可爱了。和其他新英雄不同的是,萨勒芬妮在没上线时就被拳头当成虚拟偶像来...

    人气TOP女团是?INS粉丝数见分晓;TWICE成员为何在演唱会落泪?

    现在的人气TOP女团是?INS粉丝数见分晓!现在爱豆和粉丝之间的交流方法变得多种多样,但是Instagram依然是主要的交流手段。很多粉丝根据粉丝数评价偶像的人气,拥有数百、数千万粉丝的组合作为全球偶...

    韩国女团MVaespa Drama MV_韩国女团穿超短裙子跳舞

    WelcometoDrama.Pleasefollow4ruleswhilewatchingtheDrama.·1)Lookbackimmediatelywhenyoufe...

    aespa师妹团今年将出道! SM职员亲口曝「新女团风格、人数」

    记者刘宛欣/综合报导南韩造星工厂SM娱乐曾打造出东方神起、SUPERJUNIOR、少女时代、SHINee、EXO等传奇团体,近年推出的aespa、RIIZE更是双双成为新生代一线团体,深受大众与粉丝...

    南韩最活跃的女团aespa,新专辑《Girls》即将发布,盘点昔日经典

    女团aespa歌曲盘点,新专辑《Girls》即将发布,期待大火。明天也就是2022年的7月8号,aespa新专辑《Girls》即将发行。这是继首张专辑《Savage》之后,时隔19个月的第二张专辑,这...

    章泽天女团aespa出席戛纳晚宴 宋康昊携新片亮相

    搜狐娱乐讯(山今/文玄反影/图科明/视频)法国时间5月23日晚,女团aespa、宋康昊、章泽天等明星亮相戛纳晚宴。章泽天身姿优越。章泽天肩颈线优越。章泽天双臂纤细。章泽天仪态端正。女团aespa亮...

    Aespa舞台暴露身高比例,宁艺卓脸大,柳智敏有“TOP”相

    作为SM公司最新女团aespa,初舞台《BlackMamba》公开,在初舞台里,看得出来SM公司是下了大功夫的,虽然之前SM公司新出的女团都有很长的先导片,但是aespa显然是有“特殊待遇”。运用了...

    AESPA女团成员柳智敏karina大美女

    真队内速度最快最火达成队内首个且唯一两百万点赞五代男女团中输断层第一(图转自微博)...

    对来学校演出的女团成员语言性骚扰?韩国这所男高的学生恶心透了

    哕了……本月4日,景福男子高中相关人士称已经找到了在SNS中上传对aespa成员进行性骚扰文章的学生,并开始着手调查。2日,SM娱乐创始人李秀满的母校——景福高中迎来了建校101周年庆典活动。当天,S...