【Python爬虫从入门到实战】Requests库与XPath解析详解(附豆瓣Top250抓取案例)
前言在Python爬虫的世界里requests和lxml (XPath)是一对黄金搭档。前者负责高效地获取网页数据后者负责精准地提取目标信息。本文将结合豆瓣电影Top250实战案例带你彻底掌握这两个核心工具。第一部分基础知识体系1. Requests 库HTTP 请求的利器requests是一个基于urllib3封装的 HTTP 客户端库被称为“给人类使用的 HTTP 库”。核心特点API 简洁直观自动处理连接管理、Cookie 持久化。支持多种协议支持 Keep-Alive 和连接池。安全性支持 SSL 证书验证、Session 会话保持。自动解码内置 JSON 解码器自动处理压缩响应。关键概念URL互联网上某个资源的地址如https://www.baidu.com/s?wdpython。Headers (请求头)伪装浏览器的关键。User-Agent告诉服务器你是谁浏览器版本、操作系统。如果不加这个很容易被服务器识别为爬虫并拦截403 Forbidden。常用方法与属性方法/属性说明示例requests.get()发送 GET 请求response requests.get(url, headersheaders)requests.post()发送 POST 请求requests.post(url, datadata)response.text获取字符串形式的响应内容用于解析 HTMLresponse.content获取二进制响应内容用于下载图片、视频response.status_code获取状态码200 (成功), 404 (未找到), 500 (服务器错误)response.encoding设置/获取编码格式response.encoding utf-8IP 代理 (Proxies)当访问频率过高导致 IP 被封时需要使用代理 IP 来隐藏真实身份或突破访问限制。proxies { http: http://106.14.170.158:18, https: http://106.14.170.158:18 } requests.get(url, proxiesproxies)2. XPath 解析器精准的数据提取XPath (XML Path Language) 是一种在 XML/HTML 文档中查找信息的语言。相比于正则表达式它更适合处理结构化的 DOM 树。XPath解析器获取XPath解析器是浏览器的插件或者拓展在浏览器的插件或者拓展商城就能找到推荐下载XPath Helper以下以Microsoft拓展商城为例在我们想要获取其内容路径的页面打开XPath解析器按住shift键移动鼠标到想要的内容如果将鼠标移动到内容上面没有路径显示就单击一下左键这时就会出现相关内容。节点关系根节点整个文档的源头。父/子/兄弟节点描述元素之间的层级关系。文本节点包含在标签内的文字内容。路径表达式绝对路径从根节点开始写如/html/body/div[1]/div...不推荐太脆弱。相对路径使用//开头从全文档搜索匹配节点如//div[classitem]推荐。常用语法速查语法说明示例/选取直接子节点/div/a//选取所有后代节点不考虑位置//div//span.选取当前节点常用于循环内部继续查找..选取父节点选取属性//a/hreftext()选取文本内容//div/text()[]谓语条件筛选//div[idmain]进阶函数与轴下面通过一个本地 HTML 文件hello.html来演示 XPath 的进阶用法。该文件包含一个ul列表里面有多个带有不同id属性的li标签内容如下!DOCTYPE html html langen head meta charsetUTF-8 / title学习Xpath/title /head body ul li idlhfPython爬虫/li lirequests库/li li idzlgxqXpath解析器/li liget请求/li lipost请求/li li idzwq classc1Hello World/li /ul /body /htmlfrom lxml import etree 解析本地文件 html_etree etree.parse(D:\PYTHON基础\python\Python_spider\hello.html) 1. 查找 ul 下面的 li 标签 —— 多种路径写法 li_list1 html_etree.xpath(/html/body/ul/li/text()) # 绝对路径 li_list2 html_etree.xpath(//ul/li/text()) # 相对路径 li_list3 html_etree.xpath(//li/../text()) # 父节点 li_list4 html_etree.xpath(//li/./text()) # 当前节点 2. 查询所有带 id 属性的 li 标签 li_list5 html_etree.xpath(//ul/li[id]/text()) 3. 查找 id 为 zwq 的标签的 class 属性值 li_list6 html_etree.xpath(//ul/li[idzwq]/class) 4. 查找 id 为 zwq 的 li 标签的文本 li_list7 html_etree.xpath(//ul/li[idzwq]/text())运行输出演示# li_list1绝对路径和 li_list2相对路径输出相同 [Python爬虫, requests库, Xpath解析器, get请求, post请求, Hello World] li_list5所有带 id 属性的 li 标签文本 [Python爬虫, Xpath解析器, Hello World] li_list6id 为 zwq 的标签的 class 属性值 [c1] li_list7id 为 zwq 的 li 标签文本 [Hello World]contains()模糊匹配属性检查字符串是否包含子字符串。例如//div[contains(class, btn)]可以匹配 class 为btn-primary的标签。示例查找 id 中包含字母l的 li 标签。li_list8 html_etree.xpath(//ul/li[contains(id,l)]/text())输出[Python爬虫, Hello World]starts-with()匹配以某字符串开头的属性。示例查找 id 中以l开头的 li 标签。li_list9 html_etree.xpath(//ul/li[starts-with(id,l)]/text())输出[Python爬虫]string-length()根据字符串长度筛选。示例查找 id 长度等于 3 的 li 标签。li_list10 html_etree.xpath(//ul/li[string-length(id)3]/text())输出[Python爬虫, Hello World]逻辑运算符 or组合多个条件。示例查找 id 为lhf或zwq的 li 标签注意正确写法需要把or条件放在同一个谓语[]内而不是写成两个独立的li[...]。li_list11 html_etree.xpath(//ul/li[idlhf or idzwq]/text())输出[Python爬虫, Hello World]position() 与 last()根据位置筛选。示例查找前 3 个 li、最后一个 li、以及第 1 个 li。li_list12 html_etree.xpath(//ul/li[position()4]/text()) li_list13 html_etree.xpath(//ul/li[last()]/text()) li_list14 html_etree.xpath(//ul/li[1]/text())输出# li_list12前 3 个 li [Python爬虫, requests库, Xpath解析器] li_list13最后一个 li [Hello World] li_list14第 1 个 li [Python爬虫]索引注意 XPath 的索引是从1开始的而不是 0。例如//li[1]是第一个 li。第二部分实战演练——爬取豆瓣电影 Top2501. 需求分析目标抓取电影名称、导演、主演、年份、国家、类型、评分、评价人数及引言。存储保存为 CSV 文件。难点分页处理URL 规律。数据清洗文本中包含大量\xa0空格和换行符。异常处理防止程序中断。2. 完整代码实现from lxml import etree import requests import csv import time 配置区 1. 构造请求头伪装成浏览器 headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36 } 2. 准备CSV文件 with open(douban_250.csv, w, encodingutf-8-sig, newline) as file: writer csv.writer(file) # 写入表头 writer.writerow([电影名称, 导演, 主演, 年份, 国家, 类型, 评分, 评价人数, 引言]) # 循环抓取区 # 豆瓣Top250共10页每页25部start参数每次增加25 for start in range(0, 250, 25): url fhttps://movie.douban.com/top250?start{start} print(f正在抓取第 {start // 25 1} 页: {url}) try: # 3. 发送请求 response requests.get(urlurl, headersheaders, timeout10) # 检查响应状态非200会抛出异常 response.raise_for_status() # 设置编码防止乱码 response.encoding utf-8 except Exception as e: print(f页面请求失败{e}) continue 4. 解析 HTML html etree.HTML(response.text) 获取所有电影项的列表定位到每一个电影的容器 items html.xpath(//div[classitem]) 数据提取与清洗区 for item in items: try: # --- 提取电影名称 --- # .// 表示在当前 item 节点下查找 title_list item.xpath(.//span[classtitle][1]/text()) title title_list[0].strip() if title_list else 暂无名称 # --- 提取详细信息导演/主演/年份等 --- # 这里获取的是 p 标签下的所有文本列表通常包含两行 info_lines item.xpath(.//div[classbd]/p[1]/text()) # 初始化变量 director actors year country movie_type 暂无数据 if info_lines: # 清洗数据去除首尾空白和 \xa0 (不间断空格) # replace(\xa0, ) 是关键步骤 clean_line_1 info_lines[0].strip().replace(\xa0, ).replace(\n, ) # 解析第一行导演和主演 if 主演: in clean_line_1: parts clean_line_1.split(主演:) director parts[0].replace(导演:, ).strip() actors parts[1].strip() elif 导演: in clean_line_1: director clean_line_1.replace(导演:, ).strip() # 解析第二行年份 / 国家 / 类型 if len(info_lines) amp;amp;gt; 1: line_2 info_lines[1].strip().replace(\xa0, ).replace(\n, ) # 使用 split(/) 分割注意有些数据可能缺失 details [x.strip() for x in line_2.split(/)] if len(details) amp;amp;gt; 3: year details[0] country details[1] movie_type details[2] elif len(details) 2: year details[0] country details[1] # --- 提取评分 --- rating_list item.xpath(.//span[classrating_num]/text()) rating rating_list[0].strip() if rating_list else 暂无评分 # --- 提取评价人数 --- # 这里的 xpath 路径可能需要根据实际网页微调通常是 span[4] 或者通过 text 内容判断 rating_num_raw item.xpath(.//div[classstar]/span[4]/text()) rating_num rating_num_raw[0].replace(人评价, ).strip() if rating_num_raw else 0 # --- 提取引言 --- quote_list item.xpath(.//p[classquote]/span/text()) quote quote_list[0].strip() if quote_list else 暂无引言 # 5. 写入 CSV writer.writerow([title, director, actors, year, country, movie_type, rating, rating_num, quote]) except Exception as e: print(f解析单条数据出错: {e}) continue 礼貌爬取休眠 2 秒 time.sleep(2) print(抓取完成数据已保存至 douban_250.csv)3. 代码关键点解析避坑指南关于\xa0的处理在实战中你会发现打印出来的字符串里有很多\xa0。这是 HTML 中的“不间断空格”Non-breaking space。问题直接使用.split()有时无法完美分割或者导致字符串看起来很乱。解决使用replace(\xa0, )将其替换为普通空格然后再进行strip()和split()操作。XPath 的相对路径在for item in items:循环内部提取具体字段时XPath 必须以.开头例如.//span...。错误写法//span[classtitle]—— 这会去整个网页找所有的 title导致每次循环都拿到第一部电影的名字。正确写法.//span[classtitle]—— 只在当前的item范围内查找。异常捕获的重要性网络请求和数据处理都非常容易出错比如某个电影没有引言或者网络突然断开。使用try-except包裹请求代码防止因一次 404 导致整个程序崩溃。使用try-except包裹解析代码防止因某部电影数据结构特殊缺字段导致报错中断。总结通过本案例我们不仅复习了requests发送请求和XPath解析数据的语法更重要的是学习了如何处理脏数据。爬虫不仅仅是把网页下载下来更核心的价值在于将非结构化的网页数据转化为结构化的、干净的数据。希望这篇教程对你的学习有所帮助如有问题欢迎在评论区交流。

相关新闻

UReport2报表图片加载优化:动态URL参数重写与防裂图实践

UReport2报表图片加载优化:动态URL参数重写与防裂图实践

1. 项目概述:当报表图片加载遇到“拦路虎”最近在折腾一个老项目,里面用到了UReport2这个报表引擎。需求很简单,就是要在报表里动态插入一些图片,比如用户头像、产品示意图或者公司Logo。按理说,UReport2本身是支持图片…

2026/9/19 9:57:20 阅读更多 →
如何快速配置XUnity.AutoTranslator实现游戏文本自动翻译

如何快速配置XUnity.AutoTranslator实现游戏文本自动翻译

如何快速配置XUnity.AutoTranslator实现游戏文本自动翻译 【免费下载链接】XUnity.AutoTranslator 项目地址: https://gitcode.com/gh_mirrors/xu/XUnity.AutoTranslator XUnity.AutoTranslator是一款强大的Unity游戏本地化工具,能够自动翻译游戏内文本&…

2026/9/17 7:16:51 阅读更多 →
学习日记 8.1

学习日记 8.1

前言前一篇文章讲了图片读取与显示,今天继续看图像运算、阈值处理和噪声去除。主要涉及:图像运算:图像的加法运算与加权融合阈值处理:二值化、截断等阈值操作,以及图像边框的填充噪声去除:椒盐噪声的生成与…

2026/9/19 7:13:53 阅读更多 →

最新新闻

2026最新电子节拍器选型避坑指南:告别StackTrace崩溃

2026最新电子节拍器选型避坑指南:告别StackTrace崩溃

2026最新电子节拍器选型避坑指南:告别StackTrace崩溃 还在为一段简单的计时逻辑被满屏红色的 StackTrace 搞崩溃吗?看着那几千行堆栈信息,心累得想砸键盘。…

2026/9/21 20:17:23 阅读更多 →
3个步骤一文搞懂涂鸦画底层原理与源码解析

3个步骤一文搞懂涂鸦画底层原理与源码解析

3个步骤一文搞懂涂鸦画底层原理与源码解析 看着满屏红色的 java.lang.NullPointerException 或者 Canvas is not initialized ,你是不是也感到一阵头疼?Stack Trace…

2026/9/21 20:17:23 阅读更多 →
Agent Skills 的 Spring AI 实现,模型调用走 TaoToken 通道能不能跑通?

Agent Skills 的 Spring AI 实现,模型调用走 TaoToken 通道能不能跑通?

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/21 20:17:23 阅读更多 →
CC Switch 指向 TaoToken:DeepSeek V4.1 Flash 切到 GLM 5.3 Flash 的切换记录

CC Switch 指向 TaoToken:DeepSeek V4.1 Flash 切到 GLM 5.3 Flash 的切换记录

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/21 20:17:23 阅读更多 →
DeepSeek-R1 上了 Artificial Analysis 智能指数:用同一把 TaoToken Key 复现

DeepSeek-R1 上了 Artificial Analysis 智能指数:用同一把 TaoToken Key 复现

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/21 20:17:23 阅读更多 →
ANTHROPIC_BASE_URL 指向本机 vLLM,Claude Code 再挂 TaoToken 通道怎么配环境变量

ANTHROPIC_BASE_URL 指向本机 vLLM,Claude Code 再挂 TaoToken 通道怎么配环境变量

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/21 20:16:23 阅读更多 →

日新闻

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程 【免费下载链接】agentic-awesome-skills AAS Core is the local, agent-first control plane for complete catalog discovery, agent-owned selection, stack validation, and …

2026/9/21 0:00:01 阅读更多 →
gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析

gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析

gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析 【免费下载链接】gin-vue-admin 🚀ViteVue3Gin拥有AI辅助的基础开发平台,企业级业务AI开发解决方案,内置mcp辅助服务,内置skills管理,…

2026/9/21 0:00:01 阅读更多 →
Wox 全功能插件开发实战指南:基于 Python / Node.js 宿主与 WebSocket 的持久化插件体系

Wox 全功能插件开发实战指南:基于 Python / Node.js 宿主与 WebSocket 的持久化插件体系

桌面应用AI 应用插件系统 【免费下载链接】Wox A cross-platform launcher that simply works 项目地址: https://gitcode.com/gh_mirrors/wo/Wox 点击查看 免费下载 全功能插件(Full-featured Plugin)是 Wox 三类插件实现方式中能力最完整的…

2026/9/21 0:00:01 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/21 3:13:20 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/21 2:19:36 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/21 4:51:05 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/21 15:36:51 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/21 15:36:51 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/19 23:35:34 阅读更多 →