python网络请求库实战 - urllib与requests深度解析
文章目录1.1 urllib - Python内置请求库基础使用添加请求头带参数的GET请求POST请求异常处理1.2 requests - 爬虫开发的首选库安装基础请求请求参数的几种传递方式请求头设置Cookie处理代理配置超时和重试响应数据处理1.3 实战综合运用GET/POST请求1.1 urllib - Python内置请求库基础使用urllib不需要安装直接导入使用。虽然不如requests简洁但了解它能帮助你理解HTTP请求的底层逻辑。fromurllib.requestimporturlopen,Requestfromurllib.parseimporturlencode,quotefromurllib.errorimportURLError,HTTPError# 最简单的GET请求withurlopen(https://www.python.org)asresponse:htmlresponse.read().decode(utf-8)print(html[:500])# 打印前500个字符添加请求头不加请求头的请求很容易被识别为爬虫。urlhttps://example.comheaders{User-Agent:Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36}# 使用Request对象添加请求头reqRequest(url,headersheaders)withurlopen(req,timeout10)asresponse:htmlresponse.read().decode(utf-8)带参数的GET请求base_urlhttps://example.com/searchparams{keyword:Python爬虫,page:1,size:20}# urlencode将字典转为查询字符串query_stringurlencode(params)full_urlf{base_url}?{query_string}print(full_url)# https://example.com/search?keywordPython%E7%88%AC%E8%99%ABpage1size20POST请求urlhttps://example.com/logindata{username:test,password:123456}# POST数据需要编码为bytespost_dataurlencode(data).encode(utf-8)reqRequest(url,datapost_data,headersheaders)withurlopen(req)asresponse:resultresponse.read().decode(utf-8)print(result)异常处理try:responseurlopen(https://example.com,timeout5)exceptHTTPErrorase:print(fHTTP错误:{e.code}-{e.reason})exceptURLErrorase:print(fURL错误:{e.reason})exceptExceptionase:print(f其他错误:{e})1.2 requests - 爬虫开发的首选库安装pipinstallrequests基础请求requests的API设计非常直观大大简化了HTTP请求的代码量。importrequests# GET请求responserequests.get(https://www.python.org)print(response.status_code)# 200print(response.encoding)# utf-8print(response.text[:200])# HTML内容# POST请求responserequests.post(https://example.com/login,data{user:test})# 其他请求方法requests.put(https://api.example.com/resource/1,json{name:new_name})requests.delete(https://api.example.com/resource/1)请求参数的几种传递方式# 方式1: params参数(GET请求)params{keyword:Python,page:2}responserequests.get(https://example.com/search,paramsparams)print(response.url)# https://example.com/search?keywordPythonpage2# 方式2: data参数(POST表单)data{username:user,password:pass}responserequests.post(https://example.com/login,datadata)# 方式3: json参数(POST JSON)payload{action:search,keyword:Python}responserequests.post(https://api.example.com/data,jsonpayload)# 方式4: 请求体raw数据importjson responserequests.post(https://api.example.com/data,datajson.dumps(payload),headers{Content-Type:application/json})请求头设置headers{User-Agent:Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36,Accept:application/json, text/plain, */*,Accept-Language:zh-CN,zh;q0.9,Referer:https://example.com,Connection:keep-alive}responserequests.get(https://example.com/api/data,headersheaders)常见User-Agent列表importrandom USER_AGENTS[Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36,Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36,Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:121.0) Gecko/20100101 Firefox/121.0,Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36,]defget_random_ua():returnrandom.choice(USER_AGENTS)headers{User-Agent:get_random_ua()}responserequests.get(url,headersheaders)Cookie处理# 方式1: 直接在headers中设置headers{Cookie:session_idabc123; user_id12345; tokenxyz789}responserequests.get(url,headersheaders)# 方式2: 通过cookies参数cookies{session_id:abc123,user_id:12345}responserequests.get(url,cookiescookies)# 方式3: 使用Session自动管理Cookie(最推荐)sessionrequests.Session()session.headers.update({User-Agent:Mozilla/5.0 ...})# 第一次请求: 登录login_data{username:test,password:123456}session.post(https://example.com/login,datalogin_data)# 后续请求: 自动携带Cookieresponsesession.get(https://example.com/user/orders)profilesession.get(https://example.com/user/profile)代理配置代理是突破IP封禁的常用方法。# 单一代理proxies{http:http://127.0.0.1:7890,https:http://127.0.0.1:7890}responserequests.get(url,proxiesproxies)# 带用户名密码的代理proxies{http:http://username:passwordproxy.example.com:8080,https:http://username:passwordproxy.example.com:8080}# 随机代理池PROXY_LIST[http://proxy1.example.com:8080,http://proxy2.example.com:8080,http://proxy3.example.com:8080,]defget_random_proxy():iprandom.choice(PROXY_LIST)return{http:ip,https:ip}responserequests.get(url,proxiesget_random_proxy())超时和重试importtime# 设置超时try:responserequests.get(url,timeout10)# 10秒超时# timeout(连接超时, 读取超时)responserequests.get(url,timeout(5,15))# 连接5秒,读取15秒exceptrequests.Timeout:print(请求超时)# 自动重试封装deffetch_url(url,headersNone,max_retries3,delay2):forattemptinrange(1,max_retries1):try:responserequests.get(url,headersheaders,timeout10)response.raise_for_status()# 非2xx状态码抛出异常returnresponseexceptrequests.Timeout:print(f超时,第{attempt}次重试)exceptrequests.HTTPErrorase:print(fHTTP错误{e.response.status_code})ife.response.status_codein[403,404]:returnNone# 这类错误重试无意义exceptrequests.RequestExceptionase:print(f请求异常:{e})ifattemptmax_retries:time.sleep(delay*attempt)# 递增延迟returnNone响应数据处理responserequests.get(https://example.com)# 自动检测编码print(response.encoding)# 检测到的编码print(response.apparent_encoding)# 更准确的编码检测# 设置编码解决乱码response.encodingutf-8htmlresponse.text# 二进制数据(图片、PDF等)image_responserequests.get(https://example.com/image.jpg)withopen(image.jpg,wb)asf:f.write(image_response.content)# 大文件流式下载withrequests.get(https://example.com/large_file.zip,streamTrue)asr:r.raise_for_status()withopen(large_file.zip,wb)asf:forchunkinr.iter_content(chunk_size8192):f.write(chunk)print(下载完成)1.3 实战综合运用GET/POST请求下面是一个模拟搜索引擎关键词搜索和翻页爬取的完整示例。importrequestsimporttimeimportrandomfrombs4importBeautifulSoupclassSimpleSpider:def__init__(self):self.sessionrequests.Session()self.session.headers.update({User-Agent:Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36,Accept-Language:zh-CN,zh;q0.9})self.results[]defsearch(self,keyword,max_pages5):print(f开始爬取关键词:{keyword})forpageinrange(1,max_pages1):print(f正在爬取第{page}页...)params{q:keyword,page:page,size:20}responseself._fetch(https://example.com/search,paramsparams)ifnotresponse:print(f第{page}页获取失败,跳过)continueitemsself._parse(response.text)self.results.extend(items)print(f第{page}页提取{len(items)}条数据)# 随机延时,避免过快请求sleep_timerandom.uniform(1.0,2.5)time.sleep(sleep_time)returnself.resultsdef_fetch(self,url,paramsNone):try:responseself.session.get(url,paramsparams,timeout10)response.raise_for_status()returnresponseexceptExceptionase:print(f请求失败:{e})returnNonedef_parse(self,html):soupBeautifulSoup(html,lxml)items[]foriteminsoup.select(div.result-item):items.append({title:item.select_one(h3).text.strip(),url:item.select_one(a)[href],summary:item.select_one(p.summary).text.strip()})returnitemsdefsave(self,filenameresults.json):importjsonwithopen(filename,w,encodingutf-8)asf:json.dump(self.results,f,ensure_asciiFalse,indent2)print(f已保存{len(self.results)}条数据到{filename})# 使用示例spiderSimpleSpider()dataspider.search(Python爬虫教程,max_pages3)spider.save()

相关新闻

C++俄罗斯方块项目实战:从架构设计到性能优化的完整指南

C++俄罗斯方块项目实战:从架构设计到性能优化的完整指南

1. 项目概述:为什么用C重写俄罗斯方块依然值得深究? 俄罗斯方块,这个诞生于上世纪80年代的经典游戏,几乎成了每一位程序员学习图形编程或游戏逻辑的“Hello World”。你可能觉得,用C实现一个俄罗斯方块,听起…

2026/7/22 2:42:48 阅读更多 →
架构揭秘:REFramework如何实现RE引擎游戏的跨平台模组支持

架构揭秘:REFramework如何实现RE引擎游戏的跨平台模组支持

架构揭秘:REFramework如何实现RE引擎游戏的跨平台模组支持 【免费下载链接】REFramework Mod loader, scripting platform, and VR support for all RE Engine games 项目地址: https://gitcode.com/GitHub_Trending/re/REFramework REFramework作为RE Engin…

2026/7/22 2:42:48 阅读更多 →
Linux 下 cat 和 more 的用法

Linux 下 cat 和 more 的用法

Linux 下 cat 和 more 的用法 cat: 一次性显示整个文件 文件过长时会一屏刷到底 # 显示文件内容 cat file.txt# 带行号显示 cat -n file.txt# 连接多个文件 cat file1.txt file2.txt# 将内容重定向写入文件 cat file1.txt file2.txt > combined.txtmore :分页显示&#xff0…

2026/7/22 2:42:48 阅读更多 →

最新新闻

视频创作版权避坑指南:音乐、字体与图片安全使用方案

视频创作版权避坑指南:音乐、字体与图片安全使用方案

1. 视频创作中的版权避坑指南最近帮几个做自媒体的朋友处理了几起版权投诉,发现很多内容创作者对视频中的音乐、字体、图片版权问题存在严重认知盲区。今天就用我处理过的实际案例,拆解这三个最容易踩雷的版权陷阱。2. 音乐版权:看不见的高压…

2026/7/22 4:39:33 阅读更多 →
从设计到交付:小礼文创沙盘模型定制的全流程解析

从设计到交付:小礼文创沙盘模型定制的全流程解析

沙盘模型定制的全流程解析:从设计构思到精准交付在企业形象展示、城市规划汇报或大型赛事活动中,沙盘模型定制往往是视觉呈现的核心环节。与标准化产品的批量采购不同,沙盘模型属于高度非标的定制品,其制作流程涵盖了数据采集、比…

2026/7/22 4:39:33 阅读更多 →
AI赋能n8n工作流:自然语言构建自动化流程

AI赋能n8n工作流:自然语言构建自动化流程

1. 为什么需要让AI真正"会搭n8n工作流"?在自动化工作流领域,n8n作为一款开源的节点式工作流自动化工具,已经成为了许多开发者和企业的首选。但真正阻碍n8n发挥最大价值的,往往不是工具本身的功能限制,而是构…

2026/7/22 4:39:33 阅读更多 →
LangChain入门:从零搭建DeepSeek开发环境

LangChain入门:从零搭建DeepSeek开发环境

前言 网上LangChain的教程不少,但要么是官方文档的翻译,要么上来就扔一堆概念。我看了不少,真正能让我从头跑到尾的没几个。 这篇文章记录了我自己从零开始搭建LangChain开发环境的过程,用的是DeepSeek的API。全程可复现&#x…

2026/7/22 4:39:33 阅读更多 →
CTF逆向工程自动化:Python实现常见加密算法识别与解密工具

CTF逆向工程自动化:Python实现常见加密算法识别与解密工具

1. 项目概述:为什么我们要自动化处理“烂大街”加密?在CTF逆向赛题里摸爬滚打几年,你会发现一个有趣的现象:很多题目看似复杂,外壳层层加壳,逻辑弯弯绕绕,但核心的加密算法,往往就那…

2026/7/22 4:39:33 阅读更多 →
YOLOv5在数据挖掘中的精度优化与工业实践

YOLOv5在数据挖掘中的精度优化与工业实践

1. YOLOv5在数据挖掘中的精度突破实践在计算机视觉与数据挖掘的交叉领域,目标检测技术正经历着从单纯识别到智能分析的范式转变。YOLOv5作为当前工业界最受欢迎的实时目标检测框架,其v6.1版本在COCO数据集上达到56.8% AP精度,同时保持140FPS的…

2026/7/22 4:38:33 阅读更多 →

日新闻

TI DSP系统配置模块SYSCFG详解:中断机制与主设备优先级配置实战

TI DSP系统配置模块SYSCFG详解:中断机制与主设备优先级配置实战

1. 项目概述与SYSCFG模块的核心价值在嵌入式系统,尤其是像TI C6000系列这样的高性能DSP开发中,我们常常会与芯片手册里那些密密麻麻的寄存器打交道。很多开发者可能更关注算法实现、内存优化或者外设驱动,但对于一个稳定、高效的系统而言&…

2026/7/22 0:00:26 阅读更多 →
微信Server酱:高到达率的应急通知方案实践

微信Server酱:高到达率的应急通知方案实践

1. 为什么我们需要"最次"的通知方案? 在数字化协作环境中,消息通知系统的重要性不言而喻明。但现实情况是,企业级通知方案往往需要复杂的API对接(如企业微信、钉钉、飞书),个人开发者的小项目又经…

2026/7/22 0:00:26 阅读更多 →
甲方要的“简洁“PPT,到底是简洁还是省事?

甲方要的“简洁“PPT,到底是简洁还是省事?

甲方说"简洁一点",乙方听到的是"少做几页"。甲方说"不要太复杂",乙方理解成"别放图表了"。结果交过去,甲方说"我说的简洁不是这个意思"。"简洁"这个词在PPT语境里,是…

2026/7/22 0:00:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/21 8:48:31 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/21 5:34:47 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/21 8:25:39 阅读更多 →

月新闻