Python中实现URL的解析-Python爬虫-Python学习网

Python中实现URL的解析

Python2019-06-14 10:56:55原创

在Python中的urlparse模块主要是用于解析url中的参数对url按照一定格式进行拆分或拼接

1.urlparse.urlparse

将url分为6个部分，返回一个包含6个字符串项目的元组：协议、位置、路径、参数、查询、片段。

import urlparse
url_change = urlparse.urlparse('https://i.cnblogs.com/EditPosts.aspx?opt=1')
print url_change

　　输出结果为：

ParseResult(scheme='https', netloc='i.cnblogs.com', path='/EditPosts.aspx', params='', query='opt=1', fragment='')

其中 scheme 是协议 netloc 是域名服务器 path 相对路径 params是参数，query是查询的条件

urlparse.parse_qs(urlparse.urlparse(url).query)

这个是获取urlparse分割后元祖中的某一项 urlparse.urlparse(url).query 获取查询条件

parse_qs 有几种实现

urlparse.parse_qs 返回字典
urlparse.parse_qsl 返回列表

2. urlparse.urlsplit

和urlparse差不多，将url分为5部分，返回一个包含5个字符串项目的元组：协议、位置、路径、查询、片段。

import urlparse
url_change = urlparse.urlsplit('https://i.cnblogs.com/EditPosts.aspx?opt=1')
print url_change
SplitResult(scheme='https', netloc='i.cnblogs.com', path='/EditPosts.aspx', query='opt=1', fragment='')

其中 scheme 是协议 netloc 是域名服务器 path 相对路径 query是查询的条件

3.urlparse.urljoin

将相对的地址组合成一个url，对于输入没有限制，开头必须是http://，否则将不组合前面。

import urlparse
new_url = urlparse.urljoin('https://baidu.com/ssss/','88888')
print new_url
输出 https://baidu.com/ssss/88888

如果输入错误信息如 new_url = urlparse.urljoin('122','88888') 并不会将两者合并输出‘88888’

专题推荐：python

python编程入门系列图文教程

Python是一种动态解释型的编程语言。Python可以在Windows、UNIX、MAC等多种操作系统上使用，也可以在Java、.NET开发平台上使用。对于入门，主要是掌握基本的语法和熟悉编程规范，因此大部分的教程基本一致的，所以还是建议选好适合自己的一个教程，坚持学下去。

Python基础视频教程(前端基础)

Python全栈+人工智能VIP课程，手把手带领大家从零基础学习Python语言以及人工智能应用开发。结合实际项目案例，由浅入深、全面系统地培养大家的独立开发能力，以从容应对企业开发任务，应对智能时代的新需求。

Python中实现URL的解析

相关文章推荐

相关课程推荐

python编程入门系列图文教程

Python零基础自学入门视频教程（黑马程序员）

Python全栈+人工智能全栈工程师（项目飞机大战）

Python基础视频教程(前端基础)

全部评论我要评论

Python学习网