当前位置:首页 > 芯闻号 > 充电吧
[导读]python用于url解码和中文解析的小脚本(续) by 不求东西之前写过一篇关于处理url里中文字符解码文章,后来看到原文中TL的回复,发现原来那一篇文章存在着几个问题,觉得这些问题可能别的同学

python用于url解码和中文解析的小脚本(续) by 不求东西

之前写过一篇关于处理url里中文字符解码文章,后来看到原文中TL的回复,发现原来那一篇文章存在着几个问题,觉得这些问题可能别的同学也会遇到,就续写一篇吧。

非默认编码的转换
1
2
3
4
5
import

urllib

a="http://zh.wikipedia.org/wiki/%BD%F0%B6"
b="http://zh.wikipedia.org/wiki/%E9%97%A8"
de=urllib.unquote
print

de(a),de(b)

之前的文章里的这段代码,我没有考虑到gbk和utf编码的问题,以为不带有%5Cu这种unicode标志字符的汉字解码只要unquote就万事大吉了呢,但对于与“默认编码环境”不同的编码来说,还需要再多一步处理,所以上述的代码是无法对a正确解码的

TL给出了一种解决办法,可以处理a这种残疾的编码形式(残疾的原因,下面就会解释)


1
2
de(a).decode("gbk","ignore")
de(b).decode("utf8","ignore")

再print就可以打印出中文字符了~

残疾的编码

可是,问题又来了,为什么还需要“ignore”这个参数呢,我发现如果不加这个参数,这样使用,会报错的。


1
de(a).decode("gbk")

检查了一下a在gfwlist中的出处以后,我发现自己犯了一个挺低级的错误的(汗。)

事实是:a里那个网站本来应该是zh.wikipedia.org*%BD%F0%B6%DC%B9%A4%B3%CC这样的,我误以为汉字编码都是3个“百分号+2个十六进制数”(3个字节)这样的样式,所以只取了前3个字节,也就是“%BD%F0%B6″。

而问题在于,gbk编码和utf编码所需的字节数是不一样的,gbk只需2个字节即可编码一个汉字,而a是用gbk编码的,1个汉字的解码不需要3个字节,多出来的这1个残疾的字节就成为了decode异常的来源,删掉这个多余的字节以后,解码顺利通过:


1
2
3
4
5
6
7
8
import

urllib

a="http://zh.wikipedia.org/wiki/%BD%F0"
#
gbk, 2 bytes per Chinese character

b="http://zh.wikipedia.org/wiki/%E9%97%A8"
#
utf8, 3 bytes per Chinese character

de=urllib.unquote
print

de(a).decode(
"gbk")
print

de(b).decode(
"utf8")定义解码方式的优先级

最后,我将TL的脚本中以优先级的形式处理多种中文编码的函数代码copy了过来,同时将中文编码的字节下限由3字节改为了2个字节以后,发现原来gfwlist中所有不能正常解码的中文,现在都可以显示出来了,哈哈,不错~


1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
<code class="py keyword" style="border-width:0px!important; margin:0px!important; p

本站声明: 本文章由作者或相关机构授权发布,目的在于传递更多信息,并不代表本站赞同其观点,本站亦不保证或承诺内容真实性等。需要转载请联系该专栏作者,如若文章内容侵犯您的权益,请及时联系本站删除。
换一批
延伸阅读

Pipenv是一款旨在将所有包管理工具的优点集中利用于python领域中的工具,兼容性高,使用Pipenv可以自动创建项目和管理虚拟环境,且安装或删除包时会自动在Pipfile中添加和移除相应的包。

关键字: python 管理工具 虚拟环境

随着大数据的兴起,Python 和机器学习迅速成为时代的宠儿。本书在内容编排上避免了枯燥的理论知识讲解,依循“理论简述——实际数据集——Python 程序实现算法”分析数据的思路。

关键字: python 机器学习 数据集

Python拥有很多免费数据函数库、免费web网页模板系统、以及与web服务器进行交互的库,可以实现web开发,搭建web框架,目前比较有名气的Python web框架为Django。

关键字: python 函数库 免费web网页

那么用户下载到的就是该系统的所有源代码,并且可以随意修改。这也是解释型语言本身的特性,想要运行程序就必须有源代码。

关键字: python 源代码 C/C++程序

Python有丰富的第三方库和包,可以扩展Python的功能。为了方便地管理这些包,您需要安装一个Python包管理工具,例如pip、conda等。这些工具可以帮助您安装、升级和删除Python包,使您能够轻松地管理Py...

关键字: python 编程实例 Python解释器

Python是一种非常流行的编程语言,它简单易学,功能强大,可以应用于许多领域,如Web开发、数据分析、人工智能等。本篇文章将为您介绍如何从零开始学习Python!

关键字: python 入门基础 数据分析

Python由荷兰数学和计算机科学研究学会的吉多·范罗苏姆于1990年代初设计,作为一门叫做ABC语言的替代品。 Python提供了高效的高级数据结构,还能简单有效地面向对象编程。

关键字: python 函数 对象编程

Python和Java是两种广泛应用于编程领域的高级编程语言,它们各有优劣。本文从程序设计应用、系统资源占用、高性能处理和语言特点等四方面详细介绍两种编程语言的区别。

关键字: python java 高性能处理

今天在Github上瞎逛的时候,发现了一个有趣的小项目,但是由于一些特殊的原因,犹豫了一下要不要推荐给大家。

关键字: python 开源
关闭
关闭