Java学习者论坛

 找回密码
 立即注册

QQ登录

只需一步,快速开始

手机号码,快捷登录

恭喜Java学习者论坛(https://www.javaxxz.com)已经为数万Java学习者服务超过8年了!积累会员资料超过10000G+
成为本站VIP会员,下载本站10000G+会员资源,购买链接:点击进入购买VIP会员
JAVA高级面试进阶视频教程Java架构师系统进阶VIP课程

分布式高可用全栈开发微服务教程

Go语言视频零基础入门到精通

Java架构师3期(课件+源码)

Java开发全终端实战租房项目视频教程

SpringBoot2.X入门到高级使用教程

大数据培训第六期全套视频教程

深度学习(CNN RNN GAN)算法原理

Java亿级流量电商系统视频教程

互联网架构师视频教程

年薪50万Spark2.0从入门到精通

年薪50万!人工智能学习路线教程

年薪50万!大数据从入门到精通学习路线年薪50万!机器学习入门到精通视频教程
仿小米商城类app和小程序视频教程深度学习数据分析基础到实战最新黑马javaEE2.1就业课程从 0到JVM实战高手教程 MySQL入门到精通教程
查看: 288|回复: 0

[默认分类] python爬虫中文乱码解决方法

[复制链接]
  • TA的每日心情
    开心
    2021-12-13 21:45
  • 签到天数: 15 天

    [LV.4]偶尔看看III

    发表于 2020-8-10 09:02:26 | 显示全部楼层 |阅读模式
    python爬虫中文乱码

    前几天用python来爬取全国行政区划编码的时候,遇到了中文乱码的问题,折腾了一会儿,才解决。现特记录一下,方便以后查看。

    我是用python的requests和bs4库来实现爬虫,这两个库的简单用法可参照python爬取当当网的书籍信息并保存到csv文件
    乱码未处理前部分代码
    1. [code]   url = "要爬取的网页"
    2.     r = requests.get(url, timeout=30)
    3.     soup = BeautifulSoup(r.text, "lxml")
    复制代码
    [/code]
    乱码原因
    我爬取的网页使用的编码是GBK。所以要按GBK编码,才能避免中文乱码。
    解决乱码的代码
    1. [code]   url = "要爬取的网页"
    2.     r = requests.get(url, timeout=30)
    3.     r.encoding="GBK"   #增加encoding=‘GBK’,解决中文乱码问题
    4.     soup = BeautifulSoup(r.text, "lxml")
    复制代码
    [/code]
    【原创声明】转载请标明出处:https://www.cnblogs.com/surecheun/p/9694052.html
    回复

    使用道具 举报

    您需要登录后才可以回帖 登录 | 立即注册

    本版积分规则

    QQ|手机版|Java学习者论坛 ( 声明:本站资料整理自互联网,用于Java学习者交流学习使用,对资料版权不负任何法律责任,若有侵权请及时联系客服屏蔽删除 )

    GMT+8, 2024-4-26 03:17 , Processed in 0.447250 second(s), 46 queries .

    Powered by Discuz! X3.4

    © 2001-2017 Comsenz Inc.

    快速回复 返回顶部 返回列表