Python代理IP爬虫的新手使用教程

站长资源 2024/11/25 佚名

2 0 1

前言

Python爬虫要经历爬虫、爬虫被限制、爬虫反限制的过程。当然后续还要网页爬虫限制优化，爬虫再反限制的一系列道高一尺魔高一丈的过程。爬虫的初级阶段，添加headers和ip代理可以解决很多问题。

本人自己在爬取豆瓣读书的时候,就以为爬取次数过多,直接被封了IP.后来就研究了代理IP的问题.

(当时不知道什么情况,差点心态就崩了...),下面给大家介绍一下我自己代理IP爬取数据的问题,请大家指出不足之处.

问题

这是我的IP被封了,一开始好好的,我还以为是我的代码问题了

思路：

从网上查找了一些关于爬虫代理IP的资料,得到下面的思路

爬取一些IP,过滤掉不可用.
在requests的请求的proxies参数加入对应的IP.
继续爬取.
收工
好吧,都是废话,理论大家都懂,上面直接上代码...

思路有了,动手起来.

运行环境

Python 3.7, Pycharm

这些需要大家直接去搭建好环境...

准备工作

爬取IP地址的网站(国内高匿代理)
校验IP地址的网站
你之前被封IP的py爬虫脚本...

上面的网址看个人的情况来选取

爬取IP的完整代码

PS:简单的使用bs4获取IP和端口号,没有啥难度,里面增加了一个过滤不可用IP的逻辑

关键地方都有注释了

#!/usr/bin/env python3
# -*- coding: utf-8 -*-
# @Time : 2018/11/22 
# @Author : liangk
# @Site :
# @File : auto_archive_ios.py
# @Software: PyCharm


import requests
from bs4 import BeautifulSoup
import json


class GetIp(object):
 """抓取代理IP"""

 def __init__(self):
 """初始化变量"""
 self.url = 'http://www.xicidaili.com/nn/'
 self.check_url = 'https://www.ip.cn/'
 self.ip_list = []

 @staticmethod
 def get_html(url):
 """请求html页面信息"""
 header = {
  'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.77 Safari/537.36'
 }
 try:
  request = requests.get(url=url, headers=header)
  request.encoding = 'utf-8'
  html = request.text
  return html
 except Exception as e:
  return ''

 def get_available_ip(self, ip_address, ip_port):
 """检测IP地址是否可用"""
 header = {
  'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.77 Safari/537.36'
 }
 ip_url_next = '://' + ip_address + ':' + ip_port
 proxies = {'http': 'http' + ip_url_next, 'https': 'https' + ip_url_next}
 try:
  r = requests.get(self.check_url, headers=header, proxies=proxies, timeout=3)
  html = r.text
 except:
  print('fail-%s' % ip_address)
 else:
  print('success-%s' % ip_address)
  soup = BeautifulSoup(html, 'lxml')
  div = soup.find(class_='well')
  if div:
  print(div.text)
  ip_info = {'address': ip_address, 'port': ip_port}
  self.ip_list.append(ip_info)

 def main(self):
 """主方法"""
 web_html = self.get_html(self.url)
 soup = BeautifulSoup(web_html, 'lxml')
 ip_list = soup.find(id='ip_list').find_all('tr')
 for ip_info in ip_list:
  td_list = ip_info.find_all('td')
  if len(td_list) > 0:
  ip_address = td_list[1].text
  ip_port = td_list[2].text
  # 检测IP地址是否有效
  self.get_available_ip(ip_address, ip_port)
 # 写入有效文件
 with open('ip.txt', 'w') as file:
  json.dump(self.ip_list, file)
 print(self.ip_list)


# 程序主入口
if __name__ == '__main__':
 get_ip = GetIp()
 get_ip.main()

使用方法完整代码

PS: 主要是通过使用随机的IP来爬取,根据request_status来判断这个IP是否可以用.

为什么要这样判断"htmlcode">

#!/usr/bin/env python3 # -*- coding: utf-8 -*- # @Time : 2018/11/22 # @Author : liangk # @Site : # @File : get_douban_books.py # @Software: PyCharm from bs4 import BeautifulSoup import datetime import requests import json import random ip_random = -1 article_tag_list = [] article_type_list = [] def get_html(url): header = { 'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_14_0) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.102 Safari/537.36' } global ip_random ip_rand, proxies = get_proxie(ip_random) print(proxies) try: request = requests.get(url=url, headers=header, proxies=proxies, timeout=3) except: request_status = 500 else: request_status = request.status_code print(request_status) while request_status != 200: ip_random = -1 ip_rand, proxies = get_proxie(ip_random) print(proxies) try: request = requests.get(url=url, headers=header, proxies=proxies, timeout=3) except: request_status = 500 else: request_status = request.status_code print(request_status) ip_random = ip_rand request.encoding = 'gbk' html = request.content print(html) return html def get_proxie(random_number): with open('ip.txt', 'r') as file: ip_list = json.load(file) if random_number == -1: random_number = random.randint(0, len(ip_list) - 1) ip_info = ip_list[random_number] ip_url_next = '://' + ip_info['address'] + ':' + ip_info['port'] proxies = {'http': 'http' + ip_url_next, 'https': 'https' + ip_url_next} return random_number, proxies # 程序主入口 if __name__ == '__main__': """只是爬取了书籍的第一页,按照评价排序""" start_time = datetime.datetime.now() url = 'https://book.douban.com/tag/""" 整理分析数据 """ sub_type_list = [] a = table.find_all('a') for book_type in a: sub_type_list.append(book_type.text) article_type_list.append(sub_type_list) for sub in article_type_list: for sub1 in sub: title = '==============' + sub1 + '==============' print(title) print(base_url + sub1 + '"text-align: center">

总结

使用这样简单的代理IP,基本上就可以应付在爬爬爬着被封IP的情况了.而且没有使用自己的IP,间接的保护?!?!

大家有其他的更加快捷的方法，欢迎大家可以拿出来交流和讨论，谢谢。

好了，以上就是这篇文章的全部内容了，希望本文的内容对大家的学习或者工作具有一定的参考学习价值，谢谢大家对的支持。

python采集代理ip,爬虫代理ip使用方法,python爬虫更改ip

广告合作：本站广告合作请联系QQ：858582 申请时备注：广告合作（否则不回）
免责声明：本站资源来自互联网收集,仅供用于学习和交流,请遵循相关法律法规,本站一切资源不代表本站立场,如有侵权、后门、不妥请联系本站删除！

上一篇
 PyCharm搭建Spark开发环境的实现步骤

下一篇
 浅谈Python_Openpyxl使用（最全总结）

评论“Python代理IP爬虫的新手使用教程”

再想想

暂无评论...

www.wwsws.com 伏龙阁资源网

39,976影音资源

44,792技术资源

21,817软件资源

651,128站长资源

最新文章

转载一个别人收藏的精典网站Ruby,HIBERNATE

2024/11/25
56

可与Spreadsheets媲美的在线表格系统:EditG

2024/11/25
34

cygwin使用心得

2024/11/25
73

脚本的DVD开发

2024/11/25
28

局域网设置自动配置脚本文件的写法与用途

2024/11/25
15

更新日志

2024年11月25日

群星1990《群星会·金曲重现》新加坡版[WAV+CUE][1.1G]

张惠妹2003《勇敢》[WAV+CUE][1.1G]

群星1995《摇滚中国乐势力》首版引进版[WAV+CUE][983M]

陈思安《32首酒廊情调》2CD新雅(国际)影碟[WAV+CUE]

齐豫潘越云《回声》K2HD[正版原抓WAV+CUE]

2024年11月25日

凤飞飞《我们的主题曲》飞跃制作[正版原抓WAV+CUE]

刘嘉亮《亮情歌2》[WAV+CUE][1G]

红馆40·谭咏麟《歌者恋歌浓情30年演唱会》3CD[低速原抓WAV+CUE][1.8G]

刘纬武《睡眠宝宝竖琴童谣吉卜力工作室白噪音安抚》[320K/MP3][193.25MB]

【轻音乐】曼托凡尼乐团《精选辑》2CD.1998[FLAC+CUE整轨]

邝美云《心中有爱》1989年香港DMIJP版1MTO东芝首版[WAV+CUE]

群星《情叹-发烧女声DSD》天籁女声发烧碟[WAV+CUE]

刘纬武《睡眠宝宝竖琴童谣吉卜力工作室白噪音安抚》[FLAC/分轨][748.03MB]

理想混蛋《Origin Sessions》[320K/MP3][37.47MB]

公馆青少年《我其实一点都不酷》[320K/MP3][78.78MB]

群星《情叹-发烧男声DSD》最值得珍藏的完美男声[WAV+CUE]

群星《国韵飘香·贵妃醉酒HQCD黑胶王》2CD[WAV]

卫兰《DAUGHTER》【低速原抓WAV+CUE】

公馆青少年《我其实一点都不酷》[FLAC/分轨][398.22MB]

ZWEI《迟暮的花 (Explicit)》[320K/MP3][57.16MB]

友情链接

杰晶网络 DDR爱好者之家桃源资源网杰网资源富贵资源网南强小屋铁雪资源网幽灵资源网万梅资源网狼山资源网白云岛资源网昆仑资源网相思资源网明霞山资源网内蒙古资源网黑松山资源网茶园资源网饿虎岗资源网大旗谷资源网常春岛资源网岱庙资源网兴国资源网快活林资源网蝙蝠岛资源网帝王谷资源网白云城资源网伏龙阁资源网清风细雨楼天枫庄资源网圆月山庄资源网无争山庄资源网神水资源网移花宫资源网神剑山庄资源网无为清净楼资源网金钱帮资源网丐帮资源网华山资源网极乐门资源网小李飞刀资源网凤求凰客栈风云阁资源网金狮镖局鸳鸯亭资源网千金楼资源网更多链接

Copyright © 2006~2023 伏龙阁资源网 Design by www.wwsws.com 手机版