自己要怎么做一个隧道代理?隧道代理搭建教程 |
您所在的位置:网站首页 › openresty配置隧道ip › 自己要怎么做一个隧道代理?隧道代理搭建教程 |
众所周知,隧道代理比动态短效代理贵,但是因为其产品特性,确实也更好用更方便,那我们要如何自己搭建起来隧道代理呢? 说来也不复杂,按照我说的方法,即可搭建起来隧道代理。 1.构建HTTP代理池首先,你手上得有一批HTTP 代理,要么自己去爬免费的资源(不是那么建议,免费的可用率真的非常低),要么就自己去和HTTP厂商购买动态短效代理,要么就从0开始,自己买服务器……总之,你手上得有一批可以使用起来的HTTP代理,搭建起来你的HTTP代理池子。 接下来就是使用 Redis 的 Hash 这个数据结构周期性访问url,拉取当前最新可用的HTTP代理。 代码如下: """ ProxyManager.py ~~~~~~~~~~~~~~~~~~~~~ 简易代理池管理工具,直接从URL中读取所有 最新的代理,并写入Redis。 """ import yaml import time import json import redis import datetime import requests class ProxyManager: def __init__(self): self.config = self.read_config() self.redis_config = self.config['redis'] self.client = redis.Redis(host=self.redis_config['host'], password=self.redis_config['password'], port=self.redis_config['port']) self.instance_dict = {} def read_config(self): with open('config.yaml') as f: config = yaml.safe_load(f.read()) return config def read_ip(self): resp = requests.get(self.config['proxy']).text if '{' in resp: return [] proxy_list = resp.split() return proxy_list def delete_ip(self, live_ips, pool_ips): ip_to_removed = set(pool_ips) - set(live_ips) if ip_to_removed: print('ip to be removed:', ip_to_removed) self.client.hdel(self.redis_config['key'], *list(ip_to_removed)) def add_new_ips(self, live_ips, pool_ips): ip_to_add = set(live_ips) - set(pool_ips) if ip_to_add: print('ip to add:', ip_to_add) ips = {} for ip in ip_to_add: ips[ip] = json.dumps({'private_ip': ip, 'ts': datetime.datetime.now().strftime('%Y-%m-%d %H:%M:%S')}) self.client.hset(self.redis_config['key'], mapping=ips) def run(self): while True: live_ips = self.read_ip() pool_ips = [x.decode() for x in self.client.hgetall(self.redis_config['key'])] self.delete_ip(live_ips, pool_ips) self.add_new_ips(live_ips, pool_ips) time.sleep(40) if __name__ == '__main__': manager = ProxyManager() manager.run()通常,HTTP代理从厂商那购买,是有个存活周期的,我们要在HTTP代理的存货周期内使用,所以更换的周期也要在这时间段内。更换的时候,采用了增量更换的方式。把当前拉取的 IP 和 Redis 里面的已有 IP 进行对比。不在这次拉取的 IP 全部从 Redis 移除,然后把新增的 IP 加到 Redis 中。 当然,我们需要确保从 URL 拉下来的代理也进行有效性检查,发现无效的立刻移除,可以进行少量测试: # python 3.6+ import requests url = "百度一下,你就知道" ip, port = "39.137.95.73", "8080" proxies = {"http": f"http://{ip}:{port}"} #空白位置为测试HTTP代理和HTTP代理使用端口 headers = {"User-Agent": "Mozilla/5.0"} #响应头 res = requests.get(url, proxies=proxies, headers=headers) #发起请求 print(res.status_code) #返回响应码只需要更改这里的ip就可以自动判断是否可用。 如果这里的状态码为200就表示这个ip可用,如果是502等其他的状态码就表示这个ip不可用。 2.实现自动转发我们可以使用 OpenResty实现自动转发。 对应的配置文件如下图所示: worker_processes 16; #nginx worker 数量 error_log /usr/local/openresty/nginx/logs/error.log; #指定错误日志文件路径 events { worker_connections 1024; } stream { ## TCP 代理日志格式定义 log_format tcp_proxy '$remote_addr [$time_local] ' '$protocol $status $bytes_sent $bytes_received ' '$session_time "$upstream_addr" ' '"$upstream_bytes_sent" "$upstream_bytes_received" "$upstream_connect_time"'; ## TCP 代理日志配置 access_log /usr/local/openresty/nginx/logs/access.log tcp_proxy; open_log_file_cache off; ## TCP 代理配置 upstream backend{ server 127.0.0.2:1101;# 爱写啥写啥 反正下面的代码也给你改了 balancer_by_lua_block { -- 初始化balancer local balancer = require "ngx.balancer" local host = "" local port = 0 host = ngx.ctx.proxy_host port = ngx.ctx.proxy_port -- 设置 balancer local ok, err = balancer.set_current_peer(host, port) if not ok then ngx.log(ngx.ERR, "failed to set the peer: ", err) end } } server { preread_by_lua_block{ local redis = require("resty.redis") --创建实例 local redis_instance = redis:new() --设置超时(毫秒) redis_instance:set_timeout(3000) --建立连接,请在这里配置Redis 的 IP 地址、端口号、密码和用到的 Key local rhost = "123.45.67.89" local rport = 6739 local rpass = "abcdefg" local rkey = "proxy:pool" local ok, err = redis_instance:connect(rhost, rport) ngx.log(ngx.ERR, "1111111 ", ok, " ", err) -- 如果没有密码,移除下面这一行 local res, err = redis_instance:auth(rpass) local res, err = redis_instance:hkeys(rkey) if not res then ngx.log(ngx.ERR,"res num error : ", err) return redis_instance:close() end math.randomseed(tostring(ngx.now()):reverse():sub(1, 6)) local proxy = res[math.random(#res)] local colon_index = string.find(proxy, ":") local proxy_ip = string.sub(proxy, 1, colon_index - 1) local proxy_port = string.sub(proxy, colon_index + 1) ngx.log(ngx.ERR,"redis data = ", proxy_ip, ":", proxy_port); ngx.ctx.proxy_host = proxy_ip ngx.ctx.proxy_port = proxy_port redis_instance:close() } # 下面是本机的端口,也就是爬虫固定写死的端口 listen 0.0.0.0:9976; #监听本机地址和端口,当使用keeplived的情况下使用keeplived VIP proxy_connect_timeout 3s; proxy_timeout 10s; proxy_pass backend; #这里填写对端的地址 } }有需要的友友们可以根据配置文件稍作修改。 3.启动设置好了这些配置以后,使用 Docker 来启动它: from openresty/openresty:centos copy nginx_redis.conf /usr/local/openresty/nginx/conf/nginx.conf然后,执行命令构建和运行: docker build --network host -t tunnel_proxy:0.01 . docker run --name tunnel_proxy --network host -it tunnel_proxy:0.01运行以后,你会看到 Docker 的命令行似乎卡住了。这是正常请求。因为需要你有了请求,它才会输出内容。 现在,你可以用 Requests 赶快写一段代码来进行验证: import requests import time proxies = {'http': 'http://13.88.220.207:9976'} for _ in range(10): resp = requests.get('http://httpbin.org/ip', proxies=proxies).text print(resp) time.sleep(1)运行效果如下图所示。 配置nginx.config如果出现问题,要根据具体报错信息来解决。 自己搭建隧道代理,实际工作生活中只能拿来练手,毕竟如果是在公司上班,这个要花费很多时间成本去做开发和维护,过程中如果有遇到问题,也需要及时维护,同时也无法保证自己搭建的隧道代理的稳定性,毕竟要考虑的因素实在太多了,是用什么基础搭建的?免费的HTTP代理的可用率、代理服务器的稳定性…… 4.隧道代理厂商当然,市面上的隧道代理厂商也没有多到让人无法挑的地步,主要还是这么几家: 快代理 青果网络 阿布云 熊猫代理 小象代理 亿牛云 PS:像青果网络这种,定时更换周期的,通道数居然是10,和其他家有明显的区别,蛮神奇的。 HTTP代理类型 分类 代表厂商 通道数 并发请求 月费 隧道代理 定时换IP周期 (1分钟) 快代理 1 5 272 青果网络 10 5 390 小象代理 1 5 399 熊猫代理 1 5 420 阿布云 1 5 429 亿牛云 1 5 399 动态转发 快代理 1 5 388 青果网络 1 5 360 小象代理 1 5 399 熊猫代理 1 5 420 阿布云 1 5 429 亿牛云 1 5 399 我之前有使用过,总体来说效果还可以: |
CopyRight 2018-2019 办公设备维修网 版权所有 豫ICP备15022753号-3 |