Scrapy 标准配置代码与脚本示例
完全适配标准 HTTP 与 SOCKS5 代理鉴权规范,可随心粘贴调用。
config.python
# settings.py
DOWNLOADER_MIDDLEWARES = {
'scrapy.downloadermiddlewares.httpproxy.HttpProxyMiddleware': 110,
}
# 动态轮转住宅 IP 代理地址
HTTP_PROXY = 'http://你的子账号用户名:你的子账号密码@p1.bytesflows.com:8001'
# 或者配合中间件在每个 request 的 meta['proxy'] 中指定请登录 BytesFlows 用户中心获取您的子账号用户名和密码进行替换。如果需要锁定具体国家(如美国),请在用户名尾部追加 -cc-US。
Scrapy 数据报文是如何经过 BytesFlows 轮转的?
高可靠的四层与七层网关调度,确保每一次对外部目标的 HTTP/HTTPS 连接都具备真实的家庭住宅特征。
⚡
脚本发起请求
Scrapy 按照设定的网关端口向 BytesFlows 代理集群发出连接请求,并在 Header 中附带鉴权参数。
🔐
智能认证调度
BytesFlows 代理中枢即时校准并解析用户名中包含的地域指令(如 -cc-JP-city-tokyo)。
🏠
动态分配出口
从全球 6500 万+家庭宽带池中精选一条低延迟、高纯净度的实时在线住宅宽带 IP 建立隧道。
🌐
获取目标数据
目标服务端看到的是一条来自于真实本土网民的普通浏览流量,完美放行并返回期望数据。
支持「按每次连接自动轮转新 IP」与「长达 60 分钟固定同一个 IP(长效会话)」两种高频工作模式。
Scrapy 代理接入常见问题解答
如何在 Scrapy 脚本中防止 SSL 证书报错或连接超时?
BytesFlows 网关已严格配置了标准公开证书,一般不需要跳过 SSL 验证。如果碰到偶发的单节点波动超时,建议在脚本框架层面(如 retry 中间件或 axios-retry)设置自动重试 2-3 次,网关将自动替您更换并切入一条健康的全新 IP。
Scrapy 应该选用端口 8001 还是端口 1080?
8001 为标准 HTTP/HTTPS 代理网关端口,1080 为标准 SOCKS5 代理网关端口。由于它们使用的是同一套用户名与密码鉴权机制,只要您的开发语言库同时支持两种协议,您可以自由选择使用。