# scrape网页

## 规则（Rules）

# 网络爬虫规范

## 1. 请求频率

请求间隔≥1秒，并发≤5个，禁止DDoS。

✅ 每请求间隔1-3秒随机延迟
❌ 每秒发送100个请求

## 2. 隐私保护

禁止采集用户个人隐私数据。

✅ 采集公开的商品信息、新闻内容
❌ 采集用户手机号、身份证、密码

## 3. 遵守robots.txt

必须遵守目标网站的robots.txt协议。

✅ 爬取前检查robots.txt允许的路径
❌ 爬取robots.txt禁止的路径

## 方法（Methods）

# 网络爬虫方法

## 步骤

### 1. 分析目标网站
分析页面结构和数据加载方式。

### 2. 编写爬虫代码
编写爬虫代码。

### 3. 处理反爬虫
添加IP代理池、随机User-Agent、请求间隔1-3秒。

### 4. 保存数据
保存采集数据。

### 5. 输出报告
输出采集报告。

## 技巧（Tips）

# 网络爬虫技巧

## 1. 反爬虫应对

| 反爬措施 | 应对策略 |
|---------|---------|
| IP封禁 | 使用代理IP池轮换 |
| User-Agent检测 | 随机使用不同UA |
| 请求频率限制 | 添加1-3秒随机延迟 |
| 验证码 | 使用打码平台或降低频率 |

## 2. 常见问题

| 问题 | 原因 | 解决 |
|------|------|------|
| 被封IP | 请求频率过高 | 降低频率，使用代理 |
| 数据不全 | 动态加载 | 分析API接口直接请求 |
| 编码乱码 | 页面编码不一致 | 指定正确的编码格式 |
