# 网页scraping

## 规则（Rules）

# 网络爬虫规范

## 1. 合规采集

禁止对网站进行DDoS攻击，请求间隔≥1秒，并发≤5个。

## 2. 隐私保护

禁止采集用户个人隐私数据。

## 3. 遵守协议

禁止违反网站的robots.txt协议。

## 方法（Methods）

# 网络爬虫方法

## 流程概览

分析目标网站 → 编写爬虫代码 → 处理反爬虫 → 保存数据 → 输出报告

## 步骤

1. 分析目标网站结构
2. 编写爬虫代码
3. 添加反爬虫策略
4. 保存采集数据，输出报告

## 技巧（Tips）

# 网络爬虫技巧

## 随机延迟

在请求之间添加1-3秒的随机延迟，模拟人类浏览行为。
