# 网络爬虫

从网页采集数据。触发关键词：网络爬虫、数据采集、网页抓取。

## 执行步骤

### 步骤1：读取相关常识知识
使用 `read_knowledge knowledge_name='naming_conventions'`

### 步骤2：读取工作提示词
使用 `read_work work_name='web_scraping'`、`read_work work_name='data_extraction'`

### 步骤3：分析目标网站
确定数据所在的页面结构和URL规律。

### 步骤4：编写爬虫脚本
使用 `write_text` 编写爬虫代码。

### 步骤5：数据提取
解析HTML，提取目标数据字段。

### 步骤6：结构化存储
使用 `write_text` 将数据保存为CSV/JSON格式。

### 步骤7：反爬处理
添加User-Agent、延时和IP轮换策略。

## 输出成果
1. 爬虫脚本 / 采集数据文件

## 失败处理
- 若被网站封禁，降低请求频率或更换IP
- 若页面结构变化，更新解析规则

## 禁止行为
- ❌ 禁止爬取robots.txt禁止的内容
- ❌ 禁止高频率请求影响目标网站运行