# 数据提取

从网页中提取结构化数据。触发关键词：提取数据、抓取内容、爬数据。

## 执行步骤

### 步骤1：读取相关常识知识
使用 `read_knowledge knowledge_name='naming_conventions'`

### 步骤2：读取工作提示词
使用 `read_work work_name='data_extraction'`、`read_work work_name='form_filling'`、`read_work work_name='operation_report'`、`read_work work_name='page_screenshot'`

### 步骤3：分析页面结构
确定目标数据所在的HTML标签和CSS选择器。

### 步骤4：编写提取脚本
使用 `write_text` 编写数据提取代码。

### 步骤5：提取数据
执行提取脚本，获取文本、链接、表格等数据。

### 步骤6：结构化存储
使用 `write_text` 将提取数据保存为结构化格式。

## 输出成果
1. 提取的结构化数据

## 失败处理
- 若选择器未匹配到元素，检查页面是否加载完成
- 若数据格式不一致，添加清洗和标准化处理

## 禁止行为
- ❌ 禁止提取受版权保护的数据
- ❌ 禁止忽略网站的robots协议