# 毕业论文总纲 · 资料 / 实验设计 / 论文大纲

> 2026-09-18 ｜ 主线：思维链语域指纹（三波段）的构念效度、因果操纵与预测力
> 数据底座：`E:\dsh_dynamic_adjust\anchored-monitor\demo-data\experiment.jsonl`（35.1 MB，另有 50.0 MB 备份）
> 编制依据：本地已有学术资产（M7 两篇论文稿）+ 锚定线实验平台 + 外部文献检索

---

## 第一部分 · 资料清单（Related Work 骨架）

### 簇 A｜记忆系统与记忆评测基准（提供 baseline 与任务集）
| 文献/资产 | 位置 | 用法 |
| --- | --- | --- |
| LongMemEval（ICLR 2025，xiaowu0162/LongMemEval） | 外部 | 长时交互记忆基准，可直接借用其任务类型与评分协议，作为外部任务集 |
| MIRIX（arXiv 2507.07957；本地 `.research-mirix/MIRIX-main`） | 本地已克隆 | 多智能体记忆架构，含 `evals/` 目录，可作为对照系统 |
| cognee / Memori / supermemory | 本地 `.research/`（仅 .git，需完整检出） | 三个开源记忆实现，候选 baseline |
| MemGPT / Mem0 / SimpleMem / AriadneMem | 外部 | 主流记忆架构谱系，Related Work 的骨架与数字对照来源 |
| What Do Memory Benchmarks Actually Measure? | 外部（HF blog） | **方法论批判**：直接支撑本论文「基准测的不是存储」这一立论，务必精读 |
| Long-Term Memory Security Survey（ar5iv 2604.16548） | 外部 | 记忆生命周期治理视角，可用于 Discussion |

### 簇 B｜提示措辞与语用效应（本论文的干预实验理论来源）
| 文献 | 位置 | 用法 |
| --- | --- | --- |
| The language of prompting（arXiv 2311.01967） | 外部 | 系统研究提示的语言学属性，是「措辞 → 效果」这一路的直接先例 |
| Carrot or Stick? Reconciling Contradictory Findings on Prompt Tone Effects | 外部 | **矛盾发现综述**：说明语气效应不稳定，正是本论文做严格操纵实验的理由 |
| 礼貌/粗鲁提示效应（宾大相关报道） | 外部 | 提供「措辞影响准确率」的公众叙事与反例，需找到原始论文核验 |
| 本地锚定措辞实验（E1/E1.5/E2，见 feasibility report §1.5） | 本地 | 命令式 vs 中性/建议式 → we/let me 翻转的**一手预实验证据** |

### 簇 C｜思维链的语言学分析（本论文的测量工具理论来源）
| 文献 | 位置 | 用法 |
| --- | --- | --- |
| Robust Pronoun Fidelity with English LLMs（ar5iv 2404.03134） | 外部 | 代词使用与忠实性的关系，是「人称标记作为测量对象」的方法学先例 |
| Understanding Aha Moments（ar5iv 2504.02956） | 外部 | 从语言模式识别推理转折点，方法上同类（用语词特征定位认知状态切换） |
| CoT faithfulness 相关综述 | 待补 | 论证「思维链文本本身是可研究对象」，回应「只是装饰」的质疑 |

### 簇 D｜本地已有学术资产（可直接复用，勿重复造）
| 资产 | 规模 | 复用方式 |
| --- | --- | --- |
| `docs/M7-RESEARCH-PAPER.md` | 43.5 KB | 嵌入检索选型研究，含 RQ1–4、L1/L2 语料构建、效度威胁章节——**章节结构与写法可直接借鉴** |
| `docs/M7-ACTIVATION-V2-PAPER.md` | 26.3 KB | 激活策略研究，含回声陷阱发现、金标演进、消融与证伪、跨语言迁移 |
| `docs/M7-BENCHMARK-PLAN.md`、`M7-TASK-DISPATCH.md`、`M7-LABEL-REVIEW-REPORT.md` | 4–12 KB | 基准方案、任务派发、标注复核流程——标注信度的现成流程模板 |
| `E:\dsh_dynamic_adjust\project_feasibility_report.md` | 620 行 | 锚定线完整技术叙事（含三波段、相变、路径承诺、措辞实验） |

> ⚠️ 待核验项：以上外部条目的作者名、年份、卷期需在正式引用前逐条核（本清单只保证「存在且相关」，不保证书目字段准确）。

---

## 第二部分 · 实验设计（三个实验，观测 → 操纵 → 预测）

### 共同测量口径（先冻结，全篇不再改）
- 测量量：`persona_ratio = count("let me") / (count(positive) + count("let me"))`，滑动窗口 20 块。
- 词典：正向 we / let's / we'll / we need / our；负向仅 let me；i will / i'll / i need 归中性（2026-08-17 校正，锚定线已落地）。
- 波段：ratio < 0.2 → spec；0.2 ≤ ratio < 0.5 → mixed；ratio ≥ 0.5 → react。
- 数据源：`E:\dsh_dynamic_adjust\anchored-monitor\demo-data\experiment.jsonl`（35.1 MB）+ `events.jsonl`，以及 `~/.dsh/sessions/{sessionId}/events.jsonl` 的真实会话流。

> ⚠️ **开工前必须验证的前提**：`experiment.jsonl` 首行为 `{"type":"block_received",...}`，仅含 `textLength` 无正文。需先确认文件内是否存在携带 reasoning 正文的行类型（`events.jsonl` 的 `reasoning_block` 行确有 `text` 字段）。**若 35 MB 实验数据不含正文，E1 语料必须改从会话原始 JSONL 重建**——这是全部实验的前置阻塞项，第一天就要查清。

### E1｜观测研究：语域指纹的构念效度（回答 RQ1）
- **问题**：三波段是否对应可被人类标注者识别的、稳定的语域差异？还是正则词频的人为切分？
- **材料**：从语料随机抽 300 个 reasoning 块（分层抽样：三波段各 100）。
- **标注**：两位标注者独立判断「该段是集体规划式 / 行动者式 / 无法判断」，双盲于 ratio 值；先标 30 条试点校准标注手册，再标剩余。
- **信度**：Cohen κ（二分）或 Krippendorff α（三分等级）；判据 **κ ≥ 0.61**。
- **稳健性**：词表扰动（增删 ±1 个词、改权重 ±20%）后波段归属变化率；目标 **< 10%** 翻转。
- **效度证据**：波段 × 标注类别的混淆矩阵、与 ratio 值的 ROC。
- **产出**：一张构念效度证据图 + 一份标注手册（附录）。

### E2｜操纵实验：措辞的因果效应（回答 RQ2）
- **设计**：3（措辞）× 2（注入时机）被试内设计，任务是重复测量单位。
  - 措辞：命令式（"read first and follow them"）/ 建议式（"reading the index is recommended"）/ 中性陈述（"an index exists"）。
  - 时机：首轮 system prompt / 会话中途注入。
- **因变量**：主=措辞注入后 5 个块的 persona_ratio 变化 Δ；次=任务正确率、工具调用数、返工次数、token 成本。
- **刺激材料**：≥20 个等难度任务（可取自 Project2），每条件 × 任务 × 3 次重复。
- **分析**：线性混合效应模型（固定效应=措辞、时机、交互；随机截距=任务、会话），Holm 校正，报效应量与 95% CI。
- **先验依据**：feasibility report §1.5 的 E1/E1.5/E2 三轮预实验（命令式 → we 消失出现 3 个 let me；中性/建议式 → we 保持）。
- **止损线**：若三水平无显著差异 → 保留 E1 作为主结果，E2 降级为探索性分析写入附录。

### E3｜预测研究：波段是否领先于结果（回答 RQ3）
- **问题**：波段先于任务结果（预测性），还是结果反过来改变波段（反向因果）？
- **设计**：对每个任务单元取结果**之前**的窗口特征（ratio 均值 / 斜率 / mixed 停留时长），预测该任务单元的结果。
- **分析**：时间滞后互相关（lag 从 -10 到 +10）、Granger 因果检验、以及仅用「前置窗口」特征的交叉验证分类（session 分组，防泄漏）。
- **判据**：前置于结果的 lag 相关显著，且反向 lag 弱于正向 → 支持方向性。
- **对照**：与零模型（仅用任务类型、块长度、会话位置预测）比较增量 AUC。

### 伦理与合规（开工即办）
- 数据为本人自用日志 → 写明来源、脱敏（去除绝对路径、会话 ID 哈希化）、LLM 使用声明。
- 人工标注者若含他人 → 需知情同意说明；若仅本人 → 需报告单标注者的信度局限。
- API 成本：E2 的 3×2×20×3 = 360 次运行，需先估 token 预算并设上限。
- 第三方 baseline 的 license 需逐个核对后方可分发或复现。

- **止损线**：三项主要判据任一未达 → 收缩论文范围（见第四部分风险表）。

---

## 第三部分 · 论文大纲（章节级）

**题名（工作稿）**：思维链语域的三波段模型——大模型推理轨迹中的人称标记、构念效度与结果预测

1. **引言**（1.5 页）
   1.1 现象：同一模型同一任务，分数差异可达 8 分
   1.2 从工程预设到科学问题：措辞是否是可操纵的自变量
   1.3 贡献三条：① 人格语域的构念效度证据 ② 措辞的因果操纵结果 ③ 波段的时序预测力
   1.4 论文结构
2. **相关工作**（2.5 页）
   2.1 记忆系统与记忆评测（LongMemEval / MemGPT / Mem0 / MIRIX）——说明本文不评记忆质量，而评**思维轨迹的语域**
   2.2 提示措辞与语用效应（language of prompting；语气效应的矛盾发现）
   2.3 思维链的语言学分析（代词忠实性、aha moment 检测）
   2.4 研究空白：三波段模型从未被构念效度检验，也从未被因果操纵验证
3. **数据与方法**（3 页）
   3.1 语料：来源、规模、抽取与脱敏
   3.2 测量：词典、窗口、ratio 与波段定义（冻结版本号 + 哈希）
   3.3 标注方案与信度估计
   3.4 统计模型：混合效应模型、bootstrap、多重比较校正
   3.5 可复现：脚本、种子、环境
4. **实验一：构念效度**（2.5 页）——结果表 + 混淆矩阵 + 词表扰动稳健性
5. **实验二：措辞的因果效应**（3 页）——主效应与交互、森林图、失败案例分析
6. **实验三：时序预测与方向性**（2 页）——滞后相关、Granger、增量 AUC
7. **讨论**（2 页）
   7.1 三波段是语域，不是一个分数
   7.2 对提示工程的实践含义（建议式优于命令式）
   7.3 对记忆系统设计的含义（注入措辞也是接口设计）
   7.4 与"语气效应矛盾发现"的对账
8. **效度威胁与局限**（1 页）——单模型家族、单语言（英语为主）、正则测量的上限、自用数据的样本偏倚
9. **结论与未来工作**（0.5 页）
10. **附录**——标注手册、全部提示词模板、完整结果表、复现脚本清单

**字数目标**：正文 6000–8000 词 + 附录。

---

## 第四部分 · 风险表与收缩路径

| 风险 | 概率 | 影响 | 应对 |
| --- | --- | --- | --- |
| experiment.jsonl 无正文（前置阻塞） | 中 | 高 | 改从会话原始 JSONL 重建语料；第一天验证 |
| 标注信度 κ < 0.61 | 中 | 高 | 改标注手册、合并为二分标注、或把 E1 降为描述性 |
| E2 无显著差异 | 中 | 中 | E1 升为主结果，E2 转探索性附录 |
| 波段是连续量而非相变 | 中 | 中 | 改为连续测量论文（更保守但仍成立） |
| 样本量不足（会话数少） | 中 | 中 | 先跑 power analysis；不足则做被试内重复测量 |
| 伦理/导师不认可用自用数据 | 低 | 高 | 提前与导师确认；备选是公开任务集上的受控实验 |

---

## 第五部分 · 立即执行的三步（本周）

1. **验数据**：跑一次解析脚本，确认 `experiment.jsonl` 与真实会话 JSONL 中 reasoning 正文的可得性与块数量，产出「语料可得性报告」。
2. **验信度**：抽 30 条 reasoning 块，定标注手册，标一遍，算第一版 κ。
3. **定题**：把本大纲压缩成 1 页预注册（假设、判据、止损线、样本量），交导师确认。
