# 毕业论文方向缺口分析 · dsh-auto-memory / dsh-anchored-monitor

> 日期：2026-09-18 ｜ 视角：语言科学与数据分析（主修）+ 人工智能与数据分析（第二专业）
> 结论摘要：代码与工程严谨度已经够用；缺口集中在**研究问题学术化、外部对照、消融、时间维度、测量工具信度**五处。

## 一、可当论文资产直接用的部分（已具备）

| 资产 | 现状证据 | 论文中的角色 |
| --- | --- | --- |
| 可运行系统 | lib/ 120 文件，`lib/index.js` 10389 行；npm `@a9i5k4/dsh-auto-memory` v3.0.0 已发布 | Method / System 章节；部署真实性 |
| 真实用户外部效度 | 年下载 10,900；GitHub `Aik358/dsh-auto-memory` | 区别于"玩具原型"的说服力 |
| 统计纪律雏形 | M7：69 条人工金标 held-out、pairId 聚类 bootstrap B=2000、预注册式冻结计划、零重调参 | 统计章节的骨架 |
| 参照系统语料 | `.research/` cognee / Memori / supermemory；`.research-mirix/MIRIX-main` | Related Work 与 baseline 来源 |
| 锚定线理论雏形 | `E:\dsh_dynamic_adjust\project_feasibility_report.md`（620 行）：三波段 spec 0-0.19 / mixed 0.2-0.49 / react 0.5-1.0、相变、路径承诺、措辞实验 | **最适合当论文主轴**：这是唯一有可证伪理论味的部分 |
| 纵向日志基础设施 | 锚定监控 JSONL 事件流、每日工作日志、会话转写 | 时间维度实验的数据来源 |

## 二、缺口清单（按评审最可能扣分的顺序）

### 缺口 1 · 研究问题仍是工程目标，不是可证伪假设
"记忆不断线""跨窗口续命"是产品目标。论文需要 RQ / H0 / H1 + 自变量·因变量·控制变量表 + 什么结果会推翻假设。

### 缺口 2 · 没有对外可比的 baseline
现有指标全部是自比（3.0 vs 2.5.3）。缺：与 ≥2 个公开系统（Mem0 / cognee / MIRIX / 无记忆裸模型）在同一任务集上的对照，并报告效应量而非仅 p 值。

### 缺口 3 · 没有消融实验
分层（Tier-0/1/2）、唤回、沉淀、白板、账本是一整套，无法归因到组件。优势是开关已全部在配置里，可直接跑 one-at-a-time 或 2^k 设计。

### 缺口 4 · 没有时间维度 / 纵向曲线
单轮或单会话测量测不到记忆系统的核心价值。缺：跨会话、跨天、上下文窗口填充过程中的纵向曲线（≥2 周、≥N 会话）。JSONL 已在写，但从未被当成数据集分析。

### 缺口 5 · 测量工具本身没有被验证（语言科学的主场）
we / let's / let me 目前是正则词频计数——没有标注一致性、没有信度报告、没有反例验证、没有词表敏感性分析。
缺：人工标注子集 + Krippendorff α 或 Cohen κ + 词表扰动实验。
**这一条是把"波段"从经验阈值升级为经构念效度检验的测量工具的关键**，也正是语言科学训练最能发挥的地方。

### 缺口 6 · 统计推断不完整
已有 bootstrap CI，但缺：多重比较校正（Holm/BH）、效应量（Cliff's δ / Cohen's d）、正式预注册登记、失败案例定性分析。

### 缺口 7 · 伦理与合规
- 若含人类被试（问卷 / 可用性测试）→ 需要伦理审查（IRB/HREC）批件；
- 若只用自用日志 → 必须写明数据来源、脱敏方式、LLM 使用声明；
- 第三方仓库许可必须逐个核对（cognee / MIRIX / Memori / supermemory 的 license 决定能否作为 baseline 分发）。

### 缺口 8 · 学术写作要件
Related Work 目前是散装仓库而非系统综述；缺论文骨架（Intro / Related Work / Method / Experiments / Results / Discussion / Limitations / Ethics Statement）与可复现 artifact 包（代码 + 数据 + 一键复现脚本）。

## 三、三个候选研究问题（按两个专业的契合度排序）

### RQ-A（推荐主轴）· 思维链语域指纹的构念效度与预测力
- H1：人称/施事标记（we 型 vs let me 型）构成稳定语域，而非随机波动。
- H2：语域可预测任务结果，且时间上先于结果（需时序检验，排除"高分导致 we"的反向解释）。
- 方法：会话语料 → 人工标注 → 词频与句法特征 → 变点检测 / 分段 → 预测建模（交叉验证）。
- 契合：语言科学（语域、语用、人称指称、指称链）+ 数据分析（变点检测、混合效应模型、交叉验证）。

### RQ-B · 记忆注入措辞的言语行为效应
- 假设：指令类措辞（命令式）与断言/建议类措辞（参考式）对模型行为改变率存在显著差异。
- 设计：自变量 = 措辞类型（3 水平：命令 / 建议 / 中性陈述）；因变量 = 行为改变率、命中率、返工次数、token 成本；拉丁方平衡顺序；混合效应模型。
- 已有基础：2026-09-08 记录的 A/B 分级实验设计（弱提示 vs 明确指令式）。
- 契合：语用学（Searle 言语行为理论）+ 实验设计统计。

### RQ-C（最保守，创新性最低）· 分层记忆注入的成本-收益曲线
- 假设：注入预算是边际收益递减的，存在最优点。
- 方法：扫描注入预算参数，画 quality–token 曲线。

## 四、时间线（对齐已有课程节点）

| 时间 | 动作 |
| --- | --- |
| 10 月上旬 | 定 RQ 与导师；写 1 页预注册（假设、判据、止损线） |
| 10–11 月 | 数据采集启动：锚定监控与自用日志持续累积；适配 2 个公开 baseline |
| 12–1 月 | 消融 + baseline 跑完；人工标注子集完成，出信度报告 |
| 2 月 | 分析、作图、写作主体 |
| 3 月 | 修订、artifact 打包、提交 |

## 五、验收口径（"够了"的定义）

1. 有一个可证伪假设，且写明什么结果会推翻它；
2. ≥2 个外部 baseline 的同任务集对照；
3. 一张消融表（逐组件增益）；
4. 一份标注信度报告（α 或 κ）；
5. 有效应量与置信区间，不只 p 值；
6. 一键复现的 artifact（代码 + 数据 + 脚本）。

## 六、最小下一步（本周可执行）

1. 把 `project_feasibility_report.md` 1.5 节的措辞实验扩写成 RQ-B 的正式假设与变量表；
2. 从现有会话 JSONL 中抽 200 条 reasoning 块，人工标注 we / let me 与"是否计划式"，算一次 κ；
3. 核 cognee / MIRIX / Memori / supermemory 的 license，确定哪个能当 baseline。

