# Model Capability Radar

一个 DSH 设置页插件：从 deng.codexradar.com（分布式雷达众测看板）拉取各推理模型档位在 agent 工具/benchmark 上的分数，以柱状图展示单个模型的能力构成、折线图展示分数随时间的趋势。

## Language

**模型档位（Model Tier）**:
deng.codexradar.com 上的一个被测推理配置，如「GPT-5.6 high」「GPT-5.5 xhigh」。同一基座模型的不同推理档位是不同档位。
_Avoid_: 模型名、model（单独使用时）

**能力分（Score）**:
某模型档位在某 agent 工具或 benchmark 上由该网站给出的分数。数据永远来自远端网站，本插件不做本地评测。
_Avoid_: 评分、rating、雷达分

**当前模型（Selected Model）**:
雷达界面上正在展示的模型档位。默认解析为发起查看时 DSH 会话正在使用的模型档位；用户可随时切换。
_Avoid_: 当前会话模型（那是它的默认来源，不是概念本身）

**档位匹配（Tier Match）**:
把会话当前模型解析为榜单档位的三步规则：① 精确匹配 `model@effort`；② 同基座最强档位（榜单按 IQ 降序，首个命中即最强）；③ 双向子串兜底。① 为准确匹配，②③ 为近似匹配，dock 胶囊以 `≈` 标识近似命中，设置页默认选中走同一规则。模型名比较剥 provider 路径前缀、大小写归一、并折叠 `.`/`-`/`_` 等分隔符（DSH 自身目录名 `DeepSeek-V41-Flash` 与站点写法 `deepseek-v4.1-flash` 只差分隔符，须视为同一档位），空 reasoning effort 视同无 effort。
_Avoid_: 模型识别、自动匹配（未说明规则时）、模型解析

**快照（Snapshot）**:
一次成功拉取得到的完整分数数据的带时间戳副本，持久化在插件本地。是新鲜窗口内的直接显示源（期内不发请求），也是拉取失败时的兜底显示源，并长期累积成超出远端窗口的自有历史。
_Avoid_: 缓存（缓存只是快照的一种用途）、历史数据

**趋势（Trend）**:
选定档位 IQ 序列随时间的变化。主数据源是远端 iq-history（每小时一点、7 天滚动窗），序列尾端按站点语义拼接实时权威样本（Authoritative Live Sample）——效率档位等权通过率聚合（passed/total×150，1 位小数）以 source_updated_at 盖章：同小时替换尾点、滞后不回退，小时历史停更的档位因此仍带当日实测，24h 窗内单点照常走等值直线；本地累积的快照负责兜底与延伸出更长的自有历史。趋势在近 24 小时与近 7 天两个时间页签间切换展示（同时只显示一窗，默认近 7 天，选择被记住）——两窗是同一小时序列的时间戳切片（亚小时数据点按时间归窗），各窗独立绘图、独立自适应 y 刻度、各带一组完整统计（区间净变化、最低、平均、最高）；某窗口内只有 1 个数据点时，画一条从测试时间到当前时刻的等值直线——唯一实测点带圆点与数值，整线可悬停读数，统计行照常；窗口内没有任何数据点时才显示该窗空态。趋势卡在整条序列至少 1 个数据点时即进入页签视图。曲线仍按能力等级分段着色（曲线穿过 70/85/95/100 边界时换色），面积填充与曲线同段同色（低透明度），图上画出这些边界参考线；端点与悬停标记用所在等级的颜色，悬停提示附带等级名。
_Avoid_: 历史记录、历史曲线、合并对比线

**刷新（Refresh）**
按类别新鲜窗口判定的一次数据拉取：数据仍新鲜则直接展示快照、零请求，窗口外才打远端；用户点击手动刷新按钮绕行窗口、强制该频道全量拉最新。
_Avoid_: 同步、更新

**新鲜窗口（Freshness Window）**:
每个数据类别各自的时间预算（默认：总览、任务构成与社区体感分 15 分钟、频道列表、趋势与任务源信息 60 分钟），自上次成功拉取的时间戳起算，跨宿主重启生效。窗口内视为「最新」，UI 展示最近拉取时间。
_Avoid_: TTL、节流窗口（那是实现层说法）

**频道（Channel）**:
网站上的一套独立评测集：有自己的任务列表、指标与排行。现役两套：deep-swe（代码修复 · Pass rate）、pompeii-adjacency（视觉恢复 · Adjacency F1）。API 参数名沿用 benchmark，界面用语一律说频道。
_Avoid_: 板块、benchmark（界面用语中）

**IQ**:
网站为每个档位计算的归一化能力分，是趋势序列与跨档位比较的统一度量。
_Avoid_: 能力值、intelligence

**任务（Task）**:
频道内的一道具体评测题。榜单按档位给出每任务的多数票通过结果，是柱状图「能力构成」的展开维度。
_Avoid_: 题目、cell

**基座模型（Base Model）**:
档位的宿主模型 id（如 gpt-5.6-sol）。同一基座按推理力度分成多个档位，基座本身不直接带分数。
_Avoid_: family、裸模型名

**总览（Overview）**:
频道内每个基座以其当前最强档位参与的单屏排行，行内嵌按绝对 IQ 刻度缩放的量级条与对 24h 前的趋势信号；点击一行即把该档位设为当前模型。设置页与能力浮层共用：浮层中点击一行切换浮层的查看档位，会话当前档位所在行带「当前」标记。
_Avoid_: 排行榜、leaderboard（界面用语中）、能力列表（可能与任务能力构成混淆）

**Harness**:
贡献者提交判分所用的 agent 运行器，现役八种：Codex、Claude Code、DSH、ZCode、Grok、Kimi Code、Antigravity、CodeBuddy。由被测配置的模型标识推导得出（如 `dsh-` 前缀、`glm-5.3*`、`k3`、`grok-4.6`、`gemini-3.7-flash`、`hy4-preview`、`claude-sonnet-5`/`claude-opus-5`），是档位的展示层派生属性：只标注出处，不参与排行、分组或聚合——分数永远以档位为单位。推导不出的档位不打标。
_Avoid_: 评测端、运行器、客户端、benchmark

**能力等级（Capability Band）**:
IQ 的固定跨频道语义分段：低于 70 为待提升、70–84.9 为一般、85–94.9 为稳健、95–99.9 为优秀、100 及以上为领先。进度条统一使用 0–110 绝对刻度；无数据不参与等级判断。
_Avoid_: 排名段位、百分位等级

**任务状态（Task Status）**:
任务分数的频道内语义。DeepSWE 按多数票分为通过、分歧、失败；pompeii-adjacency 按连续 F1 分为较低（<0.25）、一般（0.25–0.49）、良好（0.5–0.74）、优秀（≥0.75）。
_Avoid_: 通用通过率（跨频道混用时）、统一状态

**任务源信息（Task Source）**:
站点任务目录（/table 端点的 tasks 数组）为每道任务发布的出处元数据：任务标题点击后打开的源仓库链接（DeepSWE 为 GitHub 仓库，pompeii 为数据集页）与编程语言徽章（站点同款词表：Py/JS/TS/Go/Rust，未知语言原样展示）。数据经 Host 代理只截取 tasks 数组、按 60 分钟窗口刷新；目录属于辅助读数——拉取失败只丢徽章与链接，绝不阻塞频道视图（视图照常组装，taskMeta 缺省）。
_Avoid_: 题库、元数据接口、repo 字段直出（UI 只说「源仓库」）

**会话能力读数（Session Capability Readout）**:
输入框工具行内、模型选择器左侧的紧凑 DeepSWE 读数（`SWE IQ` 标签 + 档位色分数药丸）：当前 IQ 一项读数，24h 变化等信息留给能力浮层。精确档位不存在时以 `≈` 标识同基座最强档位；基座不存在时不显示。它同时是可点击的入口：点击展开能力浮层。
_Avoid_: 当前模型分（未说明频道时）、综合能力分

**综合成本指数（Composite Cost Index）**:
由档位的平均费用与平均耗时按「2.5 倍价格可换 1.35 倍速度」权重折算出的单一成本度量：`费用 × (耗时/10)^(ln2.5/ln1.35) × 100`。在成本对比图内按可见档位的最大值归一为 100。费用或耗时缺失的档位不参与折算。
_Avoid_: 成本分、综合分、性价比

**成本对比（Cost Comparison）**:
设置页的跨档位对比散点：综合成本、时间成本、费用成本三个页签切换显示（默认综合，选择被记住），各以对数成本轴 × 线性 IQ 轴绘制全档位。编码规则：颜色＝基座（站点同款效率图色表，效率表缺色时回落其通用色表）、形状＝推理力度（off=× · low=○ · medium=△ · high=□ · xhigh=◇ · max=⬡ · ultra=★）；同基座各档位以折线相连（按推理力度 off→ultra 依次连接，半透明，单点不画线）。悬停读数与站点同构，三行：归属（展示名 · 计费 API/订阅 · Harness · 力度，按基座色高亮）、IQ（通过/总数）、当前页签指标（综合＝综合成本指数＋费用/耗时样本数；时间＝平均耗时；费用＝平均价格）。Codex 跑的 DSV4 两档（deepseek-v4-flash/pro）默认隐藏（与 dsh- 变体同底层模型，避免重叠），模型 chip 行多选筛选同步作用于三页签。仅设置页，不进浮层。
_Avoid_: 效率图、性价比图、雷达散点

**能力浮层（Capability Popover）**:
点击会话能力读数展开的浮层视图：顶部为全基座能力总览（供对比选型），其下为查看档位的完整能力详情（IQ/价格/耗时/缓存/24h 运行数徽章、7 天 IQ 趋势、逐任务通过率构成）。频道固定 DeepSWE。查看档位默认跟随会话能力读数并实时跟随；点击总览行或切换趋势卡档位下拉可临时查看其他档位，会话切换模型或浮层关闭后回到跟随。匹配消失时浮层自动关闭。
_Avoid_: 弹窗、详情页、能力大图

**社区体感分（Community Ratings）**:
codexradar.com 主站社区按近 7 天/近 24 小时滚动窗对模型档位打出的 0–10 主观体验均分（附评分人数）。与能力分并行的第二条数据线：能力分来自 api.codexradar.com 的众测判分、按频道组织；体感分来自主站社区投票、全局且与频道无关（站点参考语义：9–10 明显好用、7–8 正常可用、5–6 勉强可用、3–4 体验较差、1–2 几乎不可用）。档位 id（如 `gpt-5.6-sol-ultra`）直接映射 `model@effort` 档位键。设置页专属卡片（成本对比之后）：按基座分组、组内按推理力度 ultra→off 排列的柱状图，y 轴固定 0–10，柱色＝基座（站点同款效率图色表），柱顶标分数、柱下标力度、人数在悬停提示；双窗页签切换（默认近 7 天，选择被记住），两窗槽位一致、无人评分的档位画「未评分」占位；当前选中档位的柱子按档位匹配规则高亮，只读、不点击切换。数据源是主站 `/api/model-ratings`——插件的第二个上游域名，无 CORS 头，与能力分同样只经 Host 代理拉取（两窗各自独立计窗）。仅设置页，不进浮层。
_Avoid_: 用户评分、人气分、情感分、model ratings（API 路径名，仅实现层用）
