注意 SESSION_EXT 是 1:1 扩展表,不改既存的 SESSIONS,
那张表被 161 个文件 import、47 张表关联,加字段影响面太大。本契约期结束后可整体摘除。
| 页面显示 | 存在哪 | 怎么来的 | 说明 |
|---|---|---|---|
| 正确率 82% | tags.live.seki |
SQL 聚合 | ΣSCORE ÷ 有评分的条数。分子来自逐条判分 |
| 未回答率 5% | tags.live.un |
SQL 聚合 | answered=false 的比例。分母是全部,不是有评分的 |
| 错误率 1% | tags.live.err |
SQL 聚合 | 系统异常,与回答质量无关 |
| 满意度 80% | tags.live.sat + satRate |
SQL 聚合 | 只是参考,不参与达标判定。代码注释写明:母数只限点过评价的人,少数点击就能翻转合否 |
| 状态「達成済 / 基準未達」 | tags.state |
纯函数算出 | 见下面的判定式,存下来避免每次重算 |
| 「検収時 92% → 最近 91%」 | baseline vs live |
两个字段并存 | 验收时冻结的成绩 vs 线上实况,分开存才说得清「当初达标过」 |
| 公开开关 | groups.publish AND tags.publish |
两级 AND | 大分类关了,小分类再开也没用 |
| 「対応中 · 担当森川 · 期限 06-18」 | tag_actions |
人填的 | 和品质状态是两套轴,见第 ④ 节 |
门槛 正确率 ≥ 90% 未回答率 ≤ 8% 错误率 ≤ 2% 最小样本 30 条已复核 evaluateState(m): 复核数 == 0 → 未着手 复核数 < 30 → データ不足 三个门槛全过 → 達成済 否则 → 基準未達 ← 注意不叫「改善中」了 満足度不参与判定 —— 母数只有点过评价的人,少数点击就能让合否翻转
还有两条容易漏的:
regression_flag 提示人拆开之后,「基準未達 且 未対応 且 样本也不增长」可以被识别为停滞, 然后落到「見送り」结案。这是给永远观察不完的卡片一个出口。
| 原因 | 什么意思 | 该打的手 | 成本 | 影响范围 |
|---|---|---|---|---|
nosrc | 根据本来就不存在 | 加知识 | 1 | 只影响这个问题及周边 |
wrongsrc | 有知识但内容错了/旧了 | 修知识 | 2 | 含该论点的全部问题 |
routing | 问题流去了别的分类 | 改标签分流 | 2 | 本标签 + 目标标签 |
scope | 本来就不该答 | 让 AI 不答,返回引导语 | 3 | 本标签 |
usage | 根据是对的,但用法不对 | 改提示词 | 4 | 全标签全问题 |
| 步骤 | 用什么 | 为什么不能换 |
|---|---|---|
| 判一条对不对 | 单次模型调用 | 输入固定三样,输出一个分。一次评测跑几百次,要批量并发且结果稳定 |
| 算标签正确率 | SQL | 就是加减乘除。用 agent 算:慢、贵、而且不可复现,而研究计划书承诺的正是「同条件可复现」 |
| 分析为什么不达标 | Agent | 要翻检索记录、翻原文、翻同类案例才能定原因。这才是 agent 该干的 |
| 项 | 我写的(felo-mygpt) | 团队代码里的(以此为准) |
|---|---|---|
| 误答原因 | 4 类:missing_source / prompt_issue / hallucination / out_of_scope | 5 类:nosrc / wrongsrc / routing / usage / scope 他们把「没有根据」和「有但错」分开了,还多了「分流错误」,更准 |
| 标签状态 | 单轴,4 个值 | 两轴:品质状态 × 对应状态 我漏了「人的意志」这一轴,以及停滞检测 |
| 手段与去向 | 没有这个概念 | MEANS + MEANS_DEST 选了手段还要能跳到干活的地方,否则「只是决定了,什么都没修」 |
结论:改我的,不改他们的。他们的定义写在 UI 代码里、已经跑起来了,而且想得比我细。
我的 FailureCause 枚举要扩成 5 类,MHLWTag 要加对应状态那一轴。
| 问题 | 说明 |
|---|---|
| 劣化判定用绝对阈值 | 91%→89.9% 和 91%→60% 目前都只是「要再確認」,不分轻重。建议加相对跌幅,大跌立刻升级 |
| 验收基线什么时候写 | 状态转「達成済」时应该自动冻结一份 baseline,但代码里没看到这个写入动作 , 如果没有,「検収時 92%」这个显示就永远是空的 |