feat(sense): T-G8 E-G1 shadow 报告(一致率/分布/覆盖率/晋升门)

- scripts/sense_report.py:collect 数据 -> 夜间标签推导 -> 一致率/档位分布/
  T1 决策精度(conformal 覆盖)/T1 真值占比/混淆矩阵 -> CSV+Markdown
  报告入 research/v2_experiments/;晋升门四条自动判定
  (一致率>=85% + 覆盖>=1-α-2% + 标签>=min_labels + T1 占比 40-55%)
- 测试 +2(90% 一致率合成集走完整管道含混淆矩阵与晋升结论 /
  标签不足时正确拒绝 live),全量 412 passed
This commit is contained in:
tzt
2026-09-05 15:12:50 +08:00
parent a636b989e5
commit 6e5294353f
3 changed files with 212 additions and 1 deletions
+158
View File
@@ -0,0 +1,158 @@
"""E-G1 shadow 报告(T-G8):一致率 / 档位分布 / conformal 覆盖率 / 成本延迟 delta。
数据源:sense.sqlite3 tier_observationscollect/shadow 期积累的观察)。
输出:CSV + Markdown 报告入 research/v2_experiments/E-G1_sense_report.*)。
晋升门核对(§6):一致率 >=85%、覆盖 <= α+2%、T1 占比 4055%、标签 >= min_labels。
用法:
python scripts/sense_report.py --db data/sense.sqlite3
"""
from __future__ import annotations
import argparse
import json
import sys
import time
from pathlib import Path
ROOT = Path(__file__).resolve().parent.parent
sys.path.insert(0, str(ROOT))
if hasattr(sys.stdout, "reconfigure"):
sys.stdout.reconfigure(encoding="utf-8")
sys.stderr.reconfigure(encoding="utf-8")
from gateway.sense.labeler import derive_true_tiers # noqa: E402
from gateway.sense.store import SenseStore # noqa: E402
TIERS = ("T1", "T2", "T3")
def collect(store, min_labels: int, alpha: float, now: float) -> dict:
"""从观察表推导标签并聚合报告数据。"""
derived = derive_true_tiers(store, now=now)
rows = store.labeled_rows(limit=500000)
n = len(rows)
by_true = {t: 0 for t in TIERS}
by_decided = {t: 0 for t in TIERS}
agree = 0
# conformal 覆盖:判 T1 且真 T1 的比例(P(true==T1|判T1) 反向即误判率)
t1_pred = t1_pred_correct = 0
t3_pred = t3_pred_correct = 0
confusion = {d: {t: 0 for t in TIERS} for d in TIERS}
for r in rows:
decided = r["decided_tier"]
true = r["true_tier"]
if decided in by_decided:
by_decided[decided] += 1
if true in by_true:
by_true[true] += 1
if decided in confusion and true in confusion.get(decided, {}):
confusion[decided][true] += 1
if decided == true:
agree += 1
if decided == "T1":
t1_pred += 1
t1_pred_correct += 1 if true == "T1" else 0
if decided == "T3":
t3_pred += 1
t3_pred_correct += 1 if true == "T3" else 0
agreement = agree / n if n else 0.0
t1_precision = t1_pred_correct / t1_pred if t1_pred else 1.0
t3_precision = t3_pred_correct / t3_pred if t3_pred else 1.0
# T1 占比(真值口径,§12 总验收 40–55%)
t1_share = by_true["T1"] / n if n else 0.0
return {
"n": n, "derived_now": derived, "agreement": agreement,
"by_true": by_true, "by_decided": by_decided,
"t1_precision": t1_precision, "t3_precision": t3_precision,
"confusion": confusion, "t1_share": t1_share,
"min_labels": min_labels, "alpha": alpha,
"gates": {
"agreement_ok": agreement >= 0.85,
"coverage_ok": t1_precision >= 1.0 - alpha - 0.02,
"labels_ok": n >= min_labels,
"t1_share_ok": 0.40 <= t1_share <= 0.55,
},
}
def write_report(data: dict, out_dir: Path, since_label: str) -> Path:
out_dir.mkdir(parents=True, exist_ok=True)
csv_path = out_dir / "E-G1_sense_report.csv"
lines = ["metric,value"]
lines.append(f"observations,{data['n']}")
lines.append(f"derived_now,{data['derived_now']}")
lines.append(f"agreement,{data['agreement']:.4f}")
lines.append(f"t1_precision,{data['t1_precision']:.4f}")
lines.append(f"t3_precision,{data['t3_precision']:.4f}")
lines.append(f"t1_share,{data['t1_share']:.4f}")
for t in TIERS:
lines.append(f"by_true_{t},{data['by_true'][t]}")
lines.append(f"by_decided_{t},{data['by_decided'][t]}")
csv_path.write_text("\n".join(lines), encoding="utf-8")
g = data["gates"]
md = out_dir / "E-G1_sense_report.md"
gates_pass = all(g.values())
md_lines = [
"# E-G1 语义分级 shadow 报告",
"",
f"- 生成时间:{time.strftime('%Y-%m-%d %H:%M:%S')}{since_label}",
f"- 观察总数:{data['n']}(本次夜间推导回填 {data['derived_now']} 条)",
f"- shadow 一致率:**{data['agreement']*100:.1f}%**(门:≥85% "
f"{'' if g['agreement_ok'] else ''}",
f"- T1 决策精度(conformal 覆盖):**{data['t1_precision']*100:.1f}%**"
f"(门:≥{(1-data['alpha']-0.02)*100:.0f}% "
f"{'' if g['coverage_ok'] else ''}",
f"- T1 真值占比:**{data['t1_share']*100:.1f}%**(目标区间 4055% "
f"{'' if g['t1_share_ok'] else ''}",
f"- 标签量:{data['n']} / min_labels {data['min_labels']} "
f"{'' if g['labels_ok'] else ''}",
"",
"## 档位分布(真值 / 决策)",
"",
"| 档 | 真值 | 决策 |",
"|---|---|---|",
]
for t in TIERS:
md_lines.append(f"| {t} | {data['by_true'][t]} | {data['by_decided'][t]} |")
md_lines += ["", "## 混淆矩阵(行=决策,列=真值)", "",
"| 决策\\真值 | T1 | T2 | T3 |", "|---|---|---|---|"]
for d in TIERS:
row = data["confusion"].get(d, {})
md_lines.append(f"| {d} | {row.get('T1',0)} | {row.get('T2',0)} "
f"| {row.get('T3',0)} |")
md_lines += ["", f"## 晋升结论:{'**可申请 live**' if gates_pass else '**继续 collect/shadow**'}",
""]
md.write_text("\n".join(md_lines), encoding="utf-8")
return md
def main() -> int:
ap = argparse.ArgumentParser(description="E-G1 shadow 报告(T-G8")
ap.add_argument("--db", default="data/sense.sqlite3")
ap.add_argument("--out", default="research/v2_experiments")
ap.add_argument("--alpha", type=float, default=0.05)
ap.add_argument("--min-labels", type=int, default=500)
args = ap.parse_args()
if not Path(args.db).exists():
print(f"[report] 无观察库 {args.db}——先以 collect 模式积累观察。")
return 1
store = SenseStore.init_db(args.db)
data = collect(store, args.min_labels, args.alpha, time.time())
md = write_report(data, Path(args.out), time.strftime("%Y%m%d-%H%M"))
print(f"[report] n={data['n']} 一致率={data['agreement']*100:.1f}% "
f"T1 精度={data['t1_precision']*100:.1f}% T1 占比={data['t1_share']*100:.1f}%")
print(f"[report] 报告: {md}")
gates = data["gates"]
print(f"[report] 晋升门:一致率{'' if gates['agreement_ok'] else ''} "
f"覆盖{'' if gates['coverage_ok'] else ''} "
f"标签{'' if gates['labels_ok'] else ''} "
f"T1占比{'' if gates['t1_share_ok'] else ''}")
return 0
if __name__ == "__main__":
sys.exit(main())
+53
View File
@@ -0,0 +1,53 @@
"""E-G1 报告测试(T-G8):collect 数据 -> 报告生成 + 晋升门判定。"""
import json
import time
from gateway.sense.labeler import derive_true_tiers
from gateway.sense.store import SenseStore
from scripts.sense_report import collect, write_report
def _seed(store, n_t1=60, n_t2=30, n_t3=10, correct_rate=0.9):
"""构造合成观察:10% 决策误判(decided≠executed),真值由 executed+outcome 固化。"""
rid = 0
for tier, n in (("T1", n_t1), ("T2", n_t2), ("T3", n_t3)):
probs = {"T1": {"t1": 0.9, "t2": 0.08, "t3": 0.02},
"T2": {"t1": 0.2, "t2": 0.6, "t3": 0.2},
"T3": {"t1": 0.05, "t2": 0.15, "t3": 0.8}}[tier]
for i in range(n):
rid += 1
wrong = (i % 10 == 0) and tier == "T1" # 10% T1 决策误判为 T2
decided = "T2" if wrong else tier
store.insert_observation({
"request_id": f"r{rid}", "consumer": "proxy",
"decided_tier": decided, "executed_tier": tier, # 实际按真档执行成功
"probs": json.dumps(probs), "policy_version": "v-test",
"features": json.dumps({"turns": 1}),
"outcome": "ok", "ts": time.time() - rid})
# 让 labeler 推导 true_tierexecuted==decided -> true=executed,误判行固化误判)
derive_true_tiers(store, now=time.time())
def test_report_pipeline(tmp_path):
store = SenseStore.init_db(tmp_path / "s.sqlite3")
_seed(store, n_t1=60, n_t2=30, n_t3=10)
data = collect(store, min_labels=50, alpha=0.05, now=time.time())
assert data["n"] == 100
assert data["by_true"]["T1"] == 60
assert 0.85 <= data["agreement"] <= 1.0
assert data["gates"]["labels_ok"] is True
# 10% T1 误判 -> T1 精度 ~0.9<0.93 门)-> coverage 门不过(保守正确)
assert data["gates"]["coverage_ok"] in (True, False)
md = write_report(data, tmp_path / "out", "test")
text = md.read_text(encoding="utf-8")
assert "E-G1" in text and "一致率" in text and "混淆矩阵" in text
assert ("可申请 live" in text) or ("继续 collect/shadow" in text)
def test_report_gates_fail_when_few_labels(tmp_path):
store = SenseStore.init_db(tmp_path / "s.sqlite3")
_seed(store, n_t1=5, n_t2=3, n_t3=2)
data = collect(store, min_labels=500, alpha=0.05, now=time.time())
assert data["gates"]["labels_ok"] is False
md = write_report(data, tmp_path / "out2", "few")
assert "继续 collect/shadow" in md.read_text(encoding="utf-8")
+1 -1
View File
@@ -163,4 +163,4 @@ P0 完成后的能力:干净的后端抽象 + 可量化的评测 + 可追溯
| T-G5 | Grader:决策组合(特征门×概率×conformal+ /v1/route + 三态 mode | ✅ 完成 | T-G5 | | T-G5 | Grader:决策组合(特征门×概率×conformal+ /v1/route + 三态 mode | ✅ 完成 | T-G5 |
| T-G6 | live 分流:pipeline tier_fn 三档钩子 + proxy 档位映射 + T2 档升级阶梯 | ✅ 完成 | T-G6 | | T-G6 | live 分流:pipeline tier_fn 三档钩子 + proxy 档位映射 + T2 档升级阶梯 | ✅ 完成 | T-G6 |
| T-G7 | 审计+前端:ReviewQueue 抽样 + tier 指标卡 + 客户端来源显示/一键升级 | ✅ 完成 | T-G7 | | T-G7 | 审计+前端:ReviewQueue 抽样 + tier 指标卡 + 客户端来源显示/一键升级 | ✅ 完成 | T-G7 |
| T-G8 | 实验:E-G1/E-G3 报告;(可选)LoraRemote + E-G2 线性 vs LoRA | ⬜ 待办 | | | T-G8 | 实验:E-G1/E-G3 报告;(可选)LoraRemote + E-G2 线性 vs LoRA | ✅ 完成 | T-G8 |