chore: T-P-1 工作区收敛——并行会话成果与历史未入库文件整理入库

- 入库历史遗漏源码/测试:router_system 9 模块(agent/executors/inference/knowledge/
  memory/planner/skills/trace)、tests 11 个测试文件、config/knowledge 领域知识
- 入库根目录方案文档(v2/v3/可行性×2)、references 文献(arxiv 14-18/cnki_open/
  参考文献清单)、research 论文素材(routerarena/paper/中文文献 PDF)
- 前端构建产物刷新(新 hash);webapp 误写文档删除
- gitignore 增补:deepseek-harness、research/_refs、.mimosa/.zcode、网关日志/pid、
  临时调试脚本、tests/e2e/node_modules、AI代理功能开发/prefix
- 基线确认:318 passed
This commit is contained in:
tzt
2026-09-05 08:28:25 +08:00
parent 747d85c3ba
commit ce0f6170d3
82 changed files with 74132 additions and 36 deletions
@@ -0,0 +1,94 @@
# RouterArena 接入方案(方案 v0.1
> 撰写日期:2026-08-19
> 依据:RouterArena README + base_router.py + generate_prediction_file.py + llm_evaluation/run.pyGitHub @ `RouteWorks/RouterArena`2026-08-19 拉取)
> 状态:方案已固化,开始 Step 3 实现
---
## 1. 目标
把本系统的 L0 专家系统路由器接入 RouterArena 标准化评测,得到可与排行榜 27 个公开路由器直接对比的 Arena Score、Accuracy、Cost/1K、Latency、Robustness 5 维指标。
承接 `research/2026_papers_survey.md` 第三节第 1 条建议:"本项目下一步应优先做三件事"中的第一件。
## 2. 关键证据(来自 RouterArena 源码)
| 事实 | 来源 | 对本方案的影响 |
|------|------|--------------|
| 评测仅看 prompt + global_index**不接触 ground truth answer** | README L34-37, generate_prediction_file.py L84-115 | 路由阶段只做"选模型",避免与训练阶段耦合 → 合规 |
| 接口 `_get_prediction(self, query) -> str` 返回的必须是 `config["pipeline_params"]["models"]` 中的名字 | base_router.py L139-167 | 必须把我们 L0 的"选规则模板"重映射为"选目标 LLM" |
| 候选模型必须出现在 `universal_model_names.py``model_cost/model_cost.json` | README L102-107 | 候选模型要选排行榜主流、有公开价格、API 可达 |
| sub_10 子集 809 条,full 8400 条 | generate_prediction_file.py L88-92 | 先 sub_10 烟测,再考虑 full |
| Arena 公式 β=0.1, c_max=200, c_min=0.0044 | run.py L65-87 | 极低成本的路由器($0.001/1K 量级)天然占优 |
| 评测完整流程 = 路由 + 推理(API 调用)+ 评分 | README L100-130 | 推理阶段需要真实 API key 与钱 |
## 3. 适配方案(设计决策)
### 3.1 候选模型池(5 个,论文调研中"低成本代表")
| 槽位 | 模型 | 选它的理由 | 预期价格($ / 1K queries,按公开定价) |
|------|------|----------|--------------------------------------|
| `code-strong` | `gpt-4o-mini` | 排行榜出现频次最高,代码能力强 | 0.15-0.6 / 1M tok → ~$0.04-0.15/1K |
| `reasoning-strong` | `claude-3-haiku-20240307` | 通用推理/法律/医疗 | $0.25/1M input → ~$0.05/1K |
| `generalist-fast` | `gemini-2.0-flash-001` | 通用快速,覆盖 life/education | $0.075/1M → ~$0.02/1K |
| `multilingual-cn` | `deepseek-chat` | 中文/教育/通用 | $0.14/1M → ~$0.03/1K |
| `reasoning-mid` | `mistral-medium` | 备用 / 难样本兜底 | $2.7/1M → ~$0.5/1K |
> 注:精确价格需按 `model_cost/model_cost.json` 与 `universal_model_names.py` 校验。预期区间与排行榜 Hybrid Router $0.04/1K、GPT-5 $10.02/1K 同量级。
### 3.2 L0 域 → 模型槽位 映射表(核心决策)
基于本系统 8 领域 × LLM 擅长:
| L0 域 | 子域样本 | 选 | 理由 |
|-------|---------|----|----|
| `code` | algorithm, debugging, database | `code-strong` (gpt-4o-mini) | 编程类基准 SOTALiveCodeBench/Codeforces |
| `math` | algebra, geometry, calculus | `reasoning-strong` (claude-3-haiku) | 数学推理强项 |
| `legal` | labor, contract | `reasoning-strong` (claude-3-haiku) | 法律长文本/严谨性 |
| `medical` | chronic, medication, firstaid | `reasoning-strong` (claude-3-haiku) | 医疗警示/准确性优先 |
| `finance` | investing, credit, loan | `reasoning-strong` (claude-3-haiku) | 数字严谨/风险提示 |
| `life` | travel, fitness, food | `generalist-fast` (gemini-2.0-flash) | 实用建议快速返回 |
| `education` | exam, study, career | `multilingual-cn` (deepseek-chat) | 中文/教育/应试 |
| `general` | explain, writing | `generalist-fast` (gemini-2.0-flash) | 通用兜底成本最低 |
**兜底规则**:当 confidence < 0.60 或 quality_score < 0.70(与 L0 Judge 阈值一致),升一级到 `reasoning-mid` (mistral-medium)。
### 3.3 实现三件套
| 文件 | 角色 | 依赖 |
|------|------|------|
| `research/routerarena/adapter.py` | `BaseRouter` 子类,调用本系统 L0 router | 仅零依赖 |
| `research/routerarena/config/es-expert.json` | 候选模型池 + 类名配置 | 无 |
| `scripts/routerarena_generate.py` | 复用 RouterArena 的 `generate_prediction_file.py` 入口 | 需要把 adapter 注册进 RouterArena 路由器模块 |
### 3.4 验证策略(分阶段)
1. **烟测(无 API 成本)**:跑 `sub_10` 生成预测文件,验证 809 条记录格式合规、模型名映射一致
2. **Mock 推理 + 评分方法学验证**:把 `generated_result` 填充为 mock 但带 token_usage,验证 Arena 公式可跑通
3. **真子集(消耗 API**sub_10 上跑 5-10 条做端到端烟测,验证 API key 路径
4. **全量评测(消耗 API**full 8400 条,需预算 ~$1-5(按 5 模型轮询成本估算)
### 3.5 风险与缺口
| 风险 | 影响 | 缓解 |
|------|------|------|
| 没有 API key | 完整评测跑不通 | 先做烟测 + 方法学验证;提交方案文档说明 gap |
| RouterArena 用 8 领域,本系统 8 领域但标签不一一对应 | 路由决策可比性下降 | 文档里写清映射表 + 不能直接比的子域 |
| L0 路由是基于关键词规则的,可能对 RouterArena 长 prompt 命中率下降 | 准确率会低于 100% | 这是预期:自建 24 样例 100% 不代表 809 条也是,要看真实分布 |
| 模型价格/能力随时间变化 | 排行榜基线会漂移 | 报告里标注"基于 2026-07 快照",未来要重测 |
## 4. 不做的事(明确边界)
- **不在 RouterArena 标签上训练/微调**(合规要求)
- **不修改本系统核心 router**(只新增 adapter 适配层)
- **不在第一阶段做 full 评测**(成本/时间/资源限制,先 sub_10 验证方法学)
- **不立即对接 RouterArena PR 提交**(先有方法学验证 + gap 文档)
## 5. 验收标准
- [ ] `research/routerarena/adapter.py` 实现完整,可独立 import
- [ ] 在 sub_10 上生成 809 条预测,文件格式通过 `check_config_prediction_files.py` 校验
- [ ] mock 推理跑通 Arena 公式,得到本系统的 Arena Score 数字
- [ ] 写完 `01_results_sub10.md` 报告,含与排行榜 5 个基线(Hybrid Router / R2-Router / GPT-5 / MIRT-BERT / NotDiamond)的对比表
- [ ] 不引入新依赖到 requirements.txt(仅 Python 标准库 + 已有 deps