Files
projectAIpopular/research/routerarena/00_integration_plan.md
T
tzt ce0f6170d3 chore: T-P-1 工作区收敛——并行会话成果与历史未入库文件整理入库
- 入库历史遗漏源码/测试:router_system 9 模块(agent/executors/inference/knowledge/
  memory/planner/skills/trace)、tests 11 个测试文件、config/knowledge 领域知识
- 入库根目录方案文档(v2/v3/可行性×2)、references 文献(arxiv 14-18/cnki_open/
  参考文献清单)、research 论文素材(routerarena/paper/中文文献 PDF)
- 前端构建产物刷新(新 hash);webapp 误写文档删除
- gitignore 增补:deepseek-harness、research/_refs、.mimosa/.zcode、网关日志/pid、
  临时调试脚本、tests/e2e/node_modules、AI代理功能开发/prefix
- 基线确认:318 passed
2026-09-05 08:28:25 +08:00

6.2 KiB
Raw Blame History

RouterArena 接入方案(方案 v0.1

撰写日期:2026-08-19 依据:RouterArena README + base_router.py + generate_prediction_file.py + llm_evaluation/run.pyGitHub @ RouteWorks/RouterArena2026-08-19 拉取) 状态:方案已固化,开始 Step 3 实现


1. 目标

把本系统的 L0 专家系统路由器接入 RouterArena 标准化评测,得到可与排行榜 27 个公开路由器直接对比的 Arena Score、Accuracy、Cost/1K、Latency、Robustness 5 维指标。

承接 research/2026_papers_survey.md 第三节第 1 条建议:"本项目下一步应优先做三件事"中的第一件。

2. 关键证据(来自 RouterArena 源码)

事实 来源 对本方案的影响
评测仅看 prompt + global_index不接触 ground truth answer README L34-37, generate_prediction_file.py L84-115 路由阶段只做"选模型",避免与训练阶段耦合 → 合规
接口 _get_prediction(self, query) -> str 返回的必须是 config["pipeline_params"]["models"] 中的名字 base_router.py L139-167 必须把我们 L0 的"选规则模板"重映射为"选目标 LLM"
候选模型必须出现在 universal_model_names.pymodel_cost/model_cost.json README L102-107 候选模型要选排行榜主流、有公开价格、API 可达
sub_10 子集 809 条,full 8400 条 generate_prediction_file.py L88-92 先 sub_10 烟测,再考虑 full
Arena 公式 β=0.1, c_max=200, c_min=0.0044 run.py L65-87 极低成本的路由器($0.001/1K 量级)天然占优
评测完整流程 = 路由 + 推理(API 调用)+ 评分 README L100-130 推理阶段需要真实 API key 与钱

3. 适配方案(设计决策)

3.1 候选模型池(5 个,论文调研中"低成本代表")

槽位 模型 选它的理由 预期价格($ / 1K queries,按公开定价)
code-strong gpt-4o-mini 排行榜出现频次最高,代码能力强 0.15-0.6 / 1M tok → ~$0.04-0.15/1K
reasoning-strong claude-3-haiku-20240307 通用推理/法律/医疗 $0.25/1M input → ~$0.05/1K
generalist-fast gemini-2.0-flash-001 通用快速,覆盖 life/education $0.075/1M → ~$0.02/1K
multilingual-cn deepseek-chat 中文/教育/通用 $0.14/1M → ~$0.03/1K
reasoning-mid mistral-medium 备用 / 难样本兜底 $2.7/1M → ~$0.5/1K

注:精确价格需按 model_cost/model_cost.jsonuniversal_model_names.py 校验。预期区间与排行榜 Hybrid Router $0.04/1K、GPT-5 $10.02/1K 同量级。

3.2 L0 域 → 模型槽位 映射表(核心决策)

基于本系统 8 领域 × LLM 擅长:

L0 域 子域样本 理由
code algorithm, debugging, database code-strong (gpt-4o-mini) 编程类基准 SOTALiveCodeBench/Codeforces
math algebra, geometry, calculus reasoning-strong (claude-3-haiku) 数学推理强项
legal labor, contract reasoning-strong (claude-3-haiku) 法律长文本/严谨性
medical chronic, medication, firstaid reasoning-strong (claude-3-haiku) 医疗警示/准确性优先
finance investing, credit, loan reasoning-strong (claude-3-haiku) 数字严谨/风险提示
life travel, fitness, food generalist-fast (gemini-2.0-flash) 实用建议快速返回
education exam, study, career multilingual-cn (deepseek-chat) 中文/教育/应试
general explain, writing generalist-fast (gemini-2.0-flash) 通用兜底成本最低

兜底规则:当 confidence < 0.60 或 quality_score < 0.70(与 L0 Judge 阈值一致),升一级到 reasoning-mid (mistral-medium)。

3.3 实现三件套

文件 角色 依赖
research/routerarena/adapter.py BaseRouter 子类,调用本系统 L0 router 仅零依赖
research/routerarena/config/es-expert.json 候选模型池 + 类名配置
scripts/routerarena_generate.py 复用 RouterArena 的 generate_prediction_file.py 入口 需要把 adapter 注册进 RouterArena 路由器模块

3.4 验证策略(分阶段)

  1. 烟测(无 API 成本):跑 sub_10 生成预测文件,验证 809 条记录格式合规、模型名映射一致
  2. Mock 推理 + 评分方法学验证:把 generated_result 填充为 mock 但带 token_usage,验证 Arena 公式可跑通
  3. 真子集(消耗 APIsub_10 上跑 5-10 条做端到端烟测,验证 API key 路径
  4. 全量评测(消耗 APIfull 8400 条,需预算 ~$1-5(按 5 模型轮询成本估算)

3.5 风险与缺口

风险 影响 缓解
没有 API key 完整评测跑不通 先做烟测 + 方法学验证;提交方案文档说明 gap
RouterArena 用 8 领域,本系统 8 领域但标签不一一对应 路由决策可比性下降 文档里写清映射表 + 不能直接比的子域
L0 路由是基于关键词规则的,可能对 RouterArena 长 prompt 命中率下降 准确率会低于 100% 这是预期:自建 24 样例 100% 不代表 809 条也是,要看真实分布
模型价格/能力随时间变化 排行榜基线会漂移 报告里标注"基于 2026-07 快照",未来要重测

4. 不做的事(明确边界)

  • 不在 RouterArena 标签上训练/微调(合规要求)
  • 不修改本系统核心 router(只新增 adapter 适配层)
  • 不在第一阶段做 full 评测(成本/时间/资源限制,先 sub_10 验证方法学)
  • 不立即对接 RouterArena PR 提交(先有方法学验证 + gap 文档)

5. 验收标准

  • research/routerarena/adapter.py 实现完整,可独立 import
  • 在 sub_10 上生成 809 条预测,文件格式通过 check_config_prediction_files.py 校验
  • mock 推理跑通 Arena 公式,得到本系统的 Arena Score 数字
  • 写完 01_results_sub10.md 报告,含与排行榜 5 个基线(Hybrid Router / R2-Router / GPT-5 / MIRT-BERT / NotDiamond)的对比表
  • 不引入新依赖到 requirements.txt(仅 Python 标准库 + 已有 deps