- 入库历史遗漏源码/测试:router_system 9 模块(agent/executors/inference/knowledge/ memory/planner/skills/trace)、tests 11 个测试文件、config/knowledge 领域知识 - 入库根目录方案文档(v2/v3/可行性×2)、references 文献(arxiv 14-18/cnki_open/ 参考文献清单)、research 论文素材(routerarena/paper/中文文献 PDF) - 前端构建产物刷新(新 hash);webapp 误写文档删除 - gitignore 增补:deepseek-harness、research/_refs、.mimosa/.zcode、网关日志/pid、 临时调试脚本、tests/e2e/node_modules、AI代理功能开发/prefix - 基线确认:318 passed
6.2 KiB
6.2 KiB
RouterArena 接入方案(方案 v0.1)
撰写日期:2026-08-19 依据:RouterArena README + base_router.py + generate_prediction_file.py + llm_evaluation/run.py(GitHub @
RouteWorks/RouterArena,2026-08-19 拉取) 状态:方案已固化,开始 Step 3 实现
1. 目标
把本系统的 L0 专家系统路由器接入 RouterArena 标准化评测,得到可与排行榜 27 个公开路由器直接对比的 Arena Score、Accuracy、Cost/1K、Latency、Robustness 5 维指标。
承接 research/2026_papers_survey.md 第三节第 1 条建议:"本项目下一步应优先做三件事"中的第一件。
2. 关键证据(来自 RouterArena 源码)
| 事实 | 来源 | 对本方案的影响 |
|---|---|---|
| 评测仅看 prompt + global_index,不接触 ground truth answer | README L34-37, generate_prediction_file.py L84-115 | 路由阶段只做"选模型",避免与训练阶段耦合 → 合规 |
接口 _get_prediction(self, query) -> str 返回的必须是 config["pipeline_params"]["models"] 中的名字 |
base_router.py L139-167 | 必须把我们 L0 的"选规则模板"重映射为"选目标 LLM" |
候选模型必须出现在 universal_model_names.py 与 model_cost/model_cost.json |
README L102-107 | 候选模型要选排行榜主流、有公开价格、API 可达 |
| sub_10 子集 809 条,full 8400 条 | generate_prediction_file.py L88-92 | 先 sub_10 烟测,再考虑 full |
| Arena 公式 β=0.1, c_max=200, c_min=0.0044 | run.py L65-87 | 极低成本的路由器($0.001/1K 量级)天然占优 |
| 评测完整流程 = 路由 + 推理(API 调用)+ 评分 | README L100-130 | 推理阶段需要真实 API key 与钱 |
3. 适配方案(设计决策)
3.1 候选模型池(5 个,论文调研中"低成本代表")
| 槽位 | 模型 | 选它的理由 | 预期价格($ / 1K queries,按公开定价) |
|---|---|---|---|
code-strong |
gpt-4o-mini |
排行榜出现频次最高,代码能力强 | 0.15-0.6 / 1M tok → ~$0.04-0.15/1K |
reasoning-strong |
claude-3-haiku-20240307 |
通用推理/法律/医疗 | $0.25/1M input → ~$0.05/1K |
generalist-fast |
gemini-2.0-flash-001 |
通用快速,覆盖 life/education | $0.075/1M → ~$0.02/1K |
multilingual-cn |
deepseek-chat |
中文/教育/通用 | $0.14/1M → ~$0.03/1K |
reasoning-mid |
mistral-medium |
备用 / 难样本兜底 | $2.7/1M → ~$0.5/1K |
注:精确价格需按
model_cost/model_cost.json与universal_model_names.py校验。预期区间与排行榜 Hybrid Router $0.04/1K、GPT-5 $10.02/1K 同量级。
3.2 L0 域 → 模型槽位 映射表(核心决策)
基于本系统 8 领域 × LLM 擅长:
| L0 域 | 子域样本 | 选 | 理由 |
|---|---|---|---|
code |
algorithm, debugging, database | code-strong (gpt-4o-mini) |
编程类基准 SOTA(LiveCodeBench/Codeforces) |
math |
algebra, geometry, calculus | reasoning-strong (claude-3-haiku) |
数学推理强项 |
legal |
labor, contract | reasoning-strong (claude-3-haiku) |
法律长文本/严谨性 |
medical |
chronic, medication, firstaid | reasoning-strong (claude-3-haiku) |
医疗警示/准确性优先 |
finance |
investing, credit, loan | reasoning-strong (claude-3-haiku) |
数字严谨/风险提示 |
life |
travel, fitness, food | generalist-fast (gemini-2.0-flash) |
实用建议快速返回 |
education |
exam, study, career | multilingual-cn (deepseek-chat) |
中文/教育/应试 |
general |
explain, writing | generalist-fast (gemini-2.0-flash) |
通用兜底成本最低 |
兜底规则:当 confidence < 0.60 或 quality_score < 0.70(与 L0 Judge 阈值一致),升一级到 reasoning-mid (mistral-medium)。
3.3 实现三件套
| 文件 | 角色 | 依赖 |
|---|---|---|
research/routerarena/adapter.py |
BaseRouter 子类,调用本系统 L0 router |
仅零依赖 |
research/routerarena/config/es-expert.json |
候选模型池 + 类名配置 | 无 |
scripts/routerarena_generate.py |
复用 RouterArena 的 generate_prediction_file.py 入口 |
需要把 adapter 注册进 RouterArena 路由器模块 |
3.4 验证策略(分阶段)
- 烟测(无 API 成本):跑
sub_10生成预测文件,验证 809 条记录格式合规、模型名映射一致 - Mock 推理 + 评分方法学验证:把
generated_result填充为 mock 但带 token_usage,验证 Arena 公式可跑通 - 真子集(消耗 API):sub_10 上跑 5-10 条做端到端烟测,验证 API key 路径
- 全量评测(消耗 API):full 8400 条,需预算 ~$1-5(按 5 模型轮询成本估算)
3.5 风险与缺口
| 风险 | 影响 | 缓解 |
|---|---|---|
| 没有 API key | 完整评测跑不通 | 先做烟测 + 方法学验证;提交方案文档说明 gap |
| RouterArena 用 8 领域,本系统 8 领域但标签不一一对应 | 路由决策可比性下降 | 文档里写清映射表 + 不能直接比的子域 |
| L0 路由是基于关键词规则的,可能对 RouterArena 长 prompt 命中率下降 | 准确率会低于 100% | 这是预期:自建 24 样例 100% 不代表 809 条也是,要看真实分布 |
| 模型价格/能力随时间变化 | 排行榜基线会漂移 | 报告里标注"基于 2026-07 快照",未来要重测 |
4. 不做的事(明确边界)
- 不在 RouterArena 标签上训练/微调(合规要求)
- 不修改本系统核心 router(只新增 adapter 适配层)
- 不在第一阶段做 full 评测(成本/时间/资源限制,先 sub_10 验证方法学)
- 不立即对接 RouterArena PR 提交(先有方法学验证 + gap 文档)
5. 验收标准
research/routerarena/adapter.py实现完整,可独立 import- 在 sub_10 上生成 809 条预测,文件格式通过
check_config_prediction_files.py校验 - mock 推理跑通 Arena 公式,得到本系统的 Arena Score 数字
- 写完
01_results_sub10.md报告,含与排行榜 5 个基线(Hybrid Router / R2-Router / GPT-5 / MIRT-BERT / NotDiamond)的对比表 - 不引入新依赖到 requirements.txt(仅 Python 标准库 + 已有 deps)