107 lines
8.3 KiB
Markdown
107 lines
8.3 KiB
Markdown
# 课题论文调研汇总(2025–2026)
|
||
|
||
> 检索日期:2026-08-12
|
||
> 检索范围:arXiv / NeurIPS / ICML / ICLR / ACL / AAAI / EMNLP / KDD / SIGMOD / Nature MI
|
||
> 用途:为本项目(多专业小模型 + 路由模型)的实施提供最新研究依据与落地参考。
|
||
|
||
---
|
||
|
||
## 一、调研结论速览
|
||
|
||
1. **路由已是一门独立学科**:2026 年出现专门综述(2603.04445),路由研究从"选模型"扩展到"级联 + 预算 + 多轮 + 多模态"。
|
||
2. **验证了本项目核心命题**:《The Avengers》(AAAI 2025) 证明小模型集合 + 路由可挑战专有大模型;RouterArena 排行榜显示低成本路由器(如 Hybrid Router $0.04/1K 查询)在性价比上全面超越 GPT-5($10.02/1K 查询)。
|
||
3. **本项目下一步应优先做三件事**:① 用 RouterArena 标准化评测;② 训练 BERT 级分类器替代规则分类器;③ 引入级联 + 预算感知(R2-Router 思路)。
|
||
|
||
---
|
||
|
||
## 二、核心论文清单
|
||
|
||
### 2.1 综述
|
||
|
||
| 论文 | 会议/期刊 | arXiv | 核心贡献 | 对本项目的启示 |
|
||
|------|----------|-------|---------|---------------|
|
||
| Doing More with Less: Routing Strategies in LLM-Based Systems (Extended Survey) | arXiv 2025 | [2502.00409](https://arxiv.org/abs/2502.00409) | 系统梳理低/高资源路由策略;query 级路由在相关数据集上 64.3% vs 领域式 52.2% | 本项目 query 级路由方向正确;已在 references/ 中 |
|
||
| **Dynamic Model Routing and Cascading for Efficient LLM Inference: A Survey** | arXiv 2026 | [2603.04445](https://arxiv.org/abs/2603.04445) | 最新综述,把多 LLM 路由/级联归纳为六种范式(难度感知、级联、预算约束等) | 建议按此框架对照本系统设计,补齐级联与预算维度 |
|
||
|
||
### 2.2 路由评估平台(直接可用)
|
||
|
||
| 论文 | 会议 | arXiv | 核心贡献 |
|
||
|------|------|-------|---------|
|
||
| RouterArena: An Open Platform for Comprehensive Comparison of LLM Routers | ICLR 2026 | [2510.00202](https://arxiv.org/abs/2510.00202) | 8400 查询 × 9 领域 × 44 类目,5 维指标(准确率/成本/最优性/鲁棒性/延迟),开源评估框架 + 排行榜 |
|
||
|
||
**RouterArena 排行榜现状(2026-07 快照)**:Cross-Router (75.75)、Sqwish (75.27)、vLLM-SR (74.86)、R2-Router (71.60, $0.06/1K)、Hybrid Router (72.08, **$0.04/1K**)、GPT-5 (64.32, $10.02/1K)。可见:**低成本路由器在 Arena Score 上已全面超越 GPT-5**,且成本低两个数量级——直接支撑本项目"路由系统替代单一大模型"的经济性论证。
|
||
|
||
### 2.3 直接验证"小模型集合挑战大模型"
|
||
|
||
| 论文 | 会议 | arXiv | 核心贡献 | 启示 |
|
||
|------|------|-------|---------|------|
|
||
| **The Avengers: A Simple Recipe for Uniting Smaller Language Models to Challenge Proprietary Giants** | AAAI 2025 | [2505.19797](https://arxiv.org/abs/2505.19797) | 轻量框架聚合小模型集体智能,路由+评分+投票在数学/代码/逻辑等任务超越专有大模型 | **本项目最直接的理论支撑**;路由选型可参考其"多模型 + 轻量评分"配方 |
|
||
|
||
### 2.4 路由方法(2025-2026 SOTA 方向)
|
||
|
||
| 论文 | 会议 | arXiv | 核心思路 | 对本项目的启示 |
|
||
|------|------|-------|---------|---------------|
|
||
| **R2-Router** | ICML 2026 | [2602.02823](https://arxiv.org/abs/2602.02823) | 把输出 token 预算提升为决策变量,在 (模型, 预算) 联合空间搜索质量-成本曲线 | 用"受限输出长度 + 强模型"可能比"弱模型全量输出"更划算;可做成本控制 |
|
||
| **Meta-Router** | ICLR 2026 | [2509.25535](https://arxiv.org/abs/2509.25535) | 用因果推断(R-/DR-learner)融合金标准评测与偏好评测训练路由器 | 训练数据不足时,偏好数据可用但需偏差校正 |
|
||
| **HyDRA** | arXiv 2026 | [2605.17106](https://arxiv.org/abs/2605.17106) | 预测查询的多维能力需求,与模型画像做 shortfall matching;路由开销 P50 55ms | 模型池动态增删/调价无需重训 |
|
||
| **FusionRoute** | ICML 2026 | — | token 级多 LLM 协作:轻量路由器每步选专家 + logit 修正 | token 级路由的落地参考 |
|
||
| **Router-R1** | NeurIPS 2025 | — | 用 RL 把多轮路由与聚合建模为序列决策 | 复杂任务可"边想边路由" |
|
||
| **MESS+** | NeurIPS 2025 | — | 随机优化做成本最优路由并保证 SLA | 生产环境 SLA 约束的参考 |
|
||
| **ICL-Router** | AAAI 2026 | — | In-Context 学习模型表征用于路由 | 冷启动友好 |
|
||
| **Select-then-Route (StR)** | EMNLP 2025 Industry | — | 两阶段:先按语义类目选模型子池,再级联路由 | 与本项目"分类器 + 专家池"结构一致,验证了该架构 |
|
||
| **RADAR** | NeurIPS 2025 WS | — | 推理能力 + 难度感知路由 | 难度估计器的进阶参考 |
|
||
| **CARROT** | ICLR 2025 WS | — | 成本感知率最优路由器 | 成本-质量权衡的数学框架 |
|
||
| **OmniRouter** | KDD 2025 | — | 预算/性能可控的多 LLM 路由 | 预算控制参考 |
|
||
| **SpareLLM** | SIGMOD 2025 | — | 等价约束下选任务专属最小成本模型 | 成本最优选择参考 |
|
||
|
||
### 2.5 LoRA 专家路由(与本项目"LoRA 微调专家池"直接相关)
|
||
|
||
| 论文 | arXiv | 核心思路 |
|
||
|------|-------|---------|
|
||
| Spend Experts Where You Are Unsure (CARE) | [2607.26052](https://arxiv.org/abs/2607.26052) | 置信度自适应地把预算分配给不确定性最高的 LoRA 专家 |
|
||
| VI-MoLE | [2608.02528](https://arxiv.org/abs/2608.02528) | 信息价值路由:估计每个前缀剩余风险并分配共享预算 |
|
||
| Hard-Routed Mixtures of Reasoning LoRAs | [2606.31413](https://arxiv.org/abs/2606.31413) | 硬路由组合独立训练的推理 LoRA,避免混合路由的尺度失配问题 |
|
||
| ReMix | arXiv 2026 | 强化路由混合 LoRA,非学习路由权重保证各 LoRA 公平参与 |
|
||
|
||
**启示**:本项目第二阶段"多领域 LoRA 专家微调"可参考 CARE/VI-MoLE 的"按不确定性分配预算"思路,避免固定路由导致的专家能力浪费。
|
||
|
||
### 2.6 级联 / 质量兜底(对应本项目 Judge + 回退层)
|
||
|
||
| 论文 | arXiv | 核心思路 |
|
||
|------|-------|---------|
|
||
| Cluster, Route, Escalate | [2606.27457](https://arxiv.org/abs/2606.27457) | 聚类 → 路由 → 选择性升级;Q3-4B 处理 59% 查询,升级仅多 4.7ms TPOT |
|
||
| Conformal Cascade | [2607.25018](https://arxiv.org/abs/2607.25018) | 分布无关的置信度级联 deferral,提供准确率保证 |
|
||
| The Routing Plateau | [2606.07587](https://arxiv.org/abs/2606.07587) | 揭示路由器准确率上限的成因,提出突破方法 |
|
||
|
||
**启示**:本项目 Judge 阈值(0.70)本质是"置信度级联",可参考 Conformal Cascade 做阈值校准,用分布无关保证控制误升级率。
|
||
|
||
### 2.7 小模型能力(支撑"小模型可替代大模型"前提)
|
||
|
||
- **Small Language Models: A Systematic Review**(2026):微调 SLM 在领域任务达 85-90% 准确率、成本仅为 LLM 的 10-25%;复杂推理仍有差距(需回退层兜底)——与本项目结论一致。
|
||
- **Specialization Beats Scale**(2026,行业分析):3B 专用模型在抽取质量/成本/稳定性上超越 GPT-4o 与 Claude Opus 4.6。
|
||
|
||
---
|
||
|
||
## 三、对本项目实施的 5 条具体建议
|
||
|
||
1. **用 RouterArena 做标准化评测**:本项目 `scripts/eval.py` 是自建迷你基准;正式化应接入 RouterArena 框架(`uv sync` + 提交预测文件即可上榜)。
|
||
2. **分类器升级为训练模型**:规则分类器(现 100%/15 条样例)在更大数据上会掉点;参考 ICL-Router / StR,训练 BERT 级分类器(94-97%)或小 LLM 分类器。
|
||
3. **引入预算感知路由**:参考 R2-Router 把"输出长度预算"纳入决策,可实现 4-5× 成本下降。
|
||
4. **级联 + 校准**:Judge 阈值参考 Conformal Cascade 做校准,确保升级率 ≤20% 且有理论保证。
|
||
5. **LoRA 专家池按不确定性路由**:第二阶段多领域专家采用 CARE / VI-MoLE 的置信度自适应预算分配。
|
||
|
||
---
|
||
|
||
## 四、参考链接
|
||
|
||
- RouterArena 代码:https://github.com/RouteWorks/RouterArena
|
||
- RouterArena 博客:https://huggingface.co/blog/JerryPotter/who-routes-the-routers
|
||
- Awesome-Routing-LLMs(持续更新的论文清单):https://github.com/MilkThink-Lab/Awesome-Routing-LLMs
|
||
- The Avengers:https://arxiv.org/abs/2505.19797
|
||
- R2-Router:https://arxiv.org/abs/2602.02823
|
||
- 最新综述:https://arxiv.org/abs/2603.04445
|
||
|
||
---
|
||
|
||
*调研人:Codex(2026-08-12)*
|