Files
projectAIpopular/research/2026_papers_survey.md
T

107 lines
8.3 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 课题论文调研汇总(2025–2026)
> 检索日期:2026-08-12
> 检索范围:arXiv / NeurIPS / ICML / ICLR / ACL / AAAI / EMNLP / KDD / SIGMOD / Nature MI
> 用途:为本项目(多专业小模型 + 路由模型)的实施提供最新研究依据与落地参考。
---
## 一、调研结论速览
1. **路由已是一门独立学科**2026 年出现专门综述(2603.04445),路由研究从"选模型"扩展到"级联 + 预算 + 多轮 + 多模态"。
2. **验证了本项目核心命题**:《The Avengers》(AAAI 2025) 证明小模型集合 + 路由可挑战专有大模型;RouterArena 排行榜显示低成本路由器(如 Hybrid Router $0.04/1K 查询)在性价比上全面超越 GPT-5($10.02/1K 查询)。
3. **本项目下一步应优先做三件事**:① 用 RouterArena 标准化评测;② 训练 BERT 级分类器替代规则分类器;③ 引入级联 + 预算感知(R2-Router 思路)。
---
## 二、核心论文清单
### 2.1 综述
| 论文 | 会议/期刊 | arXiv | 核心贡献 | 对本项目的启示 |
|------|----------|-------|---------|---------------|
| Doing More with Less: Routing Strategies in LLM-Based Systems (Extended Survey) | arXiv 2025 | [2502.00409](https://arxiv.org/abs/2502.00409) | 系统梳理低/高资源路由策略;query 级路由在相关数据集上 64.3% vs 领域式 52.2% | 本项目 query 级路由方向正确;已在 references/ 中 |
| **Dynamic Model Routing and Cascading for Efficient LLM Inference: A Survey** | arXiv 2026 | [2603.04445](https://arxiv.org/abs/2603.04445) | 最新综述,把多 LLM 路由/级联归纳为六种范式(难度感知、级联、预算约束等) | 建议按此框架对照本系统设计,补齐级联与预算维度 |
### 2.2 路由评估平台(直接可用)
| 论文 | 会议 | arXiv | 核心贡献 |
|------|------|-------|---------|
| RouterArena: An Open Platform for Comprehensive Comparison of LLM Routers | ICLR 2026 | [2510.00202](https://arxiv.org/abs/2510.00202) | 8400 查询 × 9 领域 × 44 类目,5 维指标(准确率/成本/最优性/鲁棒性/延迟),开源评估框架 + 排行榜 |
**RouterArena 排行榜现状(2026-07 快照)**Cross-Router (75.75)、Sqwish (75.27)、vLLM-SR (74.86)、R2-Router (71.60, $0.06/1K)、Hybrid Router (72.08, **$0.04/1K**)、GPT-5 (64.32, $10.02/1K)。可见:**低成本路由器在 Arena Score 上已全面超越 GPT-5**,且成本低两个数量级——直接支撑本项目"路由系统替代单一大模型"的经济性论证。
### 2.3 直接验证"小模型集合挑战大模型"
| 论文 | 会议 | arXiv | 核心贡献 | 启示 |
|------|------|-------|---------|------|
| **The Avengers: A Simple Recipe for Uniting Smaller Language Models to Challenge Proprietary Giants** | AAAI 2025 | [2505.19797](https://arxiv.org/abs/2505.19797) | 轻量框架聚合小模型集体智能,路由+评分+投票在数学/代码/逻辑等任务超越专有大模型 | **本项目最直接的理论支撑**;路由选型可参考其"多模型 + 轻量评分"配方 |
### 2.4 路由方法(2025-2026 SOTA 方向)
| 论文 | 会议 | arXiv | 核心思路 | 对本项目的启示 |
|------|------|-------|---------|---------------|
| **R2-Router** | ICML 2026 | [2602.02823](https://arxiv.org/abs/2602.02823) | 把输出 token 预算提升为决策变量,在 (模型, 预算) 联合空间搜索质量-成本曲线 | 用"受限输出长度 + 强模型"可能比"弱模型全量输出"更划算;可做成本控制 |
| **Meta-Router** | ICLR 2026 | [2509.25535](https://arxiv.org/abs/2509.25535) | 用因果推断(R-/DR-learner)融合金标准评测与偏好评测训练路由器 | 训练数据不足时,偏好数据可用但需偏差校正 |
| **HyDRA** | arXiv 2026 | [2605.17106](https://arxiv.org/abs/2605.17106) | 预测查询的多维能力需求,与模型画像做 shortfall matching;路由开销 P50 55ms | 模型池动态增删/调价无需重训 |
| **FusionRoute** | ICML 2026 | — | token 级多 LLM 协作:轻量路由器每步选专家 + logit 修正 | token 级路由的落地参考 |
| **Router-R1** | NeurIPS 2025 | — | 用 RL 把多轮路由与聚合建模为序列决策 | 复杂任务可"边想边路由" |
| **MESS+** | NeurIPS 2025 | — | 随机优化做成本最优路由并保证 SLA | 生产环境 SLA 约束的参考 |
| **ICL-Router** | AAAI 2026 | — | In-Context 学习模型表征用于路由 | 冷启动友好 |
| **Select-then-Route (StR)** | EMNLP 2025 Industry | — | 两阶段:先按语义类目选模型子池,再级联路由 | 与本项目"分类器 + 专家池"结构一致,验证了该架构 |
| **RADAR** | NeurIPS 2025 WS | — | 推理能力 + 难度感知路由 | 难度估计器的进阶参考 |
| **CARROT** | ICLR 2025 WS | — | 成本感知率最优路由器 | 成本-质量权衡的数学框架 |
| **OmniRouter** | KDD 2025 | — | 预算/性能可控的多 LLM 路由 | 预算控制参考 |
| **SpareLLM** | SIGMOD 2025 | — | 等价约束下选任务专属最小成本模型 | 成本最优选择参考 |
### 2.5 LoRA 专家路由(与本项目"LoRA 微调专家池"直接相关)
| 论文 | arXiv | 核心思路 |
|------|-------|---------|
| Spend Experts Where You Are Unsure (CARE) | [2607.26052](https://arxiv.org/abs/2607.26052) | 置信度自适应地把预算分配给不确定性最高的 LoRA 专家 |
| VI-MoLE | [2608.02528](https://arxiv.org/abs/2608.02528) | 信息价值路由:估计每个前缀剩余风险并分配共享预算 |
| Hard-Routed Mixtures of Reasoning LoRAs | [2606.31413](https://arxiv.org/abs/2606.31413) | 硬路由组合独立训练的推理 LoRA,避免混合路由的尺度失配问题 |
| ReMix | arXiv 2026 | 强化路由混合 LoRA,非学习路由权重保证各 LoRA 公平参与 |
**启示**:本项目第二阶段"多领域 LoRA 专家微调"可参考 CARE/VI-MoLE 的"按不确定性分配预算"思路,避免固定路由导致的专家能力浪费。
### 2.6 级联 / 质量兜底(对应本项目 Judge + 回退层)
| 论文 | arXiv | 核心思路 |
|------|-------|---------|
| Cluster, Route, Escalate | [2606.27457](https://arxiv.org/abs/2606.27457) | 聚类 → 路由 → 选择性升级;Q3-4B 处理 59% 查询,升级仅多 4.7ms TPOT |
| Conformal Cascade | [2607.25018](https://arxiv.org/abs/2607.25018) | 分布无关的置信度级联 deferral,提供准确率保证 |
| The Routing Plateau | [2606.07587](https://arxiv.org/abs/2606.07587) | 揭示路由器准确率上限的成因,提出突破方法 |
**启示**:本项目 Judge 阈值(0.70)本质是"置信度级联",可参考 Conformal Cascade 做阈值校准,用分布无关保证控制误升级率。
### 2.7 小模型能力(支撑"小模型可替代大模型"前提)
- **Small Language Models: A Systematic Review**2026):微调 SLM 在领域任务达 85-90% 准确率、成本仅为 LLM 的 10-25%;复杂推理仍有差距(需回退层兜底)——与本项目结论一致。
- **Specialization Beats Scale**2026,行业分析):3B 专用模型在抽取质量/成本/稳定性上超越 GPT-4o 与 Claude Opus 4.6。
---
## 三、对本项目实施的 5 条具体建议
1. **用 RouterArena 做标准化评测**:本项目 `scripts/eval.py` 是自建迷你基准;正式化应接入 RouterArena 框架(`uv sync` + 提交预测文件即可上榜)。
2. **分类器升级为训练模型**:规则分类器(现 100%/15 条样例)在更大数据上会掉点;参考 ICL-Router / StR,训练 BERT 级分类器(94-97%)或小 LLM 分类器。
3. **引入预算感知路由**:参考 R2-Router 把"输出长度预算"纳入决策,可实现 4-5× 成本下降。
4. **级联 + 校准**Judge 阈值参考 Conformal Cascade 做校准,确保升级率 ≤20% 且有理论保证。
5. **LoRA 专家池按不确定性路由**:第二阶段多领域专家采用 CARE / VI-MoLE 的置信度自适应预算分配。
---
## 四、参考链接
- RouterArena 代码:https://github.com/RouteWorks/RouterArena
- RouterArena 博客:https://huggingface.co/blog/JerryPotter/who-routes-the-routers
- Awesome-Routing-LLMs(持续更新的论文清单):https://github.com/MilkThink-Lab/Awesome-Routing-LLMs
- The Avengershttps://arxiv.org/abs/2505.19797
- R2-Routerhttps://arxiv.org/abs/2602.02823
- 最新综述:https://arxiv.org/abs/2603.04445
---
*调研人:Codex2026-08-12*