Files
projectAIpopular/research/2026_papers_survey.md

8.3 KiB
Raw Permalink Blame History

课题论文调研汇总(20252026

检索日期:2026-08-12 检索范围:arXiv / NeurIPS / ICML / ICLR / ACL / AAAI / EMNLP / KDD / SIGMOD / Nature MI 用途:为本项目(多专业小模型 + 路由模型)的实施提供最新研究依据与落地参考。


一、调研结论速览

  1. 路由已是一门独立学科2026 年出现专门综述(2603.04445),路由研究从"选模型"扩展到"级联 + 预算 + 多轮 + 多模态"。
  2. 验证了本项目核心命题:《The Avengers》(AAAI 2025) 证明小模型集合 + 路由可挑战专有大模型;RouterArena 排行榜显示低成本路由器(如 Hybrid Router $0.04/1K 查询)在性价比上全面超越 GPT-5($10.02/1K 查询)。
  3. 本项目下一步应优先做三件事:① 用 RouterArena 标准化评测;② 训练 BERT 级分类器替代规则分类器;③ 引入级联 + 预算感知(R2-Router 思路)。

二、核心论文清单

2.1 综述

论文 会议/期刊 arXiv 核心贡献 对本项目的启示
Doing More with Less: Routing Strategies in LLM-Based Systems (Extended Survey) arXiv 2025 2502.00409 系统梳理低/高资源路由策略;query 级路由在相关数据集上 64.3% vs 领域式 52.2% 本项目 query 级路由方向正确;已在 references/ 中
Dynamic Model Routing and Cascading for Efficient LLM Inference: A Survey arXiv 2026 2603.04445 最新综述,把多 LLM 路由/级联归纳为六种范式(难度感知、级联、预算约束等) 建议按此框架对照本系统设计,补齐级联与预算维度

2.2 路由评估平台(直接可用)

论文 会议 arXiv 核心贡献
RouterArena: An Open Platform for Comprehensive Comparison of LLM Routers ICLR 2026 2510.00202 8400 查询 × 9 领域 × 44 类目,5 维指标(准确率/成本/最优性/鲁棒性/延迟),开源评估框架 + 排行榜

RouterArena 排行榜现状(2026-07 快照)Cross-Router (75.75)、Sqwish (75.27)、vLLM-SR (74.86)、R2-Router (71.60, $0.06/1K)、Hybrid Router (72.08, $0.04/1K)、GPT-5 (64.32, $10.02/1K)。可见:低成本路由器在 Arena Score 上已全面超越 GPT-5,且成本低两个数量级——直接支撑本项目"路由系统替代单一大模型"的经济性论证。

2.3 直接验证"小模型集合挑战大模型"

论文 会议 arXiv 核心贡献 启示
The Avengers: A Simple Recipe for Uniting Smaller Language Models to Challenge Proprietary Giants AAAI 2025 2505.19797 轻量框架聚合小模型集体智能,路由+评分+投票在数学/代码/逻辑等任务超越专有大模型 本项目最直接的理论支撑;路由选型可参考其"多模型 + 轻量评分"配方

2.4 路由方法(2025-2026 SOTA 方向)

论文 会议 arXiv 核心思路 对本项目的启示
R2-Router ICML 2026 2602.02823 把输出 token 预算提升为决策变量,在 (模型, 预算) 联合空间搜索质量-成本曲线 用"受限输出长度 + 强模型"可能比"弱模型全量输出"更划算;可做成本控制
Meta-Router ICLR 2026 2509.25535 用因果推断(R-/DR-learner)融合金标准评测与偏好评测训练路由器 训练数据不足时,偏好数据可用但需偏差校正
HyDRA arXiv 2026 2605.17106 预测查询的多维能力需求,与模型画像做 shortfall matching;路由开销 P50 55ms 模型池动态增删/调价无需重训
FusionRoute ICML 2026 token 级多 LLM 协作:轻量路由器每步选专家 + logit 修正 token 级路由的落地参考
Router-R1 NeurIPS 2025 用 RL 把多轮路由与聚合建模为序列决策 复杂任务可"边想边路由"
MESS+ NeurIPS 2025 随机优化做成本最优路由并保证 SLA 生产环境 SLA 约束的参考
ICL-Router AAAI 2026 In-Context 学习模型表征用于路由 冷启动友好
Select-then-Route (StR) EMNLP 2025 Industry 两阶段:先按语义类目选模型子池,再级联路由 与本项目"分类器 + 专家池"结构一致,验证了该架构
RADAR NeurIPS 2025 WS 推理能力 + 难度感知路由 难度估计器的进阶参考
CARROT ICLR 2025 WS 成本感知率最优路由器 成本-质量权衡的数学框架
OmniRouter KDD 2025 预算/性能可控的多 LLM 路由 预算控制参考
SpareLLM SIGMOD 2025 等价约束下选任务专属最小成本模型 成本最优选择参考

2.5 LoRA 专家路由(与本项目"LoRA 微调专家池"直接相关)

论文 arXiv 核心思路
Spend Experts Where You Are Unsure (CARE) 2607.26052 置信度自适应地把预算分配给不确定性最高的 LoRA 专家
VI-MoLE 2608.02528 信息价值路由:估计每个前缀剩余风险并分配共享预算
Hard-Routed Mixtures of Reasoning LoRAs 2606.31413 硬路由组合独立训练的推理 LoRA,避免混合路由的尺度失配问题
ReMix arXiv 2026 强化路由混合 LoRA,非学习路由权重保证各 LoRA 公平参与

启示:本项目第二阶段"多领域 LoRA 专家微调"可参考 CARE/VI-MoLE 的"按不确定性分配预算"思路,避免固定路由导致的专家能力浪费。

2.6 级联 / 质量兜底(对应本项目 Judge + 回退层)

论文 arXiv 核心思路
Cluster, Route, Escalate 2606.27457 聚类 → 路由 → 选择性升级;Q3-4B 处理 59% 查询,升级仅多 4.7ms TPOT
Conformal Cascade 2607.25018 分布无关的置信度级联 deferral,提供准确率保证
The Routing Plateau 2606.07587 揭示路由器准确率上限的成因,提出突破方法

启示:本项目 Judge 阈值(0.70)本质是"置信度级联",可参考 Conformal Cascade 做阈值校准,用分布无关保证控制误升级率。

2.7 小模型能力(支撑"小模型可替代大模型"前提)

  • Small Language Models: A Systematic Review(2026):微调 SLM 在领域任务达 85-90% 准确率、成本仅为 LLM 的 10-25%;复杂推理仍有差距(需回退层兜底)——与本项目结论一致。
  • Specialization Beats Scale(2026,行业分析):3B 专用模型在抽取质量/成本/稳定性上超越 GPT-4o 与 Claude Opus 4.6。

三、对本项目实施的 5 条具体建议

  1. 用 RouterArena 做标准化评测:本项目 scripts/eval.py 是自建迷你基准;正式化应接入 RouterArena 框架(uv sync + 提交预测文件即可上榜)。
  2. 分类器升级为训练模型:规则分类器(现 100%/15 条样例)在更大数据上会掉点;参考 ICL-Router / StR,训练 BERT 级分类器(94-97%)或小 LLM 分类器。
  3. 引入预算感知路由:参考 R2-Router 把"输出长度预算"纳入决策,可实现 4-5× 成本下降。
  4. 级联 + 校准Judge 阈值参考 Conformal Cascade 做校准,确保升级率 ≤20% 且有理论保证。
  5. LoRA 专家池按不确定性路由:第二阶段多领域专家采用 CARE / VI-MoLE 的置信度自适应预算分配。

四、参考链接


调研人:Codex2026-08-12