docs: 代理层方案增补 + 语义分析器与三级分级执行方案入库(T-G0 准备)
This commit is contained in:
+43
-1
@@ -240,7 +240,49 @@ E1 验证;与客户端同运行时同打包,不破坏"干净环境 20 分钟
|
||||
本地层 token 占比成为吞吐瓶颈。推理引擎是可替换端点而非架构承诺;D1(只捆绑 llama.cpp
|
||||
上游二进制)约束客户端分发件,不限制服务端池子的上游类型。
|
||||
|
||||
## 7. 与毕业设计主命题的关系
|
||||
## 7. 方向评估:AI 网关 + 学习型路由(5000–20000 人情景,2026-09-05)
|
||||
|
||||
**结论**:2 万规模下难度路由从"省钱优化"升级为"容量必需"——纯云配额/峰值撑不住,
|
||||
客户端舰队(学生本机 llama.cpp)即分布式本地推理层,容量随用户线性增长;
|
||||
路由是把流量分配给该容量池的调度器。日请求 7–15 万、突发 50–150 req/s,
|
||||
网关单进程(D-P9)经预算重测仍可承载。
|
||||
|
||||
**共享 Embedding 底座 = 网关语义服务化**:`/v1/embeddings`(llama-server 挂 BGE-m3 /
|
||||
Qwen3-Embedding-0.6B,0.6B 短文本 ~15ms,CPU 即可)+ `/v1/route`(难度/域/建议路径)。
|
||||
客户端路由决策同调此 API → 全校一套 Embedding/分类器/策略,改进一次全校生效。
|
||||
同一底座喂养:语义缓存 L2 升级(T-P6 预留 M3 选项)、RAG 分块、滥用检测、审计抽样。
|
||||
|
||||
**难度分级的路线修正(关键)**:不预测文本固有难度(弱信号,《The Routing Plateau》),
|
||||
**预测升级概率**——标签由网关结果观测自动产生(本地答→验证过→"本地可答"),
|
||||
v2 验证器 + 审计队列即标签工厂;阈值用 Conformal Cascade(调研文献 2607.25018)校准,
|
||||
控制 P(需升级|路由本地) ≤ α(教育场景保守优先)。分类器两步走:线性探针(numpy,微秒级)
|
||||
起步 → 线性不够再上 LoRA heads(注意:per-request LoRA 需 vLLM——即上一节 vLLM 条件启用的
|
||||
触发项之一,专职分类服务实例);E-G2 实验裁决(AUC 对比)。
|
||||
|
||||
**语义分析器与执行逻辑映射(2026-09-05 澄清定稿)**:共享 Embedding 底座 + 轻量分类器(LoRA 可选)
|
||||
= **语义分析器**(独立组件),职责 = 输出任务难度档位 → 档位选择**执行逻辑**(而非只选模型):
|
||||
简单 → 本地小模型直答;复杂 → 完整四阶段管线(云大模型理解 = Architect.brief → 本地大模型构建+检测
|
||||
= WorkerLoop → 云大模型解决检测出的问题 = issues/decide 升级回路 → 云端大模型检查代码 = final_review)
|
||||
——即已实现的 v2 CollaborativePipeline,语义分析器是其**入口分流器**(升级现有快路径启发式判定;
|
||||
本地进程内直调,客户端/代理经网关 `/v1/route`,三方共用)。建议三档:简单/中等/复杂——
|
||||
中等 = 单次云端(或本地大模型)直答,跳过四阶段管线的 3 次云端往返(帕累托中段是流量大头,
|
||||
该档分流效率决定整体经济性);置信度不足默认中等。难度标签 = 管线充分性观测
|
||||
("简单 = 本地直答验证通过且无升级"),与上文升级概率预测同一定义;误分级非对称已由
|
||||
升级回路兜底(简单→失败→升级;复杂→多付一次 brief,方向安全)。
|
||||
**执行版**:《实施方案_语义分析器与三级分级.md》(T-G0–G8,三级规格/DDL/接口/晋升门,约 11 工作日)。
|
||||
|
||||
**2 万规模网关补强**:hnswlib 按课程桶分区 ANN(sqlite 全表扫到顶);账本 100ms 批量刷盘;
|
||||
降级阶梯写死(Embedding 挂→退 n-gram+规则;分类器挂→保守全云);T-P8 预算按 2 万口径重测。
|
||||
|
||||
**分阶段(每步独立有用)**:0 代理+缓存(T-P0..P8)→ 1 `/v1/embeddings` 只采集不决策
|
||||
→ 2 线性 head shadow mode(预测不动流量,比对一致率)→ 3 正式路由+conformal 校准+升级回路
|
||||
(复用 v2 验证器/审计队列;用户可见"端侧/云端"来源 + 一键升级重答)→ 4 可选 LoRA(vLLM)。
|
||||
|
||||
**与主命题的关系(叙事闭环)**:v1 规则路由(74.4% 失败教训)→ v2 端云协作(核心系统)→ 平台级学习型路由回归
|
||||
(真实流量 + 结果标签 + 共形校准 + 生产验证器)。
|
||||
**守门线**:① 结果驱动标签,不用文本难度;② shadow 先行 + 降级阶梯;③ conformal 保守阈值保教育质量。
|
||||
|
||||
## 8. 与毕业设计主命题的关系
|
||||
|
||||
不改变已定命题《基于端云协同的编程智能体系统设计与实现》。本方向作为扩展章/答辩亮点:
|
||||
**代理层 = 端侧基础设施的规模化形态**(从单机端侧到校园级端侧),核心贡献是
|
||||
|
||||
Reference in New Issue
Block a user