84 lines
5.1 KiB
Markdown
84 lines
5.1 KiB
Markdown
# 任务拆解与执行计划
|
||
|
||
> 任务体系:主任务(整体项目)→ 附加任务(先行实现:整体项目部分拆解)
|
||
> 建立日期:2026-08-14
|
||
|
||
---
|
||
|
||
## 一、任务体系总览
|
||
|
||
```
|
||
主任务:多专业小模型 + 路由模型系统(整体项目)
|
||
│
|
||
├─ 已完成部分(专家系统内核):
|
||
│ · 知识库(8 领域 67 规则 + 17 模板 + 45 事实)
|
||
│ · 黑板/前向链/Planner/DAG 路由(L0 零参数)
|
||
│ · 三级子领域(domain → subdomain → subdomain2)
|
||
│ · 两级路由体系(domain_group → 组内路由模型)
|
||
│ · 92 项单元测试全绿
|
||
│
|
||
└─ 附加任务(★ 先行实现):整体项目部分拆解
|
||
· 目标:把整体项目剩余工作拆解为可独立执行的部分任务,
|
||
并优先实现第一批(P0),为后续铺路
|
||
· 状态:进行中
|
||
```
|
||
|
||
## 二、整体项目剩余工作拆解清单
|
||
|
||
| # | 任务 | 内容 | 依赖 | 优先级 | 预估 | 状态 |
|
||
|---|------|------|------|--------|------|------|
|
||
| T1 | NodeExecutor 接口抽象 | 解耦 `_execute_node` 的 if-else;rule/model/未来后端统一接口 + 工厂 | — | **P0** | 0.5 天 | ✅ 完成 |
|
||
| T2 | 评测基准扩充 | eval 扩到 8 领域 24 样例 + 组路由/子领域识别指标 | — | **P0** | 0.5 天 | ✅ 完成 |
|
||
| T3 | 推理链查询接口 | 请求 ID 化 + 内存轨迹存储 + `GET /traces/{id}` | T1 | **P0** | 1 天 | ✅ 完成 |
|
||
| T12 | **Agent-Skill 路由器** | 路由器独立:Skill 注册表(21 技能)+ RouteAgent 自主分析需求→技能调用计划→执行,无需用户指定领域/模型 | T1,T2,T3 | **P0** | 1-2 天 | ✅ 完成 |
|
||
| T4 | 知识库 CRUD + 热重载 | `/knowledge/rules|facts` CRUD + `POST /config/reload` | T1 | P1 | 1-2 天 | ⬜ 待办 |
|
||
| T5 | 本地模型推理接入(L2) | Ollama/vLLM 封装 + `fallback.local` 验证 + 组内模型按需加载 | T1 | P1 | 2-3 天 | ⬜ 待办 |
|
||
| T6 | embedding 语义缓存 | BGE 本地向量化替代 n-gram L2 | — | P1 | 1-2 天 | ⬜ 待办 |
|
||
| T7 | 分类器训练流水线 | 数据构建 + 0.6B QLoRA 训练(8 领域) | — | P1 | 2-3 天 | ⬜ 待办 |
|
||
| T8 | 领域专家微调 | QLoRA 微调 5-8 领域专家 + 数据收集 | T7 | P2 | 3-4 周 | ⬜ 待办 |
|
||
| T9 | RouterArena 评测 | 标准 5 维评测接入 | T2 | P2 | 2-3 天 | ⬜ 待办 |
|
||
| T10 | 监控 + 模型注册表 | Prometheus 指标 + 模型版本/热替换 | T4,T5 | P2 | 2-3 天 | ⬜ 待办 |
|
||
| T11 | 部署生产化 | Docker/Compose + 灰度 + 安全 | T5,T10 | P2 | 3-5 天 | ⬜ 待办 |
|
||
|
||
## 三、先行实现批次(P0)—— 已完成 ✅
|
||
|
||
1. **T1 NodeExecutor 接口抽象** —— 子任务执行后端统一接口(rule/model 两实现 + 工厂),L2 模型接入无需改 Router
|
||
2. **T2 评测基准扩充** —— 24 样例 × 8 领域,指标:分类 100% / 大领域组识别 100% / 子领域识别 100%
|
||
3. **T3 推理链查询接口** —— `GET /traces/{request_id}`:完整推理链可追溯(两级路由 → 三级子领域 → 拆解 → 规则 → 评分)
|
||
4. **T12 Agent-Skill 路由器** —— 路由器独立为"技能注册表 + Agent 规划器":
|
||
- 21 个内置技能(es.* 模板 ×17、kb.retrieve/kb.answer、judge.evaluate、fallback.call)
|
||
- RouteAgent 自行分析需求 → 规划技能调用(多技能组合/依赖)→ 执行 → 校验 → 升级
|
||
- **用户只提供 query,无需指定领域/模型**;技能调用轨迹可追溯(skill:es.analyze@facts)
|
||
- 实测:法律咨询自动组合 es.analyze + kb.retrieve + es.conclude + es.disclaimer
|
||
|
||
P0 完成后的能力:干净的后端抽象 + 可量化的评测 + 可追溯的推理链 + 技能化 Agent 路由(118 项测试全绿)。
|
||
|
||
## 四、执行规则
|
||
|
||
- 每任务独立验收(测试 + 文档),完成后更新状态 ✅
|
||
- 依赖任务未完成时,先做无依赖任务
|
||
- P1/P2 任务在 P0 完成后按序推进,不阻塞主线
|
||
|
||
---
|
||
|
||
## 五、v2 任务登记(端云协同 LLM 协作系统,见《实现方案_v2_端云协同LLM协作系统.md》)
|
||
|
||
> 每个任务一个 commit(`feat(v2): Tn 描述`),交付含封闭单测;v1 的 126 项测试保持全绿。
|
||
|
||
| T | 内容 | 状态 | commit |
|
||
|---|------|------|--------|
|
||
| T1 | 环境与基线确认(126 测试全绿;README 环境备忘) | ✅ 完成 | (并入 T2 commit) |
|
||
| T2 | 运维层:hw_profile + llama_server 进程管理 | ✅ 完成 | T2 |
|
||
| T3 | ArchitectClient(DeepSeek API,JSON 约束) | ✅ 完成 | T3 |
|
||
| T4 | Workspace(交流文本 schema/校验/渲染/rollup) | ✅ 完成 | T4 |
|
||
| T5 | WorkerLoop + 接地验证 | ✅ 完成 | T5 |
|
||
| T6 | CollaborativePipeline 编排 | ✅ 完成 | T6 |
|
||
| T7 | 网关扩展(/chat 切 v2,/chat/legacy) | ✅ 完成 | T7 |
|
||
| T8 | 人工检验队列 ReviewQueue | ✅ 完成 | T8 |
|
||
| T9 | token 计量与账单 | ✅ 完成 | T9 |
|
||
| T10 | rollup + prefix cache 调优 | ✅ 完成 | T10 |
|
||
| T11 | 打包分发 setup_runtime.py | ✅ 完成 | T11 |
|
||
| T12 | 实验脚本 bench_tokens.py + 数据集 | ⬜ | |
|
||
| T13 | E1–E5 跑数到 research/v2_experiments/ | ⬜ | |
|
||
| T14 | 文档收口(README v2 改写) | ⬜ | |
|