5.0 KiB
5.0 KiB
任务拆解与执行计划
任务体系:主任务(整体项目)→ 附加任务(先行实现:整体项目部分拆解) 建立日期:2026-08-14
一、任务体系总览
主任务:多专业小模型 + 路由模型系统(整体项目)
│
├─ 已完成部分(专家系统内核):
│ · 知识库(8 领域 67 规则 + 17 模板 + 45 事实)
│ · 黑板/前向链/Planner/DAG 路由(L0 零参数)
│ · 三级子领域(domain → subdomain → subdomain2)
│ · 两级路由体系(domain_group → 组内路由模型)
│ · 92 项单元测试全绿
│
└─ 附加任务(★ 先行实现):整体项目部分拆解
· 目标:把整体项目剩余工作拆解为可独立执行的部分任务,
并优先实现第一批(P0),为后续铺路
· 状态:进行中
二、整体项目剩余工作拆解清单
| # | 任务 | 内容 | 依赖 | 优先级 | 预估 | 状态 |
|---|---|---|---|---|---|---|
| T1 | NodeExecutor 接口抽象 | 解耦 _execute_node 的 if-else;rule/model/未来后端统一接口 + 工厂 |
— | P0 | 0.5 天 | ✅ 完成 |
| T2 | 评测基准扩充 | eval 扩到 8 领域 24 样例 + 组路由/子领域识别指标 | — | P0 | 0.5 天 | ✅ 完成 |
| T3 | 推理链查询接口 | 请求 ID 化 + 内存轨迹存储 + GET /traces/{id} |
T1 | P0 | 1 天 | ✅ 完成 |
| T12 | Agent-Skill 路由器 | 路由器独立:Skill 注册表(21 技能)+ RouteAgent 自主分析需求→技能调用计划→执行,无需用户指定领域/模型 | T1,T2,T3 | P0 | 1-2 天 | ✅ 完成 |
| T4 | 知识库 CRUD + 热重载 | `/knowledge/rules | factsCRUD +POST /config/reload` |
T1 | P1 | 1-2 天 |
| T5 | 本地模型推理接入(L2) | Ollama/vLLM 封装 + fallback.local 验证 + 组内模型按需加载 |
T1 | P1 | 2-3 天 | ⬜ 待办 |
| T6 | embedding 语义缓存 | BGE 本地向量化替代 n-gram L2 | — | P1 | 1-2 天 | ⬜ 待办 |
| T7 | 分类器训练流水线 | 数据构建 + 0.6B QLoRA 训练(8 领域) | — | P1 | 2-3 天 | ⬜ 待办 |
| T8 | 领域专家微调 | QLoRA 微调 5-8 领域专家 + 数据收集 | T7 | P2 | 3-4 周 | ⬜ 待办 |
| T9 | RouterArena 评测 | 标准 5 维评测接入 | T2 | P2 | 2-3 天 | ⬜ 待办 |
| T10 | 监控 + 模型注册表 | Prometheus 指标 + 模型版本/热替换 | T4,T5 | P2 | 2-3 天 | ⬜ 待办 |
| T11 | 部署生产化 | Docker/Compose + 灰度 + 安全 | T5,T10 | P2 | 3-5 天 | ⬜ 待办 |
三、先行实现批次(P0)—— 已完成 ✅
- T1 NodeExecutor 接口抽象 —— 子任务执行后端统一接口(rule/model 两实现 + 工厂),L2 模型接入无需改 Router
- T2 评测基准扩充 —— 24 样例 × 8 领域,指标:分类 100% / 大领域组识别 100% / 子领域识别 100%
- T3 推理链查询接口 ——
GET /traces/{request_id}:完整推理链可追溯(两级路由 → 三级子领域 → 拆解 → 规则 → 评分) - T12 Agent-Skill 路由器 —— 路由器独立为"技能注册表 + Agent 规划器":
- 21 个内置技能(es.* 模板 ×17、kb.retrieve/kb.answer、judge.evaluate、fallback.call)
- RouteAgent 自行分析需求 → 规划技能调用(多技能组合/依赖)→ 执行 → 校验 → 升级
- 用户只提供 query,无需指定领域/模型;技能调用轨迹可追溯(skill:es.analyze@facts)
- 实测:法律咨询自动组合 es.analyze + kb.retrieve + es.conclude + es.disclaimer
P0 完成后的能力:干净的后端抽象 + 可量化的评测 + 可追溯的推理链 + 技能化 Agent 路由(118 项测试全绿)。
四、执行规则
- 每任务独立验收(测试 + 文档),完成后更新状态 ✅
- 依赖任务未完成时,先做无依赖任务
- P1/P2 任务在 P0 完成后按序推进,不阻塞主线
五、v2 任务登记(端云协同 LLM 协作系统,见《实现方案_v2_端云协同LLM协作系统.md》)
每个任务一个 commit(
feat(v2): Tn 描述),交付含封闭单测;v1 的 126 项测试保持全绿。
| T | 内容 | 状态 | commit |
|---|---|---|---|
| T1 | 环境与基线确认(126 测试全绿;README 环境备忘) | ✅ 完成 | (并入 T2 commit) |
| T2 | 运维层:hw_profile + llama_server 进程管理 | ✅ 完成 | T2 |
| T3 | ArchitectClient(DeepSeek API,JSON 约束) | ✅ 完成 | T3 |
| T4 | Workspace(交流文本 schema/校验/渲染/rollup) | ✅ 完成 | T4 |
| T5 | WorkerLoop + 接地验证 | ✅ 完成 | T5 |
| T6 | CollaborativePipeline 编排 | ✅ 完成 | T6 |
| T7 | 网关扩展(/chat 切 v2,/chat/legacy) | ⬜ | |
| T8 | 人工检验队列 ReviewQueue | ✅ 完成 | T8 |
| T9 | token 计量与账单 | ⬜ | |
| T10 | rollup + prefix cache 调优 | ⬜ | |
| T11 | 打包分发 setup_runtime.py | ⬜ | |
| T12 | 实验脚本 bench_tokens.py + 数据集 | ⬜ | |
| T13 | E1–E5 跑数到 research/v2_experiments/ | ⬜ | |
| T14 | 文档收口(README v2 改写) | ⬜ |