Files
projectAIpopular/research/v2_experiments
tzt ce0f6170d3 chore: T-P-1 工作区收敛——并行会话成果与历史未入库文件整理入库
- 入库历史遗漏源码/测试:router_system 9 模块(agent/executors/inference/knowledge/
  memory/planner/skills/trace)、tests 11 个测试文件、config/knowledge 领域知识
- 入库根目录方案文档(v2/v3/可行性×2)、references 文献(arxiv 14-18/cnki_open/
  参考文献清单)、research 论文素材(routerarena/paper/中文文献 PDF)
- 前端构建产物刷新(新 hash);webapp 误写文档删除
- gitignore 增补:deepseek-harness、research/_refs、.mimosa/.zcode、网关日志/pid、
  临时调试脚本、tests/e2e/node_modules、AI代理功能开发/prefix
- 基线确认:318 passed
2026-09-05 08:28:25 +08:00
..

v2 实验目录(research/v2_experiments/

端云协同编程智能体系统(《实现方案_v2》第 9 节)的论文数据来源。

E1 token 经济学(主实验)— 已有本地确定性结果

  • 脚本:scripts/bench_tokens.py
  • 数据集:eval/v2_sample.json12 条,code/math/legal/medical/finance/life/education/general
  • 输出:E1_token_economics.csvE1_token_economics.md
  • 当前(本地 estimate_tokens 测量):A2 交流文本相对 A1 全量逐字上下文降 ~61%, 稳定前缀可命中 ~99% 的 A2 输入。
  • 待办:--live 模式(API key + 本地 llama-server)确认 ≥80% 北极星。

E2 端到端质量 — 待接入

  • 三臂:快路径 only / 完整协作管线 / 纯 Architect。
  • 判分:machine_checkable 用断言;其余 LLM rubric + 10% 人工抽检。

E3 协作健康度

  • 升级率 / 回合数分布 / issue 率 / 自修成功率 / 熔断次数(可复用 /metrics 的 V2Stats)。

E4 KV 量化内存-精度曲线

  • fp16 / q8_0 / q4_0 × 上下文 4K/16K/32K:进程内存 × Worker 验证准确率。需真实 llama-server。

E5 验证器 P/R

  • 100 产物注入 50 处缺陷,测接地验证拦截率/误杀率;对照组=纯模型自由判断。
  • 验证器已实现(router_system/verifier.py),跑数待接入。

运行命令:.venv/Scripts/python.exe scripts/bench_tokens.py