Skip to content

mzw: add knowledge evolution support - #12

Open
miaozw66 wants to merge 16 commits into
HuangPuStar:next-appfrom
miaozw66:mzw_knowledge_evolution
Open

mzw: add knowledge evolution support#12
miaozw66 wants to merge 16 commits into
HuangPuStar:next-appfrom
miaozw66:mzw_knowledge_evolution

Conversation

@miaozw66

Copy link
Copy Markdown

No description provided.

myrfy001 and others added 5 commits July 15, 2026 22:05
- star-history 改用 <picture> 支持暗/亮主题自适应
- 新增 Academic Research/学术研究 章节,包含 arXiv 引用和 arxiv-paper 分支说明
- 新增 Contributing/如何贡献 章节,指向 CONTRIBUTING.md

Co-Authored-By: deepseek-v4-pro <deepseek-ai@claude-code-best.win>
…ter 并行提示

- 扩展 DIAGNOSTIC_GLOBS 覆盖 E 阶段产物(perf_report.json, perf-server.*.log)和
  retrospective.md,确保 planner 能看到 perf 失败的根因
- 新增 _render_e_failure() 给出结构化的 E 失败描述和诊断文件绝对路径
- _prev_logs_section() 自动发现 prev-iter 中的诊断文件,不再硬编码 C_test 文件名
- 新增 IMPLEMENT_PARALLEL_HINT 指导 implementer 用并行子 agent 同时写多个独立文件
- NOTEBOOKS_HINT 明确子 agent 禁令仅针对阅读(不针对写作)

Co-Authored-By: deepseek-v4-pro <deepseek-ai@claude-code-best.win>
新增 `find-low-hanging-kernel` 任务插件:输入 Chrome tracing + 模型目录 + 推理框架源码树,
自动生成可审计的执行流图(节点 = kernel 调用,含 source_ref/tensor shapes/stats/confidence),
并标记优化空间最大的低垂果实。插件完全位于 `metainfer/tasks/find_low_hanging_kernel/` 下,
复用 StateStore / AgentPool / SubAgentManager / TokenBudget 共享基础设施。

主要阶段(每阶段使用全新 Agent 实例,Step 1/2/3 均为多 agent 交叉验证):
- P1 code_analysis: 3-agent 池(arch/quant/runtime tracer)+ 综合 agent
- P2 tracing_analysis: 确定性 trace parser + 3-agent 池(stat/source/shape analyst)
- P3 graph_build + graph_validate: 5-worker 持久 AgentPool,每轮 3 节点分组语义校验
  + 确定性完整性检查,支持循环 fix;validation/round_NN/ 留存审计产物
- P4 visualize: 把 graph JSON 内联进 ELK+SVG HTML 模板,独立文件 + WebUI iframe 双形态

附带的其他改动:
- 共享层:`metainfer/orchestrator/requirements.py`(统一 req_field 读取,
  终结 requirements.json 嵌套/扁平多路径读取反模式);`server/liveness.py`
- 其他 task 包(calc_value/opt_kernel/gen_infer_framework/gen_cpp_infer_framework)
  切换到共享 requirements 读取层;CLAUDE.md 记录数据一致性权威源规约

测试:39 个新插件测试全绿;mock-based 端到端 + resume + integrity + pool 收敛均覆盖。

Co-Authored-By: glm-5.2 <zai-org@claude-code-best.win>
…从 registry 剥离

bug 现场:worker21 上的 orchestrator 已经死了(orchestrator.pid 里 finished_at 已盖戳、
exit_hint="reaped-by-kill-on-dead-pid",run.json 也明确 finished=true / final_status=stopped),
但跑在另一台机器上的 WebUI 还显示 Kill 按钮可点。

根因:LocalLauncher.status() 只有在 pid 为 None 时才认 finished_at;pid 字段非空时
直接走 validate_pid_started_at 做本机 /proc 探测。多节点 NFS 架构下,本机 /proc 永远
看不到兄弟节点上的进程——本机 os.kill(pid, 0) 撞上 PID 复用就会误判为 alive。

修复:把 finished_at 短路判断提前。pid 文件里只要 finished_at 已盖戳,进程必然没了
(这条字段由 orchestrator graceful exit / launcher._reap_dead_pid_file / spawn 失败
清理路径盖戳,每一条都意味着进程确实退出);只有 finished_at 缺失时才回落到本机
/proc 探测,覆盖 SIGKILL / OOM 等没来得及盖戳的硬死场景。

顺带做的 SSOT 整治(同一类问题):
- registry.json 不再缓存 pid / started_at / finished_at——这三处存储曾经各自被不同
  代码路径选择性同步,没有任何派生函数,必然漂移。registry 现在只存身份字段
  (id/type/label/state_dir/workspace_dir/created_at/launcher),所有进程状态查询
  只走 launcher.status() 读 orchestrator.pid。
- liveness scan 不再用 registry.pid 做 pre-filter(已经是 None 了),改为无差别
  对每个 task 调 status(),符合"进程状态只有 orchestrator.pid 一个权威源"。
- reconcile 不再写自己的简化版 _write_pid_file_finished,复用 launcher._reap_dead_pid_file
  单一 reap 路径,保证 UI 拿到的死亡信号一致(run.json + timeline + pid 三处同步更新)。

测试:
- 新增 metainfer/server/tests/test_launcher_status.py,4 个直接测试 LocalLauncher.status()
  的 case:包括专门覆盖本 bug 的"pid=当前 Python 进程 + finished_at 已盖"用例(旧逻辑
  会返回 running=True)。
- 更新 test_liveness.py 适配 registry 不再缓存 pid 的新规约。

CLAUDE.md 同步更新数据一致性权威源表 + 反模式清单。

Co-Authored-By: glm-5.2 <zai-org@claude-code-best.win>
1. req.get("answers")/req.get("form") 嵌套回退统一到 req_field()
   - 17 处分布在 11 个文件的嵌套回退全部替换为 req_field()/req_field_int()
   - 覆盖 target_model(8)/max_iterations(3)/perf_prompts_path(2)/
     oracle_prompts_path(2)/target_hardware(1)/max_validator_rounds(1)

2. _render_req() 重复逻辑消除
   - gen_infer_framework/gen_cpp_infer_framework/opt_kernel 三个 prompts.py
     里完全相同的格式化逻辑统一到 requirements.py::req_summary_lines()

3. 数据竞态修复
   - 新增 server/filelock.py (跨进程 fcntl.flock 上下文管理器)
   - timeline.jsonl: orchestrator(state.py) + WebUI(state_reader.py) 双写加锁
   - token_budget.json: orchestrator(_persist) + WebUI(routes.py) 双写加锁
   - run.json: launcher._update_run_stopped() 加锁
   - orchestrator.pid: launcher/routes.py 直接 write_text → tmp+replace 原子写

4. 其他
   - requirements.py 新增 req_summary_lines() 共享格式化函数

Co-Authored-By: deepseek-v4-pro[1m] <deepseek-ai@claude-code-best.win>
@miaozw66
miaozw66 force-pushed the mzw_knowledge_evolution branch 2 times, most recently from 8733d6e to 9e53b38 Compare July 16, 2026 02:53
myrfy001 and others added 3 commits July 17, 2026 22:02
新增 `port-model` 任务插件(task_type: port-model):给定已有模型支持的源框架
和需要添加支持的目标框架(vLLM/SGLang/TensorRT-LLM/TGI),在目标框架中实现
该模型的适配(模型端口)。

五阶段线性 pipeline:
- P1_model_analysis:单 Agent 分析模型架构(config.json + 权重结构 + 特殊层)
- P2_source_analysis:分析源框架中该模型的注册方式(入口/自定义层/权重映射/前向链)
- P3_target_analysis:分析目标框架注册模式(找模板/列文件/diff 计划)
- P4_implement:在目标框架中实现模型支持并产出 patch
- P5_test:boot 源/目标框架服务,对比输出,LLM-judge 判定正确性;失败时回到 P4 修复(最多 3 retry)

关键约束:
- model_dir / source_framework_dir 对所有 Agent 只读(prompt + orchestrator 双层防护)
- Agent 仅可在 target_framework_dir 内写入
- 产物:model_port.patch + test_results.json + 三个 memory/*.md 分析文档

测试:19 个新插件测试全绿(form 注册 + phase 状态机 + MockAgentManager 端到端 + resume)。

Co-Authored-By: glm-5.2 <zai-org@claude-code-best.win>
附带多项积累修复:
- launcher: spawn 后立即写 placeholder orchestrator.pid,避免启动窗口期内 status() 返回 not-running
- subagent_manager: 检测 ccb "No conversation found" stale session 错误,自动 drop resume_session_id 重试
- calc_value: viz.html 注入 TASK_ID / COMPUTE_URL header,修复 WebUI iframe 内 agent 误读 URL 的问题;迭代面板加 max-height 滚动
- gen_infer_framework: 新增 ASYNC_NONBLOCK_MANDATE 提示,修复 implementer 在 async handler 里同步调 tokenizer 导致 event loop 卡死的 12-iteration death spiral;面板加 max-height 防止超长 iteration 列表撑爆页面

Co-Authored-By: glm-5.2 <zai-org@claude-code-best.win>
@miaozw66
miaozw66 force-pushed the mzw_knowledge_evolution branch from 9e53b38 to 115871a Compare July 21, 2026 06:20
FY-26 and others added 8 commits July 21, 2026 16:45
- pipeline.py: A-H 8 阶段状态机(bootstrap 4 phase + 优化循环 4 phase),无重试上限
- harness.py: correctness + performance 测试 harness 模板与子进程执行引擎
- kernel_library.py: 内核库——加权排名、选择、淘汰、迭代追踪
- phases.py: 完整 Transition 表、Phase 分类、前端 graph payload
- prompts.py: 6 个 agent prompt,AMD DCU/gfx928 warp_size=64 适配
- 前端: 状态图渲染、内核库面板(可滚动代码预览)、独立 detail 视图
- 100 个单元测试
Restructure the native C++ knowledge base, add deterministic plan and implementation gates, strengthen correctness/performance validation, and preserve resumable task lifecycle state.
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

6 participants