开发路线图
本页记录项目的方法论演进与工程化计划。具体 case 细节、凭据、内部场景命名在
docs/internal/保留,本页仅描述工程化方向与里程碑。版本变更记录见 Changelog。
当前状态 · v1.3.0(已发布 · VM 联调闭环)
| 模块 | 状态 | 说明 |
|---|---|---|
| 多场景评委体系 | ✅ 已发布 | 10 个 Scene,2 类型(review / competition) |
| OP2 6段式报告输出 | ✅ | 总分 / 分项 / 必改 / 建议 / 删减 / 一页表 |
| e2e + 单元测试 | ✅ | 900 passed · make smoke-scene SCENE=<slug> |
| Phase 2 外部视角评委 | ✅ | 3 个虚拟 persona(含免责声明) |
| Workshop 竞赛场景 | ✅ | competition 模式,10分制,无 anchor |
| 定性总结场景(meeting_summary) | ✅ 已上线 | review 型场景产出多视角会议总结 deck(每评委 判断逻辑 + 3 亮点 + 3 不足 + 一句话)+ 4:1 大屏 PPTX,不走打分门槛 |
| VM 联调(M5) | ✅ 完成 | ≥2 飞书机器人真实路由 + 两类型端到端跑通 |
已完成 · M5 VM 联调闭环(v1.3.0)
目标: 在云 VM 上让 ≥2 个飞书机器人各自触发对应 panel,验证路由隔离。✅ 2026-06-29 达成。
验收结果:
- review 场景机器人 → 100分制报告 → 含 anchor judge ✅
- competition 场景机器人 → 自定义分制报告 → 无 anchor ✅
联调过程逐层暴露并修复一条"洋葱式" bug 链(多机器人并发事件循环冲突 / 异步回推机器人身份串台 / 固定评委编组场景解析 / 跨场景评委 SKILL 路径 / LLM 限流退避重试),均为"只在真实 VM 联调才暴露"的集成问题。已合并 feature branch → main 并打 v1.3.0 tag。
详见 VM 多场景部署。
短期 · P3 工程强化(v1.3 目标)
✅ P3 四项工程强化已全部完成(测试基线 790 → 835),下列保留作为能力说明。
专项行业评委扩充 ✅
Phase 2 外部视角评委 3 个(数据驱动 / AI平台化 / 资本市场视角)的基础上,Phase 3 增加:
- 行业客户视角(3 个虚拟 persona):针对垂直行业的实际用户诉求,从"甲方看效果"角度评议
- 每个 persona 基于公开报道与行业案例构建,不绑定真实人物,含标准免责声明
- 集成进对应 BG 级 review 场景的 panel
Workshop 排名展示 ✅
脚本: build_workshop_ranking.py
功能: 扫描多份竞赛方案 → 按总分降序(并列共享名次)→ 生成自包含排名 HTML
→ 可选飞书群投递
特点: 排名列由 panel 的评分维度动态决定,任意 competition 场景通用
用途: 年中/年终 workshop 后快速出排名看板Scene 级使用统计 ✅
monthly_review.py 的 --scene-breakdown flag:按场景分组统计 job 数、平均总分、 错误率、最近 job 时间,集成进月度复盘报告 §9 段。
飞书事件多场景路由 ✅
飞书事件入口按机器人 app_id 反查对应场景,把 scene_slug 注入处理流程, 确保每个机器人触发各自场景的 panel;无匹配时降级到全局配置,完全向后兼容。
下一轮 · 评委体系完整性
与最早需求逐表对照后,评分维度已 100% 对齐,6 段输出与落地优先级前三阶段已完成。 评委组合层有少量待补项(均维持虚拟 persona + 免责声明,不绑定真实人物):
- 主场景多主题评委组合:让公司级场景按议题主题(增长差距 / AI 转型 / 价值经营) 动态选取对应评委组合,而非固定一套
- 跨场景评委复用接入:已建的通用评委(数据平台 / 技术战略 / 资本市场视角)按需接入 更多业务线场景
- 生态视角补缺:为特定行业线补充本地化生态视角评委(区别于现有的全球视角)
设计纪律:所有评委是基于公开观点构建的角色化框架,含标准免责声明, doctrine 待真实材料蒸馏后填充——不凭空编造特定人物观点。
中期 · anchor research 填充(v0.6)
anchor 评委(锚点视角)的心智模型文件当前为框架占位,v0.6 计划用 agent 逆向合成 完善:
五步 SOP
S1 素材预填 从访谈 transcript + 历史 raw 材料抽候选片段,每条带 source link
S2 agent 合成 派 sub-agent 起草 6 个 research 文件(身份DNA/心智模型/反共识等)
S3 质量校验 skill_lint --check-anchor-research(字数/引用/provenance 三重校验)
S4 holdout 回测 留出 2-3 个历史决策做 back-test,≥2/3 方向一致为过
S5 互动迭代 每次真实锚点反馈落 deltas.md,monthly_review 追踪 anchor model driftconfidence 分级机制:
- 当前(占位状态):confidence ≤ 0.4
- S2 完成(agent-derived):≤ 0.6
- 锚点本人签收:解除上限
反循环护栏:合成只用访谈 transcript / anchor raw 过滤材料 / wiki,严禁用 LLM 跑出的 review 喂 S2(循环造假)。
中长期 · boss-as-a-Service(已立项 · 2026-07-06 PRD v0.2 定稿)
把 boss 判断引擎封装为任意 agent 可调用的服务(codex / opencode 等 MCP-capable agent 均可接入)——引擎、模型、知识库三者解耦。护城河命题:boss 的价值是方法论(5 镜头 / 满分制打分 / anchor_delta / 30-90-365 归因)+ 评委 doctrine + 知识库,不是模型;把模型抽离、让调用方"借 boss 的评委和方法论 + 自己的模型"出判断,反而放大护城河。
- BYOM(自带模型)两档:档 A「prepare-only 纯借脑」先行——引擎不调模型,返回各阶段 prompt 包(评委 doctrine + 输出强约束),调用方用自己的模型跑、回传结构化 review,引擎做确定性聚合 / 定级 / 渲染 / 出站脱敏;档 B「代跑」(调用方提供 OpenAI-compatible 端点)随后。
- 双知识库:托管(内部授权 + 敏感度分级过滤 + 出站脱敏 fail-close)/ 自建(bundle 格式与主库同构,租户隔离,含最小生产工具链:校验器 + 脚手架)。
- 接口:MCP server 优先,HTTP/OpenAPI 兜底;契约带
schema_version版本化。 - 第 0 红线(压倒一切):现有多场景评审 + 飞书机器人的正常运营在开发 / 部署 / 运行 / 回滚任何阶段不受影响——独立进程(不进消息事件循环)+ 资源限额 + 开关默认关 + 灰度 + 秒级回滚。
里程碑 M0–M6:引擎抽库 → KB 抽象 → 档 A 服务化(主干最短闭环)→ 认证体系 → 档 B → 自建 KB + 隔离 → 客户端适配。内部 PRD prd-boss-as-a-service v0.2 已定稿(confidential,决议 D1–D7 已拍板)。
架构决策待定项
| 决策 | 状态 | 说明 |
|---|---|---|
| ADR-013 | accepted(主理认可 + 零影响评审通过 · CTO 会签待补) | 评审提交文档受控 ingestion 进知识库(去重 + 分级 + 脱敏闸 → 只进 entities/people/concepts;报告永不进);零影响架构级保证(ingestion 物理不在生产 VM);设计稿,M1 实现待启 |
| ADR-010 | proposed(待双签) | Cloudflare Containers 评估,静态 + 函数混合部署 |
| feature branch → main | ✅ 已合并 | M5 联调通过,已发 v1.3.0 |
| EvoMap / V3 公开层 | 冻结(12月后) | 见 [CLAUDE.md §10.3] |
不在计划内
以下明确不做 / 推迟:
- Phase 4 专项评委(AI生态 / 政府事务 / 研究机构视角)→ Phase 3 验收后评估
- D3 GitHub Actions 定时调度 → D2 云端稳定后再评估
_wiki与reports/的双向自动同步 → CLAUDE.md §3 架构原则禁止
📌 已完成(曾在本清单):PDF / DOCX 文档评审 — 已用 pypdf + python-docx 直接提取文字 实现(绕开 pandoc 外部依赖),含表格提取与"无文字层(扫描件)"防护;
.doc老二进制 引导转.docx/PDF。
时间线
✅ DONE v1.3.0 已发布 · 多场景 VM 联调闭环 (review + competition 两类型端到端)
│ (含 P3 工程强化 + 评委 doctrine 源 + 多机器人并发硬化 + 429 退避重试)
│
NOW competition 真·10分制输出格式 (Phase 4 按 scene lenses 打分) — 独立专项
│
next anchor research 5步 SOP 真合成 + 回测 · 归因 fetcher 接 MCP