进展周报 · 2026-W27
周期:2026-06-29 ~ 2026-07-05
一句话:本周对外发布 14 个版本(v1.3.0 → v1.10.0),覆盖评审能力、数字分身与运维韧性等方向的持续推进。
一、本周发布版本
| 日期 | 版本 | 内容 |
|---|---|---|
| 2026-07-05 | v1.10.0 | 运营韧性 (数据自动备份) + 分身对话可观测 |
| 2026-07-04 | v1.9.0 | 运维管理台 (只读 web 视图) + 全链路遥测底座 |
| 2026-07-03 | v1.8.0 | 锚点认知对话式代理 (对话 + 文档评议) + 长连接异步加固 |
| 2026-07-03 | v1.7.0 | OP2 评分标准 v2 + 多场景机器人上线运维加固 + 自动发版 |
| 2026-07-02 | v1.6.2 | OP2 评分维度精简 (删「一页表达质量」) |
| 2026-07-02 | v1.6.1 | 报告交付前来源脱敏 (安全补丁) |
| 2026-07-02 | v1.6.0 | 评审报告自动可视化 — 发一份材料, 回来一份带评分的图文报告 |
| 2026-06-30 | v1.5.0 | 换模型工程化 + 飞书运维命令 |
| 2026-06-30 | v1.4.2 | 报告记录"是谁、用什么参数生成的" |
| 2026-06-30 | v1.4.1 | 真打分上生产后的三处修正 |
| 2026-06-29 | v1.4.0 | 竞赛/公司级"真打分"落地(自定义维度满分制) |
| 2026-06-29 | v1.3.2 | 接入第三方模型的韧性兜底(四层) |
| 2026-06-29 | v1.3.1 | LLM provider 一键切换 + 多模型接入韧性 |
| 2026-06-29 | v1.3.0 | 多场景 VM 联调闭环 + 评委体系完整性 |
二、各版本要点
v1.10.0· 运营韧性 (数据自动备份) + 分身对话可观测 让运营积累的判断数据自动进库不再丢, 让版本库只留该留的, 让分身的每一轮对话在管理台里可回溯、可审计、可按人查看.v1.9.0· 运维管理台 (只读 web 视图) + 全链路遥测底座 把机器人的运行状态、评审的处理过程与 token 花费, 汇成一个登录后只读可视的运维后台, 底下是一条只记元数据、fail-open 的遥测底座, 外面套两层访问控制.v1.8.0· 锚点认知对话式代理 (对话 + 文档评议) + 长连接异步加固 把锚点判断做成一个能对话、能评文档、带三档置信与出站脱敏的数字分身, 并把长连接稳定性与灰度观测补齐.v1.7.0· OP2 评分标准 v2 + 多场景机器人上线运维加固 + 自动发版 评分标准更到 v2 (换配比不减总分), 多机器人上线的运维坑治本 (回推缺凭据显式告警 + 手册纠错), 发版一步到位 (tag 即 Release)。v1.6.2· OP2 评分维度精简 (删「一页表达质量」) 评分维度按需精简, 定级口径保持一致 (百分比归一), 改一处配置即全场景生效。v1.6.1· 报告交付前来源脱敏 (安全补丁) 评委可以放心引用内部佐证做交叉验证, 而交付出去的报告不会把内部出处 / 真名带出去。v1.6.0· 评审报告自动可视化 — 发一份材料, 回来一份带评分的图文报告 评审从 "回一份要自己读的文字" 升级成 "回一份能直接看的图文报告", 且评委丢分 / 热力图缺失 / 名字错这几类真实坑全部治本 + 兜底。v1.5.0· 换模型工程化 + 飞书运维命令 换模型从"运维动作"降级成"日常操作", 而且有客观对比 + 全程留痕。v1.4.2· 报告记录"是谁、用什么参数生成的" 报告从此"自带出厂铭牌", 质量比较有了可靠的归因锚点。v1.4.1· 真打分上生产后的三处修正 引擎对了, 把锚点的独立性、模型输出的健壮性、文案的场景贴合度补齐 —— 真实跑一遍才照得出的边角。v1.4.0· 竞赛/公司级"真打分"落地(自定义维度满分制) "5 镜头量判断质量, 自定义维度量方案优劣" —— 两套尺子此前只有前者真在跑, 现在后者也跑起来了。v1.3.2· 接入第三方模型的韧性兜底(四层)v1.3.1· LLM provider 一键切换 + 多模型接入韧性v1.3.0· 多场景 VM 联调闭环 + 评委体系完整性
三、本周体现的方法论
- fail-open 容错:非关键路径 (如遥测) 失败绝不影响主流程。
- fail-close 保守:对外 / 敏感操作命中即拦, 宁可不做不可做错。
- 不编造:引用观点必带出处, 给不出就降级为「推演 / 存疑」。
- 治本 + 兜底:线上问题既修根因又加自动防线, 同类问题以后进不来。
- 确定性优先:能用固定规则做的就不用 AI, 保证秒级、稳定、可复现。
- 安全脱敏红线:交付件自动脱去内部出处 / 真名, 遥测只记元数据不记正文。
- 质量门纪律:每版上线前自动化测试全绿 + 脱敏检查零命中才发布。
- 真实运营驱动:需求多为系统真跑起来后暴露, 当天修当天发。
四、数字概览
| 指标 | 情况 |
|---|---|
| 本周发布版本 | 14 个(v1.3.0 → v1.10.0) |
| 本周代码提交 | 约 122 次 |
| 自动化测试规模 | ≈1276 个用例,全绿 |
| 安全脱敏检查 | 每版零命中 |
本周报由 scripts/gen_weekly_report.py 从公开变更日志自动生成,只描述工程化与方法论层面的进展;具体客户、案例、财务数字等敏感内容按保密要求不在此列。