决策版一页纸(2026-06-06)
从 Copilot 体系迁移到中国 LLM 的决策结论、风险优先级与2周执行闸门
LLM 迁移决策一页纸
一句话结论
建议迁移,但采用“分层迁移 + 证据门禁”策略,不建议一次性全量切换。
决策依据(仅保留硬证据)
- 当前样本
add-user-account-features已形成真实中等复杂度改动,不是 demo。 - 安全关键点有实现证据:
- callback
next白名单防 open redirect - forgot-password 反邮箱枚举
- 服务端 Zod 输入校验
- callback
- OpenSpec 一致性通过:
openspec validate add-user-account-features。 - 多编辑器资产已具备:
.claude/.codex/.lingmaskills 与 commands 已落地。 - 当前主要短板同样有证据:自动化测试覆盖不足,且 lint/type/test 受
pnpm approve-builds门禁阻塞。
迁移价值判断(2026-06-06)
可确认价值:
- 成本压力下,替代路径已具备“可运转”工程形态。
- 规划-执行分层(强模型规划 + 中国 LLM 执行)在本样本可行。
- 工具切换成本可控(三套编辑器指令资产已沉淀)。
暂不能确认:
- 长周期回归成本是否下降(缺自动化与多样本)。
- 复杂场景(性能、并发、迁移脚本)下的稳定性。
- 端到端交付效率是否优于旧链路。
风险优先级(按影响 x 概率)
P0(必须先处理):
- 质量门禁失效风险:当前无法稳定跑完 lint/type/test(环境门禁未统一)。
- 测试覆盖不足风险:核心新增流程缺直接自动化回归测试。
P1(两周内压降):
- 单样本偏差风险:当前仅 1 个 change,结论外推风险高。
- 评审回流风险:若模型降本但 review 闸门不强化,人工成本会反弹。
P2(并行治理):
- 合规与审计风险:多模型多编辑器下日志、数据出境、审计口径需统一。
2 周执行闸门(Go / No-Go)
第 1 周(补齐发布前置):
- 统一
pnpm approve-builds策略(本地与 CI 一致)。 - 固化三条质量门禁必须可跑通:
check-types/lint/test。 - 为本次样本补 3 条最小回归自动化:
- callback 白名单测试
- forgot/reset 主流程测试
- profile 显示名更新测试
第 2 周(做第二样本验证):
- 选择“不同类型任务”做对照(建议数据层/并发/迁移脚本之一)。
- 用相同评估框架产出第二份报告(同维度、同证据模板)。
- 复盘两份报告后作最终采购与主力工具决策。
Go 条件(满足才建议扩大迁移范围):
- 两个样本均可稳定通过质量门禁。
- 核心流程具备最小自动化回归。
- 评审效率未显著恶化(review 往返次数不劣于旧链路)。
No-Go 条件(触发则暂停扩大迁移):
- 质量门禁持续不稳定。
- 回归缺陷明显增加。
- 人工 review 负担明显上升且无法通过流程化缓解。
管理层决策建议
本周建议:批准“受控迁移”,不批准“全量替换”。
资源投入建议:
- 1 名工程负责人主导质量门禁与 CI 环境统一。
- 1 名应用工程师补最小回归自动化。
- 1 名评审负责人维护评估模板与周报口径。
关联文档:
- 独立评测全文:
llm-eval/independent-20260606 - 既有评测(用于横向对比):
llm-eval/index