AgentDock

决策版一页纸(2026-06-06)

从 Copilot 体系迁移到中国 LLM 的决策结论、风险优先级与2周执行闸门

LLM 迁移决策一页纸

一句话结论

建议迁移,但采用“分层迁移 + 证据门禁”策略,不建议一次性全量切换。

决策依据(仅保留硬证据)

  1. 当前样本 add-user-account-features 已形成真实中等复杂度改动,不是 demo。
  2. 安全关键点有实现证据:
    • callback next 白名单防 open redirect
    • forgot-password 反邮箱枚举
    • 服务端 Zod 输入校验
  3. OpenSpec 一致性通过:openspec validate add-user-account-features
  4. 多编辑器资产已具备:.claude / .codex / .lingma skills 与 commands 已落地。
  5. 当前主要短板同样有证据:自动化测试覆盖不足,且 lint/type/test 受 pnpm approve-builds 门禁阻塞。

迁移价值判断(2026-06-06)

可确认价值:

  1. 成本压力下,替代路径已具备“可运转”工程形态。
  2. 规划-执行分层(强模型规划 + 中国 LLM 执行)在本样本可行。
  3. 工具切换成本可控(三套编辑器指令资产已沉淀)。

暂不能确认:

  1. 长周期回归成本是否下降(缺自动化与多样本)。
  2. 复杂场景(性能、并发、迁移脚本)下的稳定性。
  3. 端到端交付效率是否优于旧链路。

风险优先级(按影响 x 概率)

P0(必须先处理):

  1. 质量门禁失效风险:当前无法稳定跑完 lint/type/test(环境门禁未统一)。
  2. 测试覆盖不足风险:核心新增流程缺直接自动化回归测试。

P1(两周内压降):

  1. 单样本偏差风险:当前仅 1 个 change,结论外推风险高。
  2. 评审回流风险:若模型降本但 review 闸门不强化,人工成本会反弹。

P2(并行治理):

  1. 合规与审计风险:多模型多编辑器下日志、数据出境、审计口径需统一。

2 周执行闸门(Go / No-Go)

第 1 周(补齐发布前置):

  1. 统一 pnpm approve-builds 策略(本地与 CI 一致)。
  2. 固化三条质量门禁必须可跑通:check-types / lint / test
  3. 为本次样本补 3 条最小回归自动化:
    • callback 白名单测试
    • forgot/reset 主流程测试
    • profile 显示名更新测试

第 2 周(做第二样本验证):

  1. 选择“不同类型任务”做对照(建议数据层/并发/迁移脚本之一)。
  2. 用相同评估框架产出第二份报告(同维度、同证据模板)。
  3. 复盘两份报告后作最终采购与主力工具决策。

Go 条件(满足才建议扩大迁移范围):

  1. 两个样本均可稳定通过质量门禁。
  2. 核心流程具备最小自动化回归。
  3. 评审效率未显著恶化(review 往返次数不劣于旧链路)。

No-Go 条件(触发则暂停扩大迁移):

  1. 质量门禁持续不稳定。
  2. 回归缺陷明显增加。
  3. 人工 review 负担明显上升且无法通过流程化缓解。

管理层决策建议

本周建议:批准“受控迁移”,不批准“全量替换”。

资源投入建议:

  1. 1 名工程负责人主导质量门禁与 CI 环境统一。
  2. 1 名应用工程师补最小回归自动化。
  3. 1 名评审负责人维护评估模板与周报口径。

关联文档:

  • 独立评测全文:llm-eval/independent-20260606
  • 既有评测(用于横向对比):llm-eval/index

On this page