Skip to content

设计决策 001–139 ​

NOTE

下列内容根据本日 GPT 会话中的决策编号整理。个别措辞为结构化重述,但编号与逻辑顺序保留。

  1. 001 Weekly v0.1 初期不做自定义插件。
  2. 002 Harness 是智能层,稳定数据继续留在原存储。
  3. 003 停止继续死磕卡住的 npx 路径。
  4. 004 终止卡死 npm/npx 进程。
  5. 005 npx 失败后切换 pnpm。
  6. 006 先验证 Node 环境。
  7. 007 使用 pnpm。
  8. 008 先走最短 pnpm dlx 启动路径。
  9. 009 pnpm 有进展时继续,不把 warning 当 error。
  10. 010 Build Script 权限按官方需要最小批准。
  11. 011 只批准 3 个必要构建包。
  12. 012 初期只使用 DeepSeek 官方 Provider。
  13. 013 使用独立 Test Workspace。
  14. 014 初期使用 Flash。
  15. 015 使用 Workspace Write,不用 Danger Full Access。
  16. 016 Prompt 小、边界清楚、有停止条件。
  17. 017 Workspace Write Test 通过。
  18. 018 Weekly 初期用文件制,不引入数据库。
  19. 019 先造 synthetic fixture。
  20. 020 指标先保持最小集合。
  21. 021 Harness 初期不修改现有 Weekly 数据 Schema。
  22. 022 Fixture 仅作测试资产。
  23. 023 未来正式 Weekly 服从 Project→Task→Checkbox→Daily→Try→Weekly。
  24. 024 Harness 必须兼容原 Weekly 与 UPDATE。
  25. 025 保留 update-growth / Growth 机制。
  26. 026 第一轮分析方向对,但证据纪律失败。
  27. 027 Grounding 正式化。
  28. 028 当前没有稳定真实 Weekly。
  29. 029 使用 Fact / Inference / Hypothesis / Unknown。
  30. 030 关键数字必须可追溯。
  31. 031 Inference 不能直接改 Rule。
  32. 032 没有历史 Weekly 时不伪造兼容性。
  33. 033 First Real Weekly = Baseline。
  34. 034 保留人类可读 review spec。
  35. 035 创建 weekly-review Skill。
  36. 036 Skill workspace-local。
  37. 037 Skill 用目录包形式。
  38. 038 Skill 可被模型调用。
  39. 039 先单测 Skill Discovery / Invocation。
  40. 040 Skill Discovery / Invocation 通过。
  41. 041 Skill-only 不足以做 deterministic stats。
  42. 042 增加 deterministic validation layer。
  43. 043 程序算准,Skill+Model 解释。
  44. 044 先做普通 Python Validator,不急做自定义 Tool。
  45. 045 正式统计以 Validator 为准。
  46. 046 模型可交叉检查,但冲突必须报告。
  47. 047 本机 Python 用 py。
  48. 048 Skill 必须先跑 Validator。
  49. 049 冲突时 Validator 赢。
  50. 050 End-to-End 不手工指定每个 Tool 顺序。
  51. 051 E2E 仍禁止写业务数据。
  52. 052 Weekly Review Core v0.1 通过。
  53. 053 下一步允许 Reviews 写入测试区。
  54. 054 Review 同时有机器可读 metadata。
  55. 055 Experiment 单独存,不直接改 Rule。
  56. 056 Experiment 有状态。
  57. 057 Harness 可自动生成 proposed,但不能自批。
  58. 058 proposed→approved 需要用户明确授权。
  59. 059 模型推荐不等于批准。
  60. 060 approval 记录 approved_by / approved_at。
  61. 061 支持 rejected。
  62. 062 approved ≠ running。
  63. 063 approval update 只改批准字段。
  64. 064 approval 不改 Experiment Definition。
  65. 065 approved→running 需要新授权。
  66. 066 running 记录 started_at。
  67. 067 running 后冻结关键实验定义。
  68. 068 result evaluation 增加 completed/result/evaluation/recommended_decision。
  69. 069 AI 可写 recommended_decision,不写 final decision。
  70. 070 kept/rolled_back 需要用户确认。
  71. 071 final decision 明确由用户给出。
  72. 072 接受 recommendation 时记录 decided_by / decided_at。
  73. 073 kept 不自动修改 Rule。
  74. 074 Rule Promotion 需要第三次显式授权。
  75. 075 Rule 记录 source_experiment/promoted_by/promoted_at。
  76. 076 Rule status 支持 active/deprecated。
  77. 077 Test Experiment 不写真实 Rule。
  78. 078 Promotion Gate 测试通过。
  79. 079 每个 Rule 必须有 scope。
  80. 080 不自动扩大 scope。
  81. 081 synthetic test 只能创建 test rule。
  82. 082 Test Fixture 阶段完成后停止继续炫技。
  83. 083 下一目标:Real Weekly Input Pipeline。
  84. 084 真数据留在现有系统,Harness 读/整合/验证/分析。
  85. 085 Weekly Input 应程序生成,不人工复制。
  86. 086 Handoff 仅作集成设计参考;当前本地正式规则优先。
  87. 087 WeeklyReview/Input/*.md 不成为正式新真相源。
  88. 088 下一模块是 Collector/Adapter,不是新 Input Template。
  89. 089 保留 UPDATE→update-growth→Growth。
  90. 090 Real Collector Source of Truth = 真实 Vault。
  91. 091 Collector v0.1 输出 JSON。
  92. 092 Daily/Task/Try/Project 职责分开,避免双计。
  93. 093 Try 是核心结构化执行证据之一。
  94. 094 Project 不确定字段不猜。
  95. 095 Collector 真实 Vault 只读。
  96. 096 当前 real weeks=0;本地真相优先,不造历史 Weekly。
  97. 097 Collector 容忍 schema 差异。
  98. 098 try absent/empty 只作数据可用性信息。
  99. 099 v0.1 核心证据:Try + Daily;Task 给实体/状态/关系,Project 给上层结构。
  100. 100 Collector 的测试输出只写 Harness Workspace。
  101. 101 Collector 与 Validator 正式分层。
  102. 102 Real Validator 只消费 Collector JSON。
  103. 103 missing Daily = data gap,不等于零执行。
  104. 104 Try 可作为独立证据,但不自动补写 Daily。
  105. 105 Real Validator 只做 deterministic check,不做 inference。
  106. 106 Test Mode 与 Real Mode 并存。
  107. 107 旧 weekly_validator.py 保留给 Test Fixture。
  108. 108 real_weekly_validator.py 只处理 Collector JSON。
  109. 109 weekly-review Skill 支持双执行模式。
  110. 110 下一步先 Real Mode Dry Run。
  111. 111 第一个完整真实自然周才作为 Baseline。
  112. 112 AGENTS/Flow/Stable 继续是正式业务来源。
  113. 113 Skill 定位为 orchestration + grounding adapter。
  114. 114 日期解析复用正式 Flow。
  115. 115 Collector v0.2 未来可考虑 Git Evidence。
  116. 116 Git activity ≠ meaningful progress。
  117. 117 正式 Weekly 输出服从 Stable Prompt。
  118. 118 周复盘流程.md = Real Weekly 业务 Single Source of Truth。
  119. 119 Stable Prompt = 正式分析/输出 Single Source of Truth。
  120. 120 Growth Prompt = 纵向背景,不是当周事实。
  121. 121 AGENTS 保持 thin pointer。
  122. 122 Collector/Validator = evidence enhancement layer。
  123. 123 日期解析服从 Flow,不在 Skill 另建一套。
  124. 124 Git 缺失不应使周复盘失败。
  125. 125 Weekly 保存成功后才允许运行 update-growth。
  126. 126 v0.3.1 作为第一版正式架构冻结点。
  127. 127 暂停新增架构功能,进入真实回归测试。
  128. 128 2026-08-27~08-30 作为 Real Dry Run Regression Dataset。
  129. 129 Dry Run 使用真实业务规则但禁止正式写入。
  130. 130 出问题先定位 Collector/Validator/Skill/Stable 冲突,不随意改业务规则。
  131. 131 第一次 Real Dry Run:技术通过,Grounding 基本通过,分析层需小补丁。
  132. 132 引入 Evidence Compression Drift。
  133. 133 未确认字段语义必须 Unknown。
  134. 134 UPDATE 的 Grounding 标准至少与正文一样严格。
  135. 135 暂不改 Collector/Validator/Vault Flow/Stable。
  136. 136 v0.3.2 作为当前 Grounding 稳定版。
  137. 137 除非回归发现新缺陷,不再扩展 Skill。
  138. 138 下一步只做三个已知问题的定向 Regression Test。
  139. 139 三项通过后,停止基础架构开发,等待真实 Baseline Weekly。