← 回總入口
CONSTITUTIONAL AI · STEP 1
整理 CLAUDE.md
成可對照 憲法
每條規則加「自評觸發詞」、cortex reply 時 grep 自己用詞、看到觸發詞就對照規則自評。這是 Constitutional AI inference-time 對等版的起手第一步。
01為什麼要這樣做
原版 Constitutional AI(Bai et al. 2022)是 training time、用憲法 fine-tune model。cortex 是用現成 Claude、能做的是 inference time 對等版。
核心想法:把 CLAUDE.md 12 條規則升級成「可對照憲法」、cortex reply 前先檢查自己用詞、看到觸發詞就對照規則自評、不通過就改寫 reply。
RATIONALE
實證:cortex 1 小時嘴錯 3 次(時間 / cron / 嘴答應)= 規則寫了沒用、靠記性失效。加觸發詞 + 自評流程 = 強制 cortex 每 reply 過篩。
02現況分析
CLAUDE.md 8 條主規則 + karpathy 4 條 = 12 條。藍圖 baoyi-blueprint.md 11 條絕對紅線 + 容忍 3 級。兩者合計 23 條規則、100% 載入區。
建議:加觸發詞後 CLAUDE.md 預估 350 行(+42、~14%)、藍圖預估 100 行(+20)。仍在合理範圍(業界 best practice ~100-300 行核心)。
03CLAUDE.md 12 條 + 觸發詞草案
01Telegram 訊息進來必呼叫 replyL1 鐵則
規則重點
純文字輸出他看不到、必呼叫 reply tool。
02驗證紀律L1 鐵則
規則重點
宣稱完成必驗證 + 不確定不動 + 動工前報流程 + destructive 先問 + 嘴答應立刻 spawn。
自評觸發詞
完成修了上線已 deploy已修已設有設沒設
03自助原則L1 鐵則
規則重點
動雲端服務先查 access、CLI / token / .env 自己查、查不到才問。
04記憶衛生L2 流程
規則重點
能改不增、規則進 CLAUDE.md、新拍板必回寫、能 hook 就 hook 不雙頭加。
05確定性流程腳本化L2 流程
規則重點
重複 / 確定性流程主動喊停 + 腳本化、AI 只做創意。
06task 紀律L2 流程
規則重點
觸發詞強制 TaskCreate、pending 不過 5 分、做全套 = 5 件預設全做。
自評觸發詞
等下做memo待辦pending晚點做之後做
07ship 前三道閘L3 對齊
規則重點
閘 1 動工前對齊(規格清單)/ 閘 2 ship 前自證(端對端 self-test)/ 閘 3 PDF 簽核才 deploy。
08subagent fallbackL1 鐵則
規則重點
subagent 卡關主代理接手 / 報 completed 必驗證 / 額度用完直接 Edit 不卡。
自評觸發詞
subagent副手Agentcompleted
K1Think Before CodingKarpathy
規則重點
動工前 state assumptions、不確定就問、不藏疑惑、多解釋路徑就 surface tradeoffs。
K2Simplicity FirstKarpathy
規則重點
最少 code 解問題、不寫 speculative features / 抽象 / flexibility / 不必要 error handling。
自評觸發詞
flexibility擴充未來可擴展config
K3Surgical ChangesKarpathy
規則重點
只動該動的 / 不順手 improve 相鄰 code / 配合現有 style。
自評觸發詞
順手改refactorimprove清理
K4Goal-Driven ExecutionKarpathy
規則重點
定 success criteria / loop until verified、多步 task brief plan + verify each step。
04藍圖 11 條紅線 + 觸發詞草案
R1帳號錯(個人 vs 品牌 / 草莓 vs 堡醫師)紅線
R2對外送出沒審(email / 社群貼文 / WP publish)紅線
R6對外大規模發訊息(陌生人 / 主動 push)紅線
R11寫記憶 / memory / blueprint 必先問紅線
自評觸發詞
寫 memory改藍圖blueprint
R12嘴答應沒做(絕對紅線、check-bait-and-stop hook 化)紅線
05實作教學:cortex reply 怎麼自評
原理
cortex 寫完 reply 草稿後、reply 前自動跑 self-critique 流程:
1. grep 自己 reply 草稿 → 看含哪些觸發詞
2. 對照觸發詞 → 找到對應規則
3. 對照規則 → 自評是否符合
4. 不符 → 改寫 reply
5. 符合 → 真的呼叫 reply tool
觸發詞檢查範例
假設 cortex 草稿:「接下來動 admin blact-tasks 4 view 顏色」
trigger detected: 「接下來動」→ R12 嘴答應沒做
self-check: 我這 turn 有 TaskCreate 嗎?有 spawn 嗎?有動 Bash 嗎?
verdict: 沒 → 違反 R12、改寫
rewrite: 不嘴「接下來動」、立刻 TaskCreate + 動工具
SessionStart hook(Step 2)
SessionStart 時自動 inject 提醒:
[Constitutional AI 提醒]
你 reply 前先做 self-check:
1. grep 草稿觸發詞
2. 對照 CLAUDE.md 12 條 + 藍圖 11 條紅線
3. 不符就改寫、不要嘴
06行數估算 + 建議
CLAUDE.md 12 條加觸發詞、每條多 1-2 行(觸發詞清單)= +24-30 行。藍圖 11 條紅線各加觸發詞 = +20 行。
合計 100% 載入區從 ~390 → ~450 行(+60 / +15%)。仍在 best practice 上限(~500 行)內。
TRADE-OFF
cost:每 session 多 60 行 context。
benefit:cortex 每 reply 過篩、違規率預期降低。
實證後再評估值不值得。
07後續步驟
本頁是 Step 1 草案、不直接改 CLAUDE.md / 藍圖。等堡醫師審後 ack:
- A 動:直接改 CLAUDE.md + 藍圖加觸發詞
- B 改:觸發詞清單刪 / 改 / 加
- C 進 Step 2:SessionStart hook 寫 self-check 提醒
- D 暫不動:先觀察 / 改別的