← 回總入口
CONSTITUTIONAL AI · STEP 1

整理 CLAUDE.md
成可對照 憲法

每條規則加「自評觸發詞」、cortex reply 時 grep 自己用詞、看到觸發詞就對照規則自評。這是 Constitutional AI inference-time 對等版的起手第一步。

01為什麼要這樣做

原版 Constitutional AI(Bai et al. 2022)是 training time、用憲法 fine-tune model。cortex 是用現成 Claude、能做的是 inference time 對等版

核心想法:把 CLAUDE.md 12 條規則升級成「可對照憲法」、cortex reply 前先檢查自己用詞、看到觸發詞就對照規則自評、不通過就改寫 reply。

RATIONALE

實證:cortex 1 小時嘴錯 3 次(時間 / cron / 嘴答應)= 規則寫了沒用、靠記性失效。加觸發詞 + 自評流程 = 強制 cortex 每 reply 過篩。

02現況分析

308
CLAUDE.md 行
~80
藍圖行
12
CLAUDE 條
11
藍圖紅線

CLAUDE.md 8 條主規則 + karpathy 4 條 = 12 條。藍圖 baoyi-blueprint.md 11 條絕對紅線 + 容忍 3 級。兩者合計 23 條規則、100% 載入區。

建議:加觸發詞後 CLAUDE.md 預估 350 行(+42、~14%)、藍圖預估 100 行(+20)。仍在合理範圍(業界 best practice ~100-300 行核心)。

03CLAUDE.md 12 條 + 觸發詞草案

01Telegram 訊息進來必呼叫 replyL1 鐵則
規則重點
純文字輸出他看不到、必呼叫 reply tool。
自評觸發詞
telegramreply訊息回應
02驗證紀律L1 鐵則
規則重點
宣稱完成必驗證 + 不確定不動 + 動工前報流程 + destructive 先問 + 嘴答應立刻 spawn。
自評觸發詞
完成修了上線已 deploy已修已設有設沒設
03自助原則L1 鐵則
規則重點
動雲端服務先查 access、CLI / token / .env 自己查、查不到才問。
自評觸發詞
找不到不行無法沒裝沒有
04記憶衛生L2 流程
規則重點
能改不增、規則進 CLAUDE.md、新拍板必回寫、能 hook 就 hook 不雙頭加。
自評觸發詞
寫 memory新檔新增記憶新規則
05確定性流程腳本化L2 流程
規則重點
重複 / 確定性流程主動喊停 + 腳本化、AI 只做創意。
自評觸發詞
重複每次流程以後再做常做
06task 紀律L2 流程
規則重點
觸發詞強制 TaskCreate、pending 不過 5 分、做全套 = 5 件預設全做。
自評觸發詞
等下做memo待辦pending晚點做之後做
07ship 前三道閘L3 對齊
規則重點
閘 1 動工前對齊(規格清單)/ 閘 2 ship 前自證(端對端 self-test)/ 閘 3 PDF 簽核才 deploy。
自評觸發詞
shipdeploy上線對外給堡醫師
08subagent fallbackL1 鐵則
規則重點
subagent 卡關主代理接手 / 報 completed 必驗證 / 額度用完直接 Edit 不卡。
自評觸發詞
subagent副手Agentcompleted
K1Think Before CodingKarpathy
規則重點
動工前 state assumptions、不確定就問、不藏疑惑、多解釋路徑就 surface tradeoffs。
自評觸發詞
實作動手建立
K2Simplicity FirstKarpathy
規則重點
最少 code 解問題、不寫 speculative features / 抽象 / flexibility / 不必要 error handling。
自評觸發詞
flexibility擴充未來可擴展config
K3Surgical ChangesKarpathy
規則重點
只動該動的 / 不順手 improve 相鄰 code / 配合現有 style。
自評觸發詞
順手改refactorimprove清理
K4Goal-Driven ExecutionKarpathy
規則重點
定 success criteria / loop until verified、多步 task brief plan + verify each step。
自評觸發詞
目標successverify驗證

04藍圖 11 條紅線 + 觸發詞草案

R1帳號錯(個人 vs 品牌 / 草莓 vs 堡醫師)紅線
自評觸發詞
帳號登入切換個人品牌
R2對外送出沒審(email / 社群貼文 / WP publish)紅線
自評觸發詞
email貼文publish對外發送
R3機密外流(業績 / PII / 真名)紅線
自評觸發詞
業績PII真名機密個資
R4衛生法 / 仿單核准外字眼紅線
自評觸發詞
療效治療有效仿單commerce 文案
R5金錢操作擅自紅線
自評觸發詞
金錢付款退款轉帳
R6對外大規模發訊息(陌生人 / 主動 push)紅線
自評觸發詞
大規模群發push主動發
R7真假驗收(點進去沒東西 = 假)紅線
自評觸發詞
驗收self-test確認
R8時間錯誤 / 講錯時戳紅線
自評觸發詞
HH:MM幾點現在22:00晚上凌晨
R9key 沒找就說不行紅線
自評觸發詞
沒設沒裝找不到不行
R10做事前沒讀 SOP / skill紅線
自評觸發詞
動工實作開始做
R11寫記憶 / memory / blueprint 必先問紅線
自評觸發詞
寫 memory改藍圖blueprint
R12嘴答應沒做(絕對紅線、check-bait-and-stop hook 化)紅線
自評觸發詞
接下來動等下動立刻動我去做之後動

05實作教學:cortex reply 怎麼自評

原理

cortex 寫完 reply 草稿後、reply 前自動跑 self-critique 流程:

1. grep 自己 reply 草稿 → 看含哪些觸發詞
2. 對照觸發詞 → 找到對應規則
3. 對照規則 → 自評是否符合
4. 不符 → 改寫 reply
5. 符合 → 真的呼叫 reply tool

觸發詞檢查範例

假設 cortex 草稿:「接下來動 admin blact-tasks 4 view 顏色」

trigger detected: 「接下來動」→ R12 嘴答應沒做
self-check: 我這 turn 有 TaskCreate 嗎?有 spawn 嗎?有動 Bash 嗎?
verdict: 沒 → 違反 R12、改寫
rewrite: 不嘴「接下來動」、立刻 TaskCreate + 動工具

SessionStart hook(Step 2)

SessionStart 時自動 inject 提醒:

[Constitutional AI 提醒]
你 reply 前先做 self-check:
1. grep 草稿觸發詞
2. 對照 CLAUDE.md 12 條 + 藍圖 11 條紅線
3. 不符就改寫、不要嘴

06行數估算 + 建議

308
CLAUDE 現行
~350
CLAUDE 預估
~80
藍圖 現行
~100
藍圖 預估

CLAUDE.md 12 條加觸發詞、每條多 1-2 行(觸發詞清單)= +24-30 行。藍圖 11 條紅線各加觸發詞 = +20 行。

合計 100% 載入區從 ~390 → ~450 行(+60 / +15%)。仍在 best practice 上限(~500 行)內。

TRADE-OFF

cost:每 session 多 60 行 context。
benefit:cortex 每 reply 過篩、違規率預期降低。
實證後再評估值不值得。

07後續步驟

本頁是 Step 1 草案、不直接改 CLAUDE.md / 藍圖。等堡醫師審後 ack:

Constitutional AI · Step 1 草案
來源:Bai et al. 2022 Constitutional AI(arxiv 2212.08073)/ Anthropic blog
cortex 實證:1 小時 3 次違規 / CLAUDE.md 308 行 + 藍圖 ~80 行 wc -l 實測