把資產庫按標題分組,找到了 30 組「重複」。用內容雜湊重新判定後,其中 24 組當場瓦解。真正的重複只有 5 組。還有 1 組無法判定——因為那些列裡根本沒有內容。
對象是從多個平台蒐集的 AI 代理資產庫(對話、技能、記憶、指令檔案)。數字來自 2026-08-19 的一次即時稽核。
30 組來自標題完全一致。用它「找候選」沒問題,用它「下結論」是災難。每一組我們改用四個軸來判定:
30 組的實際構成如下。
同一內容進庫兩次。原因都很平淡:同一資產以底線 slug 和連字號 slug 重複註冊;同一條記憶以英文鍵和在地化鍵存了兩遍。真正的重複是無聊的——而這正是重點:可以安全折疊的,只有無聊的列。
兩段同名對話,建立間隔 45 天,內文相似度 8%。一個 213KB 的討論串和一個 27KB 的討論串只共享名字。還有一對相似度 85%、間隔十個月——幾乎可以肯定是有人把舊對話貼進去接著寫。那是兩份資產,不是一份。在這裡折疊,歷史就沒了。標題重用是人類的正常行為,不是資料損壞。
為測試管線而寫入的合成資產,彼此只差一個內嵌標記。來自不同執行的兩個探針,在任何模糊匹配器眼裡都是重複。但它們是兩個獨立「事件」,折疊就抹掉了其中一次執行的紀錄。如果你的系統會把測試產物寫進真實儲存,去重邏輯就必須認識探針長什麼樣。
最古怪的發現:內文完全為空——只有標頭的列。標題和真實資產相同,內容沒有。全部產生於同一天約 8.7 分鐘的視窗內,一個標題最多 5 份拷貝,間隔數秒。
這不是重複問題,是寫入路徑事故的化石紀錄。教訓是——當你手裡唯一的證據是「缺失」時,你無法分類。這些列該去的地方是隔離區,不是合併佇列。
三對內容完全無關的列,共享同一個來源引用。任何只信來源就判「已蒐集、跳過」的管線,都會悄悄丟掉真實資產。我們能發現,是因為內容雜湊和來源欄位吵了起來。兩個訊號互相爭執——這正是稽核存在的意義。
| 判定 | 組數 | 安全處置 |
|---|---|---|
| 真正的重複(位元組相同) | 5 | 歸檔其中一份 |
| 同名的不同資產 | 6 | 兩份都保留 |
| 獨立的測試探針 | 7 | 都保留,打探針標籤 |
| 空殼列 | 4(12列) | 隔離,調查寫入方 |
| 來源引用衝突 | 3對 | 回源重新驗證 |
看起來像重複的東西,八成不是重複。反過來也成立——按標題「零重複」的庫,可能裝滿了不同名字的相同內容。兩種錯誤同根同源:用最便宜的鑰匙去判定同一性。
*來自 untactit——統一管理 AI 代理技能、規則與記憶的控制平面(尚未正式發布)——的開發筆記。跨平台的資產同一性正是這個產品的本業:內容雜湊+來源+回讀驗證,絕不單憑標題判定。*