部落格

30組「重複」裡,24組根本不是重複

2026年8月19日untactit

把資產庫按標題分組,找到了 30 組「重複」。用內容雜湊重新判定後,其中 24 組當場瓦解。真正的重複只有 5 組。還有 1 組無法判定——因為那些列裡根本沒有內容。

對象是從多個平台蒐集的 AI 代理資產庫(對話、技能、記憶、指令檔案)。數字來自 2026-08-19 的一次即時稽核。

標題匹配是分組的鑰匙,不是判定

30 組來自標題完全一致。用它「找候選」沒問題,用它「下結論」是災難。每一組我們改用四個軸來判定:

  1. 全文 sha256——位元組級相同,討論結束
  2. 剝掉標頭後內文的相似度
  3. 來源(provenance)——哪個系統聲稱寫入了這列
  4. 建立時間間隔——差幾秒和差幾個月是兩回事

30 組的實際構成如下。

5組:真正的重複

同一內容進庫兩次。原因都很平淡:同一資產以底線 slug 和連字號 slug 重複註冊;同一條記憶以英文鍵和在地化鍵存了兩遍。真正的重複是無聊的——而這正是重點:可以安全折疊的,只有無聊的列。

6組:同名的不同資產

兩段同名對話,建立間隔 45 天,內文相似度 8%。一個 213KB 的討論串和一個 27KB 的討論串只共享名字。還有一對相似度 85%、間隔十個月——幾乎可以肯定是有人把舊對話貼進去接著寫。那是兩份資產,不是一份。在這裡折疊,歷史就沒了。標題重用是人類的正常行為,不是資料損壞。

7組:長得像雙胞胎的驗證探針

為測試管線而寫入的合成資產,彼此只差一個內嵌標記。來自不同執行的兩個探針,在任何模糊匹配器眼裡都是重複。但它們是兩個獨立「事件」,折疊就抹掉了其中一次執行的紀錄。如果你的系統會把測試產物寫進真實儲存,去重邏輯就必須認識探針長什麼樣。

4組12列:沒有可判定的東西

最古怪的發現:內文完全為空——只有標頭的列。標題和真實資產相同,內容沒有。全部產生於同一天約 8.7 分鐘的視窗內,一個標題最多 5 份拷貝,間隔數秒。

這不是重複問題,是寫入路徑事故的化石紀錄。教訓是——當你手裡唯一的證據是「缺失」時,你無法分類。這些列該去的地方是隔離區,不是合併佇列。

來源欄位也在說謊

三對內容完全無關的列,共享同一個來源引用。任何只信來源就判「已蒐集、跳過」的管線,都會悄悄丟掉真實資產。我們能發現,是因為內容雜湊和來源欄位吵了起來。兩個訊號互相爭執——這正是稽核存在的意義。

記分板

判定組數安全處置
真正的重複(位元組相同)5歸檔其中一份
同名的不同資產6兩份都保留
獨立的測試探針7都保留,打探針標籤
空殼列4(12列)隔離,調查寫入方
來源引用衝突3對回源重新驗證

看起來像重複的東西,八成不是重複。反過來也成立——按標題「零重複」的庫,可能裝滿了不同名字的相同內容。兩種錯誤同根同源:用最便宜的鑰匙去判定同一性。


*來自 untactit——統一管理 AI 代理技能、規則與記憶的控制平面(尚未正式發布)——的開發筆記。跨平台的資產同一性正是這個產品的本業:內容雜湊+來源+回讀驗證,絕不單憑標題判定。*

相關文章

你的代理在跑什麼,不必再用猜的。

連接一個工作區,大約十分鐘,團隊實際在用的每一項技能、規則與記憶就全部看得到。

免費開始 與我們談談

免信用卡,直接搭配你現有的工具。