用語集

コンテンツハッシュ重複判定

コンテンツハッシュ重複判定とは、タイトル・ファイル名・メタデータの比較ではなく、内容のハッシュ — 典型的には sha256 — で重複レコードを特定することです。バイトが一致するときだけ、2つのレコードは同じ資産です。

安いキーが失敗する理由

タイトル一致が見つけるのは候補であって、重複ではありません。実測監査では、タイトル一致による「重複」30グループのうち24グループがコンテンツハッシュで瓦解しました: 同名の別会話、埋め込みマーカーだけが違う検証プローブ、そして内容は無関係なのに出所フィールドが衝突していた行。

判定の積み重ね

全文ハッシュが第一。ヘッダを剥いだ本文の類似度が第二。出所が第三。作成時刻の間隔が第四。そして本文が空の行は分類不能です — 隔離であって、統合ではありません。

関連

この項目は untactit 用語集の一部です。定義はブログの実測記事に基づいています。

すべての用語

エージェントが何で動いているのか。推測は、もう終わり。

ワークスペースをひとつ接続するだけで、チームで動いているスキル・ルール・メモリの全体が見えます。所要はおよそ10分です。

無料で始める 相談する

クレジットカードは不要です。いまお使いのツールのままで動きます。