2,185 顆星,8.2 天。一個叫 sepia 的「去 AI 味」工具,倉庫描述寫著相容 77+ 個 agent。這種數字通常沒人查。我打開原始碼逐行數了。
一句話結論:sepia 是 MIT 授權的開源「去 AI 味」Agent Skill,它宣稱的「77+ agent」我數到剛好 77 個、引用的 StoryScope 論文 93.2% 數據屬實,但有一句關於論文的描述寫錯了。
本文所有數字為 2026 年 9 月 5 日 10:10 UTC 親自讀取,星數是時間快照,你看到時會不一樣。
sepia 是什麼?跟一般 humanizer 差在哪?
差在它動的層級。市面上的 humanizer 幾乎都在改詞和改句:刪破折號、換掉「delve」、把長句拆短。sepia 的主張是這層改完也沒用,因為真正洩底的是敘事結構:主題被旁白講白、劇情單線又太順、情緒全靠身體感覺來寫、沒有真實世界的指涉、時間線一路直走、結局靠主角想通了收尾。
所以它把處理拆成三道,順序不能倒過來:
| 順序 | 處理層 | 實際在做的事 |
|---|---|---|
| Pass 1 | 敘事架構(小說) | 停止解釋主題、鬆開因果鏈、把揭露往後放、混用情緒表達方式、點名真實事物 |
| Pass 2 | 論述流動 | 拆掉「一段一問句」的模板、修中段塌陷、調整節奏與位置 |
| Pass 3 | 表面風格 | 經典那層:陳腔濫調、句式模板、詞彙、語域 |
非小說走另一條路。發布說明、PR 回覆、事故檢討、工單、技術文章各有一份規則檔,共用一張檢查表。事故檢討那條的寫法我特別喜歡:對人無責,對機制無情。
四個操作分得很乾淨:write(新寫)、review(只診斷不改)、refactor(最小幅度就地修)、recreate(照原意重寫)。review 只出問題清單然後停手,這個克制在同類工具裡少見。
「77+ agent」是真的嗎?我逐個數了
是真的,而且剛好 77 個。
先講清楚這個數字是誰的。sepia 自己沒宣稱支援 77 個 agent,它宣稱的是「用 Skills CLI 裝,而 Skills CLI 支援 77+ 個 agent」。數字屬於第三方,也就是 Vercel 的 vercel-labs/skills(逾 3 萬星)。所以要數就得去數那邊的原始碼,而不是數 sepia。
權威來源是 src/agents.ts 裡的 agents 註冊表。我用三個彼此獨立的方式數同一份檔:
| 數法 | 結果 | 去重後 |
|---|---|---|
| 頂層鍵(縮排 2 格) | 77 | 77 |
name: 欄(縮排 4 格) | 77 | 77 |
displayName: 欄 | 77 | 77 |
三個數法完全一致,而且鍵名跟 name 逐字相同。這裡有個容易翻車的地方:如果直接抓全檔的 name: 字串,會連巢狀物件裡的 name 一起撈進來。我先做了縮排統計,確認全部 77 個 name: 都在 4 格縮排,也就是註冊表的直屬子項,才敢下結論。
然後做兩組對照,確認我的數法本身沒壞:
- 陽性對照:README 手寫點名的六個(Cursor、Cline、Windsurf、Copilot、OpenCode、goose)全部在清單內,一個不漏。
- 陰性對照:我亂編兩個名字丟進去搜,兩個都搜不到。如果連假名都能命中,那 77 這個數就沒有意義。
挑剔一點的話,第 77 個叫 Universal,是通用的兜底安裝目標而不是某個品牌的 agent。要嚴格算,是 76 個具名 agent + 1 個通用目標。「77+」的那個加號稍微樂觀了一點:目前就是 77,不多。
可以被數的宣稱,就一定會有人去數。寫「77+」而不寫「約 80 個」,等於主動把自己放上磅秤——這是加分,不是風險。
它引用的那篇論文可信嗎?
可信,我從 arXiv 官方 API 核過。arXiv:2604.03136 確實存在,標題是《StoryScope: Investigating idiosyncrasies in AI fiction》,作者 Jenna Russell、Rishanth Rajendhran、Chau Minh Pham、Mohit Iyyer、John Wieting 共五位,2026 年 4 月 3 日發布、8 月 10 日改到 v6。
README 引的關鍵數字逐項對上:
| README 說 | 論文實際 | 對不對 |
|---|---|---|
| 61,608 篇故事 | 10,272 個題目,人類加 5 個模型各寫一篇,實得 61,608 篇(滿額應為 61,632,少 24 篇),每篇約 5,000 字 | ✅ |
| 人類 + 5 個前沿 LLM | Claude、DeepSeek、Gemini、GPT、Kimi | ✅ |
| 純敘事特徵 93.2% macro-F1 | 93.2% | ✅ |
| Russell et al., 2026 | 第一作者 Jenna Russell,2026 | ✅ |
論文 Table 2 還有幾個 README 沒提、但你該知道的數:只用 39 個風格特徵是 85.8%,敘事+風格 304 個特徵是 96.0%,而最樸素的 ModernBERT 文本分類器直接 99.9%。換句話說,敘事特徵的價值不在於它最準,而在於它抗改寫。
那句寫錯的是什麼?
README 這樣寫:「在同一份研究的 LAMP 編輯條件下,人類編輯改寫了表面風格之後,偵測率只從 95.5% 掉到 93.9%。」
兩個數字完全正確,我在論文正文找到了:LAMP 編輯後 93.9%(AUPRC 0.988),未編輯 95.5%(AUPRC 0.996),落差 1.6 個百分點。但描述有兩處要修:
- 不是人類編輯改寫的。論文原文寫明「using Gemini itself as the rewriter」,改寫的是 Gemini 自己。LAMP 這套框架用了 25 個來自專業作家的少樣本範例當示範,但實際動筆的是模型。「專業作家提供範例」和「人類編輯改寫」是兩件事。
- 只測了 Gemini 一家。論文寫的是「edited Gemini stories」,不是五個模型全跑。README 說「同一份研究的 LAMP 編輯條件」,讀起來像是整個語料庫都做了,實際上是單一模型的子集。
這是誇大,但幅度很小,而且方向也還算誠實:真要灌水,寫成「人類專業編輯全力改寫都逃不掉」會更好聽。有趣的是,倉庫自己 research/storyscope.md 那份摘要反而更嚴謹,主動寫了一句 README 沒寫的限制:StoryScope 沒有測試「先改敘事架構、再改表面風格」的介入順序。而那個順序正好是 sepia 整套設計的地基。它把自己最大的未驗證假設,寫在自己的檔案裡。
最值得抄的其實不是規則,是這段 CI
如果你只看一個檔,看 .github/workflows/behavioral-eval.yml。
做過 Agent Skill 的人都知道一個沉默的失敗模式:skill 裝好了、清單看得到、零錯誤訊息,但模型根本沒叫過它。輸出跟「今天沒事做」長得一模一樣,所以沒人發現。
sepia 直接把這件事寫成測試。它的評分器裡有一個檔名就叫 skill-fired.md,內容是:
type: tool_used
tool: Skill
input_match: '"skill"\s*:\s*"(?:[\w-]+:)?sepia(?:-[\w-]+)?"'
min: 1
翻成白話:這一輪裡 Skill 工具至少要被叫到一次,而且叫的必須是 sepia。沒觸發就算失敗,不管輸出多漂亮。整個 workflow 還有三個細節值得學:
- 有對照組。每個案例跑兩條臂:載入 plugin 的,和完全不載入的基線。比的是差值,不是絕對分數。
- 鎖定模型版本。指令寫死
--model claude-sonnet-5,註解說明理由:不鎖的話模型版本更新會被誤讀成 plugin 退步。這是在控制混淆變因。 - 門檻設 0.7。註解寫「容得下一票雜訊,但擋得住壞掉的 skill」。連為什麼是這個數都交代了。
還有一個評分器 no-slop-markers.md,是一串正規表達式黑名單,命中就扣分。我把它原封不動搬進下面的自檢器了。
自己試:AI 味自檢器
把你的英文段落貼進去。黑名單是 sepia 倉庫裡那一份原文,句長離散度用的是它唯一認可的句法指標。sepia 明講:平均句長、標點數、段落長度都不當訊號,因為各研究測出來的方向互相矛盾,只有「同一段裡句長變化多大」是所有研究一致同意的。
evals/.../no-slop-markers.md(2026-09-05 讀取)。全部在你的瀏覽器計算,不上傳。怎麼安裝?
不會寫程式也能裝,只要能開終端機貼一行指令。以下都是使用者層級(裝一次,所有專案通用)。
- 任何 agent(走 Skills CLI,涵蓋那 77 個):
npx skills add Nanako0129/sepia -g,跳出來時勾選你在用的 agent。 - Claude Code:
claude plugin marketplace add Nanako0129/sepia,再claude plugin install sepia@sepia --scope user。 - Codex:
codex plugin marketplace add Nanako0129/sepia,再codex plugin add sepia@sepia。 - Grok Build:
grok plugin install Nanako0129/sepia --trust。 - Antigravity:
agy plugin install https://github.com/Nanako0129/sepia。 - 驗它有沒有真的在跑:裝完丟一段草稿叫它
/sepia-review。看到逐項診斷報告才算成功,只回一段客套的改寫=skill 沒觸發。
最後那步是我加的,不是官方步驟,但正好呼應 README 自己的免責:官方明說「Verified 的意思只是安裝完成、選單出現了;裝完之後行為符不符合文件,我們沒有逐平台檢查過。」把界線講到這麼細的開源專案不多。
誰該用、誰不該用?
| 你是 | 建議 | 理由 |
|---|---|---|
| 寫小說/長篇敘事 | 值得裝 | 敘事架構那層是它唯一有論文撐腰的部分 |
| 寫發布說明、事故檢討、工單 | 值得裝 | 分場景規則檔,比通用「改順一點」實用 |
| 只想刪掉破折號和「delve」 | 不必 | 15 個詞的黑名單自己寫就好,上面自檢器直接送你 |
| 主要寫中文 | 先觀望 | 中文校準只建在單一語料(HC3, 2023),檔案自己標明限制 |
| 要拿去交作業/規避檢測 | 不建議 | 論文裡 ModernBERT 分類器 99.9%,這條路本來就走不通 |
不用 sepia 的話,還有什麼選擇?
- 自己寫一份 SKILL.md:sepia 全部是純 markdown,把
references/讀完照自己的語域改一份,效果通常更貼身。 - 商業 AI humanizer 服務:一鍵、按月付費,但幾乎都只動表面層,也就是 StoryScope 說改了也照樣被抓的那層。
- 只做句長離散:成本最低的一招。上面自檢器的離散係數就夠你日常自查。
這件事怎麼接到你的出路?
AI 寫稿已經沒有門檻了,所以「能產出文字」不再值錢。值錢的變成兩件事:產出讀起來像人寫的,以及你能證明它是。
接案寫手把 review 報告連同稿件一起交,等於附了一份品質證明;做內容代營運的,把 no-slop-markers 那串黑名單接進交稿前的自動檢查,客戶抓到一次 slop 詞的機會就少一次。這些都不用寫程式,複製檔案就能開始。
但真正能複製到任何工作上的,是那個 CI 的思路:你以為在跑的東西,有沒有真的跑?裝好了、看得見、沒報錯,跟「它今天做了事」是三件不同的事。sepia 用一個 min: 1 把這條線劃出來。你手上的自動化流程,有幾條有這種檢查?
常見問題
sepia 免費嗎?有沒有隱藏收費?
免費,MIT 授權(Copyright 2026 Nanako Tsai),不用註冊帳號。作者放了 Patreon 贊助連結,屬於自願支持,不影響功能。順帶一提,這點跟今天另一個爆紅倉庫 PRAXIST 差很遠,那個掛的是 Fair Source,年營收過百萬美元免費授權就自動失效。開源不開源,一定要自己開 LICENSE 檔看,openclaude 那次也是同樣的教訓。
用了就能騙過 AI 檢測器嗎?
不能,而且它自己也沒這樣宣稱。同一篇 StoryScope 論文裡,ModernBERT 文本分類器對未編輯故事的偵測率是 99.9%。sepia 的目標是讀起來像人寫的,不是規避檢測——這兩件事在論文數據上根本不是同一回事。
中文寫作能用嗎?
能,處理中文時會自動載入 references/languages/zh.md。但那份校準只建立在 HC3(2023)這一個中文語料上,檔案裡自己把限制寫清楚了。當參考可以,別當定論。
規則全套下去會不會反而更假?
會,而且這是它寫在原則裡的第一條:校準到人類的分布,不要把 AI 的分布倒過來。人類落在中間值;一篇每條規則都套滿的稿,本身就變成一個新指紋。所以它一篇只挑 3 到 5 個動作,其餘留白。修改比例也有數:替換 74%、刪除 18%、新增只佔 8%。
它跟 Agent Skills 生態的其他 skill 怎麼比?
它勝在有論文地基和 CI 驗證,這兩樣在生態裡都算少數。如果想先摸清整個 Agent Skills 生態有多大、SKILL.md 該怎麼數,可以看這篇數 SKILL.md 的方法拆解,或是生態盤點那篇。
三分鐘行動清單
- ☐ 把上面自檢器那 15 個 slop 詞存成你自己的交稿前檢查表
- ☐ 貼一段你最近的英文草稿進自檢器,看離散係數落在哪
- ☐ 真的要用就
npx skills add Nanako0129/sepia -g,然後一定要驗它有沒有觸發 - ☐ 先跑
/sepia-review(只診斷),看得懂它的判斷再讓它動手改 - ☐ 開一次
research/資料夾,就算不裝,那 8 份論文摘要本身就有價值
參考來源
- GitHub:Nanako0129/sepia(README、LICENSE、evals、workflow 全部一手讀取,2026-09-05 10:10 UTC)
- agent 數量權威來源:vercel-labs/skills
src/agents.ts - 論文:arXiv:2604.03136 StoryScope(Russell et al., 2026),數據取自官方 API 與 v6 全文
利益揭露與免責:本文與 sepia 作者、Vercel、arXiv 論文作者均無任何合作或金錢關係,沒有收取任何報酬。所有數字為 2026 年 9 月 5 日 10:10 UTC 親自讀取;星數與 agent 數量都是時間快照,會變動,請以官方倉庫當下狀態為準。本文為技術工具評測,不構成任何投資建議。




發表迴響