要讓 AI 變強,你以為只有一條路:花錢 fine-tune、租 GPU、動模型權重。微軟這次開源的 SkillOpt 走了另一條——它一個權重都不碰。
一句話結論:SkillOpt 是微軟開源的「AI 技能訓練器」,把 agent 的 skill.md 檔當成可訓練的權重,用類似訓練神經網絡的方式反覆改寫、驗證、擇優,不動模型本體。實測在 GPT-5.5 上把平均正確率拉高 23.5 分,還附一個能在你收工後自己進化技能的「夜間引擎」。想省 fine-tune 成本、又要 agent 更聰明的人值得裝。
截至 2026 年 7 月:SkillOpt 於 GitHub 突破 12,000 星,最新版 v0.2.0(2026-07-02)已上 PyPI。以下數據以官方 repo 與論文(arXiv:2605.23904)為準。
SkillOpt 到底是什麼?
SkillOpt 是一個「文字空間的優化器」。翻成人話:它幫你的 AI agent 寫、改、練那份 skill.md(也就是你給 AI 的技能說明書),練到它在某類任務上表現最好,然後把成果存成一份精簡的 best_skill.md。
關鍵在於它的思路很反直覺。現在市面上的 agent 技能,來源不外乎三種:工程師手寫、丟給一個強模型一次生成、或者讓 AI 鬆散地自我修改。這三種都有同一個毛病:沒有一個像深度學習那樣,能在回饋下穩定地「一次比一次好」。SkillOpt 做的事,就是把訓練神經網絡那套紀律(epoch、batch size、learning rate、驗證集把關)整包搬到技能檔上面。模型本身凍結不動,被訓練的是那份文件。
你可以把它想成:模型是不會變的引擎,skill.md 是你不斷微調的賽車設定表。SkillOpt 就是那個一圈一圈幫你調設定、還會把調壞的版本丟掉的技師。
它跟 fine-tune、手寫 skill 差在哪?
差在「動的是什麼、花的是什麼」。fine-tune 動的是模型權重,要 GPU、要資料、部署後每次推理成本也可能變高;SkillOpt 只動一份文字檔,部署時對模型的額外呼叫是零。下面這張表一眼看完四種做法的取捨。
| 做法 | 動到模型權重? | 要 GPU? | 部署後推理成本 | 會不會穩定變好 |
|---|---|---|---|---|
| SkillOpt | 否(只改 skill.md) | 否 | 零額外呼叫 | 有驗證集把關,只收更好的版本 |
| Fine-tune / LoRA | 是 | 是 | 可能上升 | 看資料與調參,成本高 |
| 手寫 skill | 否 | 否 | 零額外呼叫 | 靠人腦,難量化、難複現 |
| 一次性 LLM 生成 skill | 否 | 否 | 零額外呼叫 | 一次定生死,不保證比初版好 |
我的看法很直接:如果你要的是「特定任務上更聽話、更準」,SkillOpt 的性價比明顯贏 fine-tune,省掉整套 GPU 與資料工程,改的又是人看得懂的文字檔,出問題你自己都能讀。fine-tune 依然有它的位置(要改模型底層行為、風格、知識),但那是另一個層級的投入了。
它是怎麼「訓練」一份技能檔的?
核心是一個閉環:rollout(讓 agent 跑任務)→ reflect(反思哪裡做得好或差)→ aggregate(彙整)→ select(挑出值得改的地方)→ update(對 skill.md 做有界的新增/刪除/替換)→ evaluate(用留出的驗證集打分)。
三個設計讓它不會像一般「AI 自己改自己」那樣越改越亂:
- 驗證集把關(validation gate):一個候選修改,只有在留出的驗證分數「嚴格變高」時才會被接受。變差就丟。
- 文字版的 learning rate:每輪能改多少有預算上限,避免一次大改把好東西改沒了。
- 被拒緩衝區 + 慢更新:被打回的修改會被記住,配合 epoch 級的慢速/meta 更新,讓整個過程穩定、可複現。
最後產出的 best_skill.md 通常只有 300 到 2,000 個 token,很輕,直接掛在你原本那顆沒動過的模型上就能跑。
效果到底有多強?
官方在六個 benchmark、七個目標模型、三種執行環境(直接聊天、Codex CLI、Claude Code CLI)下測試,總共 52 個「模型 × benchmark × 環境」格子,SkillOpt 全部拿到最佳或並列最佳。這個「52 格全勝」是我覺得最硬的一組數字,因為它不是挑一個好看的場景報喜。
| 在 GPT-5.5 上的提升(相對無技能) | 幅度 |
|---|---|
| 直接聊天 | +23.5 分 |
| Codex 代理迴圈內 | +24.8 分 |
| Claude Code 內 | +19.1 分 |
更值錢的一點是「遷移性」:練好的技能檔可以跨模型規模、在 Codex 和 Claude Code 之間互換、甚至搬到相近的 benchmark 上,不用重練。也就是說你花一次力氣調出來的技能,不是綁死在某一顆模型上的一次性資產。
「夜間自我進化」SkillOpt-Sleep 是什麼?
這是 v0.2.0(2026-07-02)的招牌功能,名字就叫 SkillOpt-Sleep——一個離線的「夜間自我進化引擎」。概念借了人睡覺鞏固記憶的比喻:白天 agent 做事留下軌跡,晚上它收工,SkillOpt-Sleep 就做四件事:harvest(收割當天的任務記錄)、mine(挖出反覆出現的模式)、replay(重演這些任務)、consolidate(把驗證過的技能固化下來)。
它還加了多目標獎勵、經驗回放加「夢境推演」(dream rollouts),以及長期記憶,整包做成 skillopt-sleep 這個命令列工具。白話說:你設好之後,AI 會在你不看它的時候,自己把技能檔練得更好,隔天上工就變聰明了一點,而且所有進化一樣要通過留出驗證集才算數,不是亂長。
同一版本還補了跨工具後端,替 Claude、Codex、Copilot、Devin、OpenClaw 都做了外掛殼,Windows 相容性和 JSON 解析也加固了。對非工程師來說,重點是:你常用的那些 coding agent,SkillOpt 基本都接得上。
不會寫程式,怎麼快速上手?
SkillOpt 本身是 Python 命令列工具,門檻在於「你要有一個能打分的任務環境」,但基本流程不難,照著走就有感覺:
- 安裝:一行
pip install skillopt就裝好(要跑監控面板再加pip install -e ".[webui]")。 - 接後端:選你的模型後端,內建支援 OpenAI/Azure/Claude/Qwen/MiniMax,以及 Codex、Claude Code 這類執行環境。
- 準備任務:放一個 benchmark 資料夾(含一份初始的
initial.md種子技能),讓它有題目可練、有分可打。 - 開練:跑訓練迴圈,SkillOpt 會一輪一輪改技能檔、用驗證集擇優。
- 部署:拿產出的
best_skill.md掛回你原本的模型就能用。想讓它晚上自己進化,再掛上skillopt-sleep。
如果你完全不寫程式,這步驟目前確實需要一點 CLI 基礎;但你至少該知道它存在,因為接下來很多「AI 產品變聰明」的背後,靠的就是這種訓練技能檔、而非重訓模型的做法。
SkillOpt 適合你嗎?(互動決策器)
學會這個,能怎麼幫你賺錢或省錢?
這是我最想跟你講的一段。SkillOpt 表面是工程師工具,但它背後的邏輯,對想靠 AI 找出路的人很實際:
- 省成本:要讓 agent 在你的業務場景更準,過去第一反應是 fine-tune,動輒 GPU 與資料成本。用訓練技能檔的路子,你把錢省下來、把可控性拿回來。
- 做接案 / 產品:幫中小企做「客服 agent」「報表 agent」的人,最大痛點是通用模型不夠貼業務。一份針對客戶場景練出來的
best_skill.md,就是你能交付、又能重複賣的資產。 - 建立門檻:手寫 prompt 誰都會抄,但一套「有評分、可複現、會自我進化」的技能訓練流程,才是別人短時間學不走的東西。
AI 讓工具變便宜,真正稀缺的是「把工具調到剛好解決某個具體問題」的能力。SkillOpt 正好把這件事變得可量化、可複製,這對想接案、做副業的人,比多學十個新工具還有用。
它有什麼限制?不適合誰?
講完好話也要講限制,不然就變業配了。SkillOpt 有三個現實門檻:
- 你得有「打分」的辦法。它靠驗證集分數決定要不要收一個修改,任務必須能被自動評對錯。純創意、無標準答案的工作,它不好使力。
- 訓練期間有 API 成本。部署時零額外呼叫是真的,但「練」的過程要一個 optimizer 模型反覆跑,這段是要花錢和時間的。
- 目前是 CLI / Python 導向。雖然有 WebUI 監控面板,但整體還是給開發者用的,零基礎的人得跨一點門檻。
替代方案(不喜歡 SkillOpt 可以看):只想要現成技能、不想自己練,去翻 agent-skills 這類手寫技能合集抄一份改;想要「會自己學、還會記住你」的完整 agent 產品,看 Hermes 這類自進化 agent;要改的是模型本身的行為與知識,那就老老實實 fine-tune,別繞路。
常見問題 FAQ
Q:SkillOpt 免費嗎?
是。它是微軟開源專案,程式碼在 GitHub、套件在 PyPI,pip install skillopt 即可。真正會花錢的是訓練期間呼叫模型的 API 費用。
Q:它會改到我的模型嗎?
不會。它只改 skill.md 技能檔,模型權重完全不動,部署時對模型也沒有額外呼叫。
Q:它跟一般「讓 AI 自己改 prompt」有何不同?
差在有紀律。它有驗證集把關(改壞就丟)、文字版 learning rate(一次不能亂改太多)、被拒緩衝區,所以能穩定變好、可複現,而不是越改越飄。
Q:練好的技能只能給同一顆模型用嗎?
不是。官方說技能檔能跨模型規模、在 Codex 與 Claude Code 之間互換,還能搬到相近任務,不必重練。
Q:「夜間自我進化」安全嗎,會不會越練越壞?
SkillOpt-Sleep 的每一次進化一樣要通過留出驗證集才算數,沒有變好就不收,所以不會無限制亂長。
三分鐘行動清單
- ☐ 先想清楚:你要練的任務,能不能自動判定對錯?(不能就先做這步)
- ☐
pip install skillopt,跑一次內建 benchmark 感受流程。 - ☐ 換成你自己的任務,放一份
initial.md種子技能開練。 - ☐ 拿
best_skill.md掛回你日常用的 Claude Code / Codex 試效果。 - ☐ 有感之後,掛上
skillopt-sleep讓它晚上自己進化。
延伸閱讀:想看另一種「會自己學、越用越聰明」的 AI,讀我們寫過的 Hermes Agent 自進化 AI;想讓 AI 一句話做完全網調研,看 last30days 調研技能;想幫 AI 省 token、裝上記憶,看 codebase-memory-mcp。
利益揭露:本文介紹的 SkillOpt 為微軟開源免費專案,本站無任何返佣或利益關係。文中數據引自官方 GitHub repo 與論文(arXiv:2605.23904),AI 工具更新快,實際功能與版本以官方為準(截至 2026 年 7 月)。本文為技術資訊分享,非投資或財務建議。
延伸閱讀:完整的 GitHub 熱門開源 AI 專案精選,20+ 個開源工具依用途分類收藏、持續更新。






發表迴響