最後更新:2026 年 8 月 21 日

同一個模型,同一套題目。先考 13.3 分,再考 38.3 分。中間沒換模型,沒重新訓練。只改了兩個設定。

一句話結論:Codex harness 是 OpenAI 開源的 agent 執行引擎,負責管記憶、叫工具、要你批准、把工作接下去。它決定同一個模型能發揮多少:官方實測在 ARC-AGI-3 上把分數從 13.3% 拉到 38.3%,輸出 token 少 6 倍。

2026 年 8 月 19 日,OpenAI 開發者部落格發了一篇叫〈Codex as a platform〉的文章。標題直白,內容其實是一次定位轉向:Codex 不再只被當成「寫 code 的助理」,而是被當成一個任何軟體都能嵌進去的 agent 引擎。

這篇把這件事拆給不寫程式的人看:harness 到底是什麼、為什麼它能讓同一個模型差三倍、OpenAI 開源了哪部分(又刻意留住哪部分),還有已經有人拿它做了什麼非程式的工作。

Codex harness 是什麼?

Codex harness 是包在模型外面那層執行系統。模型只負責「想」,harness 負責其他全部:把任務講清楚、把上下文留住、把工具遞過去、在危險動作前停下來問你、然後把結果接回系統。

用一個比喻:模型是廚師,harness 是整個廚房。同一個廚師,在有冰箱、有備料檯、有出餐窗口的廚房,跟在只有一塊砧板的角落,做出來的東西不會一樣。

誰負責什麼模型harness
推理、生成答案
記住前幾輪講過什麼
決定能碰哪些檔案 / 工具
危險動作前要人批准
對話太長時壓縮上下文
把結果寫回你的系統

你平常用的 Codex App、CLI、IDE 外掛,底下跑的都是同一套 harness。OpenAI 這次要講的是:這層東西是開源的,你可以直接拿去包自己的產品,不用重寫一個。

為什麼同一個模型,分數會差三倍?

因為 harness 決定模型「記得多少」。這不是推論,OpenAI 在 2026 年 7 月 29 日的一篇技術文裡把數字攤開了。

事情起於 ARC-AGI-3,一個讓 AI 玩陌生 2D 益智遊戲、看它能不能自己摸清規則的評測。GPT-5.6 Sol 在上面分數低得反常。OpenAI 去翻紀錄,發現問題出在評測用的那套通用 harness 有兩個設定:

  1. 每走一步就把模型的私有推理丟掉。模型看得到自己上一步做了什麼,卻看不到當時「為什麼這樣做」。等於每一步都重新認識這個遊戲一次。
  2. 上下文滿了就從最舊的開始砍。歷史一長,早期的觀察直接消失,連做過什麼都忘了。

OpenAI 換成自己產品在用的兩個設定,保留推理(retained reasoning)加上上下文壓縮(compaction),重跑同一套題。

設定ARC-AGI-3 公開題組分數輸出 token
官方通用 harness13.3%基準
保留推理 + 壓縮38.3%少約 6 倍
(人類測試者估計平均)約 48%

分數約三倍,成本反而降。這裡有兩件事值得記住。

第一,38.3% 仍然輸給人類的 48%。這不是「AI 超車」的故事,是「量測工具本身會影響量測結果」的故事。OpenAI 自己在結論寫得很坦白:評測很少只在量模型,它同時在量一堆看不見的設定選擇。

第二,這個發現對你有直接用處。下次看到「某模型在某榜單只拿幾分」,先問一句:那套 harness 有沒有讓它記住自己想過什麼。榜單分數低,有時候是廚房的問題,不是廚師的問題。

ARC 用通用 harness 是有道理的:不給工具、不給特殊功能,模型的短處才藏不住,比較才公平。商業開發者則相反,會照每個模型的脾氣去調 harness。兩邊都沒錯,只是量的東西不一樣。

OpenAI 到底開源了什麼?沒開源什麼?

開源的是外殼,不是腦。這句要講清楚,因為網路上很多人把它寫成「OpenAI 開源了 Codex」,那是錯的。

項目開源?說明
Codex CLI✅ 是命令列介面
Codex app-server✅ 是讓應用程式接進來的協定層
官方 Codex SDK✅ 是程式化呼叫介面
模型本身(GPT-5.6 等)❌ 否要透過 API,照用量付費
託管服務(雲端執行等)❌ 否OpenAI 自己營運

OpenAI 官方原話是:開源的那層是 harness 和整合面,模型存取與託管服務維持分開。翻成白話:引擎室的圖紙給你,燃料還是要跟他們買。

這個切法對誰有利?對想把 agent 塞進自家產品、又不想被介面綁死的團隊有利。你可以檢查這層在做什麼、改它、審它,不必接受「所有互動都塞進一個聊天框」的預設。對 OpenAI 也有利:越多產品用它的 harness,越多 token 從它的 API 走。

三個整合層,你該用哪一個?

OpenAI 給了三條路,差別在「要不要留住對話」跟「agent 是不是產品的一部分」。

整合層適合對話狀態典型場景
codex exec跑完就算的任務不保留排程腳本、CI 檢查、每日報表
Codex SDK自己程式裡呼叫可續接後端服務、自動化流程
Codex app-serveragent 就是產品本體長期保持儀表板內嵌助理、需要批准關卡的系統
🧭 Codex 整合層選擇器
回答三題,告訴你該從哪一層下手。
1. 這個 agent 要做什麼?
2. 需要留住對話、即時看到進度嗎?
3. 有沒有「動手前先問人」的關卡?

有人真的拿它做非程式的工作嗎?

有,而且是報稅。這是目前公開資料裡細節最完整的一個案例,但時間要先講清楚。這件事 OpenAI 是在 2026 年 5 月 27 日公布的,不是最近才發生。8 月那篇平台文只是把它拿回來當例子引用。

案子由 Thrive Holdings 和 OpenAI 的工程師合作了半年,服務對象是 Crete 旗下 30 多家會計師事務所。

項目官方數字
試點處理報稅表7,000 份(主要是 1040、1041)
準備時間省下約三分之一
草稿準確率最高達 97%
處理量提升約 50%
原本人工作業中大型複雜案件,光資料輸入每份約 8 小時

更值得看的是準確率怎麼爬上去的。剛上線時,只有四分之一的報稅表能做到 75% 欄位正確;六週後,86% 都達標。中間沒有換模型。做法是把會計師每一次的手動修正變成結構化證據,再讓 Codex 拿這些證據去跑評測、改程式、送出待審的修改。

官方文章結尾有一段個案:一位資深會計師去年花 180 小時做報稅,今年只花 15 小時。省下的時間她拿去打電話給每一個客戶、逐份講解,還接了新客戶。

這是個案,不是平均值。官方給的平均是「省約三分之一準備時間」。看到 180 變 15 就換算成「AI 省你 92% 工時」,是自己給自己畫大餅。

其他公開案例還有:GitHub 和 JetBrains 把 Codex 接進 IDE 工作流;Cisco 在 Cloud Control 的 App Builder 裡用 Codex SDK。OpenAI 也點名了支援、營運、資安、業務、行銷這些方向,但那部分目前是「同一套模式適用」的說法,還沒有像報稅這樣的公開數字。

這篇最容易被寫錯的四件事

這題材在中文圈已經開始傳走樣,先把界線標出來:

  • 「OpenAI 開源了 Codex」:開源的是 harness、CLI、SDK、app-server,模型和託管服務沒有。
  • 「報稅業已被 AI 取代」:那是一個試點,7,000 份,範圍在 1040 和 1041,而且會計師仍然要複核、要簽字。官方明講:工程師負責架構與出貨,會計師負責把關。
  • 「成本降三分之一」:省的是準備時間,不是成本,也不是人力編制。
  • 「Codex 在 benchmark 贏了人類」:38.3% 對人類約 48%,還輸。翻三倍的是它自己的前後對比。

不用 Codex 還有什麼選擇?

harness 這層現在是兵家必爭,Codex 不是唯一解。

方案特點什麼時候選它
Codex harness官方開源、三層整合齊全、綁 OpenAI 模型已經在用 OpenAI API,要嵌進產品
自建 harness完全掌控,但記憶、批准、壓縮全部自己寫需求很特殊,或不想綁單一供應商
其他開源 harness多半綁定各自的模型生態你的模型不在 OpenAI 這邊

提醒一句:無論選哪個,「保留推理」和「上下文壓縮」這兩件事都要確認做了沒有。ARC-AGI-3 那組數字證明,這兩個設定的影響大過很多人以為的模型差距。

不寫程式的人,能從這裡拿到什麼?

報稅案例真正的重點不是報稅,是它示範了一種可複製的結構。拆開來看只有三步:

  1. 找一個「每次都差不多、但每次都要重做」的流程。報稅的資料輸入就是這種。你手上可能是每月對帳、整理客戶資料、把報價填進固定表格。
  2. 讓每一次修正都留下痕跡。這是整個案子最關鍵的一步。重點不在讓 AI 一次做對,而在讓它每次做錯都被記下來,變成下次的教材。
  3. 把重複出現的錯誤變成明確的改進目標。偶爾出錯不用管,同一個地方錯三次才值得動手。

這三步不需要你會寫程式,需要的是你說得出自己的流程哪裡最花時間、哪裡最常出錯。能把流程講清楚的人,在這一輪比會打字的人值錢。

從變現角度看,這裡有一條很實際的縫:多數中小企業有一堆「每次都差不多」的流程,但沒人有空把它寫下來。幫他們梳理流程、標出可自動化的環節、再接上現成的 agent 工具。這件事的門檻不在技術,在耐心。願意做的人不多,這就是空間。

新手行動清單

  • ☐ 先確認你在用的 AI 工具有沒有「記住上一輪推理」,這比換模型更影響結果
  • ☐ 對話一長就開新視窗?先找找有沒有上下文壓縮的設定
  • ☐ 列出手上三個最重複的流程,標出每個每週花幾小時
  • ☐ 挑最花時間的那個,記錄一週:AI 做到哪一步、你補了什麼
  • ☐ 一週後看那份記錄。重複出現三次以上的錯誤,才是值得處理的目標
  • ☐ 真的要嵌進產品,用上面的選擇器決定從哪一層下手

常見問題

Codex harness 免費嗎?

harness 本身是開源的,可以免費取用和修改。但它要接 OpenAI 的模型才能跑,模型呼叫按 API 用量付費。所以「工具免費、油錢自付」。實際費率以官網為準(截至 2026 年 8 月)。

不會寫程式,能用 Codex harness 嗎?

直接接 harness 需要開發能力。但你可以用 Codex App、CLI 或 IDE 外掛,它們底下跑的就是同一套 harness,等於是已經包好的成品。這篇講的是引擎,你平常開的是車。

「保留推理」和「上下文壓縮」差在哪?

保留推理是讓模型看得到自己上一輪「為什麼這樣想」,不只是「做了什麼」。上下文壓縮是對話太長時把舊內容摘要保留,而不是從最舊的直接砍掉。前者管品質,後者管記憶不斷片。ARC-AGI-3 的三倍差距,是兩個一起開出來的。

Codex 真的能取代會計師嗎?

就公開資料看,不能。試點裡會計師負責複核、修正、簽署最終申報,而且他們的修正正是系統改進的燃料。變的是工作內容:資料輸入的比重下降,判斷和客戶溝通的比重上升。

Codex harness 和一般的 AI API 差在哪?

直接呼叫 API 是「送一段話、收一段話」,記憶、工具、權限、批准全部要自己實作。harness 已經把這些做好了,你只要決定要開放哪些工具、哪些動作需要人批准。

延伸閱讀

參考資料

本文為資訊整理,非投資或商業建議。文中數據引自 OpenAI 官方部落格,各項功能與定價以官網最新公告為準(截至 2026 年 8 月)。文中未含任何返佣或聯盟連結。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

Trending

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash