一隻機械手伸向麻將桌,指尖碰到牌面,停了一下,然後把牌翻過來排好。整個過程,鏡頭其實看不到最關鍵的那一格——牌被夾住的那一瞬間,力道到底夠不夠。

一句話結論:T-Rex 觸覺機器人是 UC Berkeley、NVIDIA、Stanford 等六個機構開源的觸覺操作框架,靠「慢動作規劃 + 快觸覺修正」雙時鐘架構,把 12 項精細任務的平均成功率從最強對手的 35% 拉到 65%,程式碼 MIT 授權、約 50 小時數據已公開。

這篇文章拆三件事:它到底解決了什麼過去解不掉的問題、實測數字有多少水分、以及「開源」這兩個字在這裡的實際含金量。(資料截至 2026 年 8 月,全部取自論文、專案頁與 GitHub 官方 repo。)

機器人明明看得見,為什麼還是笨手笨腳?

差在它只有「眼」,沒有「手感」。

現在主流的機器人模型叫 VLA(Vision-Language-Action,視覺-語言-動作模型),運作方式是看畫面、理解指令、輸出動作。這套在「把杯放到桌上」這種粗活很夠用,但一碰到需要拿捏力度的事就露餡。

原因很物理:接觸發生的那一刻,力的變化比畫面更新快得多。等鏡頭拍到雞蛋已經裂了,蛋殼早就碎了。人類做這些事根本不靠看。你從一疊紙裡抽一張、把燈泡旋進燈座、隔著口袋摸出鑰匙,眼睛全程沒幫上什麼忙。

研究圈當然知道這件事。問題是過去的做法多半是「在原本的模型旁邊掛一個觸覺編碼器」,把觸覺當成一張靜態快照餵進去。T-Rex 團隊在論文裡直接點名這個做法的三個死結:訓練資料太少、模型架構塞不下高頻訊號、靜態編碼器抓不到力的變化過程。

T-Rex 做了什麼不一樣的事?

它讓模型跑兩個速度不同的時鐘,而不是把觸覺硬塞進同一條流水線。

架構叫「非同步混合專家 Transformer」(Asynchronous Mixture-of-Transformers,MoT),建在 Qwen3-VL-2B 這個視覺語言模型上,裡面拆成三個專家:

  • latent 專家——負責理解與推理,想清楚「現在要幹嘛」。
  • action 專家——負責生成動作,跑得慢,大約每秒 5 次。
  • tactile 專家——負責摸完之後修正動作,跑得快,大約每秒 20 次。

關鍵在 5 Hz 和 20 Hz 這個比例:規劃跑一拍,觸覺就補四拍。也就是說,機器人在「這一段動作還沒做完」的中途就能根據手感修正,而不需要重跑一次視覺辨識。兩者靠一種叫 cascaded flow matching 的機制串起來。

用開車類比:舊做法是每次微調方向盤都要先重看一次後視鏡;T-Rex 是眼睛看路的節奏不變,但手一直搭在方向盤上做細部修正。

另一半功勞在資料。團隊收了 100 小時的觸覺資料集,用的是雙臂 Dexmate Vega-1 機器人配兩隻 Sharpa Wave 靈巧手,十根指尖各有一個影像式觸覺感測器,記錄原始灰階影像、形變圖,以及六維力與力矩。資料收集方式也不是隨機亂錄,而是刻意優先錄「基本動作單元」:22 種基礎動作、200 多種物件、7,700 多條軌跡。

成功率從 35% 到 65%,這個數字有多實在?

比想像中實在,因為它是絕對百分點,不是相對增幅,而且每格都跑了 16 次評測取平均。

12 項任務全部是真機實測,包括翻書頁、傳雞蛋、抹碟、擠牙膏、分紙杯、分麻將、開鎖、補藥丸、酸鹼中和、抽卡、發撲克、旋燈泡。下面是完整對照表:

模型翻書頁傳雞蛋分麻將開鎖旋燈泡12 項平均
ViTacFormer907013
RDP1289276
π0.5 + 觸覺8914206
Tactile-VLA38142781815
π0.536173251117
EgoScale684436191835
T-Rex967565473565
單位為成功率 %,每格為 16 次評測平均。資料來源:T-Rex 官方專案頁。

這張表最值得看的不是 T-Rex 那一行,而是倒數第三行。

π0.5 本身平均 17 分,加了觸覺之後掉到 6 分。多給模型一種感官,表現反而砍掉三分之二。翻書頁從 36 掉到 8,旋燈泡直接歸零。

這件事比 65 分更有資訊量。它說明觸覺不是加了就有用的配件。用錯方式塞進去,高頻訊號會變成雜訊,把原本靠視覺運作得好好的部分一起拖垮。整篇論文的價值其實在這裡:不是證明「觸覺有用」,而是證明「觸覺要用對節奏才有用」。

哪些任務它其實還沒解決?

旋燈泡和補藥丸這兩項,它離堪用還很遠。

旋燈泡 35 分、補藥丸 41 分、發撲克 57 分。換句話說,最難的那幾項有一半以上的嘗試是失敗的。旋燈泡尤其尷尬,35 分只比 EgoScale 的 18 分好一倍,卻遠低於它自己在翻書頁的 96 分。

共通點是這些任務需要「持續旋轉 + 對準螺紋 + 感知阻力變化」的長時間連續控制,不是單次接觸就能搞定。所以更準確的說法是:T-Rex 在「接觸瞬間的力度拿捏」這一格進步很大,在「長程精細操作」這一格還沒突破。

「開源」在這裡到底開了多少?

開了大約一半,而且官方自己在 README 裡講得很清楚,沒有藏。

這一點值得單獨拉出來講,因為外面很多轉述會直接寫成「開源 100 小時資料集」,那是不準的。實際情況是:

項目狀態細節
資料集✅ 部分開源總量 100 小時,公開約 50 小時、5,400+ 條軌跡,LeRobot v3.0 格式放在 Hugging Face
模型權重✅ 已釋出pretrain 與 midtrain 兩個 checkpoint 都在 Hugging Face
後訓練 + 推論程式碼✅ 已釋出main 分支,MIT 授權
預訓練 / 中訓練程式碼⚠️ 另開分支full-pipeline 分支
預訓練 / 中訓練語料❌ 未釋出官方明言不在這次釋出範圍
硬體與遙操作程式碼✅ 已釋出Manus 手套 + VIVE tracker 整套採集流程
資料來源:T-Rex 官方 GitHub README(ZhuoyangLiu2005/T-Rex)。

白話講:你可以拿他們訓好的 midtrain 權重,在自己的任務上做微調,然後跑起來。你沒辦法從零複現整個訓練流程,因為底層那批語料沒公開。

這在機器人領域算合理範圍。真正值得讚的是硬體採集程式碼也一起放出來了。這部分通常是各實驗室最捨不得給的東西,而它恰恰是其他人想複製這套方法的最大門檻。

我可以自己跑起來嗎?

純看資料集可以,用筆電就行;真的要跑模型,你需要一台有 CUDA 的多卡機器。

分兩條路走:

路線 A:只想看看資料長什麼樣(零成本)

  1. 打開 repo 裡的 dataset_quickstart/ 資料夾。
  2. 直接點 Colab badge,在瀏覽器開官方的 quickstart notebook。
  3. 它支援單集下載,不用整包拉下來,也能在真實 URDF 模型上做 3D 回放。

這條路適合想理解「觸覺資料到底長什麼樣」的人。你會看到十根手指各自的灰階觸覺影像、形變圖和六維力數值——這比讀十篇論文更直觀。

路線 B:想在自己的任務上微調

  1. 建環境:conda create -n trex python=3.10,先裝 PyTorch 2.6.0(CUDA 12.4 版),再 pip install -e .
  2. 下載 midtrain checkpoint(官方建議從這裡開始微調,不用從 pretrain 起跑)。
  3. 準備自己的任務影片與觸覺資料,轉成 JSON 或 LeRobot v3.0 格式,官方兩種轉檔腳本都給了。
  4. scripts/train.sh 開頭的路徑變數,執行後訓練。
  5. scripts/test.sh 起一個 ZMQ 推論伺服器,機器人端連上去。

有個設計細節值得一提:觸覺編碼器(VQ-VAE)已經內嵌進模型,訓練和推論時直接吃原始力訊號,不需要事先另外編碼一次。過去這一步是很常見的出錯點,現在被拿掉了。

誠實提醒:官方腳本預設是多機多卡(假設每台 8 張 GPU),單卡玩家要自己改 CUDA_VISIBLE_DEVICESNUM_PROCESSES。而且就算模型跑起來了,沒有那套雙臂機器人加觸覺手,你也只能看數字,做不了實機驗證。

誰該花時間看,誰可以直接略過?

你是誰建議從哪開始
機器人 / 具身智能研究者值得深入先讀 MoT 架構那節,再跑 midtrain 微調
AI 工程師,沒碰過機器人值得看架構只看「多速率專家模型」的設計思路,可移植到其他多模態場景
硬體 / 觸覺感測創業者值得看直接看 hardware_code/,整套採集方案都在
一般 AI 愛好者看 demo 就好專案頁的實機影片,五分鐘看完
想買機器人回家用的人先別急這是研究框架,不是消費產品,距離商品化還很遠

不用 T-Rex 的話,還有什麼可以看?

同一張對照表裡的對手,其實都是可用的開源方向:

  • EgoScale(平均 35 分)——目前最強的非 T-Rex 方案,走大規模第一人稱影片預訓練路線。如果你手上沒有觸覺硬體,這條路現實得多。
  • π0.5(17 分)——通用 VLA 代表作,生態成熟、社群大,適合當基礎架構。
  • Tactile-VLA(15 分)——傳統靜態觸覺編碼器路線,架構簡單,適合當入門對照組。
  • ViTacFormer / RDP(3 分、6 分)——早期觸覺方法,數字不好看,但論文對理解問題演進有幫助。

Mr. Slash 觀點:這件事的重點不在機器人

過去兩年,AI 進步的敘事幾乎全部集中在「模型變大、資料變多」。T-Rex 給了一個反例:它的骨幹只是 Qwen3-VL-2B,一個 20 億參數的小模型,不是什麼千億巨獸。贏的地方在架構:把不同感官按各自的物理節奏分開跑,而不是硬塞進同一個時間軸。

π0.5 加上觸覺反而從 17 分掉到 6 分,這一格才是整篇論文最貴的資訊:多一種資料不一定是加分,接錯了就是扣分。

這個教訓可以直接搬到任何做多模態產品的人身上。很多團隊現在的做法是「有什麼資料就全部餵進去」,然後發現效果不升反降,接著怪資料品質。T-Rex 的答案是:先問這個訊號的自然頻率是多少,再決定它該用什麼節奏進模型。

另外一件值得記住的事:這份論文六月就掛上 arXiv 了,程式碼和資料是這幾天才放出來的。在 AI 圈,論文和可執行的東西之間常常差好幾個月,有時候永遠不會補上。真正該追蹤的訊號不是「誰發了論文」,而是「誰把東西放出來讓人跑」。

新手行動清單

  1. 五分鐘版:打開專案頁看 12 段實機影片,先建立直覺。
  2. 半小時版:用 Colab 開 quickstart notebook,實際看一次觸覺資料的樣子。
  3. 半天版:讀論文的架構章節,重點在多速率專家與 cascaded flow matching 的銜接方式。
  4. 如果你在做多模態產品:把「不同模態用不同更新頻率」這條原則寫進自己的設計檢查表。

常見問題

T-Rex 是免費的嗎?

是。程式碼採 MIT 授權,論文採 CC BY 4.0,模型權重與約 50 小時的資料集都公開放在 Hugging Face,商用也沒有額外授權費。

T-Rex 和 π0.5 差在哪?

差在觸覺的接法。π0.5 是通用 VLA,動作與感知跑同一個節奏;T-Rex 把觸覺獨立成一個高頻專家,用大約每秒 20 次的速度修正每秒 5 次生成的動作。實測 12 項任務平均是 65 分對 17 分。

沒有機器人硬體也能用嗎?

可以看資料、可以訓練模型、可以讀架構,但沒辦法做實機驗證。官方的 quickstart notebook 支援在瀏覽器裡做 3D 回放,這是無硬體情況下最完整的體驗方式。

100 小時和 50 小時到底哪個才對?

兩個都對,指的是不同東西。團隊總共收集了 100 小時的觸覺資料用於訓練,公開釋出的是其中約 50 小時的子集,含 5,400 多條軌跡。官方 README 原文寫的是「收集 100 小時、開源約 50 小時子集」。

這代表家用機器人快來了嗎?

還沒。最難的幾項任務成功率仍在 35 到 47 分之間,意思是超過一半的嘗試會失敗。而且它跑在一套研究級的雙臂機器人加專用觸覺手上,這套硬體本身就不是消費級的東西。

延伸閱讀:想看同一條「開源模型正在追上閉源」的線,可以參考站內的 NVIDIA Switchyard 把 Claude Code 接上開源模型Meta Muse Glimmer 與 GPT-5.6 的正面比較

資料來源:arXiv:2606.17055(2026 年 6 月 15 日提交,6 月 18 日修訂)、T-Rex 官方專案頁GitHub 官方 repo。參與機構為 UC Berkeley、NVIDIA、Stanford、Panasonic、羅馬第一大學與 ItalAI,作者名單包含 Fei-Fei Li、Ken Goldberg、Jitendra Malik、Pieter Abbeel、Jim Fan、Trevor Darrell 等人。

免責聲明:本文為技術資訊整理與個人觀點分享,不構成任何投資建議。文中數據取自公開論文與官方 repo,截至 2026 年 8 月 22 日;開源專案內容可能隨時更新,請以官方文件為準。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

Trending

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash