你一定試過:把一份 PDF 年報、一張掃描的合約、或一個塞滿表格的 PPT 丟給 ChatGPT,想叫它幫你整理重點。結果它把表格讀成一團亂碼,分欄的內容黏在一起,數字對不上格子,最後你只能自己一頁一頁複製貼上。問題不在 AI 笨,而在你餵進去的「料」本來就是壞的。
一句話結論:MinerU 是一個免費開源工具,能把 PDF、掃描件、財報、PPT、Excel 轉成乾淨的 Markdown,讓 ChatGPT、Claude 真正讀懂你的文件——想餵文件給 AI 的人都該裝一個。
MinerU 到底是什麼?一句話搞懂
MinerU 是上海人工智慧實驗室旗下 OpenDataLab 開源的「文件解析」工具。它做的事情很單純:把人類在看的複雜文件(PDF、圖片、Word、PPT、Excel),轉成機器和大型語言模型(LLM,就是 ChatGPT、Claude 背後的技術)讀得懂的乾淨格式——Markdown 或 JSON。
它在 GitHub 上已經累積超過 7 萬顆星(截至 2026 年 6 月),是這個領域熱度最高的開源項目之一。簡單講,它就是你和 AI 之間的「翻譯官」:你給它一份亂七八糟的文件,它還你一份排版整齊、表格完整、閱讀順序正確的文字稿,再丟給 AI 就順了。
為什麼 PDF 直接丟給 ChatGPT 會出問題?
差在 PDF 這種格式根本不是給機器讀的。PDF 記錄的是「這個字要印在紙上的哪個位置」,不是「這段文字的邏輯順序」。所以一份雙欄排版的論文、一張跨頁的大表格、一份帶頁首頁尾的財報,AI 直接讀的時候會把左右欄黏在一起、把表格拆散、把頁碼和正文混在一起。
MinerU 的價值就在這裡。它會先判斷版面結構,分辨哪裡是標題、哪裡是正文、哪裡是表格、哪裡是頁首頁尾雜訊,再按照「人類閱讀的順序」重新輸出。表格會還原成 Markdown 表格或 HTML,公式會轉成可辨識的格式,多欄會拆對。你拿到的是一份 AI 一看就懂的稿子,而不是一堆錯位的字。
MinerU 2.5 有什麼新東西?值得升級嗎?
值得。最新的 MinerU 2.5 是一次蠻大的升級,重點有四個。
- 準確率做到業界第一。在公開的文件解析評測 OmniDocBench v1.6 上,MinerU 2.5 拿到 95.69 的綜合分數,英文文字錯誤率低到 0.061、中文 0.215,兩項都排第一。對中文、財報、複雜表格這種難啃的文件特別強。
- 模型很小,普通電腦也跑得動。MinerU 2.5 的核心模型只有 12 億參數(1.2B),算是同類裡的「輕量級」。不需要昂貴顯卡,純 CPU 也能跑,等於把「在自己電腦上跑」的門檻降下來了。
- 格式支援更全。除了原本的 PDF 和圖片,現在原生支援 Word(DOCX)、PowerPoint(PPTX)、Excel(XLSX),還新增了圖表解析、跨頁表格合併、被切斷的段落自動接回。
- 授權放寬,商用更安心。過去用的是比較嚴格的 AGPLv3,現在改成以 Apache 2.0 為基礎的自訂授權,個人和商業團隊採用的顧慮少很多。
MinerU 怎麼用?三種上手方式(從零基礎到進階)
不會寫程式也能用。照你的程度挑一種:
- 完全不碰程式碼——用線上 Demo。OpenDataLab 在 Hugging Face 上架了免費的線上版本(搜尋「opendatalab MinerU」的 Space)。直接把文件拖上去,等它跑完下載 Markdown,零安裝。先用這個試水溫最快。
- 想批次處理——本機安裝。裝好 Python 後,一行指令安裝:
pip install -U "mineru[all]"。之後要轉檔就用mineru -p 你的文件 -o 輸出資料夾,同樣一行搞定。 - 沒有顯卡——用 CPU 模式。在指令後面加上
-b pipeline,就能在純 CPU 環境跑。網路連不上預設模型來源時,可以設MINERU_MODEL_SOURCE=modelscope換國內鏡像下載模型。
真正的用法是接成一條流水線:MinerU 把文件轉 Markdown,再餵給 AI 做摘要、問答、或建知識庫。這跟我們之前介紹過、用 Claude Code 自組投研團隊那篇是同一個邏輯——先把資料整理乾淨,AI 才幫得上忙。
MinerU、Marker、Docling 差在哪?該選哪個?
差在你最在意速度、語言、還是企業整合。MinerU 不是唯一選擇,這三個是目前最多人用的開源方案,各有性格:
| 工具 | 最強的地方 | 弱項 | 適合誰 |
|---|---|---|---|
| MinerU | 綜合最強,中文/日文等非英語、複雜表格準確率第一 | 速度最慢,圖片裁切偶爾不完整 | 處理中文財報、論文、掃描件的人 |
| Marker | 速度快,格式涵蓋廣(DOCX/XLSX/EPUB) | 極複雜版面準確率略遜 | 要快速批次轉大量文件的人 |
| Docling | 結構抽取強(閱讀順序、程式碼塊、數學公式) | 上手與調校門檻較高 | 做企業級 RAG、要接知識庫的團隊 |
結論很簡單:如果你主要處理中文文件、財報、帶複雜表格的資料,MinerU 是首選,因為它在這塊準確率最高。要追求速度、文件量很大,Marker 更快。要做企業內部的知識庫檢索系統,Docling 的結構化能力更合用。三個都免費,可以都裝來比一比。
MinerU 適合誰?不適合誰?
適合:常要把文件餵給 AI 的人——研究員、分析師、學生、做內容的、想建私人知識庫的。尤其你手上有大量中文 PDF、財報、掃描合約、產品型錄,MinerU 幫你省下最多人工複製貼上的時間。
不適合:只是偶爾要問一份簡單的純文字 PDF,那 ChatGPT 直接上傳就夠了,不用特地裝工具。另外,MinerU 對極端複雜的圖文混排、手寫稿,效果還是有極限,輸出後最好快速校對一遍再用。
學會 MinerU,可以怎麼把它變成收入?
工具只是工具,真正值錢的是你拿它去做什麼。幾個實際的方向:
- 幫人整理資料。很多中小企業、律師、會計、研究單位有一堆紙本文件想數位化、想接 AI,但不會弄。你用 MinerU 幫他們把文件轉成可搜尋、可問答的知識庫,這就是一門服務。
- 做垂直知識庫產品。把某個領域(法規、醫療、產業報告)的公開 PDF 批次轉 Markdown,餵給 AI 做成問答機器人,是現在很多 AI 副業的起點。
- 加速自己的內容生產。做自媒體、寫報告、出電子書,把參考資料用 MinerU 整理好再交給 AI 協作,產出速度會差很多。
重點是:當「把文件變成 AI 看得懂的格式」的門檻被一行指令打掉之後,誰先把這個能力接到真實需求上,誰就先賺到。
常見問題(FAQ)
MinerU 要錢嗎?
完全免費、開源。新版授權改成以 Apache 2.0 為基礎,個人和商用都能放心使用。
不會寫程式能用 MinerU 嗎?
可以。直接用 Hugging Face 上的免費線上 Demo,把文件拖上去就能轉,完全不用安裝或寫程式。
MinerU 跟 ChatGPT 直接讀 PDF 差在哪?
差在準確率。ChatGPT 直接讀複雜 PDF 常把表格、多欄、頁首頁尾搞亂;MinerU 先把版面解析乾淨再輸出,AI 讀到的內容正確很多。
中文文件用 MinerU 準嗎?
很準。MinerU 在中文等非英語文件、複雜表格的準確率是同類開源工具中第一,特別適合中文財報和論文。
※ 本文為工具教學與資訊整理,截至 2026 年 6 月。MinerU 版本與功能更新極快,實際請以官方 GitHub(opendatalab/MinerU)說明為準。文中不構成任何投資或商業建議。
延伸閱讀:更多 AI 工具與趨勢
- 只用 Cursor 的你已經落後:2026 AI 編程工具 8 強實測,$10 的 Copilot 在 SWE-Bench 贏了 $20 的 Cursor
- 滙豐裁 2 萬人 AI 接管中後台:銀行白領的「最後通牒」已經寄出







發表迴響