你一定試過:把一份 PDF 年報、一張掃描的合約、或一個塞滿表格的 PPT 丟給 ChatGPT,想叫它幫你整理重點。結果它把表格讀成一團亂碼,分欄的內容黏在一起,數字對不上格子,最後你只能自己一頁一頁複製貼上。問題不在 AI 笨,而在你餵進去的「料」本來就是壞的。

一句話結論:MinerU 是一個免費開源工具,能把 PDF、掃描件、財報、PPT、Excel 轉成乾淨的 Markdown,讓 ChatGPT、Claude 真正讀懂你的文件——想餵文件給 AI 的人都該裝一個。

MinerU 到底是什麼?一句話搞懂

MinerU 是上海人工智慧實驗室旗下 OpenDataLab 開源的「文件解析」工具。它做的事情很單純:把人類在看的複雜文件(PDF、圖片、Word、PPT、Excel),轉成機器和大型語言模型(LLM,就是 ChatGPT、Claude 背後的技術)讀得懂的乾淨格式——Markdown 或 JSON。

它在 GitHub 上已經累積超過 7 萬顆星(截至 2026 年 6 月),是這個領域熱度最高的開源項目之一。簡單講,它就是你和 AI 之間的「翻譯官」:你給它一份亂七八糟的文件,它還你一份排版整齊、表格完整、閱讀順序正確的文字稿,再丟給 AI 就順了。

為什麼 PDF 直接丟給 ChatGPT 會出問題?

差在 PDF 這種格式根本不是給機器讀的。PDF 記錄的是「這個字要印在紙上的哪個位置」,不是「這段文字的邏輯順序」。所以一份雙欄排版的論文、一張跨頁的大表格、一份帶頁首頁尾的財報,AI 直接讀的時候會把左右欄黏在一起、把表格拆散、把頁碼和正文混在一起。

MinerU 的價值就在這裡。它會先判斷版面結構,分辨哪裡是標題、哪裡是正文、哪裡是表格、哪裡是頁首頁尾雜訊,再按照「人類閱讀的順序」重新輸出。表格會還原成 Markdown 表格或 HTML,公式會轉成可辨識的格式,多欄會拆對。你拿到的是一份 AI 一看就懂的稿子,而不是一堆錯位的字。

MinerU 2.5 有什麼新東西?值得升級嗎?

值得。最新的 MinerU 2.5 是一次蠻大的升級,重點有四個。

  • 準確率做到業界第一。在公開的文件解析評測 OmniDocBench v1.6 上,MinerU 2.5 拿到 95.69 的綜合分數,英文文字錯誤率低到 0.061、中文 0.215,兩項都排第一。對中文、財報、複雜表格這種難啃的文件特別強。
  • 模型很小,普通電腦也跑得動。MinerU 2.5 的核心模型只有 12 億參數(1.2B),算是同類裡的「輕量級」。不需要昂貴顯卡,純 CPU 也能跑,等於把「在自己電腦上跑」的門檻降下來了。
  • 格式支援更全。除了原本的 PDF 和圖片,現在原生支援 Word(DOCX)、PowerPoint(PPTX)、Excel(XLSX),還新增了圖表解析、跨頁表格合併、被切斷的段落自動接回。
  • 授權放寬,商用更安心。過去用的是比較嚴格的 AGPLv3,現在改成以 Apache 2.0 為基礎的自訂授權,個人和商業團隊採用的顧慮少很多。

MinerU 怎麼用?三種上手方式(從零基礎到進階)

不會寫程式也能用。照你的程度挑一種:

  1. 完全不碰程式碼——用線上 Demo。OpenDataLab 在 Hugging Face 上架了免費的線上版本(搜尋「opendatalab MinerU」的 Space)。直接把文件拖上去,等它跑完下載 Markdown,零安裝。先用這個試水溫最快。
  2. 想批次處理——本機安裝。裝好 Python 後,一行指令安裝:pip install -U "mineru[all]"。之後要轉檔就用 mineru -p 你的文件 -o 輸出資料夾,同樣一行搞定。
  3. 沒有顯卡——用 CPU 模式。在指令後面加上 -b pipeline,就能在純 CPU 環境跑。網路連不上預設模型來源時,可以設 MINERU_MODEL_SOURCE=modelscope 換國內鏡像下載模型。

真正的用法是接成一條流水線:MinerU 把文件轉 Markdown,再餵給 AI 做摘要、問答、或建知識庫。這跟我們之前介紹過、用 Claude Code 自組投研團隊那篇是同一個邏輯——先把資料整理乾淨,AI 才幫得上忙。

MinerU、Marker、Docling 差在哪?該選哪個?

差在你最在意速度、語言、還是企業整合。MinerU 不是唯一選擇,這三個是目前最多人用的開源方案,各有性格:

工具最強的地方弱項適合誰
MinerU綜合最強,中文/日文等非英語、複雜表格準確率第一速度最慢,圖片裁切偶爾不完整處理中文財報、論文、掃描件的人
Marker速度快,格式涵蓋廣(DOCX/XLSX/EPUB)極複雜版面準確率略遜要快速批次轉大量文件的人
Docling結構抽取強(閱讀順序、程式碼塊、數學公式)上手與調校門檻較高做企業級 RAG、要接知識庫的團隊

結論很簡單:如果你主要處理中文文件、財報、帶複雜表格的資料,MinerU 是首選,因為它在這塊準確率最高。要追求速度、文件量很大,Marker 更快。要做企業內部的知識庫檢索系統,Docling 的結構化能力更合用。三個都免費,可以都裝來比一比。

MinerU 適合誰?不適合誰?

適合:常要把文件餵給 AI 的人——研究員、分析師、學生、做內容的、想建私人知識庫的。尤其你手上有大量中文 PDF、財報、掃描合約、產品型錄,MinerU 幫你省下最多人工複製貼上的時間。

不適合:只是偶爾要問一份簡單的純文字 PDF,那 ChatGPT 直接上傳就夠了,不用特地裝工具。另外,MinerU 對極端複雜的圖文混排、手寫稿,效果還是有極限,輸出後最好快速校對一遍再用。

學會 MinerU,可以怎麼把它變成收入?

工具只是工具,真正值錢的是你拿它去做什麼。幾個實際的方向:

  • 幫人整理資料。很多中小企業、律師、會計、研究單位有一堆紙本文件想數位化、想接 AI,但不會弄。你用 MinerU 幫他們把文件轉成可搜尋、可問答的知識庫,這就是一門服務。
  • 做垂直知識庫產品。把某個領域(法規、醫療、產業報告)的公開 PDF 批次轉 Markdown,餵給 AI 做成問答機器人,是現在很多 AI 副業的起點。
  • 加速自己的內容生產。做自媒體、寫報告、出電子書,把參考資料用 MinerU 整理好再交給 AI 協作,產出速度會差很多。

重點是:當「把文件變成 AI 看得懂的格式」的門檻被一行指令打掉之後,誰先把這個能力接到真實需求上,誰就先賺到。

常見問題(FAQ)

MinerU 要錢嗎?

完全免費、開源。新版授權改成以 Apache 2.0 為基礎,個人和商用都能放心使用。

不會寫程式能用 MinerU 嗎?

可以。直接用 Hugging Face 上的免費線上 Demo,把文件拖上去就能轉,完全不用安裝或寫程式。

MinerU 跟 ChatGPT 直接讀 PDF 差在哪?

差在準確率。ChatGPT 直接讀複雜 PDF 常把表格、多欄、頁首頁尾搞亂;MinerU 先把版面解析乾淨再輸出,AI 讀到的內容正確很多。

中文文件用 MinerU 準嗎?

很準。MinerU 在中文等非英語文件、複雜表格的準確率是同類開源工具中第一,特別適合中文財報和論文。

※ 本文為工具教學與資訊整理,截至 2026 年 6 月。MinerU 版本與功能更新極快,實際請以官方 GitHub(opendatalab/MinerU)說明為準。文中不構成任何投資或商業建議。

延伸閱讀:更多 AI 工具與趨勢

延伸閱讀:站內相關文章

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

最新文章

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash