做過 RAG(讓 AI 讀你的文件回答問題)的人都知道一個痛:文件一複雜,效果就崩。一份滿是表格、跨欄排版、還夾雜掃描圖的 PDF,用一般「固定長度切塊」的做法,常常把一個表格從中間切爛,AI 讀到的是支離破碎的殘句,答出來的東西自然錯漏百出。RAGFlow 想解的,就是這件事。
一句話講:RAGFlow 是一個主打「深度文件理解」的開源 RAG 引擎。它不急著把文字切碎,而是先分析文件的版面結構(哪裡是標題、哪裡是表格、哪裡是段落),理解之後再抽取——所以對複雜版面的保留度比一般 RAG 好很多,答案還附上可追溯的原文引用,降低幻覺。它由 InfiniFlow 團隊開發,截至 2026 年 7 月在 GitHub 有約 8.4 萬顆星,是成長最快的開源 RAG 專案之一。
RAGFlow 的幾個關鍵本事
- 深度文件理解(DeepDoc):先做版面分析和 OCR,看懂文件結構再抽知識,不是無腦切字。這是它跟其他 RAG 最大的差異。
- 模板化智慧切塊:依文件類型套不同的切法,而且切得可解釋、可以人工介入調整——不滿意的地方你能自己修。
- 什麼格式都吃:Word、PPT、Excel、圖片、掃描件、網頁、結構化資料都能進來。
- 引用可追溯:每個答案都標出處,方便稽核、也逼 AI 少編。
- 多路召回+融合重排:多種檢索一起跑再重排,命中率更高;還能建 GraphRAG 知識圖譜,補向量檢索抓不到的實體關係。
它和 LangChain、一般 RAG 差在哪
兩個層面。第一是切塊哲學:一般 RAG 用固定長度粗暴切,RAGFlow 先看懂版面再切,對複雜表格、掃描 PDF 明顯更穩。第二是定位:LangChain 是「組件庫」,你得自己拼裝;RAGFlow 是「開箱即用的完整引擎」,自帶介面、知識庫、工作流和引用功能,裝好就能用。想抓「網頁」進 RAG 的話,它跟 Firecrawl 是互補的——一個負責把網站變乾淨資料,一個負責把複雜文件理解好。
免費開源,但自架吃資源
RAGFlow 是 Apache-2.0 授權,免費、可商用、可自架,沒有授權費、沒有按席次收費、沒有功能鎖,這點比某些「開源但限制一堆」的專案佛心。也有官方雲端版(cloud.ragflow.io)可以不想自架的人直接用。
但自架的門檻不低,這要先有心理準備:
| 項目 | 需求 |
|---|---|
| CPU / 記憶體 | 至少 4 核、16 GB RAM(建議 32 GB) |
| 硬碟 | 50 GB 以上;映像檔解開約 7 GB |
| 部署 | Docker Compose(x86 + Nvidia 為主,ARM/Apple Silicon 要自己 build) |
模型和 embedding 都可以自己配,本地跑可以接 Ollama,資料完全不出門。2026 年它還陸續加了 MCP、agentic workflow、記憶、以及 Feishu/Discord/Telegram 等多渠道接入。
誰適合、誠實缺點
適合:要對大量、版面複雜的文件做問答或建知識庫的團隊——法遵、財報、合約、掃描檔、滿是表格的 PDF;尤其重視「答案要有出處、可稽核、少幻覺」的企業內部應用。
缺點講白:自架資源門檻高(16 GB RAM 起跳、映像檔大),不是筆電隨手就能跑;Apple Silicon 要自己 build 映像,有點折騰;功能多、配置面廣,學習曲線不算平緩;而且版本還在 0.x,屬於年輕但活躍的專案,上生產前穩定度要自己評估。
結論:如果你的 RAG 一直卡在「複雜文件讀不好」,RAGFlow 的深度文件理解值得一試,尤其你在意引用可追溯、又願意自架保資料;但如果只是簡單幾份純文字文件,殺雞不用牛刀,輕量方案就夠。
延伸閱讀:Firecrawl:把網站變成 AI 可讀資料(RAG 的網頁來源)、Dify:內建 RAG 的 LLM 應用平台、Ollama:本地跑 LLM 與 embedding。
※ 本文為工具介紹與使用心得整理,資訊(功能、定價、授權、硬體需求)截至 2026 年 7 月,AI 工具更新極快,star 數與需求請以 RAGFlow 官方 GitHub 當下為準。文中不含任何投資建議。






發表迴響