不用向量資料庫,但 PDF coverage 仍要先驗
重點先講:PageIndex 不用向量資料庫,而是先把文件做成樹狀索引,再讓 LLM 沿著結構找答案。2026 年 8 月後 SDK 已有 local mode,本機文件可以不需要 PageIndex API key;但不用 PageIndex key 不等於零成本,local chat/index 仍可能用到自己的 LLM provider key。更重要的是,有使用者在 GitHub issue #518 回報 FinanceBench coverage only 50%,其中部分 PDF 缺開頭頁;未見完整測法與分母,因此這是使用者回報,不是官方 benchmark。
PageIndex 是什麼?
傳統 RAG 常把文件切 chunk、做 embedding,再用向量相似度找內容。PageIndex 的做法不同:它先建立 hierarchical tree,再用 LLM 做 reasoning retrieval。README 把它稱為 vectorless、reasoning-based RAG,主打 no vector DB、no chunking 與可追溯的結構式檢索。
2026 年 8 月 SDK 更新把 local mode 做進 pip install -U pageindex。release 說 local mode 不需要 server、vector DB 或 PageIndex Cloud key。文件索引與儲存可在本機。LLM 推論仍可能要外部 API key,也可自行配置其他 backend。
我們實際查過什麼
我讀了 repo README、SDK release、pyproject、LICENSE 與 issues。截至 2026-10-04 03:42(台北時間),GitHub main 的 pyproject 為 0.2.10;PyPI 最新發布為 0.2.21。Python 要 3.10 以上,依賴包含 OpenAI SDK、openai-agents、LiteLLM、PyPDF2、pypdfium2 等;授權是 MIT。SDK 原始碼把 local document 與 cloud document 分成兩條路:有 PageIndex API key 代表文件放雲端,local 則把文件留在自己的 storage path,模型可走自己的 credentials。
我也看了 issue #518。有使用者回報 FinanceBench coverage only 50%,其中部分 PDF 缺開頭頁;未見完整測法與分母。內文補充有不少檔案用 PageIndex Flash 時缺了開頭頁,例如 3M_2108k.pdf 沒有正確抽出。這是單一使用者回報,不能拿來當整個專案的官方 benchmark;但它是具體、可重現方向明確的風險訊號。
依官方文件與 issue 整理,未在本機實測。
星數品質檢查
| 欄位 | 本週資料 | 怎麼讀 |
|---|---|---|
| 總星 | 38,537 | 候選掃描 2026-10-03 |
| 5 天快照差分 | +2,655 | 2026-09-28 到 2026-10-03 |
| fork / star | 0.0867 | 高於本站過低門檻 1/80 |
| 建立時間 | 550 天 | 不是短期新 repo |
| 🚩 | 無 | 候選檔未標 star 異常 |
本站判定星數品質正常,而且 +2,655 是同一母體的 5 天快照差分,可跟其他 snapshot 候選比較。
決策表
| 用途 | 本週漲星/總星 | 授權 | 要不要付費 key | 本機能不能跑 | 上手難度 | 繁中/台灣可用性 | 結論 |
|---|---|---|---|---|---|---|---|
| 長文件 RAG、PDF 問答、樹狀檢索 | +2,655 / 38,537(5 天快照) | MIT;一般可商用,需保留版權與授權聲明 | local mode 不要 PageIndex API key;但自帶模型通常仍要自己的 LLM provider key。Cloud 走 PageIndex key | 可;官方 SDK 有 local mode,沒有把 GPU 列成必要前置 | 中;pip 安裝不難,真正工作在文件解析、模型設定與 retrieval 評估 | 沒有看到繁中專屬介面承諾;能否處理繁中主要取決於模型與文件品質 | 可試,但先拿自己的 PDF 做 coverage 測試 |
不用向量資料庫,到底換來什麼
PageIndex 的賣點不是單純把 Pinecone、Qdrant 拿掉,而是把檢索問題改成讓模型沿著文件結構找。對財報、研究報告、合約這種章節結構很強的長文件,這條路很直接:不用先替每段文字決定 chunk 邊界,也能保留章節脈絡。
代價也很直接。傳統向量檢索的成本與錯誤型態比較熟;tree index + reasoning 的品質會被 PDF 解析、樹建立、summary、模型本身一起影響。#518 就是一個例子:如果開頭頁根本沒進索引,後面的 reasoning 再聰明也找不到。
兩個坑先看
1. Local mode 不是完全不用 key
release 說的是不需要 PageIndex API key。若用自己的 OpenAI、Anthropic 或其他 LiteLLM 支援模型,仍要算自己的 provider credentials 與費用。這跟 PageIndex 本身不收 cloud key 是兩件事。
2. PDF coverage 要自己驗
FinanceBench issue 的問題不是回答品質,而是輸入 coverage。做財報、法務或研究資料時,先拿一批已知答案文件檢查頁數、目錄與關鍵段落是否真的被索引,比直接跑聊天 demo 更有用。
適合誰/不適合誰
適合:長 PDF、財報、規格書、研究報告很多,想比較 vectorless RAG 跟傳統 chunk + embedding 差異的人。
不適合:資料主要是短文本、即時事件流,或完全不想管文件解析與 retrieval eval 的人。
替代品:RAGFlow
RAGFlow 走較傳統的 RAG 工程路線,強調文件理解與完整 pipeline;PageIndex 的差異是把 vector DB 拿掉,改用樹狀結構與 reasoning。資料抓取層可搭配 Firecrawl;本週其他 repo 收在 GitHub 熱門開源 AI 專案精選。
社群怎麼說
HN 在 2026-10-01 有一則 Vectorless, Reasoning-Based RAG 提交,8 points、0 comments,所以沒有足夠留言可做正反面引用。GitHub issue 裡比較具體的質疑是 #518:有使用者回報 FinanceBench coverage only 50%,其中部分 PDF 缺開頭頁;未見完整測法與分母。10 月 1 日還有人開 #540 希望有 standalone local MCP server,顯示社群需求已走到本地整合細節;這是功能需求,不代表品質背書。
FAQ
PageIndex 完全不用向量資料庫嗎?
官方設計主線是 vectorless tree index,不需要把 document chunks 存進 vector DB 才能檢索。
Local mode 完全免費嗎?
PageIndex local mode 不需要 PageIndex API key,但選的 LLM provider 可能收費;如果跑本地模型,則改成自己負擔硬體與電力。
它適合中文 PDF 嗎?
程式沒有把繁中排除,但這篇沒有找到官方繁中 benchmark。最穩的做法是拿自己的繁中 PDF 做頁面 coverage、retrieval 與答案正確率測試。
資料截點:2026-10-03 19:02(台北時間);星數使用 2026-09-28 到 2026-10-03 的 GitHub API 快照差分。
資料來源
- PageIndex GitHub repo
- PageIndex releases
- pyproject.toml
- MIT LICENSE
- Issue #518
- Issue #540
- HN submission
本文為開源工具資訊整理,不是投資建議;提到的公司與代幣不構成推介。





發表迴響