核心概念
H Company 與 Hugging Face 發表的 NeoMME 是一組 260M、800M 參數的多語言多模態編碼器。它刻意避開「預訓練視覺塔+投影器+自回歸語言模型」這條常見 VLM 路徑:文字 token 與原始影像圖塊都進入同一個雙向 Transformer,從零開始以遮罩式離散擴散目標訓練。這代表它的定位不是生成文字,而是用較低的模型與推論負擔,產生可供檢索、分類與標註任務使用的多模態表徵。^[raw/articles/huggingface-neomme-2026-09-03.md]
兩個版本皆使用 32×32 影像圖塊、16,384 token 脈絡長度,以及滑動視窗注意力穿插全域注意力;影像保留原始長寬比,資訊密度較高的文件頁可自然分配更多 token。其 131k BPE tokenizer 也從多語言文本、程式碼、數學與影像轉錄資料重新訓練,不是把既有單語文字編碼器外接一層視覺模組。這條設計路線與 Gemma 4 12B:統一無編碼器多模態模型 都試圖減少跨模態拼裝成本,但前者是雙向編碼器,後者則以統一解碼器服務生成任務;兩者不應以單一排行榜直接互換。^[raw/articles/huggingface-neomme-2026-09-03.md]
技術亮點:以影像頁面做檢索
NeoMME-Retriever 以 ColPali 的「文件頁面即影像」方法微調,直接搜尋 PDF 或文件的頁面截圖,而非先 OCR、切 chunk 再檢索。優點是表格、圖表、版面、字體大小等 OCR 易壓平的證據仍可被保留;代價則是高解析影像會產生大量向量,索引成本成為部署瓶頸。^[raw/articles/huggingface-neomme-2026-09-03.md]
該模型在一次 forward pass 同時輸出兩種表徵:dense embedding 適合 ANN 快速召回,late-interaction embedding 保留 token/圖塊級局部匹配,適合精細比對或重新排序。這正好補上 Sentence Transformers 多向量嵌入模型:訓練與微調判讀 所指出的取捨:多向量能降低長文件被壓縮成單一向量時的局部資訊損失,但以索引空間與比對計算交換精度。實務上可先用 dense 召回候選,再用 late interaction 精排,而非一開始就讓全庫承擔最高成本。^[raw/articles/huggingface-neomme-2026-09-03.md]
效能與壓縮的實務判讀
官方在 ViDoRe v3 報告 NeoMME-260M 的 nDCG@10 為 0.523、800M 為 0.556;260M 在其列出的 800M 以下模型中表現最佳。於 NVIDIA L40S、2048×2048 的對照設定,260M 約每秒編碼 51 頁,約為 ColModernVBERT 的兩倍。這些數值是發布方在特定資料與硬體的測量,採用前仍需以自己的語料、查詢集、吞吐與延遲預算重新評估。^[raw/articles/huggingface-neomme-2026-09-03.md]
更值得注意的是索引壓縮:原本高解析 late-interaction 向量平均約 1.5 MB/頁。作者以階層式 token pooling 加上非對稱量化,將其降至 39 kB/頁時保留逾 99% 基線品質;更激進的設定可到 6 kB/頁、約 255 倍縮小,並保留逾 95%。這與 Granite Embedding Multilingual R2:開源多語言嵌入的效能突破 的 Matryoshka 維度取捨有相同管理意義:檢索品質不是唯一指標,儲存、重建索引與成本都應在同一張決策表裡。
對知識庫/RAG 的意義
NeoMME 的價值不在取代所有 RAG 檢索增強生成架構,而是為「文件視覺資訊本身就是證據」的場景提供一個較輕的開源選項,例如含大量表格、圖示、版面語意的研究報告、技術手冊與掃描檔。若內容主要是乾淨文字,先用單向量檢索通常更經濟;若 OCR 後仍反覆遺失關鍵格式或局部對應,再把視覺多向量檢索納入實驗。其 Apache 2.0 授權與 Transformers 的 day-zero 支援,降低了測試門檻,但不會自動消除 GPU、索引與評測的工程成本。
相關頁面
- Sentence Transformers 多向量嵌入模型:訓練與微調判讀:多向量檢索的架構與評測要點。
- Granite Embedding Multilingual R2:開源多語言嵌入的效能突破:長脈絡多語言文字嵌入的另一條選型路徑。
- Gemma 4 12B:統一無編碼器多模態模型:以統一解碼器處理多模態生成的不同架構取向。
反向連結
以下頁面引用了本頁: