【techweb】1月30日消息,百度在ocr領域再發力。
29日,百度正式發布並開源新一代文檔解析模型paddleocr-vl-1.5。
該模型以僅0.9b參數的輕量架構,在全球權威文檔解析評測榜單omnidocbench v1.5中取得全球綜合性能第一成績,整體精度達到94.5%,不僅超過gemini-3-pro、qwen3-vl-235b-a22b、gpt-5.2等模型,也超過了1月27日deepseek剛剛發布和開源的deepseek-ocr2模型。
目前,paddleocr-vl-1.5 已全面開源,開發者可通過github、hugging face獲取,並在 paddleocr 官網進行在線體驗或通過百度智能雲千帆平台調用api介面。
在線使用/api:https://www.paddleocr.com
開源項目地址:https://github.com/paddlepaddle/paddleocr
模型下載地址:https://huggingface.co/paddlepaddle/paddleocr-vl-1.5
paddleocr-vl-1.5全球首次實現「異形框定位」
paddleocr-vl-1.5是2025年10月16日百度首次發布並開源的paddleocr-vl模型的升級版。
相比於上代,paddleocr-vl-1.5-0.9b繼承了輕量級架構,navit視覺編碼器 + ernie-4.5-0.3b語言模型。
在功能層面,paddleocr-vl-1.5新增多項能力,包括:
進一步集成印章識別、文本檢測與識別等任務能力;
針對特殊場景與多語種識別進行系統優化,在生僻字、古籍文獻、多語種表格、下劃線與複選框等複雜結構識別方面顯著提升;
新增對藏語、孟加拉語等語種的支持;
模型還支持跨頁表格自動合併與跨頁段落標題識別,有效解決長文檔解析中的結構斷裂問題。
尤其值得注意的是,paddleocr-vl-1.5 全球首次實現ocr模型的「異形框定位」能力,使機器能夠精準識別傾斜、彎折、拍照畸變等非規則文檔形態,首次讓「歪文檔」實現穩定、可規模化解析。
該技術解決了傳統ocr模型在移動拍照、掃描件變形、複雜光照等真實場景中因文檔形變導致的識別失敗問題,可廣泛應用於金融票據處理、檔案數字化、政務文檔流轉等場景。
paddleocr-vl-1.5性能超deepseek-ocr2
技術文檔內容顯示,paddleocr-vl-1.5 基於文心大模型進行開發,在 omnidocbench v1.5文檔解析基準上實現了 94.5%的最新最先進(sota)準確率,在文本、公式、表格、閱讀順序所有子任務上均領先。

表格來源:paddleocr-vl-1.5技術文檔
公式識別 (formulacdm):94.21%,大幅領先所有對比模型,顯示出在複雜數學表達式解析上的巨大優勢。
表格識別 (tableteds):92.76%,同樣是最高水平,表明其對表格結構的理解能力極強。
文本與閱讀順序:文本識別 (textedit: 0.035) 和閱讀順序 (reading orderedit: 0.042) 誤差極低,僅為同類其他模型約一半,保持了頂級水準。
paddleocr-vl-1.5 在複雜文檔結構還原與版面邏輯理解方面具備更高穩定性,在合同、財報等高複雜度業務場景中擁有更高可用性。
1月27日deepseek剛剛發布和開源的deepseek-ocr 2模型,在omnidocbench v1.5的綜合得分是91.09%。這也意味著paddleocr-vl-1.5性能超過deepseek-ocr 2。

表格來源:1月27日deepseek-ocr 2模型開源技術文檔
另外,為了嚴格評估模型對真實世界物理畸變的魯棒性——包括掃描、傾斜、彎曲、屏幕翻拍和光照不均。百度飛槳團隊提出了real5-omnidocbench評測基準。paddleocr-vl-1.5在該基準上取得92.05%的整體精度,同樣達到sota,在五個子場景下均排名第一,顯著優於包括qwen3-vl-235b、gemini-3 pro在內的通用大模型。

表格來源:paddleocr-vl-1.5技術文檔
另外,在硬體適配方面,paddleocr-vl-1.5模型在h800、a100、rtx 4090d等多種硬體上均具備的高效推理性能,驗證了其廣泛的部署適用性。paddleocr-vl-1.5具備優秀的工程化和部署友好性,能夠靈活適配從數據中心到邊緣設備的各種計算環境,為其大規模實際應用奠定了堅實的基礎。

表格來源:paddleocr-vl-1.5技術文檔
整體來看,paddleocr-vl-1.5在標準文檔解析任務上實現了新的sota精度,其核心突破在於對真實世界複雜物理畸變的卓越魯棒性。通過架構創新、訓練策略優化以及新增印章識別和文本定位能力,該模型成為一個輕量(0.9b)、高效、多功能的文檔解析解決方案,能夠為下游rag系統和llm應用提供高保真的知識輸入,推動文檔智能技術在複雜現實場景中的可靠部署。
ocr技術發展經歷了從最早的模板匹配到現在的端到端深度學習等多個重要發展階段。近半年來,全球主流模型廠商密集布局 ocr 領域。mistral ai、位元組跳動、騰訊等企業也相繼推出新一代 ocr 模型。1月27日,深度求索發布新一代 ocr 模型 deepseek-ocr-2,行業競爭持續加劇。
而縱觀中國ocr發展史,百度一直是這一領域的領航者和重要貢獻者。此前,百度推出的開源工具庫paddleocr,集成了最先進的檢測和識別模型,推動了ocr的工業化應用。
隨著大模型加速進入金融、政務、製造等高複雜度業務流程,文檔解析能力正從「能用」走向「穩定可規模化落地」。
paddleocr-vl-1.5 在精度、複雜場景適應性與工程化能力上的系統突破,有望進一步降低產業應用門檻,推動 ocr 技術在真實生產環境中的深度落地。