百度開源全新OCR模型 PaddleOCR-VL-1.5,性能超越DeepSeek-OCR2

2026年01月30日16:30:38 科技 3583

【techweb】1月30日消息,百度在ocr領域再發力。

29日,百度正式發布並開源新一代文檔解析模型paddleocr-vl-1.5

該模型以僅0.9b參數的輕量架構,在全球權威文檔解析評測榜單omnidocbench v1.5中取得全球綜合性能第一成績,整體精度達到94.5%,不僅超過gemini-3-pro、qwen3-vl-235b-a22b、gpt-5.2等模型,也超過了1月27日deepseek剛剛發布和開源的deepseek-ocr2模型。

目前,paddleocr-vl-1.5 已全面開源,開發者可通過github、hugging face獲取,並在 paddleocr 官網進行在線體驗或通過百度智能雲千帆平台調用api介面。

在線使用/api:https://www.paddleocr.com

開源項目地址:https://github.com/paddlepaddle/paddleocr

模型下載地址:https://huggingface.co/paddlepaddle/paddleocr-vl-1.5

paddleocr-vl-1.5全球首次實現「異形框定位

paddleocr-vl-1.5是2025年10月16日百度首次發布並開源的paddleocr-vl模型的升級版。

相比於上代,paddleocr-vl-1.5-0.9b繼承了輕量級架構,navit視覺編碼器 + ernie-4.5-0.3b語言模型。

在功能層面,paddleocr-vl-1.5新增多項能力,包括:

進一步集成印章識別、文本檢測與識別等任務能力;

針對特殊場景與多語種識別進行系統優化,在生僻字、古籍文獻、多語種表格、下劃線與複選框等複雜結構識別方面顯著提升;

新增對藏語、孟加拉語等語種的支持;

模型還支持跨頁表格自動合併與跨頁段落標題識別,有效解決長文檔解析中的結構斷裂問題。

尤其值得注意的是,paddleocr-vl-1.5 全球首次實現ocr模型的「異形框定位」能力,使機器能夠精準識別傾斜、彎折、拍照畸變等非規則文檔形態,首次讓「歪文檔」實現穩定、可規模化解析。

該技術解決了傳統ocr模型在移動拍照、掃描件變形、複雜光照等真實場景中因文檔形變導致的識別失敗問題,可廣泛應用於金融票據處理、檔案數字化、政務文檔流轉等場景。

paddleocr-vl-1.5性能超deepseek-ocr2

技術文檔內容顯示,paddleocr-vl-1.5 基於文心大模型進行開發,在 omnidocbench v1.5文檔解析基準上實現了 94.5%的最新最先進(sota)準確率,在文本、公式、表格、閱讀順序所有子任務上均領先。

百度開源全新OCR模型 PaddleOCR-VL-1.5,性能超越DeepSeek-OCR2 - 天天要聞

表格來源:paddleocr-vl-1.5技術文檔

公式識別 (formulacdm):94.21%,大幅領先所有對比模型,顯示出在複雜數學表達式解析上的巨大優勢。

表格識別 (tableteds):92.76%,同樣是最高水平,表明其對表格結構的理解能力極強。

文本與閱讀順序:文本識別 (textedit: 0.035) 和閱讀順序 (reading orderedit: 0.042) 誤差極低,僅為同類其他模型約一半,保持了頂級水準。

paddleocr-vl-1.5 在複雜文檔結構還原與版面邏輯理解方面具備更高穩定性,在合同、財報等高複雜度業務場景中擁有更高可用性。

1月27日deepseek剛剛發布和開源的deepseek-ocr 2模型,在omnidocbench v1.5的綜合得分是91.09%。這也意味著paddleocr-vl-1.5性能超過deepseek-ocr 2。

百度開源全新OCR模型 PaddleOCR-VL-1.5,性能超越DeepSeek-OCR2 - 天天要聞

表格來源:1月27日deepseek-ocr 2模型開源技術文檔

另外,為了嚴格評估模型對真實世界物理畸變的魯棒性——包括掃描、傾斜、彎曲、屏幕翻拍和光照不均。百度飛槳團隊提出了real5-omnidocbench評測基準。paddleocr-vl-1.5在該基準上取得92.05%的整體精度,同樣達到sota,在五個子場景下均排名第一,顯著優於包括qwen3-vl-235b、gemini-3 pro在內的通用大模型。

百度開源全新OCR模型 PaddleOCR-VL-1.5,性能超越DeepSeek-OCR2 - 天天要聞

表格來源:paddleocr-vl-1.5技術文檔

另外,在硬體適配方面,paddleocr-vl-1.5模型在h800、a100、rtx 4090d等多種硬體上均具備的高效推理性能,驗證了其廣泛的部署適用性。paddleocr-vl-1.5具備優秀的工程化和部署友好性,能夠靈活適配從數據中心到邊緣設備的各種計算環境,為其大規模實際應用奠定了堅實的基礎。

百度開源全新OCR模型 PaddleOCR-VL-1.5,性能超越DeepSeek-OCR2 - 天天要聞


表格來源:paddleocr-vl-1.5技術文檔

整體來看,paddleocr-vl-1.5在標準文檔解析任務上實現了新的sota精度,其核心突破在於對真實世界複雜物理畸變的卓越魯棒性。通過架構創新、訓練策略優化以及新增印章識別和文本定位能力,該模型成為一個輕量(0.9b)、高效、多功能的文檔解析解決方案,能夠為下游rag系統和llm應用提供高保真的知識輸入,推動文檔智能技術在複雜現實場景中的可靠部署。

ocr技術發展經歷了從最早的模板匹配到現在的端到端深度學習等多個重要發展階段。近半年來,全球主流模型廠商密集布局 ocr 領域。mistral ai、位元組跳動、騰訊等企業也相繼推出新一代 ocr 模型。1月27日,深度求索發布新一代 ocr 模型 deepseek-ocr-2,行業競爭持續加劇。

而縱觀中國ocr發展史,百度一直是這一領域的領航者和重要貢獻者。此前,百度推出的開源工具庫paddleocr,集成了最先進的檢測和識別模型,推動了ocr的工業化應用。

隨著大模型加速進入金融、政務、製造等高複雜度業務流程,文檔解析能力正從「能用」走向「穩定可規模化落地」。

paddleocr-vl-1.5 在精度、複雜場景適應性與工程化能力上的系統突破,有望進一步降低產業應用門檻,推動 ocr 技術在真實生產環境中的深度落地。

科技分類資訊推薦

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相 - 天天要聞

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相

兼具宜商氣度與家用溫情的科技豪華旗艦MPV,第二代騰勢D9迎來西安地區正式亮相。新車依託全球新能源MPV冠軍底蘊,以第二代刀片電池、雙閥雲輦-C、天神之眼5.0智駕等核心技術全面升級,兼顧商務體面與家庭舒適,為西北高端用戶帶來一站式全能出行解決方案。
採購禁入!科華數據材料造假被拒門外 - 天天要聞

採購禁入!科華數據材料造假被拒門外

本報(chinatimes.net.cn)記者胡雅文 北京報道這家趕上AI算力風口的公司,因投標材料造假,被相關採購方列入禁入名單兩年,其此前提出的複議申請也被正式駁回。相關採購平台近日發布公告,明確駁回科華數據股份有限公司(下稱「科華數據」,002335.SZ)此前提交的複議申請。早在一年前,科華數據已被認定在「信息通信樞紐...
快評樂道L80:15萬元級買大五座,這波值得沖? - 天天要聞

快評樂道L80:15萬元級買大五座,這波值得沖?

日前,樂道L80正式發布並開啟預售,其整車購買預售價為24.58萬元起,租電購買預售價則低至15.98萬元起。面對大型SUV市場「細分再細分」之競爭趨勢,這款樂道年度重磅新車都有哪些優勢?又能否成為「大五座SUV革新之作」?下面,圈哥就帶大家全方位感受。
成都直擊凱威德:純電全尺寸SUV的張揚與大氣 - 天天要聞

成都直擊凱威德:純電全尺寸SUV的張揚與大氣

4月22日,凱迪拉克以奧斯卡級盛典規格,將上海保利大劇院點亮為璀璨舞台,在品牌代言人倪妮與全場嘉賓的共同見證下,凱迪拉克全尺寸純電公路旗艦——凱威德耀然上市。新車共推出長續航四驅Pro、高性能四驅Ultra兩款配置,官方售價區間為46.88萬-50.88萬元。