
在藥物研發、蛋白構象研究、核酸功能解析等領域,分子模擬是理解生命過程的重要工具,但長期受制於「尺度-精度」矛盾:高精度量子化學方法往往只能覆蓋數百原子,而更可擴展的經典力場又難以刻畫複雜分子作用與非局部效應。即便機器學習力場顯著提升了精度,在真實生物大分子場景仍常被三類問題卡住:公開數據以小分子為主、顯式溶劑與大體系樣本稀缺;長程相互作用難以被完整建模;以及大體系推理吞吐不足,難以進入穩定可用的工程流程。
近日,iquest research(至知創新研究院) ubio 團隊發布分子基礎模型框架ubio‑molfm,面向生物大分子體系的高精度模擬需求,通過數據、模型架構與訓練策略的協同設計,實現了分子模型的新突破。團隊構建了迄今為止最大的高精度 dft 數據集 ubio-mol26,包含 1700 多萬數據,分子最多達 1200 原子。數據重點覆蓋溶液環境中的蛋白質、dna/rna 段、細胞膜塊等生物大分子體系。在這個海量數據基礎上,團隊使用最先進的 e2formerv2 類 transformer 的等變神經網路架構,結合顯式的長程相互作用建模,在多階段課程學習框架的加持下,實現了sota級精度與吞吐表現。同時,團隊開源 5 百萬條高質量 dft 數據 ubio‑protein26 5m,推動社區復現與應用,後續模型權重和推理代碼也會陸續上線。

框架總覽
01
本次發布:ubio-molfm 框架、
protein26 數據底座與開源復現路徑
ubio‑molfm 是一套面向真實生物體系場景的分子基礎模型框架,覆蓋蛋白、dna/rna、脂質膜及多類複合體系,並針對顯式溶劑、長程耦合與大體系穩定推理進行了系統化設計。
ubio-molfm 包含三部分:一是面向生物體系的數據底座(ubio-mol26/protein26),二是用於大體系推理的等變架構實現(e2former-v2),三是支持多理論層級穩定融合的訓練範式,並配套開放代碼、數據與後續模型/工作流計劃。
數據底座:更接近生物體系
ubio-mol26(約 1700 萬構型),覆蓋蛋白、dna/rna、脂質膜與複合體系,包含顯式溶劑,單體系規模最高可達 1200 原子,並採用統一流程生成高質量 dft 標註(wb97m-d3)。同時開放標準化子集 ubio-protein26 5m(5m 訓練 + 0.2m 測試),訓練集由 4.5m def2-svp 與 0.5m def2-tzvpd 組成;其平均原子數超過 370,用於補足公開數據在生物大體系尺度上的覆蓋缺口。

數據生成流程
數據構造上,ubio-mol26 採用「bottom-up 枚舉 + top-down 採樣」的混合路線:bottom-up 系統枚舉氨基酸短肽、核酸片段與脂質單元以保證基礎構件覆蓋;top-down 從真實蛋白結構抽取局部環境並進行溶劑化與化學封端,以增強對生物場景幾何與相互作用模式的覆蓋。團隊還給出了與 omol25 的分布對比(t-sne 可視化,t-sne 為常用降維可視化方法),用於說明兩套數據在特徵空間中的互補關係。

t-sne 對比:ubio-mol26 vs omol25
模型:e2former‑v2(線性擴展的等變transformer)
ubio-molfm 採用 e2former-v2(線性擴展的等變 transformer),以「節點中心、硬體友好」的實現減少稀疏邊操作、提升內存局部性,從而降低大體系推理開銷;同時通過 eaas 稀疏化降低 so(3) 張量積開銷,並結合 lsr 長短程建模同時處理局部相互作用與遠程耦合。

e2former-v2 架構示意
訓練:三階段課程學習(穩定融合多理論層級)
三階段訓練用於在化學覆蓋、物理一致性與尺度擴展之間取得平衡:
stage 1 使用 omol25 進行快速能量初始化,採用能量頭與獨立力頭並行預測以提升吞吐;
stage 2 丟棄獨立力頭,力由能量梯度計算,強化能量‑力一致性;
stage 3 融合 ubio‑mol26 的多保真數據,通過雙頭結構與 force‑only 監督處理不同理論層級:svp 與 tzvpd 分別對應不同能量頭,tzvpd 僅施加力損失以繞開能量偏移,同時用 omol25、svp、tzvpd 8:1:1 的數據配比與相似性過濾保持訓練穩定。
02
在生物大體系上同時跑出
「可引用精度」與「大規模吞吐」,
讓高精度模擬更接近真實工作流
對科研與產業而言,分子基礎模型要真正進入日常工作流,至少要回答兩個問題:第一,在更接近真實的生物大體系上,誤差是否仍可控且可驗證;第二,在需要長時間軌跡與高頻推理的分子動力學場景里,吞吐是否足以支撐工程使用。ubio-molfm 的價值在於,它把這兩件事放在同一套評測與工程約束下並行推進。
外推精度:1,300–1,500 原子規模上精度顯著領先
團隊構建了 1,300–1,500 原子規模外推測試集,並對比 mace-omol 與 uma-s-1p1(使用官方代碼與官方 checkpoint,評測設置保持官方一致)。測試集覆蓋蛋白質優化、dna 優化、rna 優化、蛋白質 md 等多類任務,樣本數與平均原子數在文檔中給出了明確統計:例如蛋白質優化 1,010 樣本、平均 1,524.9 原子;rna 優化 505 樣本、平均 1,467.4 原子。
外推測試集統計

在代表性結果(蛋白質優化)中,ubio-molfm (s3) 的相對能量 mae 為 8.68 mev/100 atoms,顯著優於 mace-omol 的 76.94 與 uma-s-1p1 的 83.45;力 mae 為 16.77 mev/Å,也顯著低於 mace-omol 的 39.29 與 uma-s-1p1 的 42.84。
代表性結果(蛋白質優化;相對能量與 Δe 單位為 mev/100 atoms,力單位為 mev/Å)

團隊同時給出了階段性判斷:蛋白質任務上能量與力誤差顯著降低;dna 任務仍有提升空間,已明確為後續數據擴展的重點方向。
物理一致性:從溶劑結構、環境敏感構象到金屬配位,驗證「像物理」的關鍵細節
生物體系里,很多「看上去像細節」的物理量,恰恰決定了模型能否用於解釋與預測。ubio-molfm 在文檔中給出了多組物理一致性驗證:
在純水與 0.15 mol/l nacl 溶液中,模型能夠重現 rdf 結構與配位數,用溶劑統計量驗證基本液體結構是否合理。

水的 rdf
在環孢素 a(csa)體系中,模型能保持環境敏感構象:水中維持開放態、真空中維持閉合態,驗證其對溶劑化環境變化的響應是否符合物理直覺。

csa 水中構象

csa 真空構象
在 rna 1l2x + mg²⁺ 系統中,模型重現 mg–o 距離與角分布,體現對金屬離子配位幾何的刻畫能力。對於核酸結構穩定性與功能相關研究,這類能力往往是「能不能用」的分水嶺。

rna mg2+ 配位
推理吞吐:在1k–50k 原子範圍內實現約4× 提升,把「大體系計算」從偶發實驗推向可重複流程
在單卡 h100 上,ubio 團隊對 molfm-s3 與 uma-s/uma-m、mace-omol、esen、e2former-v1 等等變模型做了推理吞吐測試(1k–100k 原子,保守力計算)。結果顯示:在 1,000 原子規模下,molfm-s3 為 61 steps/s,對比 uma-s 的 16、mace-omol 的 8、e2former-v1 的 12;在 10,000 原子規模下,molfm-s3 仍有 6.10 steps/s,而多種對比模型已出現 oom。單卡可實現至多 15 萬原子的推理。
在 1k–50k 原子範圍內,molfm-s3 相對 uma-s 約 4× 吞吐提升;在 100k 原子規模下,除 uma-s 外大多數模型出現 oom,ubio-molfm 由於顯式建模長程作用也未能倖免,這也提示了下一步的明確方向:探索更好的長程相互作用建模方式,進一步降低顯存開銷。

綜合外推精度、物理一致性與吞吐表現,ubio-molfm 的定位更接近「生物體系高精度模擬底座」:一方面把可驗證的生物體系模擬推進到更真實的尺度(1,300–1,500 原子),另一方面通過 ubio-mol26 與 e2former-v2 的協同設計,使模型能夠同時處理生物結構、溶劑化與金屬配位等關鍵相互作用,從而為藥物發現、蛋白構象動力學、核酸功能研究等提供統一的建模基礎。