IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理

2026年03月04日19:50:20 科學 6708
IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞
在 1,300–1,500 原子規模的高精度 dft 基準上實現 sota 級精度,可實現最多單卡 15 萬原子的吞吐。

在藥物研發、蛋白構象研究、核酸功能解析等領域,分子模擬是理解生命過程的重要工具,但長期受制於「尺度-精度」矛盾:高精度量子化學方法往往只能覆蓋數百原子,而更可擴展的經典力場又難以刻畫複雜分子作用與非局部效應。即便機器學習力場顯著提升了精度,在真實生物大分子場景仍常被三類問題卡住:公開數據以小分子為主、顯式溶劑與大體系樣本稀缺;長程相互作用難以被完整建模;以及大體系推理吞吐不足,難以進入穩定可用的工程流程。

近日,iquest research(至知創新研究院) ubio 團隊發布分子基礎模型框架ubio‑molfm,面向生物大分子體系的高精度模擬需求,通過數據、模型架構與訓練策略的協同設計,實現了分子模型的新突破。團隊構建了迄今為止最大的高精度 dft 數據集 ubio-mol26,包含 1700 多萬數據,分子最多達 1200 原子。數據重點覆蓋溶液環境中的蛋白質、dna/rna 段、細胞膜塊等生物大分子體系。在這個海量數據基礎上,團隊使用最先進的 e2formerv2 類 transformer 的等變神經網路架構,結合顯式的長程相互作用建模,在多階段課程學習框架的加持下,實現了sota級精度與吞吐表現。同時,團隊開源 5 百萬條高質量 dft 數據 ubio‑protein26 5m,推動社區復現與應用,後續模型權重和推理代碼也會陸續上線。

IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞

框架總覽


01

本次發布:ubio-molfm 框架、

protein26 數據底座與開源復現路徑


ubio‑molfm 是一套面向真實生物體系場景的分子基礎模型框架,覆蓋蛋白、dna/rna、脂質膜及多類複合體系,並針對顯式溶劑、長程耦合與大體系穩定推理進行了系統化設計。

ubio-molfm 包含三部分:一是面向生物體系的數據底座(ubio-mol26/protein26),二是用於大體系推理的等變架構實現(e2former-v2),三是支持多理論層級穩定融合的訓練範式,並配套開放代碼、數據與後續模型/工作流計劃。


數據底座:更接近生物體系

ubio-mol26(約 1700 萬構型),覆蓋蛋白、dna/rna、脂質膜與複合體系,包含顯式溶劑,單體系規模最高可達 1200 原子,並採用統一流程生成高質量 dft 標註(wb97m-d3)。同時開放標準化子集 ubio-protein26 5m(5m 訓練 + 0.2m 測試),訓練集由 4.5m def2-svp 與 0.5m def2-tzvpd 組成;其平均原子數超過 370,用於補足公開數據在生物大體系尺度上的覆蓋缺口。

IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞

數據生成流程

數據構造上,ubio-mol26 採用「bottom-up 枚舉 + top-down 採樣」的混合路線:bottom-up 系統枚舉氨基酸短肽、核酸片段與脂質單元以保證基礎構件覆蓋;top-down 從真實蛋白結構抽取局部環境並進行溶劑化與化學封端,以增強對生物場景幾何與相互作用模式的覆蓋。團隊還給出了與 omol25 的分布對比(t-sne 可視化,t-sne 為常用降維可視化方法),用於說明兩套數據在特徵空間中的互補關係。

IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞

t-sne 對比:ubio-mol26 vs omol25


模型:e2former‑v2(線性擴展的等變transformer)

ubio-molfm 採用 e2former-v2(線性擴展的等變 transformer),以「節點中心、硬體友好」的實現減少稀疏邊操作、提升內存局部性,從而降低大體系推理開銷;同時通過 eaas 稀疏化降低 so(3) 張量積開銷,並結合 lsr 長短程建模同時處理局部相互作用與遠程耦合。

IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞

e2former-v2 架構示意


訓練:三階段課程學習(穩定融合多理論層級)

三階段訓練用於在化學覆蓋、物理一致性與尺度擴展之間取得平衡:

stage 1 使用 omol25 進行快速能量初始化,採用能量頭與獨立力頭並行預測以提升吞吐;

stage 2 丟棄獨立力頭,力由能量梯度計算,強化能量‑力一致性;

stage 3 融合 ubio‑mol26 的多保真數據,通過雙頭結構與 force‑only 監督處理不同理論層級:svp 與 tzvpd 分別對應不同能量頭,tzvpd 僅施加力損失以繞開能量偏移,同時用 omol25、svp、tzvpd 8:1:1 的數據配比與相似性過濾保持訓練穩定。


02

在生物大體系上同時跑出

可引用精度大規模吞吐

讓高精度模擬更接近真實工作流


對科研與產業而言,分子基礎模型要真正進入日常工作流,至少要回答兩個問題:第一,在更接近真實的生物大體系上,誤差是否仍可控且可驗證;第二,在需要長時間軌跡與高頻推理的分子動力學場景里,吞吐是否足以支撐工程使用。ubio-molfm 的價值在於,它把這兩件事放在同一套評測與工程約束下並行推進。


外推精度:1,300–1,500 原子規模上精度顯著領先

團隊構建了 1,300–1,500 原子規模外推測試集,並對比 mace-omol 與 uma-s-1p1(使用官方代碼與官方 checkpoint,評測設置保持官方一致)。測試集覆蓋蛋白質優化、dna 優化、rna 優化、蛋白質 md 等多類任務,樣本數與平均原子數在文檔中給出了明確統計:例如蛋白質優化 1,010 樣本、平均 1,524.9 原子;rna 優化 505 樣本、平均 1,467.4 原子。

外推測試集統計

IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞

在代表性結果(蛋白質優化)中,ubio-molfm (s3) 的相對能量 mae 為 8.68 mev/100 atoms,顯著優於 mace-omol 的 76.94 與 uma-s-1p1 的 83.45;力 mae 為 16.77 mev/Å,也顯著低於 mace-omol 的 39.29 與 uma-s-1p1 的 42.84。

代表性結果(蛋白質優化;相對能量與 Δe 單位為 mev/100 atoms,力單位為 mev/Å

IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞

團隊同時給出了階段性判斷:蛋白質任務上能量與力誤差顯著降低;dna 任務仍有提升空間,已明確為後續數據擴展的重點方向。


物理一致性:從溶劑結構、環境敏感構象到金屬配位,驗證「像物理」的關鍵細節

生物體系里,很多「看上去像細節」的物理量,恰恰決定了模型能否用於解釋與預測。ubio-molfm 在文檔中給出了多組物理一致性驗證:

在純水與 0.15 mol/l nacl 溶液中,模型能夠重現 rdf 結構與配位數,用溶劑統計量驗證基本液體結構是否合理。

IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞

水的 rdf

在環孢素 a(csa)體系中,模型能保持環境敏感構象:水中維持開放態、真空中維持閉合態,驗證其對溶劑化環境變化的響應是否符合物理直覺。

IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞

csa 水中構象

IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞

csa 真空構象

在 rna 1l2x + mg²⁺ 系統中,模型重現 mg–o 距離與角分布,體現對金屬離子配位幾何的刻畫能力。對於核酸結構穩定性與功能相關研究,這類能力往往是「能不能用」的分水嶺。

IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞

rna mg2+ 配位


推理吞吐:在1k–50k 原子範圍內實現約4× 提升,把「大體系計算」從偶發實驗推向可重複流程

在單卡 h100 上,ubio 團隊對 molfm-s3 與 uma-s/uma-m、mace-omol、esen、e2former-v1 等等變模型做了推理吞吐測試(1k–100k 原子,保守力計算)。結果顯示:在 1,000 原子規模下,molfm-s3 為 61 steps/s,對比 uma-s 的 16、mace-omol 的 8、e2former-v1 的 12;在 10,000 原子規模下,molfm-s3 仍有 6.10 steps/s,而多種對比模型已出現 oom。單卡可實現至多 15 萬原子的推理。

在 1k–50k 原子範圍內,molfm-s3 相對 uma-s 約 4× 吞吐提升;在 100k 原子規模下,除 uma-s 外大多數模型出現 oom,ubio-molfm 由於顯式建模長程作用也未能倖免,這也提示了下一步的明確方向:探索更好的長程相互作用建模方式,進一步降低顯存開銷。

IQuest Research 發布 UBio - MolFM:讓生物大分子模擬同時實現更高精度與更快推理 - 天天要聞

綜合外推精度、物理一致性與吞吐表現,ubio-molfm 的定位更接近「生物體系高精度模擬底座」:一方面把可驗證的生物體系模擬推進到更真實的尺度(1,300–1,500 原子),另一方面通過 ubio-mol26 與 e2former-v2 的協同設計,使模型能夠同時處理生物結構、溶劑化與金屬配位等關鍵相互作用,從而為藥物發現、蛋白構象動力學、核酸功能研究等提供統一的建模基礎。


*頭圖來源:至知研究院


科學分類資訊推薦

首張嗅覺圖譜問世 或重塑嗅覺形成認知 - 天天要聞

首張嗅覺圖譜問世 或重塑嗅覺形成認知

研究人員以前所未有的細節繪製了小鼠鼻腔中的嗅覺受體分布圖譜。這一成果顛覆了人們對鼻子如何產生嗅覺的認知。△小鼠鼻腔的顯微鏡橫截面圖像,顯示了鼻腔上皮的解剖結構。圖片來源:Datta Lab4月28日發表於《細胞》的一項研究,揭示了感覺神經元上表達的約1100個嗅覺受體是如何在鼻腔內壁上皮組織中受到嚴格調控的空間位置...
心臟為什麼不會得癌症? - 天天要聞

心臟為什麼不會得癌症?

心臟為什麼不會得癌症?心肌細胞會進行有節律的搏動,並在個體出生後停止增殖,因此,心臟沒有再生能力。近日,義大利的里雅斯特大學醫學院Serena Zacchigna團隊完成的體內癌症模型和離體工程心臟組織實驗表明,心肌細胞搏動所產生的機械力負
暴雨、冰雹要來,廣東天氣明起大反轉!珠海接下來…… - 天天要聞

暴雨、冰雹要來,廣東天氣明起大反轉!珠海接下來……

【來源:珠海發布】「五一」假期前兩天, 珠海天氣晴好,大家都去哪裡玩了?不過天氣馬上要反轉再反轉了! 廣東明天好天氣要暫時「下線」,局部有大暴雨、小冰雹;珠海明天午後也將有雷雨+10級大風…… 這場雨會持續多久?假期接下來的天氣會怎樣?趕緊
河北衡水:假日邂逅飛行 低空魅力引遊人 - 天天要聞

河北衡水:假日邂逅飛行 低空魅力引遊人

5月2日,位於河北省衡水市的中國航協衡水航空飛行營地,各類飛行表演和低空飛行器展示吸引市民遊客觀賞。中國桃城第四屆「翱翔中國」全國低空無人飛行器大賽暨第二屆京津冀低空飛行器集采會於5月1日至2日在此舉行。圖為遊客近距離參觀飛行器。
可拍原子運動過程 揭秘地下30米的「國之重器」 - 天天要聞

可拍原子運動過程 揭秘地下30米的「國之重器」

來源:央視新聞客戶端坐落在上海張江的硬X射線自由電子激光裝置是「十三五」國家重大科技基礎設施建設規劃優先啟動項目,也是上海(長三角)國際科技創新中心核心空間載體——張江科學城重大科技基礎設施集群的旗艦裝置,是我國實現2035年建成科技強國戰