界面新聞記者 | 伍洋宇
界面新聞編輯 | 文姝琪
「中國和美國相比,美國45%的醫生在用ai,我們遠遠沒有達到這個水平,跟我們的思考、分工、國情都有關係。」百川智能ceo王小川想要用方法讓中國的醫療ai市場追上去。
在大模型行業還在以參數為競賽主線的時候,王小川就選擇了醫療這條更窄的路。一段頗為靜謐的調整期過後,如今他以一種「捲起來」的姿態密集披露公司的技術進程。
1月22日,百川智能發佈新一代醫療大模型baichuan-m3 plus,此次的焦點在於呈現模型的判斷究竟能否在醫療場景中被驗證、被信任、乃至被真正使用。
大模型正在進入普通用戶的自診場景,但誤判和幻覺對醫療ai的用戶信任問題有巨大影響,因而低幻覺是ai邁向臨床的前置門檻。
百川稱,m3 plus在嚴肅醫療問答中的事實性幻覺率降至2.6%,低於目前行業標杆open evidence,達到全球最低水平。這一結果建立在此前m3已在healthbench、healthbench hard等評測中取得第一的基礎之上。
百川試圖進一步解決的,是信任之後的核驗問題。
m3 plus引入了其稱為「證據錨定(evidence anchoring)」的新技術路徑。不同於行業中常見的列出參考文獻的做法,該模型要求每一句醫學結論,都必須精確對應到論文或指南中的具體證據段落。也就是說,醫生能看到文獻來源,也能直接定位具體原文。
為此,百川在訓練階段引入了獨立的引用獎勵模型(citation reward model),對錯誤或不匹配的引用進行懲罰。據其技術負責人鞠強披露,最終結論與證據段落的匹配準確率超過95%。
另外,王小川認為,只有當成本足夠低,ai才可能進入臨床輔助和醫學教學等高頻場景。因而在工程層面,百川也試圖降低醫療ai落地的成本門檻。通過moe架構優化、模型量化以及投機解碼等手段,m3 plus的api調用成本較上一代下降70%。
相較通用場景,醫療ai目前還是一個未爆發的賽道,百川希望能先把市場做大。公司同步推出了「海納百川」計劃,將m3 plus以api形式向中國醫療服務機構免費開放,使用範圍限定在臨床輔助決策和醫學教育。
「要是全部臨床醫生都使用ai,我們覺得一年的成本也就是1億左右。」王小川說,「中國現在有500萬的醫學工作者,我們認為這種成本是可接受的,帶來的行業變化會非常大。」
他認為中國醫生之所以相對美國醫生擁抱ai的態度更保守,一方面是因為「中國醫生太忙了」,另一方面是中國沒有像美國那樣真實地表達進展,「就像我們發佈一個模型,我們說好的話大家都不信,美國人說大家才信。」
不過免費向機構端開放api的背後,一個現實考量是百川智能明確了向醫院、向醫生收費的商業模式是不成立的,因此api開放戰略的本質目的是推動ai醫療的普及率,從醫生端逐步化解這類產品的信任問題。
對於醫療模型可能涉及的安全對齊問題,以及現有法規下,面向患者不能跨越的診療結論紅線,王小川告訴界面新聞記者,百川的做法是醫生使用時ai可以給出診療結果,由醫生把關並最終決策,相應責任依然歸屬於醫生;但患者使用仍不可以提供結論,僅起到輔助決策的作用。
在大模型公司分化日益清晰的當下,一部分公司繼續押注通用能力和平台化敘事;另一部分則開始在垂直領域尋找確定性更高的落點。王小川顯然選擇了後者。
但在他看來,這也並不違背所有模型公司都在追求的agi道路。「如果醫療ai能達到和醫生同樣的水平,並且能上崗,那本身就是對人類職業的一個benchmark。」