華為位元組聯手,研發28nm存內計算晶元

2026年02月26日17:30:19 科技 8064

華為位元組聯手,研發28nm存內計算晶元 - 天天要聞

編譯|程茜

編輯|panken

芯東西2月26日消息,2月15日-19日,在被業界譽為「晶元設計國際奧林匹克會議」的國際固態電路大會(isscc 2026)上,清華大學、華為、位元組跳動等大學與公司的研究人員發表論文,首次提出一款基於hydar框架28nm混合存內計算(cir)晶元的推薦系統(recsys)加速器。

華為位元組聯手,研發28nm存內計算晶元 - 天天要聞

這款36m rram cir晶元能實現390k qps的吞吐率與1574k qps/w能效比。其構建的多晶元系統可實現百萬級實時端到端推薦系統(recsys)。

華為位元組聯手,研發28nm存內計算晶元 - 天天要聞▲晶元顯微照片與系統概述

在實際推薦系統任務中,cir通過擴展至576m規模的多晶元系統,qps提升了66倍,qps/w提升181倍,準確率與cpu相當

華為位元組聯手,研發28nm存內計算晶元 - 天天要聞▲晶元性能與當前頂尖設計的對比

該晶元的核心優勢包括:採用dl-adc實現非top-k計算的早期終止;基於預測的預取調度流水線(ppsp)數據流提升不規則工作負載的吞吐量;由粗到細的檢索架構(coarse-to-fine)在保證系統召回精度的同時,可擴展至大規模應用。

一、引入cir,實現高吞吐、高能效、高精度相似向量檢索

推薦系統中的核心運算單元是相似向量檢索(svs),該方式通過計算查詢向量與大規模向量庫之間的距離,檢索出top‑k最鄰近向量。

svs會佔據推薦系統絕大部分的計算時間與功耗,主要原因是外部存儲器訪問(ema)開銷。其中,採用混合鍵合技術的dram加速器成本高昂,基於nand tcam的加速器存在讀取延遲高、數據與距離表示精度有限等問題。

針對上述痛點,研究人員提出一種基於rram的數模混合存內計算加速器hydar,可實現高吞吐量、高能效、高精度的svs。

基於rram的存內計算(compute-in-rram,cir)因能最大限度減少數據移動、存儲密度高、並行度極大,已被公認為深度學習加速的極具前景的技術路線。但將cir應用於svs仍會帶來額外挑戰,如能耗與延遲急劇增加、降低pe利用率與吞吐量、精度降低等。

華為位元組聯手,研發28nm存內計算晶元 - 天天要聞▲面向高效推薦系統的、基於cir的svs加速器的研究動機與設計挑戰

hydar通過cir pe(存內計算處理單元)、混合晶元設計與多晶元系統架構協同優化,解決了上述挑戰:

首先是帶動態延遲adc(dl‑adc)的cir pe,其通過多位模擬cir pe集成dl‑adc,用於基於直方圖的相似向量檢索,可提前將距離與檢索閾值比較,並跳過非top‑k向量,從而降低延遲與功耗。

其次是基於預測的搶佔式調度流水線(ppsp),通過這種混合晶元機制,預測每個pe的運行時間、中斷不平衡任務、插入短任務來平衡負載,以適應動態svs工作流,提升利用率與吞吐量。

最後是兩步由粗到精的檢索架構,其軟硬體協同設計框架,先在cir pe上進行粗粒度檢索以保證高吞吐量,再在數字svs引擎上進行精粒度檢索,在保證召回精度的同時最大化吞吐量。

在此基礎上,基於hydar框架,研究人員採用28nm工藝流片實現了一款cir原型晶元,包含36m rram單元,分為16個並行pe,每個pe包含一個288×4096陣列

華為位元組聯手,研發28nm存內計算晶元 - 天天要聞▲hydar整體架構與核心特性及基於cir的端到端檢索系統

二、採用基於dl‑adc的svs高效過濾機制,降低60%延時、71%功耗

具體來看基於模擬存內計算單元(cir pe)的直方圖相似向量檢索(svs)實現,以及支持計算提前終止的dl‑adc設計。

其通過查詢向量與基礎向量之間的距離分布直方圖來確定top‑k檢索的截斷閾值(ck)。在歐氏距離框架下,距離超過ck的基礎向量由雙模dl‑adc過濾,該adc可動態監測比較結果,實現非top‑k向量的計算提前終止。

歐氏距離計算可在288×4096的cir陣列上完成,其中每個2t2r單元表示一個4位維度,每一列代表一個256維基礎向量及32維偏置。

本設計中,cir pe在計算過程中將直方圖存入本地直方圖存儲器,隨後同步至跨pe直方圖單元(chu),合併分散式結果以生成ck。該論文設計了三條定製指令來執行該流程。

在dl‑adc方面,基於逐次逼近寄存器(sar)的結構支持提前終止模式(et),將預生成的ck作為輸入,與每個周期生成的sar碼一同送入按位比較器。

在迭代調整idac以逼近adc輸入電流的過程中,任何一位不匹配都表明計算結果與ck存在差異,觸發提前終止,停止計算並輸出2位向量掩碼(vmask)。

最後,通過將dl‑adc設置為et模式,距離計算與過濾可同時執行。

華為位元組聯手,研發28nm存內計算晶元 - 天天要聞▲基於動態延遲adc(dl‑adc)的直方圖式svs的cir實現

該et機制在資料庫規模擴大時效果顯著,平均減少60%的計算時間和71%的功耗,宏單元面積開銷增加7%。

三、預測搶佔式調度,利用率提升至91%、平均查詢延遲降低30%

其次是面向svs負載提出的基於預測的搶佔式調度流水線(ppsp)。

查詢在不同pe間並行計算,而每個pe參與計算的基礎向量數量通常不同,這會造成計算周期差異與pe間同步開銷,進而引發調度停頓與流水線氣泡。

ppsp採用連續搶佔式調度與動態任務調度器(dts)解決了這一問題。

dts會對各pe上查詢執行的完成時間戳進行監測與預測。該論文提出的搶佔式調度機制允許新任務搶佔那些即將完成的正在運行任務,這可以消除流水線氣泡、讓任務更早完成、pe更快釋放,以服務後續查詢。

在接收到指令時,任務會佔用一個dts槽位,並將其pe/段掩碼存入任務表,然後作為子任務路由到目標pe的兩個待處理緩衝區之一。

dts同時監控每個任務的預測關鍵結束時間(pcet),其定義為所有子任務pet的最大值。其中的仲裁器檢查pe與正在運行任務的重疊情況,如果新任務的pet可以降低且不影響正在運行任務的pcet,則切換待處理緩衝區以搶佔式調度新任務,從而提升吞吐量、降低延遲。

此外,在查詢調度期間,dts會在後端內存分配器中為每個查詢預分配地址空間,使得pe可以直接將結果寫入輸出緩衝區,無需pe間同步,從而實現pe快速釋放以處理新查詢。

華為位元組聯手,研發28nm存內計算晶元 - 天天要聞▲面向動態svs負載的、所提出的基於預測的搶佔式調度流水線(ppsp)

通過以上優化,ppsp將pe利用率提升至91%,平均查詢延遲降低30%,qps吞吐量提升1.82倍。

四、由粗到細兩步檢索,實現系統級四級流水線並行

最後是面向svs、基於cir的兩步檢索架構。

為提升系統精度,該架構集成了數字精檢索引擎,在高吞吐粗檢索結果中精確篩選向量。這使得即使在模擬cir存在雜訊與低精度處理的情況下,仍能保持高召回精度。

該架構還通過多cir晶元並行擴展了向量庫容量,並支持更廣泛的並行粗檢索,同時採用thresh‑ivf流程與系統流水線,進一步提升吞吐量。

cir pe分為三類:質心pe(cpe)存儲聚類中心坐標,採樣pe(spe)存儲從每個聚類中採樣的少量向量,用於表徵分布並生成ck;全量庫pe(fpe)存儲所有基礎向量,並全程運行在高能效的dl‑adc提前終止(et)模式下,在整個流程中佔據92.7%的向量存儲。

cir專用的thresh‑ivf工作流程包括查詢首先送入cpe,通過it運算計算查詢與聚類中心的距離,識別最近的聚類;系統將查詢路由到所選聚類的spe,通過ih在多晶元間生成直方圖,進而生成ck;ck被路由到步驟1所確定聚類的所有fpe,通過ic完成粗檢索id生成。

這種系統級基於閾值的粗檢索,最小化了每個晶元輸出的過濾結果數量,避免了在各晶元上執行相同top‑k計算帶來的冗餘id過濾。最後,少量候選id被送入數字引擎,以fp16格式進行精檢索,使系統級存儲帶寬需求降低97.44%。

華為位元組聯手,研發28nm存內計算晶元 - 天天要聞▲兩步由粗到精檢索系統架構與工作流程

該設計實現了系統級四級流水線並行;同時晶元內不同pe也可並行處理不同任務。相較於傳統基於cpu的ivf方案,這種多晶元層級流水線可將延遲降低90.17%。

結語:兼顧精度與效率,推薦系統算力成本驟降

推薦系統在連接用戶與海量內容和服務方面發揮著至關重要的作用,已廣泛部署於電商和流媒體平台,但作為其核心運算單元相似向量檢索佔據了推薦系統絕大部分的計算時間和功耗。

其中採用混合鍵合技術的dram加速器提升了帶寬以緩解ema問題,但其成本高昂,且仍受限於dram與邏輯單元之間的數據傳輸瓶頸;基於nand tcam的加速器將計算集成到存儲陣列中以減少ema,但存在讀取延遲高、數據和距離表示精度有限的問題。

基於此,這篇最新研究提出了一款高效的svs加速器,能在保證高吞吐量檢索的同時,不犧牲召回精度,進一步降低推薦系統的功耗。

科技分類資訊推薦

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相 - 天天要聞

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相

兼具宜商氣度與家用溫情的科技豪華旗艦MPV,第二代騰勢D9迎來西安地區正式亮相。新車依託全球新能源MPV冠軍底蘊,以第二代刀片電池、雙閥雲輦-C、天神之眼5.0智駕等核心技術全面升級,兼顧商務體面與家庭舒適,為西北高端用戶帶來一站式全能出行解決方案。
採購禁入!科華數據材料造假被拒門外 - 天天要聞

採購禁入!科華數據材料造假被拒門外

本報(chinatimes.net.cn)記者胡雅文 北京報道這家趕上AI算力風口的公司,因投標材料造假,被相關採購方列入禁入名單兩年,其此前提出的複議申請也被正式駁回。相關採購平台近日發布公告,明確駁回科華數據股份有限公司(下稱「科華數據」,002335.SZ)此前提交的複議申請。早在一年前,科華數據已被認定在「信息通信樞紐...
快評樂道L80:15萬元級買大五座,這波值得沖? - 天天要聞

快評樂道L80:15萬元級買大五座,這波值得沖?

日前,樂道L80正式發布並開啟預售,其整車購買預售價為24.58萬元起,租電購買預售價則低至15.98萬元起。面對大型SUV市場「細分再細分」之競爭趨勢,這款樂道年度重磅新車都有哪些優勢?又能否成為「大五座SUV革新之作」?下面,圈哥就帶大家全方位感受。
成都直擊凱威德:純電全尺寸SUV的張揚與大氣 - 天天要聞

成都直擊凱威德:純電全尺寸SUV的張揚與大氣

4月22日,凱迪拉克以奧斯卡級盛典規格,將上海保利大劇院點亮為璀璨舞台,在品牌代言人倪妮與全場嘉賓的共同見證下,凱迪拉克全尺寸純電公路旗艦——凱威德耀然上市。新車共推出長續航四驅Pro、高性能四驅Ultra兩款配置,官方售價區間為46.88萬-50.88萬元。