來源:重慶信通設計院天空實驗室
前 言
本文要點:
- 落地路線圖
- 落地模式及選擇(策略)
- 安全防護構架
- 安全落地技術方案
- 私域安全部署全流程示例
- 大模型安全評估
- 網路安全運營大模型參考架構與賦能
- 其它場景及應用案例
相關資料獲取
請文末評論留言
落地 路線圖
遵循原則
需求拉動、問題驅動、創新推動
四個階段
現狀診斷、能力建設、應用部署、運營管理
五個層面
基礎設施、數據資源、演算法模型、應用服務、安全可信
三個關鍵維度
安全、可靠、可控
工程實施方面
(1)基礎設施側
- 構建高性能和高可靠的訓練和推理基礎設施
- 根據行業屬性或企業性質,明晰技術路徑,如選擇大模型部署方式等
(2)數據構建側
- 全流程數據治理
- 構建數據隱私和安全保護體系
(3)服務能力側
- 實現大模型與現有業務數據和信息系統對接
- 開展提示工程
- 開發人工智慧原生應用等實施方案
技術選型方面
(1)技術指標側
- 明確技術指標:涉及基礎設施、數據資源、演算法模型、應用模式和風險控制等方面
(2)評估方法側
在模型應用的全生命周期,開展技術能力先進性和應用場景適用性等評估。
- 應用前,評估現有模型的性能水平
- 應用中,評估演算法模型與實際業務需求的匹配程度
- 應用後,跟進模型使用效果,制定改進方案
落地 三種主要模式
端側 部署模式
- 部署位置:用戶終端設備,如智能手機、個人電腦或專業工作站。
- 主要優點:實現高度個性化的用戶體驗,最小化數據傳輸延遲。
- 適用場景:對隱私保護和實時性極高,如離線語音識別、即時翻譯和全知個人助理等。
邊緣 計算模式
- 部署位置:接近用戶的邊緣伺服器。
- 主要優點:融合雲計算強處理能力與端側低延遲特性。
- 適用場景:適合處理計算和數據要求高、需快速響應的應用。
- 其它優點:減少數據遠端雲傳輸,降低帶寬需求,提升數據安全性。
雲平台 服務模式
- 部署位置:雲端基礎設施。
- 主要優點:存儲和計算資源充足,支持複雜演算法及大量數據處理;升級維護靈活,訪問便利。
- 風險問題:網路延遲、數據隱私問題等。
- 應對方式:系統設計和改進策略。
大模型設施 安全風險框架

(點擊可放大查看)
落地安全 防護構架
基於合規框架和技術風險矩陣,可分為三個層次:
- 底層(運行環境):
- 保障基礎設施安全,涵蓋通信網路、區域邊界、計算環境、雲及容器的安全設計與實現。
- 中層(技術與管理):
- 技術上實現供應鏈安全、數據安全、運營安全三類關鍵業務安全場景;管理上完成合規評估備案,納入組織機構總體風險管理、安全監測預警及應急響應框架。
- 頂層(目標):
- 實現基座、模型、數據與演算法、運行的安全技術目標,以及模型風險可控、合法合規的管理目標。
安全落地 技術方案
落地的 安全性
(1)內生安全防禦
1)數據安全防禦
- 大模型數據隱私保護:數據脫敏、數據匿名化、數據加密
- 大模型分散式訓練:聯邦學習和區塊鏈技術
2)模型安全防禦
大模型越獄防禦:模型生成優化、系統提示優化、輸入輸出檢測

(點擊可放大查看)
- 提示語泄露防禦:輸入檢測、輸入處理、輸出處理

(點擊可放大查看)
3)系統防禦
- 硬體層面防禦:涵蓋漏洞修復防範技術、被動檢測防範技術和主動防範技術。防範對模型存儲介質的威脅。
- 軟體層面防禦:涵蓋用戶數據防範技術 、模型數據防範技術。防範對用戶及模型數據的威脅。
- 框架層面防禦:深度學習框架及其依賴的大規模第三方軟體包漏洞會威脅模型安全。防範對深度學習框架及依賴庫的威脅。
- 操作系統層面防禦:涵蓋訪問控制防範技術、加密防範技術 與其他防範技術。防範對操作系統調度過程的威脅。
- 網路傳輸層面防禦:涵蓋端設備地址防範技術、傳輸路徑防範技術、網路服務防範技術。從網路安全形度保障生成式AI安全。
(2)外生安全防禦
1)面向隱私安全攻擊的防禦:
包含對抗訓練、提示工程策略,正則化、Dropout、數據增強、差分隱私、隱私風險檢測、生成內容過濾審查等技術。
2)針對毒化數據的防禦:
- 採用數據溯源和對齊技術。
- 發展高級對抗演算法(用複雜數據分析識別異常模式、開發自動排除或修正此類數據的機制)。
- 構建統一安全風險防禦策略:針對多模態數據(對文本、圖像、聲音等)。
3)面向惡意後門的防禦
- 檢查神經元激活特徵,識別並消除可能被惡意操縱的神經元。
- 通過模型微調和再訓練清除後門。
- 持續監控和定期安全評估。
4)針對提示注入攻擊的防禦
- 常用防禦技術:對抗訓練,即迭代收集攻擊樣本,通過指令微調等優化模型,使其能以拒絕等方式應對新型惡意提示。
- 注意事項:過於保守的防禦策略會影響內容多樣性和趣味性。
(3)衍生安全防禦
1)偏見和毒性內容生成風險防範
- 預訓練數據排毒
- 基於強化學習的對齊
- 推理階段的安全風險防控
2)虛假新聞防範
- 大模型直接識別
- 微調的 AIGC 文本檢測模型識別
- 依據困惑度與可信度
基於事實核查的虛假新聞檢測關鍵技術:
- 聲明檢測
- 證據檢索
- 聲明核查
3)版權侵犯風險防範
- 面向 AI 訓練數據安全的水印技術:後門攻擊。
- 面向 AI 生成內容溯源的水印技術:
✔數字水印技術
✔快速微調技術
✔有效水印提取技術
4)電信詐騙風險防範
- 深度偽造檢測技術:
✔基於空間域信號
✔基於頻域
✔基於生物信號
- 深度偽造主動防禦技術:
✔基於主動干擾
✔基於主動取證
落地的 可靠性
(1)大模型的對抗魯棒性
- 數據增強:針對不同內容模態設計策略以提升訓練樣本多樣性。
- 訓練優化:跨模態數據構建針對性對齊 loss 訓練;採用預設攻擊函數對樣本變換進行對抗訓練。
- 增強用戶指令精細理解力,檢測攻擊誘導意圖並前置干預。
(2)大模型的真實性
幻覺主要緩解方案:
- 訓練階段改進:涉及預訓練、微調等所有模型參數更新。
- 推理階段干預:根據用戶輸入生成回復時進行干預。
- 提示語優化:通過優化提示語提升生成效果。
- 輸出後處理:對初步生成文本進一步編輯、修改。
- 結合外部知識檢索:結合外部知識源的信息檢索單元加強生成質量。
- 多智能體交互:引入多個大語言模型參與生成過程。
(3)大模型的價值對齊
1)基礎優化手段:
- 清洗訓練樣本中的 「毒性」 數據
- 引入基於強化學習的對齊技術
2)基於人類偏好的強化學習技術(RLHF):
包含三個子階段:
- 指令微調
- 獎勵模型訓練
- 生成策略優化
3)基於 AI 反饋的強化學習技術(RLAIF):
- 特點:用 LLM 代替人類標記偏好,對齊效果有限。
- 優化方向:結合人工反饋,兼顧成本與模型效果。
落地的 可控性
(1)大模型的可解釋性
- 基於過程信息的解釋性
- 基於 CoT(思維鏈)提示的解釋性
- 基於模型內生的機制可解釋性
(2)大模型的可標識和可追溯
- 數字水印追溯
- AIGC 檢測技術
(3)大模型的指令遵循
- 監督微調
- 強化學習
- 指令優化
落地 安全測評
(1)試題的全面性:
要求:安全評估需覆蓋多模態和各種應用場景,且評測試題需全面覆蓋可能的安全問題類型。
(2)對抗樣本的多樣性:
方法:在已有試題基礎上通過生成演算法構建多樣化測試樣本。
(3)評估研判的自動化:
新方向:
- 基於商業化大模型服務構建研判策略,但存在成本高、數據隱私、可控性差等問題。
- 構建專用研判大模型
私域安全部署 全流程示例
以下內容僅供參考
具體需根據實際情況進行調整和優化
獲取完整版
請文未評價留言
大模型 安全評估
以下內容僅供參考
具體需根據實際情況進行調整和優化
獲取完整版
請文未評價留言
網路安全運營 大模型
參考架構與賦能
以下內容僅供參考
具體需根據實際情況進行調整和優化
獲取完整版
請文未評價留言
其它場景及應用 案例
以下內容僅供參考
具體需根據實際情況進行調整和優化
獲取完整版
請文未評價留言
參考資料:《大模型落地路線圖研究報告》《大模型安全實踐白皮書》《私有化部署必看!大模型設施的安全風險框架和防護方案》《專題·人工智慧安全|大模型安全風險分析與防護架構》《超雲2025私域大模型部署白皮書》《生成式大模型安全評估白皮書》《工業大模型白皮書》《金融行業大模型應用探索與實踐》《網路安全運營大模型參考架構》《大模型安全研究報告》
重慶信通設計院
首批上海數據交易所
數據安全服務商
首批商用密碼檢測機構
公司致力於跟蹤最新網路安全形勢與動態 ,持續開展技術標準制定、安全能力建設、漏洞挖掘 、威脅情報分析 、重大課題專項的研究和支撐 ,主要研究領域涵蓋:AI安全、5G安全 、雲安全 、國密 、物聯網安全、工控安全、數據治理 、車聯網安全等
重慶信通設計院簡介:
擁有等級保護測評、商用密碼應用安全性評估、數據安全評估等服務資質,並具有中國網路安全審查技術與認證中心、中國信息安全測評中心頒發的網路安全服務資質;依託專業的精英團隊,能夠為客戶提供專業的等級保護、商用密碼、數據安全測評及諮詢服務,並致力於成為集諮詢、規劃設計、測評、運維、攻防對抗、培訓等能力於一體的綜合型網路與信息安全專家。
榮譽與資質:
擔任多個理事和支撐單位,如:重慶市互聯網界聯合會監事長單位、重慶市信息安全協會副理事長單位、重慶市互聯網協會理事會成員、重慶市雲計算產業協會理事單位、重慶市信息技術應用標準化技術委員會秘書單位、重慶市網路與信息安全信息通報機制-技術支持單位、市委網信辦、市公安局、市通管局等的長期技術支撐單位;擁有等保測評、密評、數安評估、培訓等較為豐富的網路與信息安全相關服務資質。