標籤: AI 安全
此標籤的文章
- 深入解析 Gemini 3.6 Flash、3.5 Flash-Lite 與 3.5 Flash Cyber:為 Agentic 應用打造的全新模型架構
Google 推出全新 Gemini 模型陣容,包含在效能與效率全面進化的 3.6 Flash、專為高吞吐量打造的 3.5 Flash-Lite,以及專攻資安漏洞防禦的 3.5 Flash Cyber,全面迎戰 AI Agent 大規模應用時代。
- 企業 AI Agent 安全架構:Threat Model、控制面與上線檢查表
以 Prompt Injection、工具授權、資料外洩、記憶與身分、供應鏈及可觀測性為邊界,建立可驗證的企業 AI Agent 縱深防禦架構。
- 金融級 Enterprise Agentic AI 架構設計:從 Demo 到 Agentic Operating System
AI Summit 分享整理:企業 AI Control Plane、15+ Agents 責任分解、理專現場的四段 Runtime 流程、三層安全邊界、LLM-as-a-Judge 品質治理,以及 E·P·J·T 可複用能力底座。
- OpenAI 最新研究:強化學習 (RL) 如何讓 AI 系統更加對齊與具備韌性
深度解讀 OpenAI 關於強化學習 (RL) 與 AI 對齊的最新研究。探討模型如何透過專注於「有益特徵」的訓練,在超過 40 項未曾見過的對齊基準測試中展現廣泛的泛化能力,並在惡意微調與對抗性提示下展現強大的持久性與韌性。
- OpenAI 發表「部署模擬」(Deployment Simulation):解決評估覺醒,更真實地在發布前預測 LLM 安全性
深度解讀 OpenAI 提出的最新大語言模型安全性評估方法「部署模擬」(Deployment Simulation)。剖析如何透過重播歷史真實用戶對話前綴,擺脫傳統紅隊測試中模型的「評估覺醒」與應試行為,對 GPT-5 系列模型實現高精度的風險預測,並使用簡潔的流程圖與預估圖表進行完整說明。
- 推理模型為何「無法控制自己的思路」——反而是 AI 安全的好消息
OpenAI 最新研究發現,現有前沿推理模型幾乎無法依指令隱藏或改變自身的思維鏈(Chain of Thought),可控性最高僅 15.4%。這個「缺陷」不只不是問題,更是當前 CoT 監控機制值得信賴的關鍵理由。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡