標籤: AI 安全
此標籤的文章
- NVIDIA Open Agent Safety Platform:把可執行控制和外部觀測分開驗證
拆解 OpenShell 可檢查的 Agent runtime 控制,以及 NVIDIA 所提出的 BlueField-4/Sentry 參考設計,釐清兩層各自能做什麼、仍缺哪些成效證據。
- AI Agent 風險如何變成 Runtime Policy:ASSERT 評估與 ACS 執行閘門
拆解 Microsoft run-assert-eval 如何串接 Clarity 風險探索、ASSERT 行為測試與 ACS runtime policy,並以 unsafe behavior 和 over-refusal 兩組指標檢視治理效果。
- Turnstile Spin:讓 Agent 安裝 CAPTCHA,也把驗證留在真正的安全邊界
拆解 Cloudflare Turnstile Spin 如何在人工核准下安裝、修復或遷移 widget,並以 Siteverify、憑證隔離與可重播驗收形成後端安全閉環。
- AI Agent 不該只會聽話:XY 問題如何讓修錯走錯路
XYEval 顯示,當使用者把一個看似合理、其實偏離根因的建議加進任務,Agent 可能照做而降低成功率;工程解法是先驗證目標,再用證據解釋修正方向。
- AI Agent 漏洞回報要附上什麼證據?MobileCybench 用可執行 Probe 重播驗證
MobileCybench 將 Android Agent 找到的漏洞主張交給隔離環境重播,再用可信狀態上的安全性 Probe 判斷哪些性質確實遭到違反。
- 自我修改 Agent 如何在部署前留下可查的發布 provenance?以 Ouroboros v7.4.4 為例
從 Ouroboros v7.4.4 拆解自我修改 Agent 的發布證據鏈:把身分、記憶、程式演化與受管理的子 Agent,綁到 SHA256、SBOM、GitHub build provenance 與 smoke receipts。
- AWS Bedrock AgentCore Consent Portal:Agent 的 OAuth 不只是按下 Connect
拆解 Amazon Bedrock AgentCore Consent Portal 的 end-user OAuth flow:如何分開 corporate IdP、Gateway、GitHub/Slack outbound provider、callback、session binding、token vault 與 CloudTrail,並標出 AWS reference walkthrough 沒有證明的安全邊界。
- GitSpawn:當 Repository 的 Git Config 先於 Coding Agent 的信任邊界執行
拆解 GitSpawn 如何透過 repository-local 的 core.fsmonitor 觸發背景命令,穿過 coding agent 的 workspace trust 與 approval 邊界,並整理 archive 交付條件、修補矩陣、安全重現界線與企業控制。
- Model Hardware Standard:給實體裝置的 MCP 形狀介面
拆解 Anthropic Model Hardware Standard 研究預覽:它標準化 Agent 與可程式化硬體之間的驅動、探索與操作介面,但不取代平台的身分、授權、審批與實體安全控制。
- Automated Alignment Researchers:Agentic Post-Training 為何需要 Integrity Gates
拆解 Anthropic 的 automated alignment researcher 實驗:Agent 可以搜尋、訓練與迭代 post-training 方法,但 benchmark、能力門檻、資料隔離與完整性審查必須由外部 gate 固定。
- Gemini 3.6 Flash、3.5 Flash-Lite 與 Flash Cyber:定位、價格與採用邊界
整理 Gemini 3.6 Flash、3.5 Flash-Lite 與 3.5 Flash Cyber 的官方定位、目前價格、發布方評測與可用性,並提出 Agent 模型路由與資安權限的驗證重點。
- 企業 AI Agent 安全架構:Threat Model、控制面與上線檢查表
以 Prompt Injection、工具授權、資料外洩、記憶與身分、供應鏈及可觀測性為邊界,建立可驗證的企業 AI Agent 縱深防禦架構。
- 金融級 Enterprise Agentic AI 架構設計:從 Demo 到 Agentic Operating System
AI Summit 分享整理:企業 AI Control Plane、15+ Agents 責任分解、理專現場的四段 Runtime 流程、三層安全邊界、LLM-as-a-Judge 品質治理,以及 E·P·J·T 可複用能力底座。
- OpenAI 最新研究:強化學習 (RL) 如何讓 AI 系統更加對齊與具備韌性
深度解讀 OpenAI 關於強化學習 (RL) 與 AI 對齊的最新研究。探討模型如何透過專注於「有益特徵」的訓練,在超過 40 項未曾見過的對齊基準測試中展現廣泛的泛化能力,並在惡意微調與對抗性提示下展現強大的持久性與韌性。
- OpenAI 部署模擬:發布前怎麼預測 LLM 安全
讀 OpenAI Deployment Simulation:離線評測和真實部署為什麼會落差,以及這套模擬能預測什麼、不能預測什麼。
- 推理模型為何「無法控制自己的思路」——反而是 AI 安全的好消息
OpenAI 最新研究發現,現有前沿推理模型幾乎無法依指令隱藏或改變自身的思維鏈(Chain of Thought),可控性最高僅 15.4%。這個「缺陷」不只不是問題,更是當前 CoT 監控機制值得信賴的關鍵理由。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡