標籤: Research
此標籤的文章
- 精讀 AgentEscapeBench:評測 LLM Agent 的域外長鏈條工具推理能力
深度解析最新 arXiv:2605.07926 論文《AgentEscapeBench》。論文揭示現有 AI Agent 在領域外 (OOD) 密室逃脫型 DAG 工具鏈上的實證表現:模型表現隨圖深度呈急劇崩塌,並暴露中繼結果傳遞(Clue Adherence)與狀態追蹤瓶頸。
- Ornith 1.0 與 Self-Scaffolding:Agentic Coding 的訓練、評測與信任邊界
整理 Ornith-1.0 的 Self-Scaffolding、Reward Hacking 防線與 Pipeline-RL 設計,並說明 Agentic Coding 系統在評測與部署時應保留的信任邊界。
- 球員大腦揭秘:現代足球致勝關鍵是「心流狀態」?
探討在現代高強度競技中,頂尖球隊如何透過神經科學與大腦訓練,幫助球員進入「心流狀態」,並將這些科學概念轉化為日常訓練指南。
- OpenAI 最新研究:強化學習 (RL) 如何讓 AI 系統更加對齊與具備韌性
深度解讀 OpenAI 關於強化學習 (RL) 與 AI 對齊的最新研究。探討模型如何透過專注於「有益特徵」的訓練,在超過 40 項未曾見過的對齊基準測試中展現廣泛的泛化能力,並在惡意微調與對抗性提示下展現強大的持久性與韌性。
- 高效學術論文閱讀:三遍掃描法
把「三遍讀論文法」落地成可執行流程:用 5–10 分鐘做海選、用 1 小時抓住方法與證據、再用「虛擬重做一遍」吃透細節。本文整合 Keshav 的 three-pass 與李沐老師的實作要點,附檢查清單與文獻綜述讀法。
- AI 對勞動市場的衝擊:從「理論能力」到「實際使用」的新衡量方式
根據 Anthropic《Labor market impacts of AI: A new measure and early evidence》整理:介紹「觀察到的曝光度」指標,說明哪些職業最暴露在 AI 之下、與就業成長與失業率的關係,以及對政策、企業與個人職涯的啟示。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡