標籤: Machine Learning
此標籤的文章
- 邁向穩健的小型語言模型強化學習:架構解析與實務判斷
探討 70M–500M 參數級別的 SLM 在 PPO 強化學習對齊中常見的三大崩潰模式(梯度凍結、數值溢出、策略崩潰),並解析 PPL < 20 的能力空間假說(Capacity-Headroom Hypothesis)。
- Ornith 1.0 與 Self-Scaffolding:Agentic Coding 的訓練、評測與信任邊界
整理 Ornith-1.0 的 Self-Scaffolding、Reward Hacking 防線與 Pipeline-RL 設計,並說明 Agentic Coding 系統在評測與部署時應保留的信任邊界。
- 轉化率提升 24%!DoorDash 揭秘 Ask Assistant 智能購物助理底層架構
深度剖析外送龍頭 DoorDash 如何結合大型語言模型、專屬 AI Agent、Model Context Protocol (MCP) 以及三層記憶體系統,打造出日均執行 2,000 次自動化評估的企業級 AI 購物助理系統。
- Grok 4.5 是什麼?SpaceXAI 程式開發模型的能力、評測與導入判斷
根據 SpaceXAI 官方發布與模型文件,釐清 Grok 4.5 的 API 規格、程式開發評測、可用管道,以及團隊導入前應自行驗證的限制。
- GPT-5.6 Sol 已正式推出:模型路由、價格與評測判讀
更新 GPT-5.6 從有限預覽轉為正式供應後的 Sol、Terra、Luna 定位、API 規格與價格,並整理 benchmark 限制和企業導入決策。
- 終極雲端算力解放:Google Colab CLI 正式推出,AI 代理與開發者的最強輔助
Google 宣布推出全新的 Colab CLI 工具!打破本地端與雲端 GPU 之間的隔閡,只要透過簡單的終端機指令,即可瞬間調用強大算力,更是次世代 AI Agent 自動化執行的完美利器。
- Kaggle Titanic:從 0.74 到 0.816,特徵工程比調參重要
鐵達尼號生存預測競賽的完整實戰紀錄:漸進式特徵工程、CatBoost 與 RF 集成、CV 與 Public LB 脫鉤、嚴格 notebook 移植,以及何時該停手。最終 Public LB 0.81578。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡